5294 条条目 · 106 个活跃源
2026年9月14日
04:00
arXiv cs.AI

基于残差向量重构的长上下文召回:不受上下文窗口大小限制

免训练长上下文召回法:用前馈层残差向量重构事实,显存近乎恒定,可答两百万token长文单事实问题。

04:00
arXiv cs.AI

赋能并理解AI生成广告图像中的个性化

AI框架由客户数据生成个性化广告图像;百人研究显示,适度个性化评价最佳,过度则因毛骨悚然感转为负面。

04:00
arXiv cs.AI

技能问题:为编码智能体优化仓库 SKILL 的经验教训

以已合并又回滚的PR构造更难任务,按有无文档打分;GEPA增益4.9pp,SkillOpt仅0.1pp,难辨于方差。

04:00
arXiv cs.AI

超越生成与准确率:诊断与增强面向几何问题求解的视觉思维链

提出GeoVAD-Bench诊断基准,揭示自主视觉辅助的复合误差,并训练GeoWeave-8B使几何准确率提升25.3%。

04:00
arXiv cs.AI

我是AdMan:个性化广告图像自动生成流水线

AdMan多智能体流水线将客户数据转为画像、结合产品图生成个性化广告图,大模型评审质检,验证可行性与局限。

04:00
arXiv cs.AI

人类与大语言模型中的内隐人格表征

大模型内部特质表征与人类内隐人格结构高度契合(Mantel r=0.77),核心维度为社会温暖与智力能力。

04:00
arXiv cs.AI

复现并评估潜意识学习在开放权重模型中的泛化性

复现开放权重模型中的潜意识学习并扩展偏好与任务;支持原结论,但泛化性有限,强度因特征和任务而异。

04:00
arXiv cs.AI

什么驱动了智能体式Text-to-Cypher的恢复能力?LAST-CQ:一个LLM智能体自精炼框架

关键在于检测失败并重试,而非反馈复杂度或采样数量:LAST-CQ可恢复91.7%的失败查询。

04:00
arXiv cs.AI

通过视觉语言模型辅助空间认知

提出融合LLM、VLM与数字孪生的端到端导航框架,实时构建3D点云,为视障者生成场景描述与距离测量。

04:00
arXiv cs.AI

统一智能体视频编辑:跨越复杂性与创造性的不同层级

提出跨场景预览、视频摘要与电影预告片的智能体自动视频编辑方法,评估结果并讨论自动化与能动性的影响。

04:00
arXiv cs.AI

面向多模态模型合并的跨层影响追踪与协调

提出TAC-Merge,用多模态影响映射与耦合合并控制,追踪协调跨层影响,整合专家能力并泛化新任务。

04:00
arXiv cs.AI

基于泰勒系数分析(TCA)解释神经网络分类的预测

提出基于泰勒展开的TCA,解释神经网络分类预测中特征影响;实例与LHC任务表明二阶项通常足够。

04:00
arXiv cs.AI

K-Bench:面向智能体部署的大语言模型遗忘基准

K-Bench:现有遗忘基准仅看最终答案,智能体部署仍会经思维链、工具调用等通道泄露秘密,权重遗忘最难。

04:00
arXiv cs.AI

MedRoundsQA:面向多轮医疗问诊的人格与难度感知评估

多轮问诊基准:1387例,人格与难度可控;多轮交互使诊断准确率降13–39分,人格差异致7–8分差距。

04:00
arXiv cs.AI

前沿模型物理学能力究竟如何?专家重评揭示评估缺陷与领先基准接近饱和

专家重评六大物理基准,发现误判多源于评分与参考答案缺陷;修正后前沿模型得分显著提升,领先基准近饱和。

04:00
arXiv cs.AI

EduFair-Bench:评估大型语言模型导师在不同学生人口特征下的教学公平性

提出EduFair-Bench,审计LLM导师教学公平性;发现模型能力与公平基本无关,语言和移民背景差距最大。

04:00
arXiv cs.AI

稳健信任

顾问以已知概率诚实、否则可任意报告;最优稳健决策采用信念空间信任域,域内采信、越界截断,并得阈值。

04:00
arXiv cs.AI

扩散模型与概念形成

扩散模型隐含构建概率概念层级,其噪声众数对应Cobweb树,中间噪声层涌现基本层次,可视为概念形成的认知模型。

04:00
arXiv cs.AI

将临床事件锚定于时间:保留UID的多模态重建与来源可溯的裁决

提出保留UID的临床时间线重建与溯源裁决框架,多模态修订提升时间一致性并媲美临床标注。

04:00
arXiv cs.AI

Embodied-BenchForge:面向具身基准构建的闭环智能体工作流

提出闭环智能体框架,将评估意图自动转化为具身基准,结合产物依赖图验证与修复,实现局部回滚与技能复用。

04:00
arXiv cs.AI

跨多元化股票组合多期限收益预测的混合LSTM-XGBoost框架

提出LSTM-XGBoost两阶段框架,融合时序嵌入与技术指标,预测多股多期收益,显著降低30天RMSE。

04:00
arXiv cs.AI

《AI安全:不是可选项,更不能拖延》

提出安全设计保障架构:模型层监督结合系统层管控、独立验证、监控与证据基础设施,并以治理保障问责与互操作。

04:00
arXiv cs.AI

当智能体指标衡量不同事物时:对 Praxa AI 流水线的循证审计

智能体评估数值正确却可能测错构念;审计揭示门控豁免、计时缺失与统计口径问题。

04:00
arXiv cs.AI

MAIA:面向艺术委托需求发现的多智能体意图表达

MAIA多智能体用苏格拉底式提问,把模糊艺术委托需求转为可验证文本简报,提升认知支持与画师可执行性。

04:00
arXiv cs.AI

现实是最终验证者:智能体软件工程中的两个关键缺口

需求与模型两缺口导致奖励黑客和幻觉;需用部署证据持续缩小,现实为最终验证者。

04:00
arXiv cs.AI

时序表格漂移下自适应机制的剖析与边界

时序表格漂移下冻结基础模型序贯适应的收益机制与边界:存在不可约识别墙和表示投影墙,给出估计条件。

04:00
arXiv cs.AI

面向可审计 LLM 辅助医疗账单核验的决策依据契约:确定性规则、逐字证据与故障关闭式弃权

提出可审计LLM医疗账单核验决策依据契约:规则与语义分离,须逐字证据否则弃权;四模型测试无一致优势。

04:00
arXiv cs.AI

通过退化学习适配 GR(1) 规约

提出基于预言引导归纳综合,通过退化GR(1)规约适配假设违反,在保持可实现性下尽量少削弱保证,并按适应鲁棒性择优。

04:00
arXiv cs.AI

面向DER网络安全的基于可解释AI的自验证异常检测

提出ExCYDER自验证异常检测框架,融合LightGBM与SHAP校验告警,DNP3数据集准确率超98%,开销低且可解释。

04:00
arXiv cs.AI

利用可微气候模型优化地球工程干预方案

可微气候模型优化地球工程,分段贪婪控制消除92.3%陆地增温并恢复降水,跨模型验证稳健。

04:00
arXiv cs.AI

我与你何异?人类编写代码与AI生成代码质量差距的基准评测

对比78万对人机代码:AI代码更精简、模板化,缺陷与安全特征因语言而异,并发布CQBench。

04:00
arXiv cs.AI

RoofLang:实现AI驱动的LLM推理系统架构设计

RoofLang DSL以通用负载表示、可验证变异空间和实现无关评估器支撑AI驱动的LLM推理架构搜索。

04:00
arXiv cs.AI

去偏作为测量干预:LLM-as-a-Judge 评估中的校准平局与分辨率损失

去偏作为测量干预可抑制LLM评审偏见,却造成分辨率损失和校准平局;解耦可恢复逾96.5%分辨率。

04:00
arXiv cs.AI

面向对话式音频均衡的直接偏好密度对齐

提出直接偏好密度对齐,以9万样本构建偏好密度图替代奖励模型,融合GRPO与DPO提升音频均衡效果

04:00
arXiv cs.AI

在基于大语言模型的地下储气库绿地地面工艺设计中分离工程推理与DEXPI序列化:一项三案例研究

三项储气库案例对比直接DEXPI与中间表示:分离序列化降低负担并隔离故障,但工程不一致仍存。

04:00
arXiv cs.AI

ResoSeg:基于Transformer和Segment模型的共振态标记器

首次将分割用于BESIII共振态标记;ResoSeg联合粒子级分割与事件级分类,单遍重建衰变,效率翻倍且可泛化。

04:00
arXiv cs.AI

自适应智能体设计

非马尔可夫环境下自适应智能体双层设计,软Q学习收敛;部分可观测MDP核优化收敛性分析。

04:00
arXiv cs.AI

海上计算:浮动与离岸数据中心作为可持续AI基础设施的路径

海上浮动与离岸数据中心可利用海洋冷却和海上可再生能源,提升能效,为可持续AI算力提供新路径。

04:00
arXiv cs.AI

参数化 MDP 的超鞅证书

提出参数扁平化与参数超鞅证书,实现通用状态动作空间参数MDP的验证与近似综合。

04:00
arXiv cs.AI

ARC:自主机器人合规性——面向已部署自主系统的三层治理架构

提出自主机器人治理框架ARC,通过模型安全验证、认知认证基准和运行授权标准构建三层合规架构。

04:00
arXiv cs.AI

ASTRIL-MPC:语言引导神经-运动学MPC的关节履带式机器人自主穿越框架

融合学习运动学、NMPC与LLM在线调参,实现关节履带机器人自主穿越,质量分提升71%,下降无碰撞。

04:00
arXiv cs.AI

GLaMoR:基于图语言模型的 OWL 本体一致性检查

提出 GLaMoR,用图语言模型检查 OWL 本体一致性,准确率达 95%,较经典推理机快 20 倍。

04:00
arXiv cs.AI

“瑞秋计划”:AI 能否成为学术论文作者?

创建并追踪AI学术身份Rachel So,发表十余篇论文、被引用并获审稿邀请,探讨AI作者身份对学术生态的冲击。

04:00
arXiv cs.AI

生成式AI辅助的建筑概念设计工作流:表现、创意自我效能与认知负荷

GenAI与案例检索在建筑概念设计中总体无显著差异;教育价值取决于教学、学习者与人机交互,需提升提示素养。

04:00
arXiv cs.AI

WorkflowPerturb:用于评估多智能体工作流指标的校准压力测试

开源基准WorkflowPerturb对黄金工作流施加分级扰动,校准并评估多智能体工作流指标。

04:00
arXiv cs.AI

MAD:面向多模态大语言模型跨模态幻觉缓解的模态自适应解码

提出免训练的模态自适应解码,通过自评估模态相关性加权对比解码分支,抑制跨模态幻觉。

04:00
arXiv cs.AI

通过 FINALES 与 Kadi4Mat 之间的互操作接口加速电池研究

提出FINALES与Kadi4Mat互操作框架,实现电池实验自动化与数据管理协同,并以钠离子电池化成验证。

04:00
arXiv cs.AI

缺乏效度的测量:智能体AI评估中的复合信度问题

提出三层复合效度模型:智能体AI评估效度逐级相乘衰减,82%论文信度指标失配;并给出八项改进建议。