5446 条条目 · 106 个活跃源
2026年6月12日
04:00
arXiv cs.AI

Pythagoras-Prover:通过增强型Lean形式化推进高效形式化证明

Pythagoras-Prover以极小参数量,通过课程学习和增强形式化,在MiniF2F上达93%准确率,超越同类模型。

04:00
arXiv cs.AI

Evoflux:面向紧凑型智能体的推理时可执行工具工作流演化

Evoflux通过推理时演化搜索修复工具工作流,将紧凑智能体的执行可行性从3%提升至17-24%。

04:00
arXiv cs.AI

心智效用理论:心理化机制的形式化规范

形式化推断他人信念的计算机制,通过局部认知世界模型分析信息访问顺序,预测心理化失败原因。

04:00
arXiv cs.AI

跨尺度科学挑战中AI智能体的基准测试

SciAgentArena基准测试发现,AI智能体在明确任务中有效,但难以生成新见解、自主探索和解决开放式问题。

04:00
arXiv cs.AI

重新思考大语言模型的心理测量评估:自我报告何时及为何能预测行为

LLM自我报告与行为一致性有选择性:共享对话中TPB达人类水平,跨对话仅隐含偏见有效,需任务特异工具。

04:00
arXiv cs.AI

零源大语言模型幻觉检测:基于类人标准探针

提出HCPD方法,通过类人标准探针和弱监督对齐,实现零源下可解释的幻觉检测,性能优于现有基线。

04:00
arXiv cs.AI

(人类)注意力(依然)是一切:人类监督让AI辅助社会科学更可靠

HLER架构通过人类决策门和确定性计算,将AI社会科学研究失败率从72%降至16%(p<0.001),确保可靠性。

04:00
arXiv cs.AI

DailyReport:面向日常搜索任务的搜索代理开放式评估基准

提出DailyReport基准,含150个开放式任务与3546条细粒度评估标准,测试发现现有搜索代理系统未能满足用户期望。

04:00
arXiv cs.AI

奇妙的科学智能体及其构建方法:用于Rietveld精修的AgentBuild

通过合同编译智能体而非科学家的判断,AgentBuild实现了工作流智能体的可重复构建。

04:00
arXiv cs.AI

HarnessBridge:面向LLM智能体框架的可学习双向控制器

提出可学习双向控制器HarnessBridge,优化LLM智能体与环境交互,减少token消耗并提升泛化能力。

04:00
arXiv cs.AI

APCyc:通过自动化环化实现环肽的性质指导设计

APCyc框架显式建模环化,联合优化多个性质,实现靶向环肽的可控多性质优化。

04:00
arXiv cs.AI

MARS:面向并行大语言模型测试时扩展的边际对抗风险控制停止策略

MARS提出边际对抗停止策略,在并行LLM测试中提前停止,节省25-47%计算量且精度不变。

04:00
arXiv cs.AI

学习记住什么:一种基于认知的智能体记忆多因素价值模型

提出基于认知的多因素记忆价值模型,学习七因素权重,盲测保留0.77%黄金证据,优于均匀权重(0.657)和近因(0.368)。

04:00
arXiv cs.AI

多模态大语言模型推理移动用户体验:任务、基准与方法

提出UXBench基准及UI-UX模型,经强化学习优化,UI推理精度达0.7963,超越Claude。

04:00
arXiv cs.AI

SciR:面向大语言模型科学推理的可控基准

SciR 是首个可控多范式科学推理基准,独立调节提取与推理难度,揭示模型的差异化表现。

04:00
arXiv cs.AI

多智能体优势的幻觉

自动生成的多智能体系统性能不及单智能体,成本高且架构臃肿,现有评估掩盖缺陷。

04:00
arXiv cs.AI

AAbAAC:用于自身免疫信息提取的注释语料库

AAbAAC是115篇自身免疫文献的手动注释语料库,用于提升命名实体识别性能,验证了小规模标注的价值。

04:00
arXiv cs.AI

Otters++:基于首次脉冲时间的高能效光学脉冲Transformer

利用光电器件衰减实现TTFS计算,混合训练与噪声感知,GLUE得分84.17%,能效超越先前的脉冲Transformer。

04:00
arXiv cs.AI

从判决到过程:面向多阶段事实核查的智能体强化学习

ProFact框架通过过程感知奖励优化多阶段事实核查,提升性能与效率。

04:00
arXiv cs.AI

ARMOR-MAD:大型语言模型推理中异构多智能体辩论的自适应路由

ARMOR-MAD提出自适应路由、早期停止和异常检测,实现异构多智能体辩论的准确高效推理。

04:00
arXiv cs.AI

LLM作为调查员:基于证据优先推理的鲁棒交互式问题诊断

提出证据优先的智能体方法,通过假设生成、提问和概率更新,直至证据充分,提升诊断准确性并减少用户误导。

04:00
arXiv cs.AI

医学影像AI中的幻觉:在监管约束下的跨模态分类、检测与缓解分析框架

医学影像AI幻觉的跨模态分析框架,涵盖分类、检测与缓解,并适配FDA生命周期监管。

04:00
arXiv cs.AI

物理引导的时空学习用于从视频中估计近岸波峰周期

提出物理引导深度学习框架,从视频估计近岸波峰周期,融合时空学习与物理约束,提升预测准确性与物理一致性。

04:00
arXiv cs.AI

我能买你的KV缓存吗?

提议预计算文档KV缓存供代理购买,跳过预填充,节省近50倍计算成本,托管端消除传输瓶颈。

04:00
arXiv cs.AI

使用元启发式算法优化太阳能管理中的家电调度

采用ILS和SA算法优化家电启停时间,处理多天调度与系统约束,提高太阳能利用率并兼顾用户便利。

04:00
arXiv cs.AI

CloudCons:面向云资源整合的全面端到端基准测试

提出CloudCons基准,评估云资源整合中预测模型的决策效用,发现基础模型预测准但决策效用未提升,分位数选择是关键杠杆。

04:00
arXiv cs.AI

中文标题

科学发现中AI的三层框架:层1搜索、层2定性推理形成模型(最关键但最不成熟)、层3执行优化,案例展示结构革新。

04:00
arXiv cs.AI

多智能体协议中的聚合置信信号

提出三种聚合置信协议,通过转换和融合原始信号提升判别性,保持正确性稳定。

04:00
arXiv cs.AI

Agents-K1:迈向智能体原生的知识编排

提出Agents-K1端到端知识编排管道,构建科学知识图谱Scholar-KG,实现高效科学信息抽取与多跳推理。

04:00
arXiv cs.AI

生成主义:迈向生成式人工智能时代的学习理论

生成主义学习理论认为学习是人与AI迭代共建知识的过程,包含认识论伙伴、分布式能动性等四原则。

04:00
arXiv cs.AI

美国AI专业项目地图:2026年初现状报告及AI主修与辅修分析

美国350+本科AI项目分析:主修必须包含机器学习,超三分之一要求伦理课程,辅修伦理要求不足四分之一。

04:00
arXiv cs.AI

面向质量多样化的Web Agent模仿的推测性回滚纠正

SRC框架通过固定步长分支审查与回滚,纠正早期错误,收集977条验证通过轨迹,提升恢复与查询权衡。

04:00
arXiv cs.AI

重新定义AI失控:是什么、如何拥有、如何失去

本文以“设定和获取目标”定义控制,剖析控制要素与失控机制,指出AI在低于超智能水平时即可导致人类不同层面的失控。

04:00
arXiv cs.AI

多关系网络中的图约简:面向传播的约简基准

提出SORB基准,系统性评估图约简对影响最大化影响,发现效果依赖网络类型和评估指标,强调约简感知的多任务评估。

04:00
arXiv cs.AI

使用基于机器学习的微观仿真从模拟交通冲突中改进碰撞频率预测

用机器学习模型模拟交通冲突,预测碰撞频率更准,无需地点校准,优于传统规则模型。

04:00
arXiv cs.AI

通过惩罚项提升直接偏好优化

提出DPOP,在DPO加门控惩罚参考贪婪响应,AlpacaEval 2.0提升5.3%和4.4%。

04:00
arXiv cs.AI

EWAM:一种用于具身智能中闭环在线适应的增强世界动作模型

EWAM基于冻结的Cosmos3,通过推理时协同推理机制减少部署数据,实现零样本闭环在线适应。

04:00
arXiv cs.AI

HybridCodeAuthorship:用于行级代码作者归属检测的基准数据集

提出混合作者代码基准HybridCodeAuthorship,模拟真实AI辅助编码,检测算法F1仅约0.5,挑战性高。

04:00
arXiv cs.AI

维度袋:基于维度级符号模式的无训练机制可解释性

Transformer隐状态的维度符号模式无需训练即可作为语义特征,单次前向传播实现高精度预测与类别发现。

04:00
arXiv cs.AI

面向AI增强计算的令牌复杂度理论

提出令牌复杂度度量AI计算成本,证明其单调性、凸性等性质,并确认复杂度前沿非空凸闭。

04:00
arXiv cs.AI

低地球轨道卫星地面站位置自由布置优化

提出SCORE方法实现地面站自由布置优化,吞吐量提升15%,评估次数减少5倍。

04:00
arXiv cs.AI

M*:一个模块化、可扩展的多模态模型服务系统

提出M*系统,以数据流图表示复合模型,实现模块化、灵活部署和优化,降低延迟提升吞吐量。

2026年6月11日
04:00
arXiv cs.AI

从显式元素到隐式意图:面向可审计行为推理的预定义库

提出SemantiClean框架,通过四层架构与抗通胀机制实现可审计的行为推理,优先透明性与决策可追溯。

04:00
arXiv cs.AI

AI智能体能否综合科学结论?

引入SciConBench评估AI科学结论综合,最佳F1仅0.337,泄露高估能力,消费者智能体结论不完整,可靠综合仍是挑战。

04:00
arXiv cs.AI

知道何时提问:层次化语言智能体的自门控澄清机制

提出ACTION-RATING框架,将澄清纳入动作空间,产生强制与机会两种求助模式,诊断指标ISE从50%升至74%,受控条件下准确率提升16.2%。

04:00
arXiv cs.AI

INFRAMIND: 基础设施感知的多智能体编排

INFRAMIND利用基础设施动态信号,强化学习平衡质量与延迟,低负载提升精度并降低延迟,高负载保持高SLO合规。

04:00
arXiv cs.AI

MoCA-Agent:面向金融与数值推理的声明市场代码智能体

MoCA-Agent通过原子声明级证据聚合,提升金融数值推理鲁棒性,在多个基准中取得优异性能。

04:00
arXiv cs.AI

Lung-R1:知识图谱引导的肺部诊断推理大语言模型

提出LungKG知识图谱与Lung-R1模型,在EMR诊断中得分4.3583,超越最强基线0.1476,实现SOTA。

04:00
arXiv cs.AI

面向可信AI:连续数据汇总的多目标对抗攻击与鲁棒防御

提出基于DR-submodular优化的连续数据汇总多目标攻击与防御算法,理论保证且实验验证有效。

04:00
arXiv cs.AI

架构感知的强化学习使滑动窗口注意力在数学推理中具有竞争力

SWARR方法通过SFT转换与RL策略适配,弥补数据-架构不匹配,使线性复杂度SWA在数学推理中接近SA性能。