Pythagoras-Prover:通过增强型Lean形式化推进高效形式化证明
Pythagoras-Prover以极小参数量,通过课程学习和增强形式化,在MiniF2F上达93%准确率,超越同类模型。
Evoflux:面向紧凑型智能体的推理时可执行工具工作流演化
Evoflux通过推理时演化搜索修复工具工作流,将紧凑智能体的执行可行性从3%提升至17-24%。
心智效用理论:心理化机制的形式化规范
形式化推断他人信念的计算机制,通过局部认知世界模型分析信息访问顺序,预测心理化失败原因。
跨尺度科学挑战中AI智能体的基准测试
SciAgentArena基准测试发现,AI智能体在明确任务中有效,但难以生成新见解、自主探索和解决开放式问题。
重新思考大语言模型的心理测量评估:自我报告何时及为何能预测行为
LLM自我报告与行为一致性有选择性:共享对话中TPB达人类水平,跨对话仅隐含偏见有效,需任务特异工具。
零源大语言模型幻觉检测:基于类人标准探针
提出HCPD方法,通过类人标准探针和弱监督对齐,实现零源下可解释的幻觉检测,性能优于现有基线。
(人类)注意力(依然)是一切:人类监督让AI辅助社会科学更可靠
HLER架构通过人类决策门和确定性计算,将AI社会科学研究失败率从72%降至16%(p<0.001),确保可靠性。
DailyReport:面向日常搜索任务的搜索代理开放式评估基准
提出DailyReport基准,含150个开放式任务与3546条细粒度评估标准,测试发现现有搜索代理系统未能满足用户期望。
奇妙的科学智能体及其构建方法:用于Rietveld精修的AgentBuild
通过合同编译智能体而非科学家的判断,AgentBuild实现了工作流智能体的可重复构建。
HarnessBridge:面向LLM智能体框架的可学习双向控制器
提出可学习双向控制器HarnessBridge,优化LLM智能体与环境交互,减少token消耗并提升泛化能力。
APCyc:通过自动化环化实现环肽的性质指导设计
APCyc框架显式建模环化,联合优化多个性质,实现靶向环肽的可控多性质优化。
MARS:面向并行大语言模型测试时扩展的边际对抗风险控制停止策略
MARS提出边际对抗停止策略,在并行LLM测试中提前停止,节省25-47%计算量且精度不变。
学习记住什么:一种基于认知的智能体记忆多因素价值模型
提出基于认知的多因素记忆价值模型,学习七因素权重,盲测保留0.77%黄金证据,优于均匀权重(0.657)和近因(0.368)。
多模态大语言模型推理移动用户体验:任务、基准与方法
提出UXBench基准及UI-UX模型,经强化学习优化,UI推理精度达0.7963,超越Claude。
SciR:面向大语言模型科学推理的可控基准
SciR 是首个可控多范式科学推理基准,独立调节提取与推理难度,揭示模型的差异化表现。
多智能体优势的幻觉
自动生成的多智能体系统性能不及单智能体,成本高且架构臃肿,现有评估掩盖缺陷。
AAbAAC:用于自身免疫信息提取的注释语料库
AAbAAC是115篇自身免疫文献的手动注释语料库,用于提升命名实体识别性能,验证了小规模标注的价值。
Otters++:基于首次脉冲时间的高能效光学脉冲Transformer
利用光电器件衰减实现TTFS计算,混合训练与噪声感知,GLUE得分84.17%,能效超越先前的脉冲Transformer。
从判决到过程:面向多阶段事实核查的智能体强化学习
ProFact框架通过过程感知奖励优化多阶段事实核查,提升性能与效率。
ARMOR-MAD:大型语言模型推理中异构多智能体辩论的自适应路由
ARMOR-MAD提出自适应路由、早期停止和异常检测,实现异构多智能体辩论的准确高效推理。
LLM作为调查员:基于证据优先推理的鲁棒交互式问题诊断
提出证据优先的智能体方法,通过假设生成、提问和概率更新,直至证据充分,提升诊断准确性并减少用户误导。
医学影像AI中的幻觉:在监管约束下的跨模态分类、检测与缓解分析框架
医学影像AI幻觉的跨模态分析框架,涵盖分类、检测与缓解,并适配FDA生命周期监管。
物理引导的时空学习用于从视频中估计近岸波峰周期
提出物理引导深度学习框架,从视频估计近岸波峰周期,融合时空学习与物理约束,提升预测准确性与物理一致性。
我能买你的KV缓存吗?
提议预计算文档KV缓存供代理购买,跳过预填充,节省近50倍计算成本,托管端消除传输瓶颈。
使用元启发式算法优化太阳能管理中的家电调度
采用ILS和SA算法优化家电启停时间,处理多天调度与系统约束,提高太阳能利用率并兼顾用户便利。
CloudCons:面向云资源整合的全面端到端基准测试
提出CloudCons基准,评估云资源整合中预测模型的决策效用,发现基础模型预测准但决策效用未提升,分位数选择是关键杠杆。
中文标题
科学发现中AI的三层框架:层1搜索、层2定性推理形成模型(最关键但最不成熟)、层3执行优化,案例展示结构革新。
多智能体协议中的聚合置信信号
提出三种聚合置信协议,通过转换和融合原始信号提升判别性,保持正确性稳定。
Agents-K1:迈向智能体原生的知识编排
提出Agents-K1端到端知识编排管道,构建科学知识图谱Scholar-KG,实现高效科学信息抽取与多跳推理。
生成主义:迈向生成式人工智能时代的学习理论
生成主义学习理论认为学习是人与AI迭代共建知识的过程,包含认识论伙伴、分布式能动性等四原则。
美国AI专业项目地图:2026年初现状报告及AI主修与辅修分析
美国350+本科AI项目分析:主修必须包含机器学习,超三分之一要求伦理课程,辅修伦理要求不足四分之一。
面向质量多样化的Web Agent模仿的推测性回滚纠正
SRC框架通过固定步长分支审查与回滚,纠正早期错误,收集977条验证通过轨迹,提升恢复与查询权衡。
重新定义AI失控:是什么、如何拥有、如何失去
本文以“设定和获取目标”定义控制,剖析控制要素与失控机制,指出AI在低于超智能水平时即可导致人类不同层面的失控。
多关系网络中的图约简:面向传播的约简基准
提出SORB基准,系统性评估图约简对影响最大化影响,发现效果依赖网络类型和评估指标,强调约简感知的多任务评估。
使用基于机器学习的微观仿真从模拟交通冲突中改进碰撞频率预测
用机器学习模型模拟交通冲突,预测碰撞频率更准,无需地点校准,优于传统规则模型。
通过惩罚项提升直接偏好优化
提出DPOP,在DPO加门控惩罚参考贪婪响应,AlpacaEval 2.0提升5.3%和4.4%。
EWAM:一种用于具身智能中闭环在线适应的增强世界动作模型
EWAM基于冻结的Cosmos3,通过推理时协同推理机制减少部署数据,实现零样本闭环在线适应。
HybridCodeAuthorship:用于行级代码作者归属检测的基准数据集
提出混合作者代码基准HybridCodeAuthorship,模拟真实AI辅助编码,检测算法F1仅约0.5,挑战性高。
维度袋:基于维度级符号模式的无训练机制可解释性
Transformer隐状态的维度符号模式无需训练即可作为语义特征,单次前向传播实现高精度预测与类别发现。
面向AI增强计算的令牌复杂度理论
提出令牌复杂度度量AI计算成本,证明其单调性、凸性等性质,并确认复杂度前沿非空凸闭。
低地球轨道卫星地面站位置自由布置优化
提出SCORE方法实现地面站自由布置优化,吞吐量提升15%,评估次数减少5倍。
M*:一个模块化、可扩展的多模态模型服务系统
提出M*系统,以数据流图表示复合模型,实现模块化、灵活部署和优化,降低延迟提升吞吐量。
从显式元素到隐式意图:面向可审计行为推理的预定义库
提出SemantiClean框架,通过四层架构与抗通胀机制实现可审计的行为推理,优先透明性与决策可追溯。
AI智能体能否综合科学结论?
引入SciConBench评估AI科学结论综合,最佳F1仅0.337,泄露高估能力,消费者智能体结论不完整,可靠综合仍是挑战。
知道何时提问:层次化语言智能体的自门控澄清机制
提出ACTION-RATING框架,将澄清纳入动作空间,产生强制与机会两种求助模式,诊断指标ISE从50%升至74%,受控条件下准确率提升16.2%。
INFRAMIND: 基础设施感知的多智能体编排
INFRAMIND利用基础设施动态信号,强化学习平衡质量与延迟,低负载提升精度并降低延迟,高负载保持高SLO合规。
MoCA-Agent:面向金融与数值推理的声明市场代码智能体
MoCA-Agent通过原子声明级证据聚合,提升金融数值推理鲁棒性,在多个基准中取得优异性能。
Lung-R1:知识图谱引导的肺部诊断推理大语言模型
提出LungKG知识图谱与Lung-R1模型,在EMR诊断中得分4.3583,超越最强基线0.1476,实现SOTA。
面向可信AI:连续数据汇总的多目标对抗攻击与鲁棒防御
提出基于DR-submodular优化的连续数据汇总多目标攻击与防御算法,理论保证且实验验证有效。
架构感知的强化学习使滑动窗口注意力在数学推理中具有竞争力
SWARR方法通过SFT转换与RL策略适配,弥补数据-架构不匹配,使线性复杂度SWA在数学推理中接近SA性能。