长时程语言智能体中的重尾记忆轨迹
揭示智能体记忆呈核心-尾部重尾分布,提出CTWM按秩分配提示预算,节省token并降低尾部预测误差。
从提议到可验证效果:Praxa——面向受治理AI智能体执行的证据约束型执行框架
Praxa以证据约束架构显式区分提案、授权、派发与验证效果;四条证据线均未证明性能优越。
理由究竟传递了什么?角色专精问答中的消息干预研究
忠实理由不提升答案准确率,但受损理由显著改变验证支持判断,故理由共享应作为验证消息机制评估。
刻画推理时 PRM 剪枝片段嫁接无效的配置:来自三个推理语言模型的证据
PRM剪枝片段嫁接在推理时与独立并行思维链基线无显著差异;触发多未命中真正困难链,跨三模型六基准复现。
预测信用:衡量科学解释对实验预测的增量贡献
配对预测评估科学解释的预测增益;预设检验多未达标,仅特定模型降低漂移,自然解释信用未证实。
懂得何时让步:基于文本的具身智能体中用户纠正的接地仲裁。
GAVA在文本ALFWorld中仲裁用户纠正,选择性核查降本,准确率约98.7%,未证普遍优于澄清。
ContractRL:面向可审计工具调用修复的屏蔽式组相对策略优化
契约约束的JSON顺序修复,经动作掩码与组相对策略优化,以更少token提升修复成功率。
大语言模型中的数学迁移更取决于推理方法而非主题
多模型实验验证,微调时按推理方法匹配数据比按主题匹配迁移更强。
JusticeAxis:在刚性规则适用与无根据自由裁量之间基准评测法律裁判
构建18国256起刑案的多模态基准与JusticeAgent,兼顾法条与情节,使开源模型达商用裁判水平。
当执行框架丢失信号:大语言模型智能体中恢复机制的因果评估
将恢复视为因果决策问题,提出CIR路由器,在ALFWorld上提升成功率3个百分点且不干扰正确轨迹。
基于国际象棋的大语言模型提示优化基准测试
提出1118道Lichess棋题基准,评测大模型自动提示优化,低成本、可再生且具区分度。
CompMat-Bench:面向计算材料科学的AI智能体基准测试
发布CompMat-Bench基准,含94项计算材料学任务,预复现仿真免昂贵计算并固定评分。最强智能体单任务通过率66%-90%,失败多因科学错误。
智能体评估可靠性:更多任务并不总能修正智能体排行榜
评估可靠性随目标而异:底层模型排名不可靠,增加任务难以解决,合并多样基准可低成本提升可靠性。
基于专家隔离与关停的大语言模型后门遏制
提出“学习但分流”:训练时把后门导入可隔离专家,部署时关闭该专家,攻击成功率降至0–10%且效用多保持。
当更多数据还不够:生成式AI个性化中的上下文充分性前沿
提出上下文充分性理论:相关上下文比数量更重要,分不足、充分、饱和、干扰四态;实验表明无关上下文反降效果。
面向规范引导决策的简单信念道义逻辑
提出简单信念道义逻辑,定义规范遵从优化问题,区分主客观优化并给出归约至加权部分MaxSAT的条件。
基于本体、经推理器验证的科学AI大模型推理评测基准
提出从OWL本体自动生成多选题基准,推理器验证干扰项,六模型准确率41-77%,可诊断推理失败。
R-GroundBench:面向Markush分子编辑中R基团定位的诊断性基准
提出基于真实专利Markush结构的R-GroundBench基准,揭示模型在R基团定位与编辑上存在显著能力差距。
MemFit:高效的长期智能体记忆
MemFit 用免LLM的追加式存储与多路径检索,降低记忆构建成本与延迟,在三大基准达最优性能。
Sapien:面向自主 AI 智能体的有状态策略引擎
Sapien 是有状态策略引擎,用扩展正则约束工具调用序列,效用近无损,可拦截 93-95% 的攻击。
教育者引导的LLM教学智能体:面向概念数据库设计的支架式反馈
教育者引导LLM智能体,基于ERD与评分标准分四阶段提供支架反馈;383次中71.1%采纳隐藏诊断。
PG-SFT:在离线智能体微调中平衡能力获取与保持
PG-SFT按轨迹轮次级信息增益调节监督强度,缓解离线智能体微调中的通用能力退化。
面向受控世界模型适配的校准风险路由
提出MC-WM:按拟合/选择/校准划分数据,依标准化校准风险择优适配,在MuJoCo偏移上验证。
面向做运筹的AI的运筹学:在OSCAR框架内让LLM沿"扶梯"逐级路由
OSCAR用模拟器、编码器与审阅者逐级调用不同LLM,低成本高准确率地验证并改进优化建模。
ActiveSaddler:面向智能体框架优化的自动化课程学习
将课程学习引入智能体框架优化,用赌博机动态发现并排序失败模式,使课程与框架共演化,显著提升通过率。
寻找最佳契合:智能体任务中的模型—框架交互
评估66种模型与框架组合,发现模型排名随框架反转,最佳搭配依任务而变,三者应联合评估。
ABDA-NL:面向基于论证推理的自然语言场景探索器
为ABDA论证系统加自然语言界面,大模型桥接语言与形式化,判定由确定性引擎完成,修改需用户确认。
RISED:面向智能体多环境选择与自蒸馏的评分量规
RISED用行为评分量规引导多环境智能体的数据选择与自蒸馏,提升跨环境表现。
评估大语言模型生成的偏好分布
大语言模型生成的偏好分布:模型自洽但跨模型差异大,结果更取决于模型选择而非提示措辞。
关于人工意识,类比能告诉我们什么?
构建因果框架评估类比证据,指出行为相似对人工意识的证据力有限,需建立因果对应。
空头承诺:当智能体承诺其运行时无法兑现之事
论文定义"空头承诺":智能体承诺当前轮次后无法执行的动作,并给出失败类型、锚定条件与测量协议。
从发现到决策:LLM投票中的有限预算可恢复性
揭示LLM投票固定预算下发现与决策的差距,推导可恢复性阈值与精确锁定证明,实验省28-30%调用并提升准确率。
为故障付费,而非为流程付费:无标签的流内多智能体工作流优化
提出无标签流内多智能体工作流优化法InFlowOp,统一代价权衡智能体能力与开销,发布Braid基准,最高提升11.97%。
YouRA:面向证据可追溯自主研究智能体的持久状态架构
YouRA以验证状态架构、独立控制器与反思机制持久追踪研究状态和失败证据,实现证据可追溯,优于基线。
HHR:面向高效大语言模型生成的分层哈希检索
提出分层哈希检索HHR,以几何感知路由与学习哈希投影对齐汉明距离与注意力相关性,提升长文本推理效率与精度。
AbsorbEvo:微波吸收器自主逆向设计的智能体框架
AbsorbEvo智能体框架将自然语言性能目标转化为经全波仿真验证的微波吸收器设计,测试成功率79.17%,远超通用智能体与随机搜索。
CortexBridge:面向基础模型的脑电电极布局皮层对齐
CortexBridge用电极与图谱坐标把任意脑电布局对齐到共享皮层空间,15项评测中13项提升。
审计LLM智能体环境中的动作结算:顺序、进展与重放
审计LLM智能体动作结算:保守拒绝仅完成31.25%任务,随机票据达90.28%;重放审计精确复原156个检查点并拒绝1332处构造损坏。
ReSolve:通过选择性生成式审核复用候选推理
ReSolve免训练,以选择性生成式审核复用候选推理,竞赛数学准确率超投票且更省token。
将大语言模型锚定于DSGE模拟器:面向政策生成与预测
以PPO/GRPO检验LLM在DSGE中的政策行动是否符合经济动态,以模拟后果而非语言合理性评判。
面向智能体强化学习的依赖感知奖励塑形
DARS将任务进度表示为带前置依赖的谓词,按依赖图分配步级信用,经衰减与修复机制提升训练效果。
声誉、策略与情绪对生成式AI合作的影响:推理模型与非推理模型的比较
声誉、策略与情绪共同影响生成式AI合作;推理模型更倚重策略与声誉,情绪作用更具条件性,末轮行为各异。
联邦智能体优化
提出联邦智能体优化,使分布式智能体在保留本地隐私数据下受控交换信息、协作提升,并平衡效用、隐私与通信成本。
ProtoFlow:用于多变量时间序列预测的原型引导流匹配
ProtoFlow以VQ码本为原型先验,用DiT修正流实现高效非自回归多变量时间序列预测,性能领先。
学习提问:预算约束下面向SLM-LLM协作的信息获取
将SLM-LLM协作建模为预算受限的信息获取:SLM按需向黑盒LLM发问,三阶段RLVR学习何时调用、如何提问与整合,优化性能成本权衡。
无需等待的反馈:在大型数学课堂中试点生成式AI练习平台
设计生成式AI练习平台,在大型数学课中即时提供支架式反馈,将人工监督前移至答案预先核验。
DeFA:面向LLM智能体的依赖引导式故障归因
DeFA以事件依赖图与故障传播图定位智能体决定性错误,多项基准达最优,其诊断反馈还能提升下游任务精度。
面向智能交通系统与物流的可信数据运维与机器学习运维
综述智能交通与物流领域的可信DataOps与MLOps,探讨其工具、案例、AI可信方法及未来挑战。
SCOPE-AD:面向诊断智能体的基于能量模型的序贯成本感知序数信念规划
SCOPE-AD用能量模型规划成本感知序贯检查,在ADNI以50.46美元成本达77.70% Macro-F1,超基线9.34个百分点。
DAYJOB:长周期专业工作基准测试
DAYJOB 基准涵盖医疗与金融共130项长周期专业任务,最强模型通过率约24%,中位配置不足3%。