工具失效之时:LLM代理动态重规划与异常恢复基准测试
ToolMaze基准测试发现工具扰动致LLM性能骤降,恢复率降37%,动态重规划为模型扩展无法解决的瓶颈。
基于分子感知探索的智能体分子恢复
针对无效SMILES,提出AMREC方法,通过分子感知探索与轨迹级选择,在保留分子身份的同时实现最优恢复。
QCFuse:通过压缩视图实现查询感知的缓存融合以提升RAG服务效率
QCFuse用压缩视图实现查询感知缓存融合,达到全预填充质量,预填充时间加速1.7倍。
连续动作空间中的重试策略梯度
将ReMax扩展到连续动作空间,用路径导数估计器优化重试目标,通过重塑梯度鼓励探索;ReMAC算法性能与SAC相当。
迈向生物医学研究中的世界模型
提出生物医学世界模型新范式,通过学习潜在状态和动力学模拟未来,助力虚拟细胞、患者等应用。
记忆是重构的,而非检索的:面向LLM Agent的图记忆
提出MRAgent框架,将记忆重构为关联图,动态适应推理,提升23%并降低开销。
自我纠正幻觉:大语言模型能纠正他人却无法自我纠正
LLM纠错不对称性源于角色标签伪像,非能力缺陷;通过改变错误来源角色即可大幅提升纠错率。
Edit-R2:上下文感知强化学习用于多轮图像编辑
Edit-R2通过强化学习后训练,重构会话意图并联合优化推理与生成,解决多轮编辑中的长期约束稀释和状态污染。
最长路径的双向搜索:面向前端启发式适用性分析
提出BiXDFBnB双向深度优先分支定界算法,利用前端启发式减少节点扩展,有时提升运行时间。
RLVR中自我一致性诱发与奖励设计的预注册因果分解
证明RLVR中naive估计偏误源于混淆自我一致性诱发与奖励设计,分解实验揭示非加性交互,可诊断主导因素。
PLAN-S:将规划与潜在风格动态桥接的自动驾驶世界模型
PLAN-S通过解码风格条件语义成本图,解决紧凑性与可控性困境,在nuScenes和NAVSIM上分别降低碰撞率42%和达89.4 PDMS。
RedditPersona:基于Reddit的社区条件大语言模型自适应的模块化框架
提出标准化社区条件LLM自适应框架,发现可识别性与分布相似性存在权衡。
构框、判断、引导:面向学生用生成式AI推理教学的可评估能力模型
提出CoRe-3能力模型,将生成式AI的合理使用分解为构框、判断、引导三种可评估技能,并验证其区分效度。
超越相似性:面向个人AI代理的可信记忆搜索
提出轻量级插件MemGate(9M参数),在记忆搜索中引入任务条件过滤,解决语义相似性导致的信任漏洞,降低风险并保持效用。
记忆何时应保持沉默:测量记忆增强对话代理中的使用边界
现有评估忽略敏感内容是否应整合,RBI-Eval发现模型在拥有敏感记忆时行为偏差显著,需在检索与生成阶段进行记忆感知决策。
通过模态差距感知自蒸馏从符号状态学习视觉空间规划
提出MGSD两阶段框架,通过自蒸馏弥合视觉与符号规划差距,在4B和8B模型上分别提升19.3%和18.4%。
衡量对集合型AI建议适当依赖的框架
提出首个衡量对集合型AI建议适当依赖的框架,定义分类和回归新指标,揭示人机协作中被忽略的细微差别。
超越语义组织:记忆作为长时程智能体的执行状态管理
MAGE将记忆作为执行状态管理,构建层级状态树,通过四项操作维护,提升任务成功率7.8-20.4个百分点,减少55.1% token消耗。
评估计算机网络中的智能体配置修复
智能体架构结合形式验证与上下文检索,使网络配置修复效果提升12%,安全性提升17%。
从奖励黑客激活到代理风险状态:LLM智能体中的上下文校准机制监控
研究发现奖励黑客激活可转移至动作选择,但需结合熵和上下文特征才能有效预测风险,支持上下文校准监控。
利用测试时重建实现潜在推理的闭环
提出ReLAT方法,用查询重建损失锚定潜在推理,在数学推理等任务上显著提升性能。
RedKnot:基于头感知KV复用与SegPagedAttention的高效长上下文大语言模型服务
RedKnot以头感知分解KV缓存,实现高效复用、压缩与分布式管理,无需重训即提升长上下文LLM服务效率。
重新思考基础设施检测:作为图像差异分类——以交通标志为例
将缺陷检测重构为图像差异分类可减少数据依赖,指令型分类器优于编码器,有效应对数据限制。
TokenMizer:面向长程LLM上下文管理的图结构会话记忆
TokenMizer用知识图建模会话历史,压缩上下文,节省token并提高召回,平均恢复块仅78 token。
大语言模型自我识别:引导与提取激活特征
通过随机稀疏向量引导生成,LLM创建可检测指纹实现自我归因,准确率超98%且不降文本质量。
DragOn:用于基于拖拽的GUI交互的基准和数据集
提出DragOn拖拽基准数据集,含28.6万截图和350万任务,在文本高亮等四领域提升模型性能。
基于大语言模型决策的传染病传播模拟
使用LLM模拟个体决策,结合空间数据,发现收入和学历主导报告率变化,支持空间流行病学建模。
自动驾驶风险评估:整合技术故障、伦理困境与政策框架
基于NHTSA等数据,自动驾驶主要技术故障为感知错误,伦理法规不一致,需协同治理。
虚拟圆桌:多智能体角色模拟人类头脑风暴动态
提出多智能体架构模拟圆桌头脑风暴,通过发散与收敛两阶段生成评估想法,AI角色互动提升讨论质量。
Unsupervised Skill Discovery for Agentic Data Analysis
全维度基准测试:面面俱到,同步推进
提出自主基准构建系统Benchmark Agent,高效生成多场景高质量样本,揭示模型领域推理短板。
MLEvolve:用于自动机器学习算法发现的自我进化框架
提出MLEvolve框架,通过跨分支信息流和记忆机制实现自我进化,在算法发现任务取得SOTA性能。
RAINO:将智能体锚定于现实——基于Agent建模中现实主义的系统综述与概念框架
系统综述发现现实主义定义模糊,引入RAINO框架(现实锚点、输入输出),拓宽建模视角并解释评估差异。
结构何在?关于人机协作与混合智能促进学习的实证研究系统文献综述
系统综述62项人机协作与混合智能学习实证研究,揭示协作结构、应用情境,提取设计知识与研究空白。
得分哈密顿量:将扩散模型映射到绝热输运
扩散模型与绝热输运精确对应,采样极限由得分匹配误差平方与谱间隙之比决定。
评估AI图像生成中地域表征的地理多样性
发现旧模型多样性更高,提示修改比生成更能增强多样性,但模型同质化易导致刻板印象。
大步长梯度下降恢复多通路深度线性网络中的对称性
大学习率梯度下降后期通过震荡迫使信号多通路再分配,恢复对称性,避免单通路主导。
可微分高效算子搜索
提出可微分高效算子搜索,自动联合搜索token缩减位置、数量与处理方式,在积极压缩下实现性能与效率的竞争优势。
深度研究智能体中的搜索时污染:公共基准评估中性能膨胀的衡量
搜索时污染使深度研究智能体在基准测试中性能虚高4%,需采取隔离沙箱等防污染措施。
本体约束的多LLM评分:预测处理文献中的假设支持评估
使用多LLM对预测编码文献进行本体约束评分,映射假设空间并揭示结构化分歧,证明了可审计的定量证据映射方法。
Toward Pre-Deployment Assurance for Enterprise AI Agents: Ontology-Grounded Simulation and Trust Certification
Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Representation Signal
通过符号思考:PEEL作为面向认知负责的AI驱动研究的符号学脚手架
PEEL框架结合Voyant工具与Claude,基于皮尔斯符号学揭示AI量化扭曲与认知责任缺失,三者设计启示:须有确定性工具、流畅非忠实、权威需内置。
VAMPS:视觉辅助数学问题解决基准
多模态模型用可视化工具时性能下降,VAMPS基准测试发现直接解析求解优于视觉辅助。
通用智能体能否自动化数据整理?
通用Agent可自动化数据整理循环,但需脚手架引导弥补执行-研究差距。
描述人机协作的初始证明形式化工作流
研究AI对数学证明形式化工作流的影响,发现人们偏好AI辅助但保持人类控制,使用AI提高准确率并灵活选用多种工具。
模拟、推理、决策:基于大语言模型的科学推理驱动模拟决策
提出MechSim框架,使LLM推理模拟器机制,提升解释质量与决策可靠性。
数字学徒:人类指导的自主AI开发框架
提出数字学徒框架,通过方法论捕获、分级授权和持续对齐,实现可扩展且可信的AI代理,自治需逐步获得。
Trivium:将时间遗憾作为因果记忆控制器的首要目标
提出时间遗憾作为因果记忆核心,弥补结果遗憾忽略“何时为何”的结构缺陷,实现对数级错误修正。
元智能体挑战:当前智能体能自主开发智能体系统吗?
提出MAC基准,测试模型自主开发智能体,发现多数无法匹敌人类,存在鲁棒性与对齐缺失。