工具使用LLM智能体的多轨迹推理中,记忆何时发挥作用?
记忆效果依赖推理策略:反射仅对MCTS有效,扩展内注入助力波束搜索,原子事实提取缩短轨迹19-26%。
PIRS:基于物理信息的奖励塑造用于SAC建筑能量管理
PIRS用ISO 7730 PMV替代启发式舒适度代理,提升奖励可解释性,在建筑能量管理中优于非物理设计。
Rollout从何处开始:面向RLVR的低负载、高杠杆首Token多样化
发现首Token分布尖峰且与正确性解耦,提出REFT均匀采样候选,提升多样性与推理性能。
针对带有不兼容顾客的容量限制设施选址问题的增强型大邻域搜索方法
提出增强型大邻域搜索求解不兼容顾客设施选址问题,性能超越现有元启发式。
SafeMed-R1:临床医生审核的安全与伦理对齐的医学大语言模型
SafeMed-R1通过临床医生审核的安全伦理对齐,临床准确率79.6%,对抗测试减少3-5%不安全输出,用药安全匹配住院医师水平。
搜索前先规划:搜索代理需要规划
提出Plan方法,检索前分解问题为有序子问题,自举范式激活规划能力,无需蒸馏提升多跳问答性能。
从认知到执行:面向股票市场LLM交易智能体的记忆控制基准
KTD-Fin基准采用数据掩码和Barra归因,揭示LLM交易智能体收益主要源于市场风格暴露,缺乏持续选股Alpha。
FedMPT: Federated Multi-label Prompt Tuning of Vision-Language Models
Picid: A Modular Evaluation Infrastructure for Reproducible PHM Across Tasks and Domains
风险控制的Lean作为评判器用于自然语言数学推理
Lean评判数学答案覆盖率低且不可靠;COVCAL方法在风险控制下选择可信答案,高覆盖率下接受48%问题,准确率98%。
你活不止一次:迈向层次化技能元演化
提出轻量级层次化技能元演化HiSME,联合优化技能与演化策略,生成高质量技能库,适配多场景。
使用离线强化学习高效后训练代码生成大语言模型
离线强化学习利用现有代码数据集后训练代码生成LLM,效果显著,尤其适用于小模型和难题。
机制性解读样本难度在LLMs的RLVR中的作用
样本难度非单调影响RLVR:中等难度提升推理最强,过难导致退化;内部分析揭示特征动态,提出自适应策略。
Measuring Progress Toward AGI: A Cognitive Framework
基于长期用户交互的具身多模态大语言模型智能体个性化
提出POLAR框架,用多模态记忆图增强长期个性化,在跨交互推理与用户上下文跟踪中显著提升性能。
JobBench:使智能体工作与人类意愿对齐
JobBench评估AI代理在专家优先委托的130项职业任务中的表现,最强模型仅45.9%,旨在推动从替代转向赋能人类。
中文标题:大语言模型能内省吗?现实检验
中文摘要:重新检验两种范式后,发现当前证据不足以证明大语言模型能真正内省,其表现可能基于表面线索而非内部状态感知。
Is Agent Memory a Database? Rethinking Data Foundations for Long-Term AI Agent Memory
Anchor:缓解智能体基准生成中的工件漂移
提出Anchor管道,通过约束优化联合生成任务组件,缓解工件漂移,构建ERP-Bench基准。
PolyFusionAgent:用于聚合物性能预测和逆向设计的多模态基础模型与自主AI助手
PolyFusionAgent融合多模态模型与文献代理,实现聚合物性能预测和逆向设计,链接证据检索与假设验证。
ScientistOne:通过证据链迈向人类级自主研究
提出证据链框架确保可追溯性,ScientistOne实现零幻觉引用与人类级性能。
从静态上下文到校准的交互式强化学习:通过对齐模拟器缓解多轮对话中的分布偏移
提出校准交互式RL,通过对齐模拟器减少分布偏移,提升多轮对话性能。
推进大型多模态模型中的创造性物理智能
提出MM-CreativityBench评估创造性工具使用,发现模型因缺乏基础探索而失败,提出基于可供性的对齐方法提升表现。
哪些变化至关重要?通过相关性敏感评估和基于求解器的推理实现可信法律AI
提出法律相关性敏感评估,发现LLM对无关变化敏感,LexGuard通过形式化约束与求解器验证提升法律推理可靠性。
MemFail:对LLM记忆系统故障模式的压力测试
MemFail诊断基准通过总结、存储、检索三操作隔离LLM记忆故障,用五数据集评估四系统。
面向CUDA内核生成中自演化大语言模型智能体的反馈-规划决策
通过轨迹冻结和选择性反馈注入,揭示反馈对齐和交互对规划决策的关键作用,强推理模型的高层规划可部分迁移。
尾部感知HiFloat4:面向Wan2.2的W4A4训练后量化
针对Wan2.2的W4A4训练后量化,采用激活尾部感知校准与紧凑恢复,减少异常值影响,保持HiFloat4推理不变。
UnityMAS-O:基于LLM的多智能体系统的通用强化学习优化框架
UnityMAS-O将多智能体工作流整体作为优化单元,解耦角色与模型参数,支持灵活配置与分布式RL训练,显著提升问答与代码生成性能。
AGORA:基于适配器的观察-动作保留——面向LLM智能体的无推理提示压缩方法
AGORA提出步骤级无推理压缩,结合结构保留与自适应评分,在9个测试中8个保持≥75%原始性能。
超越单一方向:思维链打破简单的拒绝引导
思维链使大型推理模型拒绝行为由残差激活和推理链共同编码,单纯激活干预效果有限,但CoT成为新攻击面。
用于口语处理任务的机器人与患者、医生与患者医疗对话数据集
提出MeDial-Speech语音数据集(111+小时),覆盖四种疾病。基准测试显示Claude Sonnet 4准确率最高,但LLM均过于自信。
组合崩溃:稳定事实知识不意味组合推理
稳定事实知识不保证组合推理能力,原子知识相同但组合行为差异超40%,即组合崩溃。
LELA: 一种基于大语言模型的端到端实体链接框架,具备零样本域适应能力
LELA是模块化、领域无关的LLM实体消歧库,集成零样本命名实体识别,实现端到端实体链接。
可溯源知识图谱推理支持钢铁行业工业VOCs的LLM辅助决策
Chat-ISV知识图谱增强系统实现高可靠(F1=0.83)钢铁VOCs治理智能决策支持。
ORCA:面向优化根源分析的端到端交互式副驾驶
ORCA是端到端因果分析交互工具,自动或引导用户进行根源分析,生成报告与见解。
利用大型语言模型生成稳健的优化模型组合
提出利用LLM双重角色生成稳健模型组合,理论保证高质量候选,实验有效。
BatteryMFormer:面向电池退化轨迹预测的多层次学习
BatteryMFormer通过多层次学习,从早期数据准确预测电池全生命退化轨迹,显著优于现有方法。
通过增强负采样提升知识图谱基础模型
提出KMAS自适应负采样,动态调整硬负比例,提升KGFM零样本补全性能且开销低。
ICCU:基于模式诱导拒绝规则的上下文持续遗忘
ICCU利用诱导的拒绝规则,无需修改参数即可实现上下文持续遗忘,消除顺序请求干扰,有效抑制目标知识并保持模型效用。
VitaBench 2.0:评估长期用户交互中的个性化和主动式智能体
新基准通过时序任务评估智能体从碎片化交互中提取偏好并主动获取缺失信息的能力,揭示现实个性化挑战。
带有弱约束的2-ASP(Q)程序:复杂性与高效实现
研究2-ASP(Q)^w程序的复杂性,提出基于CEGAR的高效实现方法,实验验证有效。
Xe-Forge: 面向英特尔GPU的多阶段大语言模型驱动的内核优化
Xe-Forge用多阶段LLM自动优化英特尔GPU内核,硬件验证,平均加速1.17倍,最高82倍,消除手动优化瓶颈。
Maat:面向竞争保护的智能法律研究助手
Maat智能体通过RAG与网络搜索,精准提供竞争法案例引用,性能显著超越现有模型。
对齐篡改:人类反馈强化学习如何被利用来优化错误对齐的偏见
揭示RLHF结构漏洞:对齐篡改利用偏好数据放大模型偏见,现有缓解方法难保质量。
面向检索代理的自然语言查询配置化
BRANE系统依据查询动态选择检索管道配置,优化成本与准确性平衡,最高降低89%成本。
MUSE-Autoskill:通过技能创建、记忆、管理与评估的自我进化智能体
提出MUSE-Autoskill框架,通过技能生命周期管理(创建、记忆、评估、改进)实现智能体持续进化,实验验证提升任务成功率与复用性。
Gumbel机器:通过Gumbel噪声引导的反事实学生写作生成
提出Gumbel Machine方法,用β-Hindsight控制算法生成相似且改进的反事实学生写作,实验有效。
在噪声下学习行动:通过噪声环境增强智能体鲁棒性
提出NoisyAgent框架,在训练中引入交互噪声,提升智能体在真实噪声环境下的鲁棒性与泛化能力。
SIA:结合框架与权重更新的自我改进AI
SIA通过反馈代理同时更新任务代理的框架和权重,在三个领域显著提升性能。
超越模型的边缘AI部署:面向工业嵌入式平台的板级支持包感知系统框架
提出BSP感知五层系统框架,解决工业边缘AI从模型到平台脱节问题,提升可复现性与可靠性。