FedLore:通过共享梯度低秩投影实现通信与内存高效的联邦学习
FedLore共享并刷新低秩梯度投影,消除聚合偏差,降低通信与内存,性能超低秩基线并媲美全参数训练。
衡量动作分块背后的稳定性假设
动作分块中,注入动作误差测开/闭环传播,稳定罕见、误差放大常见;误差复合解释不足,需显式训练闭环恢复。
CoEvolve:基于双向状态精炼的“构建—编辑”式视觉定位
CoEvolve将视觉定位分为状态构建与编辑,双向精炼修正坐标,9B模型精度媲美241B模型。
AREX-2:通过长时程反思任务推进自我改进智能体
AREX-2用长时程反思数据训练智能体,在MLE-bench等基准表现优异并可随迭代持续提升。
MoFlow:多目标智能体工作流生成
MoFlow以凸包蒙特卡洛树搜索生成多目标智能体工作流,一次搜索近似帕累托前沿,按偏好查询即可,无需重训。
对齐数据可通过语境混淆导致失准
对齐数据会因语境混淆在其他情境诱发失准,需针对性对齐与全面后训练评估。
探究引导式AI导师化解学生卡壳方式的差异
分析2万余学生回合发现:卡壳每加深一轮恢复概率降12.7%,追问效果递减,直指错误更有效。
超越模式崩溃:基于生成流网络生成多样化的合成专家对话
提出用生成流网络生成多样合成专家对话,覆盖更全、更真实,下游训练信号更强。
以智能体为自身优化器的多任务自演化执行框架
冻结模型兼任求解者与提议者,直接改写自身执行框架;多任务分阶段演化,域外泛化提升12.64分,超越Codex
AI 智能体能否重新发现 Blaschke 曲线不变量?
AI 在 Blaschke 曲线受控环境中重新发现不变量,高精度拟合三次式,但未证明优于多项式拟合。
SimTrace:面向在线用户建模的基于真实交互的多模态用户轨迹生成
SimTrace基于真实轨迹生成逼真细粒度多模态点击流,支持虚拟客户端与在线用户行为建模。
MetaPersona:基于实证社会科学的任务锚定合成人群
基于1.1万项实证研究提出MetaPersona框架,按任务检索证据并采样合成人群,单任务成本低于0.5美元。
ArgGYM:一个面向结构化可废止推理的程序化、引擎验证基准
ArgGYM将可废止推理拆为12项任务,以符号论证引擎验证,提供1440实例基准及RLVR训练环境。
自主智能体失控的竞争风险系统化框架
提出竞争风险框架,将智能体行为归为完成、安全停止、越界、继续,审计表明失控多源于持续越界与宽松环境
深入CHOIR:自由列举式引出揭示大语言模型集成中的独特模型之声
提出CHOIR框架,以自由列举法探测LLM集成,区分表层共识与深层差异,识别各模型独特声音。
AIM:面向自动化研究的智能体式想法管理
提出AIM框架,用智能体代理与采集机制组织并优选研究想法,维护想法与实现一致,动态分配预算,优于基线且快3.1倍。
解码延迟反馈预填充:一种无模型控制器及其泛化极限
无模型控制器DLFP以解码延迟反馈调预填充分块,A100上P99令牌间隔降27.7%,但泛化受限。
理性与敏感性:以医师专家为基准评估大语言模型的临床分诊建议
基准测试显示,LLM较医生更易建议不必要诊疗,且对性别与语气等临床无关扰动更敏感。
AgBench:面向个人AI设备的智能体AI基准测试
提出AgBench基准套件,评估个人设备上智能体AI的本地、混合与云端执行,揭示成功率、延迟、成本与数据暴露间的权衡。
人口统计多元主义:多元人类偏好分布的推理时建模
提出人口统计多元主义推理时框架,无需微调估计群体意见分布;JS距离降8.4%-26.4%,等权聚合最优。
基于扩散模型的创意国际象棋谜题条件生成
扩散模型条件生成国际象棋谜题,支持主题与局部棋局,结合最佳着法预测与DDPO优化,唯一符题率提升89.1%。
OpenJev-RLCD:一个可用的RLCD实现
提出RLCD两阶段方案:先校准再强化,推理任务上准确率与选择性预测优于SFT、RFT与GRPO。
GraphCert:以认证证据评分标准自举智能体式图推理
GraphCert以认证证据标准自举图智能体,免昂贵标注,在五类图推理任务超越更大模型并跨域迁移。
谁的声音能在摘要中留存?LLM 员工倾听的声音留存审计
提出声音留存比指标审计LLM摘要偏差:按流行度过滤,仅现一次的关切流失86%,短文本与德语内容亦遭删。
Talk2Agent:面向文本智能体的语音接口基准评测
Talk2Agent:免执行评测语音接口,保留任务信息,关联完成度并优于WER/CER。
STRATA:面向实时策略游戏的基于角色对齐分层智能体的自学习
STRATA为红警设计角色对齐分层智能体,通过赛后复盘与跨局自学习压缩经验卡,胜率由30%提升至100%。
面向长时程智能体任务的一致性规划-行动
揭示规划者-执行者状态错配,提出ConPAct以矛盾反馈和一致性微调提升协调与成功率。
风险感知的自适应评估:在有限预算下发现高影响失败
风险感知上下文汤普森采样用于序贯分配评估:仅50次试验即找回86%高影响失败,均匀分配仅25%。
定向检索,紧凑表征:CoT推理如何提升长上下文计数
研究发现思维模型通过CoT枚举逐一检索目标,注意力更集中、内部表征更紧凑,并以CoT轨迹维护更新内部计数器。
免训练的不确定性引导调控:缓解推理任务中的幻觉
提出免训练方法USteer,利用置信度梯度引导推理时激活,降低不确定性以减少幻觉。
当顺序至关重要:顺序多智能体辩论中的首位发言者偏见及基于人格的缓解
顺序多智能体辩论存在首位发言者偏见,强者后置削弱其优势;降低强方宜人性可恢复其影响力并提升准确率。
RealWorldShop:在真实电商环境中对会话式购物智能体进行基准测试与改进
构建328万商品的会话购物基准,揭示状态跟踪与约束更新不足,并提出REALSHOP_AGENT框架。
C-STRIDE:一种观测驱动的人工智能数字孪生,用于从稀疏水文站历史记录预测全流域洪水场
少量水文站记录+地形降雨,AI数字孪生可预测全流域洪水深度并提前一天,误差约15%,速度快150倍。
搜索塑造结论:审计深度研究智能体中的证据选择偏差
提出CESS审计深度研究智能体的证据选择偏差,校正候选池估计,并区分其与搜索政策干预效应。
BELIEFRAG:在证据持续演化下实现状态感知的自适应RAG
BELIEFRAG以显式信念状态闭环选择检索、改写、验证或作答,六项问答基准上以少39%token超越固定迭代检索。
RefCon:面向上下文演化智能体的迭代精炼与对比记忆提取
RefCon以自精炼与自对比迭代提取记忆,无需标注,在多项智能体基准上稳定提升且更高效。
MASCRDM:大语言模型训练过程合规风险检测与缓解的多智能体系统
提出多智能体系统MASCRDM,在LLM训练全程实时检测并缓解合规风险,兼顾语义表现。
MADBench:多智能体辩论安全性基准评测
MADBench评测多智能体辩论安全;六类攻击下,辩论未必提升推理,且会放大越权读写。
自演化技能能否泛化到留出任务?
21个提升训练任务的技能中仅5个完全泛化,13个部分,3个全无;据此提出GSO,六项基准最优。
基于令牌级感知锚定优势估计强化多模态推理
提出令牌级感知锚定优势估计TPAE,依据视觉依赖与预测熵细粒度调制序列优势,提升多模态推理。
超越记忆中的世界:演化世界中持久导航的预测性4D信念
提出EvolvingNav,以预测性4D信念与事件滤波推断移动目标,提升演化世界持久导航成功率。
Fyan: A Human--AI Harness with Semantic Auditing for Document-Level Formalization
面向自主研究的实验经验建模
提出实验经验建模框架EEM,获取、复用与积累实验经验,指导实验决策,降低开销并提升自主研究性能。
有效并不意味着有用:面向 Transformer 冗余与规模化的条件功能可替代性
提出条件功能可替代性,从功能替代视角刻画冗余,揭示规模化下的功能重组与收益递减,助力高效动态计算。
MiniRep:面向多智能体辩论的鲁棒声誉聚合
MiniRep在多智能体辩论中融合当前行为与历史声誉,抵御恶意攻击并防相似群体主导,实验优于基线。
ANI:自适应数值注入,统一数值推理中的语义与算术表示
提出ANI,基于上下文门控选择性注入数值嵌入,兼顾语义标识与算术运算;MATH提升9.5分,通用性能稳健。
使用语言模型推断两个事件序列之间的因果关系
大语言模型可仅凭两个事件序列推断因果关系,在合成与真实数据上优于标准因果发现算法。
早期问题的计算能否帮助大语言模型解决新问题?
提出STAIR:复用历史键值并重定向查询,仅训练1.2万参数,后期准确率最高提升11.67个百分点。
解耦自蒸馏:习得与保持的测量与建模
系统解耦自蒸馏的三大轴(展开来源、教师耦合、KL方向),揭示三者对习得与保持的不同影响。
走出柏拉图洞穴的阴影:通过反事实推理评估自主智能体中的虚假记忆
提出免训练框架FAME,借反事实推理下的信念演变检测智能体虚假记忆,无需奖励设计或答案采样,多基准上显著优于基线。