Aperture:用于压缩词元的合并一致旋转状态
Aperture用旋转频率傅里叶矩编码压缩词元的位置支撑,证明维度最小且合并更新可加;视频问答65.63%,略低于67.12%。
UpliftMem:为智能体记忆检索学习集合级增益
UpliftMem以集合级执行增益学习记忆检索,用EVSI准则定向探测,无需测试时探测即取得最佳成功率。
AI 作为编译器:无需 Triton 编译器即可编译 Triton 内核
让大模型智能体将 Triton 内核直接编译为 PTX,性能达自动调优 Triton 的 0.83–3.34 倍,并扩展验证器支持 Blackwell。
面向时间扭曲鲁棒序列检索的几何条件化固定支架编码器
GeoPatch采用固定支架编码器,几何仅作条件调制,提升心电、语音等时序检索抗时间扭曲鲁棒性。
默认陷阱:重新思考工具使用型LLM智能体中的计划评估
研究揭示“默认陷阱”,主张工具型LLM智能体计划评估应联合报告优先级响应、默认依赖及任务成功/成本。
校准改变未来的决策:面向多模态大语言模型的同策略训练后量化
提出OnPTQ:按当前量化策略轨迹校准,以决策-后果风险评估关键状态,提升多模态模型低比特量化性能。
中文标题:PrecogUI:通过预认知模拟与经验检索实现的主动式GUI智能体
PrecogUI预认知架构融合经验池、模拟预测与闭环纠错实现主动决策,在强干扰长程任务上超越现有方法。
基于统计形状模型与深度学习的骨盆骨折复位螺钉自动规划
提出全自动骶髂螺钉术前规划流程,自动识别安全通道并生成个体化轨迹;200例验证:安全边界提升2%,规划时间减少逾90%,接受率达95%。
状态轨迹推理解释作为强化学习中的辅助任务
STRAT以预测自身状态文本轨迹为辅助任务,助RL攻克稀疏奖励难题,压缩状态表示并提供可读解释。
HorizonFlow:面向离线目标条件强化学习的可变长度规划
HorizonFlow将规划长度作为生成输出,以插入式生成加流匹配联合生成内容与长度,无需价值模型,多基准平均性能最优。
STAR-GRPO:面向表示依赖型奖励黑客的规范锚定与可靠性优先优势估计
提出STAR-GRPO,以可靠性优先优势估计分离质量与学习影响,锚定规范信号,有效抑制奖励黑客并提升真实质量。
神经符号计算机使用:学习可复用策略以实现可靠高效的执行
提出神经符号计算机使用,将重复工作流固化为可复用策略,神经模型处理依赖观测的决策,大幅降本增效。
双通道鲁棒群相对策略优化:基于优势与序列权重估计
提出双通道鲁棒优化器RoVR-GSPO,以有界残差信用与SoftRoVR聚合稳健估计优势和序列权重,抗奖励污染与比率异常,优于GSPO。
CF-LoRA:解耦因子聚合与适应感知客户端聚类用于联邦LoRA微调
CF-LoRA通过解耦因子聚合与适应感知聚类,解决联邦LoRA微调的聚合与协作不匹配,提升异构数据下的精度。
AnyAct:面向自进化智能体的通用动作层
提出通用动作层AnyAct,以渐进检索与测试时演化统一异构反馈,实现动态工具生态下的可靠高效编排。
语言作为界面:基础模型对比学习连接转录组与电生理
LangPatch以语言为界面,用冻结文本编码器对齐基因与电生理表征,实现跨模态预测及脑区、物种迁移。
低秩参数化之外:通过梯度分解缩小LoRA与全量微调之间的差距
GDLoRA将权重梯度正交分解,提取LoRA切空间之外的“法向梯度”直接更新基权重,不增显存即缩小与全量微调的差距。
FedLAFP:联邦微调中低秩聚合与全秩个性化的融合
FedLAFP以共享LoRA低秩聚合、客户端私有RandLoRA全秩个性化,仅交换共享参数,四基准平均准确率86.93%,超最佳基线1.30个百分点。
MatToolBench:面向真实材料科学工作流的多模态智能体基准测试
首个真实材料科学软件多模态智能体基准,含204项任务,最佳仅GUI 25%、代码45%成功率。
打破静态评估下评审可靠性的幻象:面向基于大语言模型的科学审稿人的SCOPE模糊测试
构建三层扰动评估框架,揭示静态评估的分层脆弱与覆盖不足,提出SCOPE-Fuzzer持续挖掘被忽视的漏洞。
与AI共事:人机协作设计框架
提出人机协作设计框架,统筹人、AI系统、任务、组织与社会环境,并以协作机器人装配案例演示其落地应用。
COUNTERMEM:面向语言智能体的世界模型验证式反事实记忆
用可执行世界模型验证失败后的反事实记忆,12项基准平均提升12.6个百分点,token降7.7%-42%。
见证重叠:开放权重模型家族内的方向性溯源
见证重叠法免训练免提示,以同族第三检查点为见证判断父子方向,176个模型上准确率95.3%。
CP-Agent:面向晶体塑性仿真工作流的框架工程化智能体
基于LLM的CP-Agent自主完成晶体塑性建模全流程,四案例验证参数校准与织构复现。
ConflictVLA-Bench:评测视觉-语言-动作模型对前提冲突的行为响应
提出ConflictVLA-Bench,发现VLA面对前提冲突常现“失败坚持”,仅看结果不足以评估。
秩能换来什么?低秩适配的谱与分布分析
LoRA秩非容量控制;范数预算下复杂度与分布位移不随秩变,秩仅决定可及更新及抵消主奇异方向的代价。
EmailBench:评估企业邮件与生产力任务中LLM智能体的基准
EmailBench含206个邮件场景,最佳模型仅通过33.5%,工具调用成功不等于任务完成。
基于正交均衡学习的上下文相关智能体评估
提出NashEval,用去偏上下文收益矩阵与正交均衡学习,稳健评估上下文相关智能体。
BioDyad:同步生物医学发现与机器学习工程
BioDyad以双层次蒙特卡洛图搜索协同生物医学发现与机器学习工程,在76项任务上取得最高得分与成功率。
SenseAgent:面向自适应跨域IMU感知的大语言模型智能体
利用LLM规划跨域IMU感知工具,结合无标签诊断与验证器,实现闭环自适应活动识别。
目标持续型编程智能体作为科学性能工程师:一项固定半径最近邻案例研究
固定半径最近邻案例中,智能体自主去依赖、假设驱动优化,获1.6倍加速并精确复现,可作实验性能工程师。
EngramRAG:面向多跳智能体记忆的动态使用加权拓扑与突触巩固
EngramRAG以使用加权动态拓扑与突触巩固机制融合三源混合检索,LoCoMo上Recall@5相对提升38.9%。
迈向代码 API 的交互式理解
提出PAU基准:模型仅凭黑盒API查询理解Python代码,前沿模型表现不佳;AAC后训练提升探索。
Residual Streams Read, Recurrent States Remember: The Global Workspace in Mamba Models
接收方条件化的潜在通信实现 94% 的 CacheBack
CacheBack 按接收方信息需求过滤压缩 KV 缓存,状态减 75%,准确率提升 14.7 点,延迟降 3.2 倍。
合约监督:以权力分立治理人工智能
提出AI安全框架,以合约限定智能体行为,通过监督者与裁判分权及算力不对称执行,可实证衡量安全保证。
记忆即中间件:面向自我改进的AI智能体
智能体跨会话失忆、重复犯错;应将记忆打造为可插拔的中间件层,本文归纳六大系统挑战并给出参考实现。
GameBoyWorlds:具身电子游戏中自我改进的测试平台
提出GameBoyWorlds测试平台,评估智能体在电子游戏中自主探索与自我改进,前沿模型表现不佳。
双语AI听力师在模拟病例盲评中全面超越人类听力师:基于评分量表引导的策略手册归纳
双语AI听力师无需微调,凭量表引导的策略手册,在58例模拟病例盲评中全面胜过17名人类听力师。
逃离对齐:Best-of-N越狱的物理陷阱模型
提出物理陷阱模型,以四个可解释参数刻画Best-of-N越狱攻击面,可外推并预测温度影响。
含噪测试时强化学习用于代码大语言模型
提出NTRL-Code框架,仅用无标注含噪数据实现代码LLM鲁棒自进化,在三个基准上稳定提升性能。
PastForward:通过复用计算经验加速端侧GUI智能体
通过复用历史GUI计算经验,端侧GUI智能体动作步延迟加速1.63–2.36倍且保持任务成功率。
CoMemBench:跨多智能体工作流拓扑的协作记忆边界基准测试
提出CoMemBench,跨多智能体工作流拓扑评测协作记忆边界,揭示共享—隔离权衡。
WITNESS:交互式解谜环境中的发现、破译与顿悟
提出Witness基准,考察模型规则发现;前沿模型解24%,RL可提升小模型并迁移至外部任务。
RAO-Nav:探究全能语言模型用于零样本语义视听导航
提出RAO-Nav零样本语义视听导航框架,借全能语言模型视听知识并加潜在导航推理,无需训练即超越现有基线。
Train4Merge:基于OPD模型合并的RL与SFT教师受控单教师对比研究
OPD模型合并中,性能相当的RL教师比SFT教师更会教,学生表现更优;因RL教师参数更接近共享初始化,更易被跟随。
技能何时能增加价值?面向选择性技能使用的任务条件增益预测
技能常无益甚至有害;SkillDelta可预测任务条件增益,选择性使用使成功率平均提升4.3%。
GLIDE:面向异构LLM智能体的广义逐层内在分布评估
GLIDE以逐层残差一致性校准步级奖励,无需外部验证器,提升异构LLM智能体评估与分支效率。
Agentsensus:面向多智能体故事世界的共识压缩共享记忆
统一共享记忆将同一事件合并为见证者共有记录并语义链接,写入减少22-44%,共享率14-28%,质量不降。
测试时语言模型的延迟监督
在长间隔无关事件后提问并监督答案,可显著提升测试时记忆模型的长上下文检索能力。