带有偏见LLM评判器的主动偏好学习最优设计
提出NAOD,将评判器偏差纳入采集设计,优化比较选择,理论达紧致下界,实验遗憾降低29.1%。
答案正确,模型昂贵:基于大语言模型的优化建模效率差距
LLM优化建模常答案正确但求解更慢、开销更高;新基准揭示效率差距,应兼顾正确性与效率。
面向可解释图像伪造检测的智能体工具增强推理
提出ATAR,用22种工具多轮推理,检测定位并解释图像伪造,零样本F1达78.5%,超MLLM基线11.8点。
GeoNest:学习为圆形容器中的不规则背包问题选择失败感知邻域
GeoNest用强化学习图策略选择失败感知邻域,提升圆形不规则背包利用率约0.9%。
DeCoPrune:基于去噪一致性的自回归视频扩散高效 KV 缓存剪枝
DeCoPrune免训练,用去噪一致性剪枝KV缓存,保留高差异token,降低自回归视频扩散推理成本。
BaLEEN:面向上下文感知语音识别的潜在编码实体偏置
BaLEEN以潜在编码实体实现免微调上下文偏置,即插即用,显著降低关键词漏检及识别错误率。
基于令牌级感知锚定优势估计强化多模态推理
提出令牌级感知锚定优势估计TPAE,依据视觉依赖与预测熵细粒度调制序列优势,提升多模态推理。
CamAgent:面向多物种相机陷阱工作流的LLM智能体框架
CamAgent是LLM智能体框架,统一整合红外相机多物种分析工作流,以自然语言驱动物种识别、占据建模等工具,降低编程门槛。
Rep2Skill:表征引导的LLM智能体技能自演化
Rep2Skill利用内部表征定位偏离成功的轮次并生成反馈,引导LLM智能体修订技能实现自演化,优于纯文本法。
超越局部线性:学习型图像编码器的尺度分辨几何
提出尺度分辨统计量,发现编码器特征位移非线性偏离局部预测,形成训练后才出现的凸起,反映学习对表征的塑造。
面向详细图像描述的动量耦合评分标准自适应
提出MoCo Rubric框架,单模型兼任描述、评分标准与评判,动量耦合更新,五基准平均胜率72.83%。
Unmerge:通过任务算术实现高效机器遗忘
将遗忘重构为任务算术的逆操作,用低秩遗忘子空间优化三目标,实现高效机器遗忘,并扩展到ViT和Llama。
超越记忆中的世界:演化世界中持久导航的预测性4D信念
提出EvolvingNav,以预测性4D信念与事件滤波推断移动目标,提升演化世界持久导航成功率。
语言模型能学会预测股价吗?
后训练显著提升语言模型股价预测表现,并改变其信息调查与工具使用方式。
学习随机混杂系统的连续神经表示
用高维潜空间连续SDE逼近随机混杂系统,辅助变量粘合重置分支,无需标注或事件仿真即可学习概率演化。
ER-JEPA:经验回放提升语言模型中的联合嵌入预测学习
为LLM-JEPA加入经验回放路径,存储并检索训练对以提供额外监督,多数据集实验证明其优于LLM-JEPA。
更好的教师监督就足够了吗?解锁多模态同策略蒸馏中的学生端学习
指出学生感知是多模态在线策略蒸馏瓶颈,提出S-OPD,借教师校准对比与策略一致性强化学生感知,即插即用。
VAA-CSEC:基于投票引导优势分配的中文语义纠错
提出VAA-CSEC,融合思维链蒸馏、监督微调、强化学习与自一致性解码,投票引导优势分配,提升中文语义纠错。
伊比利亚语言自动语音识别工具基准评测
评测11个ASR系统于5种伊比利亚语言,发现精度、效率与语言覆盖难兼顾,低资源语言尤其巴斯克语明显退化。
为模型定日期:系统提示中的隐藏日期影响大语言模型评估
系统提示隐藏注入当日日期,令LLM评测随日期波动,最高14%并改变排名,威胁可复现性。
论从视频中获取非线性标量动力学参数:不变量、标定与可辨识性
提出视频中非线性标量二阶动力学参数可辨识性:辨识性因方程族而异,或唯一、或不变量组合、或需外部标定。
GRC-Pose:面向无先验6D物体位姿跟踪的生成-重建对应
提出GRC-Pose,将无先验6D位姿跟踪建模为生成-重建对应,HOT3D最优,运动保持+58%。
Fyan: A Human--AI Harness with Semantic Auditing for Document-Level Formalization
WorkGenesis: Building the Worlds That Teach Agents to Work
Asking the World: Generalist Physical Reasoning through Agentic World Modeling and Probing
How to Reduce Localization Ambiguity? Geometry-Semantic Constrained BEV Representation Learning for Satellite-Ground Localization
The Golden Path Hypothesis: Reusable Schedules in Diffusion Caching
面向自主研究的实验经验建模
提出实验经验建模框架EEM,获取、复用与积累实验经验,指导实验决策,降低开销并提升自主研究性能。
MEND:世界模型中潜在幻觉的无标签检测、定位与校正
MEND用单一得分网络在推理时无标签检测、定位并校正世界模型潜在幻觉。
大型视觉语言模型中压缩触发隐蔽失效的特征感知令牌攻击
提出FATA,利用视觉编码器梯度,在保持全令牌正确时触发压缩后隐蔽失效,且检测率最低。
CypherTurn:对话式Text-to-Cypher评估的多轮基准与自主性分化
首个对话式Text-to-Cypher多轮基准,涵盖721会话5927轮;最佳执行准确率64.7%,会话正确率不足5%,并揭示自主性分化。
有效并不意味着有用:面向 Transformer 冗余与规模化的条件功能可替代性
提出条件功能可替代性,从功能替代视角刻画冗余,揭示规模化下的功能重组与收益递减,助力高效动态计算。
Chinese-Jev:将 System One 模型引入中文任务
提出 Chinese-Jev,统一中文数据处理与训练,覆盖通用及医疗、法律、金融,准确率超 Jev,最高提速 20 倍,支持端侧部署。
MiniRep:面向多智能体辩论的鲁棒声誉聚合
MiniRep在多智能体辩论中融合当前行为与历史声誉,抵御恶意攻击并防相似群体主导,实验优于基线。
后训练在多语言推理中改变了什么?
多语言后训练中,SFT恢复目标语言推理但降准确率,RL仅当奖励含语言项才能兼顾正确与终止。
GeoGAT:双向时序采样结合层次化图注意力实现全球视频地理定位
提出GeoGAT,融合双向时序采样与层次图注意力,消除层级预测冲突,显著提升全球视频地理定位精度。
可交换性感知神经后验估计的摊销式数据借用
提出可交换性感知摊销神经后验估计用于外部数据借用;结局漂移下偏差更低,约千倍加速。
On the Complexity of Preference-Based Bandits
MindWorldBench:评估图像到视频生成中的心理状态到行为推理
提出MindWorldBench基准,评估图生视频的心理状态到行为推理,发现模型存在"全知偏差",视觉生成与认知推理脱节。
使用机器学习与人类相似性判断的感知色差建模
基于人类相似性评分建模色差,颜色表示比算法更关键,LightGBM结合感知类别特征最佳。
ANI:自适应数值注入,统一数值推理中的语义与算术表示
提出ANI,基于上下文门控选择性注入数值嵌入,兼顾语义标识与算术运算;MATH提升9.5分,通用性能稳健。
EFormer:面向连续sEMG手部姿态跟踪的时间对齐局部校正
EFormer融合高频事件与时间对齐局部交叉注意力,降低连续sEMG手姿跟踪误差,MAE较基线降11.38%。
DAMPER:回报优先的梯度控制以实现平滑策略
DAMPER以回报优先的冲突投影与自适应幅度控制融合时序一致性梯度,在连续控制任务中显著降低动作振荡。
混合整数线性与非线性规划中的自动研究
AutoMIP用想法池与算法树搜索组织长周期自动研究,在MILP/MINLP基准刷新多个最优解。
重复而非长度:分离神经文本到语音中的计数失败
重复而非长度:神经语音合成在重复短语时计数失败,匹配对照近乎全对,重复句k≥6仅18.2%完全正确。
文本何时能取代视觉?图表推理中的结构性瓶颈
诊断区分信息缺失与未利用:黄金结构达87%,视觉与学习文本不足30%;答案相关拓扑比全局结构更关键。
理解即无套利:有界荷兰赌局作为语言模型的定义与训练目标
以无套利定义理解 证明下一词预测固有逻辑不一致 提出对抗交易者训练 大幅降低套利且不损准确率 并揭示缩放错觉
AMU:个性化对话的准入与记忆更新——SLM引导控制的结构化记忆
AMU:SLM引导的结构化写入记忆控制,过滤准入、管理存储并去重融合,实验显示个性化记忆更干净可检索。
面向少步视频生成的不确定性感知一致性蒸馏
提出不确定性感知一致性蒸馏,按局部时空不确定性重加权监督,结合对抗训练与语义对齐,实现4步视频生成。
SRJudge:以选择性推理赋能大语言模型实现细粒度知识概念标注
提出选择-推理-评判三阶段SRJudge框架,缩小候选空间,提升细粒度知识概念标注性能。