更好的教师监督就足够了吗?解锁多模态同策略蒸馏中的学生端学习
指出学生感知是多模态在线策略蒸馏瓶颈,提出S-OPD,借教师校准对比与策略一致性强化学生感知,即插即用。
VAA-CSEC:基于投票引导优势分配的中文语义纠错
提出VAA-CSEC,融合思维链蒸馏、监督微调、强化学习与自一致性解码,投票引导优势分配,提升中文语义纠错。
伊比利亚语言自动语音识别工具基准评测
评测11个ASR系统于5种伊比利亚语言,发现精度、效率与语言覆盖难兼顾,低资源语言尤其巴斯克语明显退化。
为模型定日期:系统提示中的隐藏日期影响大语言模型评估
系统提示隐藏注入当日日期,令LLM评测随日期波动,最高14%并改变排名,威胁可复现性。
论从视频中获取非线性标量动力学参数:不变量、标定与可辨识性
提出视频中非线性标量二阶动力学参数可辨识性:辨识性因方程族而异,或唯一、或不变量组合、或需外部标定。
GRC-Pose:面向无先验6D物体位姿跟踪的生成-重建对应
提出GRC-Pose,将无先验6D位姿跟踪建模为生成-重建对应,HOT3D最优,运动保持+58%。
Fyan: A Human--AI Harness with Semantic Auditing for Document-Level Formalization
WorkGenesis: Building the Worlds That Teach Agents to Work
Asking the World: Generalist Physical Reasoning through Agentic World Modeling and Probing
How to Reduce Localization Ambiguity? Geometry-Semantic Constrained BEV Representation Learning for Satellite-Ground Localization
The Golden Path Hypothesis: Reusable Schedules in Diffusion Caching
面向自主研究的实验经验建模
提出实验经验建模框架EEM,获取、复用与积累实验经验,指导实验决策,降低开销并提升自主研究性能。
MEND:世界模型中潜在幻觉的无标签检测、定位与校正
MEND用单一得分网络在推理时无标签检测、定位并校正世界模型潜在幻觉。
大型视觉语言模型中压缩触发隐蔽失效的特征感知令牌攻击
提出FATA,利用视觉编码器梯度,在保持全令牌正确时触发压缩后隐蔽失效,且检测率最低。
CypherTurn:对话式Text-to-Cypher评估的多轮基准与自主性分化
首个对话式Text-to-Cypher多轮基准,涵盖721会话5927轮;最佳执行准确率64.7%,会话正确率不足5%,并揭示自主性分化。
有效并不意味着有用:面向 Transformer 冗余与规模化的条件功能可替代性
提出条件功能可替代性,从功能替代视角刻画冗余,揭示规模化下的功能重组与收益递减,助力高效动态计算。
Chinese-Jev:将 System One 模型引入中文任务
提出 Chinese-Jev,统一中文数据处理与训练,覆盖通用及医疗、法律、金融,准确率超 Jev,最高提速 20 倍,支持端侧部署。
MiniRep:面向多智能体辩论的鲁棒声誉聚合
MiniRep在多智能体辩论中融合当前行为与历史声誉,抵御恶意攻击并防相似群体主导,实验优于基线。
后训练在多语言推理中改变了什么?
多语言后训练中,SFT恢复目标语言推理但降准确率,RL仅当奖励含语言项才能兼顾正确与终止。
GeoGAT:双向时序采样结合层次化图注意力实现全球视频地理定位
提出GeoGAT,融合双向时序采样与层次图注意力,消除层级预测冲突,显著提升全球视频地理定位精度。
可交换性感知神经后验估计的摊销式数据借用
提出可交换性感知摊销神经后验估计用于外部数据借用;结局漂移下偏差更低,约千倍加速。
On the Complexity of Preference-Based Bandits
MindWorldBench:评估图像到视频生成中的心理状态到行为推理
提出MindWorldBench基准,评估图生视频的心理状态到行为推理,发现模型存在"全知偏差",视觉生成与认知推理脱节。
使用机器学习与人类相似性判断的感知色差建模
基于人类相似性评分建模色差,颜色表示比算法更关键,LightGBM结合感知类别特征最佳。
ANI:自适应数值注入,统一数值推理中的语义与算术表示
提出ANI,基于上下文门控选择性注入数值嵌入,兼顾语义标识与算术运算;MATH提升9.5分,通用性能稳健。
EFormer:面向连续sEMG手部姿态跟踪的时间对齐局部校正
EFormer融合高频事件与时间对齐局部交叉注意力,降低连续sEMG手姿跟踪误差,MAE较基线降11.38%。
DAMPER:回报优先的梯度控制以实现平滑策略
DAMPER以回报优先的冲突投影与自适应幅度控制融合时序一致性梯度,在连续控制任务中显著降低动作振荡。
混合整数线性与非线性规划中的自动研究
AutoMIP用想法池与算法树搜索组织长周期自动研究,在MILP/MINLP基准刷新多个最优解。
重复而非长度:分离神经文本到语音中的计数失败
重复而非长度:神经语音合成在重复短语时计数失败,匹配对照近乎全对,重复句k≥6仅18.2%完全正确。
文本何时能取代视觉?图表推理中的结构性瓶颈
诊断区分信息缺失与未利用:黄金结构达87%,视觉与学习文本不足30%;答案相关拓扑比全局结构更关键。
理解即无套利:有界荷兰赌局作为语言模型的定义与训练目标
以无套利定义理解 证明下一词预测固有逻辑不一致 提出对抗交易者训练 大幅降低套利且不损准确率 并揭示缩放错觉
AMU:个性化对话的准入与记忆更新——SLM引导控制的结构化记忆
AMU:SLM引导的结构化写入记忆控制,过滤准入、管理存储并去重融合,实验显示个性化记忆更干净可检索。
面向少步视频生成的不确定性感知一致性蒸馏
提出不确定性感知一致性蒸馏,按局部时空不确定性重加权监督,结合对抗训练与语义对齐,实现4步视频生成。
SRJudge:以选择性推理赋能大语言模型实现细粒度知识概念标注
提出选择-推理-评判三阶段SRJudge框架,缩小候选空间,提升细粒度知识概念标注性能。
OP-CAD:面向鲁棒音视频推理的在线策略干净音频蒸馏
OP-CAD以课程式特权自蒸馏,按声学敏感度加权干净教师监督,提升噪声下音视频推理鲁棒性且不损干净准确率。
可解释代表性地标的认证近似
提出CAIRN,为自监督可解释地标排序提供端到端误差认证,量化近似误差,优化覆盖与预算,提速且保精度。
TripleFlow:通过桥接残差编辑与原生生成实现免训练视频物体移除
免训练框架,耦合残差与合成流,将生成背景持续回注编辑轨迹,实现时空一致的视频物体移除。
EHR-RobustGym:稳健临床推理智能体的基准评测与训练
EHR-RobustGym基于MIMIC-IV构建噪声EHR评测训练环境,模型噪声下成功率从62.2%降至37.9%,微调与强化学习可提升鲁棒性。
通过在线策略蒸馏学习思维模式优势
提出ThinkOPD,通过轨迹-响应差异路由监督,在数学与代码任务上超越基线。
用对比遗忘集遗忘大语言模型中的欺骗行为
PACT用对比遗忘集和压力感知目标,将大模型欺骗率从50%以上降至3%以下,并保持上下文遵循。
SkillFM:通过潜在流匹配为LLM智能体生成技能
提出生成式框架SkillFM,在连续潜在空间用条件流匹配生成任务条件文本技能,推理时单步采样、无需检索,在具身任务与问答上表现领先。
LatCom:面向高效多智能体协作的跨智能体潜在压缩
提出跨智能体潜在压缩框架LatCom,两阶段训练,在Qwen3-4B上推理提速2.46倍、输出token降70.3%且精度相当。
世界即图:基于潜空间图的关系世界建模
提出图式对象中心世界模型WAG,借潜空间动态图与对象记忆增强关系建模,提升视觉推理与机器人操作。
在自然语言自编码器中选择最具信息量的词元
470万解释表明,仅按聊天结构选位常优于计算信号;解释5%位置即可接近全量成功率,预训练语言化器还能揭示微调隐藏词。
Traverse:学习在长视野网络搜索中何时记忆、重置与重定向
提出自主搜索框架,含三状态与记忆工具,以强化学习训练并解决崩溃问题;35B模型BrowseComp得分72.83。
自适应自洽性:从黑盒采样到分布值反馈
提出ASC-D,自洽性转为分布值反馈的序贯众数识别,轨迹减少46.4%–95.6%,正确认证率最高。
噪声潜在结构下的流匹配:超越精确低维支撑
研究噪声潜在结构下的线性流匹配,证明统计速率由潜在维数而非环境维数决定,并给出收敛保证。
广义残差闭合:稳定性—可塑性兼容的通用学习动力学
提出广义残差闭合框架,将学习视为递归闭合未来相关差异,统一稳定性—可塑性、表示修正与持续学习。
学习何处引导:基于生成模型的高效离线多目标优化的噪声空间几何
离线多目标优化中,仅调初始噪声、学少数敏感方向,低成本引导扩散模型,47任务超体积领先。
使用语言模型推断两个事件序列之间的因果关系
大语言模型可仅凭两个事件序列推断因果关系,在合成与真实数据上优于标准因果发现算法。