60852 条条目 · 106 个活跃源
2026年10月1日
04:00
arXiv cs.CV

更好的教师监督就足够了吗?解锁多模态同策略蒸馏中的学生端学习

指出学生感知是多模态在线策略蒸馏瓶颈,提出S-OPD,借教师校准对比与策略一致性强化学生感知,即插即用。

04:00
arXiv cs.CL

VAA-CSEC:基于投票引导优势分配的中文语义纠错

提出VAA-CSEC,融合思维链蒸馏、监督微调、强化学习与自一致性解码,投票引导优势分配,提升中文语义纠错。

04:00
arXiv cs.CL

伊比利亚语言自动语音识别工具基准评测

评测11个ASR系统于5种伊比利亚语言,发现精度、效率与语言覆盖难兼顾,低资源语言尤其巴斯克语明显退化。

04:00
arXiv cs.CL

为模型定日期:系统提示中的隐藏日期影响大语言模型评估

系统提示隐藏注入当日日期,令LLM评测随日期波动,最高14%并改变排名,威胁可复现性。

04:00
arXiv cs.LG

论从视频中获取非线性标量动力学参数:不变量、标定与可辨识性

提出视频中非线性标量二阶动力学参数可辨识性:辨识性因方程族而异,或唯一、或不变量组合、或需外部标定。

04:00
arXiv cs.CV

GRC-Pose:面向无先验6D物体位姿跟踪的生成-重建对应

提出GRC-Pose,将无先验6D位姿跟踪建模为生成-重建对应,HOT3D最优,运动保持+58%。

04:00
ArXiv AI

Fyan: A Human--AI Harness with Semantic Auditing for Document-Level Formalization

04:00
arXiv cs.AI

WorkGenesis: Building the Worlds That Teach Agents to Work

04:00
arXiv cs.CV

Asking the World: Generalist Physical Reasoning through Agentic World Modeling and Probing

04:00
arXiv cs.CV

How to Reduce Localization Ambiguity? Geometry-Semantic Constrained BEV Representation Learning for Satellite-Ground Localization

04:00
arXiv cs.AI

The Golden Path Hypothesis: Reusable Schedules in Diffusion Caching

04:00
ArXiv AI

面向自主研究的实验经验建模

提出实验经验建模框架EEM,获取、复用与积累实验经验,指导实验决策,降低开销并提升自主研究性能。

04:00
arXiv cs.CV

MEND:世界模型中潜在幻觉的无标签检测、定位与校正

MEND用单一得分网络在推理时无标签检测、定位并校正世界模型潜在幻觉。

04:00
arXiv cs.CV

大型视觉语言模型中压缩触发隐蔽失效的特征感知令牌攻击

提出FATA,利用视觉编码器梯度,在保持全令牌正确时触发压缩后隐蔽失效,且检测率最低。

04:00
arXiv cs.CL

CypherTurn:对话式Text-to-Cypher评估的多轮基准与自主性分化

首个对话式Text-to-Cypher多轮基准,涵盖721会话5927轮;最佳执行准确率64.7%,会话正确率不足5%,并揭示自主性分化。

04:00
ArXiv AI

有效并不意味着有用:面向 Transformer 冗余与规模化的条件功能可替代性

提出条件功能可替代性,从功能替代视角刻画冗余,揭示规模化下的功能重组与收益递减,助力高效动态计算。

04:00
arXiv cs.CL

Chinese-Jev:将 System One 模型引入中文任务

提出 Chinese-Jev,统一中文数据处理与训练,覆盖通用及医疗、法律、金融,准确率超 Jev,最高提速 20 倍,支持端侧部署。

04:00
ArXiv AI

MiniRep:面向多智能体辩论的鲁棒声誉聚合

MiniRep在多智能体辩论中融合当前行为与历史声誉,抵御恶意攻击并防相似群体主导,实验优于基线。

04:00
arXiv cs.CL

后训练在多语言推理中改变了什么?

多语言后训练中,SFT恢复目标语言推理但降准确率,RL仅当奖励含语言项才能兼顾正确与终止。

04:00
arXiv cs.CV

GeoGAT:双向时序采样结合层次化图注意力实现全球视频地理定位

提出GeoGAT,融合双向时序采样与层次图注意力,消除层级预测冲突,显著提升全球视频地理定位精度。

04:00
arXiv cs.LG

可交换性感知神经后验估计的摊销式数据借用

提出可交换性感知摊销神经后验估计用于外部数据借用;结局漂移下偏差更低,约千倍加速。

04:00
arXiv cs.AI

On the Complexity of Preference-Based Bandits

04:00
arXiv cs.CV

MindWorldBench:评估图像到视频生成中的心理状态到行为推理

提出MindWorldBench基准,评估图生视频的心理状态到行为推理,发现模型存在"全知偏差",视觉生成与认知推理脱节。

04:00
arXiv cs.CV

使用机器学习与人类相似性判断的感知色差建模

基于人类相似性评分建模色差,颜色表示比算法更关键,LightGBM结合感知类别特征最佳。

04:00
ArXiv AI

ANI:自适应数值注入,统一数值推理中的语义与算术表示

提出ANI,基于上下文门控选择性注入数值嵌入,兼顾语义标识与算术运算;MATH提升9.5分,通用性能稳健。

04:00
arXiv cs.LG

EFormer:面向连续sEMG手部姿态跟踪的时间对齐局部校正

EFormer融合高频事件与时间对齐局部交叉注意力,降低连续sEMG手姿跟踪误差,MAE较基线降11.38%。

04:00
arXiv cs.LG

DAMPER:回报优先的梯度控制以实现平滑策略

DAMPER以回报优先的冲突投影与自适应幅度控制融合时序一致性梯度,在连续控制任务中显著降低动作振荡。

04:00
arXiv cs.AI

混合整数线性与非线性规划中的自动研究

AutoMIP用想法池与算法树搜索组织长周期自动研究,在MILP/MINLP基准刷新多个最优解。

04:00
arXiv cs.CL

重复而非长度:分离神经文本到语音中的计数失败

重复而非长度:神经语音合成在重复短语时计数失败,匹配对照近乎全对,重复句k≥6仅18.2%完全正确。

04:00
arXiv cs.CV

文本何时能取代视觉?图表推理中的结构性瓶颈

诊断区分信息缺失与未利用:黄金结构达87%,视觉与学习文本不足30%;答案相关拓扑比全局结构更关键。

04:00
arXiv cs.AI

理解即无套利:有界荷兰赌局作为语言模型的定义与训练目标

以无套利定义理解 证明下一词预测固有逻辑不一致 提出对抗交易者训练 大幅降低套利且不损准确率 并揭示缩放错觉

04:00
arXiv cs.CL

AMU:个性化对话的准入与记忆更新——SLM引导控制的结构化记忆

AMU:SLM引导的结构化写入记忆控制,过滤准入、管理存储并去重融合,实验显示个性化记忆更干净可检索。

04:00
arXiv cs.CV

面向少步视频生成的不确定性感知一致性蒸馏

提出不确定性感知一致性蒸馏,按局部时空不确定性重加权监督,结合对抗训练与语义对齐,实现4步视频生成。

04:00
arXiv cs.CL

SRJudge:以选择性推理赋能大语言模型实现细粒度知识概念标注

提出选择-推理-评判三阶段SRJudge框架,缩小候选空间,提升细粒度知识概念标注性能。

04:00
arXiv cs.CV

OP-CAD:面向鲁棒音视频推理的在线策略干净音频蒸馏

OP-CAD以课程式特权自蒸馏,按声学敏感度加权干净教师监督,提升噪声下音视频推理鲁棒性且不损干净准确率。

04:00
arXiv cs.LG

可解释代表性地标的认证近似

提出CAIRN,为自监督可解释地标排序提供端到端误差认证,量化近似误差,优化覆盖与预算,提速且保精度。

04:00
arXiv cs.CV

TripleFlow:通过桥接残差编辑与原生生成实现免训练视频物体移除

免训练框架,耦合残差与合成流,将生成背景持续回注编辑轨迹,实现时空一致的视频物体移除。

04:00
arXiv cs.AI

EHR-RobustGym:稳健临床推理智能体的基准评测与训练

EHR-RobustGym基于MIMIC-IV构建噪声EHR评测训练环境,模型噪声下成功率从62.2%降至37.9%,微调与强化学习可提升鲁棒性。

04:00
arXiv cs.CL

通过在线策略蒸馏学习思维模式优势

提出ThinkOPD,通过轨迹-响应差异路由监督,在数学与代码任务上超越基线。

04:00
arXiv cs.LG

用对比遗忘集遗忘大语言模型中的欺骗行为

PACT用对比遗忘集和压力感知目标,将大模型欺骗率从50%以上降至3%以下,并保持上下文遵循。

04:00
arXiv cs.AI

SkillFM:通过潜在流匹配为LLM智能体生成技能

提出生成式框架SkillFM,在连续潜在空间用条件流匹配生成任务条件文本技能,推理时单步采样、无需检索,在具身任务与问答上表现领先。

04:00
arXiv cs.CL

LatCom:面向高效多智能体协作的跨智能体潜在压缩

提出跨智能体潜在压缩框架LatCom,两阶段训练,在Qwen3-4B上推理提速2.46倍、输出token降70.3%且精度相当。

04:00
arXiv cs.LG

世界即图:基于潜空间图的关系世界建模

提出图式对象中心世界模型WAG,借潜空间动态图与对象记忆增强关系建模,提升视觉推理与机器人操作。

04:00
arXiv cs.CL

在自然语言自编码器中选择最具信息量的词元

470万解释表明,仅按聊天结构选位常优于计算信号;解释5%位置即可接近全量成功率,预训练语言化器还能揭示微调隐藏词。

04:00
arXiv cs.CL

Traverse:学习在长视野网络搜索中何时记忆、重置与重定向

提出自主搜索框架,含三状态与记忆工具,以强化学习训练并解决崩溃问题;35B模型BrowseComp得分72.83。

04:00
arXiv cs.LG

自适应自洽性:从黑盒采样到分布值反馈

提出ASC-D,自洽性转为分布值反馈的序贯众数识别,轨迹减少46.4%–95.6%,正确认证率最高。

04:00
arXiv cs.LG

噪声潜在结构下的流匹配:超越精确低维支撑

研究噪声潜在结构下的线性流匹配,证明统计速率由潜在维数而非环境维数决定,并给出收敛保证。

04:00
arXiv cs.LG

广义残差闭合:稳定性—可塑性兼容的通用学习动力学

提出广义残差闭合框架,将学习视为递归闭合未来相关差异,统一稳定性—可塑性、表示修正与持续学习。

04:00
arXiv cs.LG

学习何处引导:基于生成模型的高效离线多目标优化的噪声空间几何

离线多目标优化中,仅调初始噪声、学少数敏感方向,低成本引导扩散模型,47任务超体积领先。

04:00
ArXiv AI

使用语言模型推断两个事件序列之间的因果关系

大语言模型可仅凭两个事件序列推断因果关系,在合成与真实数据上优于标准因果发现算法。