通过流匹配迈向通用 Wasserstein 重心
提出BaryFM,用流匹配逼近Wasserstein单纯形上全体重心,ODE采样,域适应基准领先。
PathAnchor:面向科学智能体的路径结构化证据
PathAnchor以路径结构化证据工作区组织科学检索,保留角色与方向,在固定预算下显著提升来源召回与引用完整性。
校准到谁?JEV 文化价值观中的人格与语言效应
审计JEV文化价值观:无角色时偏美国,设沙特角色则部分复现人类差异(英语87%>阿拉伯语62%),各设计一致。
事件驱动刷新与复现记忆:减少指代视频目标分割中的陈旧定位
提出EDRRM,仅在稳定变化点刷新模型并用循环记忆召回锚帧,减少陈旧定位与误报,提升精度效率权衡。
OpenJev-RLCD:一个可用的RLCD实现
提出RLCD两阶段方案:先校准再强化,推理任务上准确率与选择性预测优于SFT、RFT与GRPO。
JARQ:面向量化的联合交替精修
JARQ为插件式量化精修:交替联合拟合组缩放与Babai码提议,免反向传播、不增开销,广泛降困惑度。
SCALE:基于嵌入空间一致性标注的合成校准
病理模型在低一致性病例上校准更差;提出嵌入插值合成一致性校准,无需多标注者即可改善校准且不损区分。
面向 GUI 智能体的动作条件双模拟记忆
以动作条件双模拟定义记忆合并:仅当共享动作导致一致结果才合并,免训练,MiniWoB++ 成功率提升。
学习赋能的估计:样本选择偏差下的紧致刻画
提出样本选择偏差下回归可识别性的紧致刻画,突破先估选择再纠偏范式,并给出有限样本保证与高效算法。
迷失在翻译中:衡量非母语英语对大型语言模型终端用户表现的影响
非母语英语使LLM回答质量更低;模型不复制拼写错误,但会模仿提示的修辞与词汇水平。
Matisse:面向主动三维重建的证据空间推理
Matisse 为免训练框架,用生成式三维模型的证据不确定性统一主动重建与关键帧选取,提升精度与速度。
绝不走捷径:面向视频生成中途流式提示切换的状态锚定过渡
SEGUE用免训练规划器生成过渡提示,配合SPANDMD训练,使中途提示切换的状态过渡更真实。
在学生状态下向教师续写学习
OLIVE:学生生成前缀、教师续写,用其token交叉熵更新学生,优于OPD且省23.8%时间。
当推理误入歧途:失控推理的注意力动态
大型推理模型扩展推理易退化为冗余验证与循环;RADAR实时识别状态,注意力重对齐可减循环并保性能。
积极评分,隐忧暗藏:AI中介组织倾听中的员工声音披露
AI访谈中员工常先给好评、后吐实质顾虑,以缓和、推责等策略自我保护,形成"有界披露"——沉默藏于表达之中。
CineSubBench:基于多语言电影字幕评估大语言模型的长篇叙事与文化理解能力
基于六语电影字幕的长上下文基准,评测大模型在叙事重构、类型预测、各国分级与文化安全等七项任务上的表现。
AI语音代理中的人格设定与说服性框架:一项针对儿童的2×2实地实验
德国圣诞热线实地实验:说服性框架使儿童亲社会愿望比例从11.6%升至45.7%,人格权威几乎无效,说话方式比自称身份更关键。
GraphCert:以认证证据评分标准自举智能体式图推理
GraphCert以认证证据标准自举图智能体,免昂贵标注,在五类图推理任务超越更大模型并跨域迁移。
基于恰当评分规则的扩散模型用于概率天气预报
引入辅助条件去噪任务,结合扩散模型与恰当评分规则,提升概率天气预报,尤其长预报期与全球尺度。
软空间推理
提出软空间推理框架,混合词元嵌入成软状态,并由AdaptSoft自适应调节软化程度,缓解过早离散化。
规范顺序问题:当大型语言模型作为多值关系知识库时为何不可靠
大模型按字母或时间等规范顺序组织多值关系,提示若违背此内部排序,生成完整实体集合的可靠性显著下降。
含潜在混杂因子的循环线性高斯模型的可微结构学习
针对含循环与潜在混杂的线性高斯模型,提出可微结构学习,用伯努利门控优化带复杂度惩罚似然,并证明一致性。
SpatialCORE:大型视觉语言模型中置信度感知的定位式空间推理
SpatialCORE将模型对生成定位的置信度转化为空间推理奖励,配合答案门控,在多项基准上达开源最优。
大语言模型推理中束搜索的可证明测试时扩展
理论证明束搜索测试时扩展优势,CF-Beam将覆盖依赖由二次降至近线性,优于Best-of-N。
于此聆听立体声世界:学习动态空间对应以实现沉浸式音视频联合生成
提出StereoBind,以运动轨迹绑定视觉运动与立体声生成,实现动态空间对应,并构建数据集与基准,显著提升立体声空间一致性。
HeurEvo:面向时间关键型数学优化的混合求解器增强启发式智能体进化
HeurEvo协同进化规划、代码与组件,在严格时限内融合启发式与求解器,于组合优化和MIPLIB上匹配或超越先进方法。
群体保真度:评估大语言模型中的群体代表性
提出群体保真度框架,从群体准确度、组间差异量及结构三维度评估LLM群体代表性,并检验机器偏见与文化微调成效。
面向参考引导伪装目标检测的共识感知多源融合
提出共识感知多源融合框架,利用参考条件双骨干融合与跨参考共识聚合,提升参考引导伪装目标检测效果。
谁的声音能在摘要中留存?LLM 员工倾听的声音留存审计
提出声音留存比指标审计LLM摘要偏差:按流行度过滤,仅现一次的关切流失86%,短文本与德语内容亦遭删。
认知专家语言模型更好地与相应脑系统对齐
提示与微调构建六类认知专家大模型,其与对应脑系统对齐更强,且总体预测精度基本不变。
困难区域监督:荣登 Waymo 开放数据集 2D 视频全景分割排行榜榜首
提出困难区域监督改进DVIS++,结合测试时集成与跨相机链接,在Waymo视频全景分割挑战赛三项指标第一。
几何-物理混杂削弱跨不同域的PDE学习
几何变化与物理性质混杂削弱跨域PDE学习;显式几何-算子去混杂可提升数据效率并准确恢复方程。
训练大语言模型表达评估意识
VT:用强化学习训练大模型更愿表达评估意识,表达量增2.4-2.9倍,潜在意识与行为大致不变。
通过针对探针训练实现对齐且不损失可监控性
持续更新探针引导微调,可提升无害与诚实,保持效用和可监控性,优于DPO及推理干预。
更多选择,更少决策:类JEV直接决策模型中的有序尺度偏差
直接决策模型存在序数尺度利用偏差,候选空间压缩,仅用约七成有效支持,BA-LoRA后训练可缓解。
基于学习排序与验证的智能体式相对相机位姿估计
提出PoseAgent智能体框架,用学习排序与验证调度估计器,相对相机位姿估计AUC@5最高提升4.2%。
多路径LLM推理中的分集合并
多路径LLM推理可建模为分集合并;路径相关性限制投票增益,提示模板多样性降相关,自适应K近MV@32精度。
直接偏好优化的不确定性归一化间隔
提出不确定性归一化边距DPO,结合偏好强度、提示尺度与长度归一化,实验优于DPO/SimPO。
DeepRewind:预测与修复深度研究智能体中的过早承诺
提出DeepRewind:以类型图追踪认知状态,预测并阻止高风险过早承诺,失效时回滚;过早承诺减少59.1%。
可解释但脆弱?几何-语义扰动下概念瓶颈的鲁棒性
概念瓶颈不天然提升鲁棒性,而是按几何/语义扰动转移敏感性,存在可解释性-鲁棒性权衡。
理解离策略与在策略蒸馏:不同训练目标的故事
多教师蒸馏中,前向KL产生算术混合,反向KL产生几何聚合;在策略蒸馏保留专家偏好,却对错误前缀敏感。
ChartDensity-Bench:视觉密度下多模态大模型数值数据重建基准测试
提出ChartDensity-Bench基准,评估多模态大模型在视觉密度下重建图表数值数据的能力,发现密度越高重建误差越大。
掩码扩散语言模型中的可靠并行解码
提出免训练方法RPD,按逐层预测稳定性与置信度筛选候选,并以累积熵预算提交,提升并行解码吞吐且保持准确率。
学习遗忘什么:面向大语言模型表示空间的分布性遗忘
提出非参数分布性遗忘框架Mamushi,用概率分类器排序遗忘样本,改善删除与保留权衡,减少遗忘样本需求。
DraftTrace:面向AI融合写作的多视角分析环境
DraftTrace同步捕捉写作成品、过程与AI交互,提供多视角分析,可区分真实写作与复制粘贴。
dattri-LLM:面向LLM规模的统一高效训练数据归因库
高效LLM规模训练数据归因库,以紧凑梯度表示与动态路由提速3.2倍,兼容分布式训练,可扩展至110B模型。
当上下文变化时:理解大语言模型中的更新失败
提出CICM基准研究LLM的过期绑定失败,发现注意力漂移致旧值胜出,无需训练调整注意力可纠正多数错误
蒸馏视觉证据,而非仅答案:面向视觉语言模型的跨世界同策略蒸馏
提出CW-OPD,构造关键证据不同的双视觉世界,蒸馏教师信念转变,显式监督学生对视觉证据的依赖。
Talk2Agent:面向文本智能体的语音接口基准评测
Talk2Agent:免执行评测语音接口,保留任务信息,关联完成度并优于WER/CER。
在测试时使用可复用原语组合任务特定的智能体执行框架
提出可复用原语与STITCH框架,测试时按任务选取组合,成功率最高提升12点,开销仅2.7%。