59657 条条目 · 106 个活跃源
2026年10月1日
04:00
arXiv cs.LG

通过流匹配迈向通用 Wasserstein 重心

提出BaryFM,用流匹配逼近Wasserstein单纯形上全体重心,ODE采样,域适应基准领先。

04:00
arXiv cs.AI

PathAnchor:面向科学智能体的路径结构化证据

PathAnchor以路径结构化证据工作区组织科学检索,保留角色与方向,在固定预算下显著提升来源召回与引用完整性。

04:00
arXiv cs.CL

校准到谁?JEV 文化价值观中的人格与语言效应

审计JEV文化价值观:无角色时偏美国,设沙特角色则部分复现人类差异(英语87%>阿拉伯语62%),各设计一致。

04:00
arXiv cs.CV

事件驱动刷新与复现记忆:减少指代视频目标分割中的陈旧定位

提出EDRRM,仅在稳定变化点刷新模型并用循环记忆召回锚帧,减少陈旧定位与误报,提升精度效率权衡。

04:00
ArXiv AI

OpenJev-RLCD:一个可用的RLCD实现

提出RLCD两阶段方案:先校准再强化,推理任务上准确率与选择性预测优于SFT、RFT与GRPO。

04:00
arXiv cs.LG

JARQ:面向量化的联合交替精修

JARQ为插件式量化精修:交替联合拟合组缩放与Babai码提议,免反向传播、不增开销,广泛降困惑度。

04:00
arXiv cs.CV

SCALE:基于嵌入空间一致性标注的合成校准

病理模型在低一致性病例上校准更差;提出嵌入插值合成一致性校准,无需多标注者即可改善校准且不损区分。

04:00
arXiv cs.AI

面向 GUI 智能体的动作条件双模拟记忆

以动作条件双模拟定义记忆合并:仅当共享动作导致一致结果才合并,免训练,MiniWoB++ 成功率提升。

04:00
arXiv cs.LG

学习赋能的估计:样本选择偏差下的紧致刻画

提出样本选择偏差下回归可识别性的紧致刻画,突破先估选择再纠偏范式,并给出有限样本保证与高效算法。

04:00
arXiv cs.CL

迷失在翻译中:衡量非母语英语对大型语言模型终端用户表现的影响

非母语英语使LLM回答质量更低;模型不复制拼写错误,但会模仿提示的修辞与词汇水平。

04:00
arXiv cs.CV

Matisse:面向主动三维重建的证据空间推理

Matisse 为免训练框架,用生成式三维模型的证据不确定性统一主动重建与关键帧选取,提升精度与速度。

04:00
arXiv cs.CV

绝不走捷径:面向视频生成中途流式提示切换的状态锚定过渡

SEGUE用免训练规划器生成过渡提示,配合SPANDMD训练,使中途提示切换的状态过渡更真实。

04:00
arXiv cs.CL

在学生状态下向教师续写学习

OLIVE:学生生成前缀、教师续写,用其token交叉熵更新学生,优于OPD且省23.8%时间。

04:00
arXiv cs.AI

当推理误入歧途:失控推理的注意力动态

大型推理模型扩展推理易退化为冗余验证与循环;RADAR实时识别状态,注意力重对齐可减循环并保性能。

04:00
arXiv cs.AI

积极评分,隐忧暗藏:AI中介组织倾听中的员工声音披露

AI访谈中员工常先给好评、后吐实质顾虑,以缓和、推责等策略自我保护,形成"有界披露"——沉默藏于表达之中。

04:00
arXiv cs.CL

CineSubBench:基于多语言电影字幕评估大语言模型的长篇叙事与文化理解能力

基于六语电影字幕的长上下文基准,评测大模型在叙事重构、类型预测、各国分级与文化安全等七项任务上的表现。

04:00
arXiv cs.AI

AI语音代理中的人格设定与说服性框架:一项针对儿童的2×2实地实验

德国圣诞热线实地实验:说服性框架使儿童亲社会愿望比例从11.6%升至45.7%,人格权威几乎无效,说话方式比自称身份更关键。

04:00
ArXiv AI

GraphCert:以认证证据评分标准自举智能体式图推理

GraphCert以认证证据标准自举图智能体,免昂贵标注,在五类图推理任务超越更大模型并跨域迁移。

04:00
arXiv cs.LG

基于恰当评分规则的扩散模型用于概率天气预报

引入辅助条件去噪任务,结合扩散模型与恰当评分规则,提升概率天气预报,尤其长预报期与全球尺度。

04:00
arXiv cs.CV

软空间推理

提出软空间推理框架,混合词元嵌入成软状态,并由AdaptSoft自适应调节软化程度,缓解过早离散化。

04:00
arXiv cs.CL

规范顺序问题:当大型语言模型作为多值关系知识库时为何不可靠

大模型按字母或时间等规范顺序组织多值关系,提示若违背此内部排序,生成完整实体集合的可靠性显著下降。

04:00
arXiv cs.LG

含潜在混杂因子的循环线性高斯模型的可微结构学习

针对含循环与潜在混杂的线性高斯模型,提出可微结构学习,用伯努利门控优化带复杂度惩罚似然,并证明一致性。

04:00
arXiv cs.CV

SpatialCORE:大型视觉语言模型中置信度感知的定位式空间推理

SpatialCORE将模型对生成定位的置信度转化为空间推理奖励,配合答案门控,在多项基准上达开源最优。

04:00
arXiv cs.LG

大语言模型推理中束搜索的可证明测试时扩展

理论证明束搜索测试时扩展优势,CF-Beam将覆盖依赖由二次降至近线性,优于Best-of-N。

04:00
arXiv cs.CV

于此聆听立体声世界:学习动态空间对应以实现沉浸式音视频联合生成

提出StereoBind,以运动轨迹绑定视觉运动与立体声生成,实现动态空间对应,并构建数据集与基准,显著提升立体声空间一致性。

04:00
arXiv cs.CL

HeurEvo:面向时间关键型数学优化的混合求解器增强启发式智能体进化

HeurEvo协同进化规划、代码与组件,在严格时限内融合启发式与求解器,于组合优化和MIPLIB上匹配或超越先进方法。

04:00
arXiv cs.CL

群体保真度:评估大语言模型中的群体代表性

提出群体保真度框架,从群体准确度、组间差异量及结构三维度评估LLM群体代表性,并检验机器偏见与文化微调成效。

04:00
arXiv cs.CV

面向参考引导伪装目标检测的共识感知多源融合

提出共识感知多源融合框架,利用参考条件双骨干融合与跨参考共识聚合,提升参考引导伪装目标检测效果。

04:00
ArXiv AI

谁的声音能在摘要中留存?LLM 员工倾听的声音留存审计

提出声音留存比指标审计LLM摘要偏差:按流行度过滤,仅现一次的关切流失86%,短文本与德语内容亦遭删。

04:00
arXiv cs.CL

认知专家语言模型更好地与相应脑系统对齐

提示与微调构建六类认知专家大模型,其与对应脑系统对齐更强,且总体预测精度基本不变。

04:00
arXiv cs.CV

困难区域监督:荣登 Waymo 开放数据集 2D 视频全景分割排行榜榜首

提出困难区域监督改进DVIS++,结合测试时集成与跨相机链接,在Waymo视频全景分割挑战赛三项指标第一。

04:00
arXiv cs.LG

几何-物理混杂削弱跨不同域的PDE学习

几何变化与物理性质混杂削弱跨域PDE学习;显式几何-算子去混杂可提升数据效率并准确恢复方程。

04:00
arXiv cs.CL

训练大语言模型表达评估意识

VT:用强化学习训练大模型更愿表达评估意识,表达量增2.4-2.9倍,潜在意识与行为大致不变。

04:00
arXiv cs.LG

通过针对探针训练实现对齐且不损失可监控性

持续更新探针引导微调,可提升无害与诚实,保持效用和可监控性,优于DPO及推理干预。

04:00
arXiv cs.AI

更多选择,更少决策:类JEV直接决策模型中的有序尺度偏差

直接决策模型存在序数尺度利用偏差,候选空间压缩,仅用约七成有效支持,BA-LoRA后训练可缓解。

04:00
arXiv cs.CV

基于学习排序与验证的智能体式相对相机位姿估计

提出PoseAgent智能体框架,用学习排序与验证调度估计器,相对相机位姿估计AUC@5最高提升4.2%。

04:00
arXiv cs.AI

多路径LLM推理中的分集合并

多路径LLM推理可建模为分集合并;路径相关性限制投票增益,提示模板多样性降相关,自适应K近MV@32精度。

04:00
arXiv cs.LG

直接偏好优化的不确定性归一化间隔

提出不确定性归一化边距DPO,结合偏好强度、提示尺度与长度归一化,实验优于DPO/SimPO。

04:00
arXiv cs.CL

DeepRewind:预测与修复深度研究智能体中的过早承诺

提出DeepRewind:以类型图追踪认知状态,预测并阻止高风险过早承诺,失效时回滚;过早承诺减少59.1%。

04:00
arXiv cs.LG

可解释但脆弱?几何-语义扰动下概念瓶颈的鲁棒性

概念瓶颈不天然提升鲁棒性,而是按几何/语义扰动转移敏感性,存在可解释性-鲁棒性权衡。

04:00
arXiv cs.LG

理解离策略与在策略蒸馏:不同训练目标的故事

多教师蒸馏中,前向KL产生算术混合,反向KL产生几何聚合;在策略蒸馏保留专家偏好,却对错误前缀敏感。

04:00
arXiv cs.LG

ChartDensity-Bench:视觉密度下多模态大模型数值数据重建基准测试

提出ChartDensity-Bench基准,评估多模态大模型在视觉密度下重建图表数值数据的能力,发现密度越高重建误差越大。

04:00
arXiv cs.CL

掩码扩散语言模型中的可靠并行解码

提出免训练方法RPD,按逐层预测稳定性与置信度筛选候选,并以累积熵预算提交,提升并行解码吞吐且保持准确率。

04:00
arXiv cs.AI

学习遗忘什么:面向大语言模型表示空间的分布性遗忘

提出非参数分布性遗忘框架Mamushi,用概率分类器排序遗忘样本,改善删除与保留权衡,减少遗忘样本需求。

04:00
arXiv cs.CL

DraftTrace:面向AI融合写作的多视角分析环境

DraftTrace同步捕捉写作成品、过程与AI交互,提供多视角分析,可区分真实写作与复制粘贴。

04:00
arXiv cs.LG

dattri-LLM:面向LLM规模的统一高效训练数据归因库

高效LLM规模训练数据归因库,以紧凑梯度表示与动态路由提速3.2倍,兼容分布式训练,可扩展至110B模型。

04:00
arXiv cs.AI

当上下文变化时:理解大语言模型中的更新失败

提出CICM基准研究LLM的过期绑定失败,发现注意力漂移致旧值胜出,无需训练调整注意力可纠正多数错误

04:00
arXiv cs.CV

蒸馏视觉证据,而非仅答案:面向视觉语言模型的跨世界同策略蒸馏

提出CW-OPD,构造关键证据不同的双视觉世界,蒸馏教师信念转变,显式监督学生对视觉证据的依赖。

04:00
ArXiv AI

Talk2Agent:面向文本智能体的语音接口基准评测

Talk2Agent:免执行评测语音接口,保留任务信息,关联完成度并优于WER/CER。

04:00
arXiv cs.AI

在测试时使用可复用原语组合任务特定的智能体执行框架

提出可复用原语与STITCH框架,测试时按任务选取组合,成功率最高提升12点,开销仅2.7%。