60678 条条目 · 106 个活跃源
2026年10月1日
04:00
arXiv cs.CV

具有语言记忆的视觉-语言-动作自动驾驶智能体

提出AD-Memo,用语言记忆扩展思维链记录关键物体并作为后续输入,经SFT与半闭环强化学习训练,提升驾驶与问答。

04:00
arXiv cs.CV

HIGS:用于几何与语义联合场景理解的分层隐式网格

提出分层隐式神经场,多分辨率子图统一支持几何与语义,含视觉语言特征,实现高效可扩展重建与开放词汇定位。

04:00
arXiv cs.LG

ReLaG:将随机划分推广至潜在关联数据的可扩展框架

ReLaG 以层次潜变量建模样本关联,用近邻图与社区检测推断相关样本组,生成独立划分;可扩展性强,适配分子与蛋白质数据,并支持无标签自适应分辨率。

04:00
arXiv cs.CV

基于多阶段特征对齐的模板-搜索域自适应跨模态目标跟踪

提出模板-搜索域自适应框架,以多阶段特征对齐缩小模态差异,跨模态跟踪性能优于现有方法。

04:00
arXiv cs.CL

SCOUT:协同推理与工具使用,保障计算机使用安全

SCOUT是两阶段智能体安全验证器,融合任务专属评分标准生成与工具探测取证,显著提升计算机使用安全验证效果。

04:00
arXiv cs.AI

从代码到控制:合成参数化反应式控制器

LLM合成控制器结构、搜索调参,决策时无需LLM或规划,实时性强,媲美深度强化学习且交互更少。

04:00
arXiv cs.AI

测试时数学推理中的预算边界效应

轨迹回放显示:上限落在推导中途时,宽松放行可减少弃答并提升准确率,但比较须兼顾实际成本与选择器。

04:00
arXiv cs.CL

「纠正何时成为修复?」工具使用型LLM内部干预的机制审计

SAKIKO框架经目标端验证审计LLM内部干预,揭示位移不等于修复:净增益干预会破坏过半正确决策。

04:00
arXiv cs.CL

语言模型是“不安全”的报告者

模型默认报喜:关键负面结果披露率仅1%,加诚实指令后升至95%;诚实与求成功在表征空间方向相反。

04:00
arXiv cs.CV

ReGain:在合成图像个性化中恢复主体保真度

合成图像个性化因无分类器引导膨胀而损失主体保真度,作者提出免训练采样校正法ReGain,按频段缩放引导。

04:00
arXiv cs.AI

保持专注:检验长时程智能体可靠性的根基

提出Long-Transduction诊断:7个开源模型在上下文延长、格式变化、复杂度提升下性能分别降62.8%、36.5%、39.9%。

04:00
arXiv cs.LG

重新审视奖励优化的缩放定律

奖励优化性能约随√min(log M,K)缩放,M为训练比较数,K为KL预算;理论与实证支持。

04:00
arXiv cs.CL

FastGuide:加速扩散大语言模型的奖励引导

混合并行与自回归解码,复用奖励引导与KV缓存,使扩散语言模型奖励引导提速最高4.4倍且质量相当。

04:00
arXiv cs.CV

水景的欧拉运动重建

单段非循环二维视频重建可循环四维水景,欧拉运动场驱动高斯泼溅并加残差,实现逼真新视角动画。

04:00
arXiv cs.LG

新鲜草图在岭回归中的优势

新鲜草图在迭代岭回归中提供可证明优势,通过残差感知采样实现更快收敛。

04:00
arXiv cs.LG

MM-FinEval:面向真实世界金融预测的多任务多模态基准

提出多任务多模态金融预测基准,含2045场财报电话会议文本、幻灯片、音频及12类任务,验证三模态互补有效。

04:00
arXiv cs.CV

揭示运动对电影运镜轨迹的价值

提出用方向与速度表示相机轨迹,提升文本对齐与生成,并提出 CineGEN 与 CineScript 数据集。

04:00
arXiv cs.AI

通过多步嵌入检索在视觉空间中学习路由

提出VHOP基准与VHOP-Router,将嵌入模型训为多步检索器,在视觉隐空间直接检索图像链,检索性能从<5%升至76.3%。

04:00
arXiv cs.LG

FlexRouter:学习互补模型集以实现灵活的大语言模型路由

FlexRouter显式建模模型互补性,以答案覆盖为目标,用DPP与贪心策略自适应路由,提升覆盖并降低冗余。

04:00
arXiv cs.CL

不同分词器生育率下跨语言的概念方向可靠性

情感方向可复现性跨语言差异显著,分类准确不代表方向一致,需独立评估;未证明分词粒度是成因。

04:00
arXiv cs.LG

NeurDuo-EEG:一种具有持久状态与显式记忆的长序列脑电基础模型

提出NeurDuo-EEG,具通道级持久记忆,预训练3955小时,五项基准四项最优,支持流式推理。

04:00
arXiv cs.LG

通过流匹配迈向通用 Wasserstein 重心

提出BaryFM,用流匹配逼近Wasserstein单纯形上全体重心,ODE采样,域适应基准领先。

04:00
arXiv cs.AI

PathAnchor:面向科学智能体的路径结构化证据

PathAnchor以路径结构化证据工作区组织科学检索,保留角色与方向,在固定预算下显著提升来源召回与引用完整性。

04:00
arXiv cs.CL

校准到谁?JEV 文化价值观中的人格与语言效应

审计JEV文化价值观:无角色时偏美国,设沙特角色则部分复现人类差异(英语87%>阿拉伯语62%),各设计一致。

04:00
arXiv cs.CV

事件驱动刷新与复现记忆:减少指代视频目标分割中的陈旧定位

提出EDRRM,仅在稳定变化点刷新模型并用循环记忆召回锚帧,减少陈旧定位与误报,提升精度效率权衡。

04:00
ArXiv AI

OpenJev-RLCD:一个可用的RLCD实现

提出RLCD两阶段方案:先校准再强化,推理任务上准确率与选择性预测优于SFT、RFT与GRPO。

04:00
arXiv cs.LG

JARQ:面向量化的联合交替精修

JARQ为插件式量化精修:交替联合拟合组缩放与Babai码提议,免反向传播、不增开销,广泛降困惑度。

04:00
arXiv cs.CV

SCALE:基于嵌入空间一致性标注的合成校准

病理模型在低一致性病例上校准更差;提出嵌入插值合成一致性校准,无需多标注者即可改善校准且不损区分。

04:00
arXiv cs.AI

面向 GUI 智能体的动作条件双模拟记忆

以动作条件双模拟定义记忆合并:仅当共享动作导致一致结果才合并,免训练,MiniWoB++ 成功率提升。

04:00
arXiv cs.LG

学习赋能的估计:样本选择偏差下的紧致刻画

提出样本选择偏差下回归可识别性的紧致刻画,突破先估选择再纠偏范式,并给出有限样本保证与高效算法。

04:00
arXiv cs.CL

迷失在翻译中:衡量非母语英语对大型语言模型终端用户表现的影响

非母语英语使LLM回答质量更低;模型不复制拼写错误,但会模仿提示的修辞与词汇水平。

04:00
arXiv cs.CV

Matisse:面向主动三维重建的证据空间推理

Matisse 为免训练框架,用生成式三维模型的证据不确定性统一主动重建与关键帧选取,提升精度与速度。

04:00
arXiv cs.CV

绝不走捷径:面向视频生成中途流式提示切换的状态锚定过渡

SEGUE用免训练规划器生成过渡提示,配合SPANDMD训练,使中途提示切换的状态过渡更真实。

04:00
arXiv cs.CL

在学生状态下向教师续写学习

OLIVE:学生生成前缀、教师续写,用其token交叉熵更新学生,优于OPD且省23.8%时间。

04:00
arXiv cs.AI

当推理误入歧途:失控推理的注意力动态

大型推理模型扩展推理易退化为冗余验证与循环;RADAR实时识别状态,注意力重对齐可减循环并保性能。

04:00
arXiv cs.AI

积极评分,隐忧暗藏:AI中介组织倾听中的员工声音披露

AI访谈中员工常先给好评、后吐实质顾虑,以缓和、推责等策略自我保护,形成"有界披露"——沉默藏于表达之中。

04:00
arXiv cs.CL

CineSubBench:基于多语言电影字幕评估大语言模型的长篇叙事与文化理解能力

基于六语电影字幕的长上下文基准,评测大模型在叙事重构、类型预测、各国分级与文化安全等七项任务上的表现。

04:00
arXiv cs.AI

AI语音代理中的人格设定与说服性框架:一项针对儿童的2×2实地实验

德国圣诞热线实地实验:说服性框架使儿童亲社会愿望比例从11.6%升至45.7%,人格权威几乎无效,说话方式比自称身份更关键。

04:00
ArXiv AI

GraphCert:以认证证据评分标准自举智能体式图推理

GraphCert以认证证据标准自举图智能体,免昂贵标注,在五类图推理任务超越更大模型并跨域迁移。

04:00
arXiv cs.LG

基于恰当评分规则的扩散模型用于概率天气预报

引入辅助条件去噪任务,结合扩散模型与恰当评分规则,提升概率天气预报,尤其长预报期与全球尺度。

04:00
arXiv cs.CV

软空间推理

提出软空间推理框架,混合词元嵌入成软状态,并由AdaptSoft自适应调节软化程度,缓解过早离散化。

04:00
arXiv cs.CL

规范顺序问题:当大型语言模型作为多值关系知识库时为何不可靠

大模型按字母或时间等规范顺序组织多值关系,提示若违背此内部排序,生成完整实体集合的可靠性显著下降。

04:00
arXiv cs.LG

含潜在混杂因子的循环线性高斯模型的可微结构学习

针对含循环与潜在混杂的线性高斯模型,提出可微结构学习,用伯努利门控优化带复杂度惩罚似然,并证明一致性。

04:00
arXiv cs.CV

SpatialCORE:大型视觉语言模型中置信度感知的定位式空间推理

SpatialCORE将模型对生成定位的置信度转化为空间推理奖励,配合答案门控,在多项基准上达开源最优。

04:00
arXiv cs.LG

大语言模型推理中束搜索的可证明测试时扩展

理论证明束搜索测试时扩展优势,CF-Beam将覆盖依赖由二次降至近线性,优于Best-of-N。

04:00
arXiv cs.CV

于此聆听立体声世界:学习动态空间对应以实现沉浸式音视频联合生成

提出StereoBind,以运动轨迹绑定视觉运动与立体声生成,实现动态空间对应,并构建数据集与基准,显著提升立体声空间一致性。

04:00
arXiv cs.CL

HeurEvo:面向时间关键型数学优化的混合求解器增强启发式智能体进化

HeurEvo协同进化规划、代码与组件,在严格时限内融合启发式与求解器,于组合优化和MIPLIB上匹配或超越先进方法。

04:00
arXiv cs.CL

群体保真度:评估大语言模型中的群体代表性

提出群体保真度框架,从群体准确度、组间差异量及结构三维度评估LLM群体代表性,并检验机器偏见与文化微调成效。

04:00
arXiv cs.CV

面向参考引导伪装目标检测的共识感知多源融合

提出共识感知多源融合框架,利用参考条件双骨干融合与跨参考共识聚合,提升参考引导伪装目标检测效果。

04:00
ArXiv AI

谁的声音能在摘要中留存?LLM 员工倾听的声音留存审计

提出声音留存比指标审计LLM摘要偏差:按流行度过滤,仅现一次的关切流失86%,短文本与德语内容亦遭删。