当平坦性代理不是函数:鲁棒性证书与训练干预
曲率上界有效,并不足以证明鲁棒性证书或内在训练干预合理;代理受softmax平移影响,中心化可修复。
非洲语言的几何表征:区域语义枢纽与文化引导
Gemma 4 31B对非洲语言的几何表征与文化引导:非洲语言间表征较对照更一致,存在区域与语系模式,国家引导有效。
使用复值记忆的强化学习
提出复值酉RNN替代PPO循环结构,在部分可观测任务中显著提升奖励。
STEPS:基于扩散与对比式风格编码的保风格场景文本编辑
提出STEPS扩散模型,借助独立风格编码与多语义条件,高质量替换图像文本并保留原风格,优于现有方法。
概念锚定的注意力:图注入注意力、时序版本化与认知状态的受控评估
时序版本与认知状态显式化可显著提升准确率;图注入注意力增益主要源于容量增加,机制诊断需禁用对照。
十年之后:以智能体训练数据将阴影去除带入真实世界
针对配对数据十年停滞的困境,提出离线智能体工作流,构建含17138个三元组的AgenticShadow数据集,色差降低50.5%,跨域LAB RMSE降低19.7%–37.5%。
EPIC:极线一致的360°沉浸式立体视频生成
提出零样本管线,将视频扩散模型扩展为4K立体360°视频,并以极线感知匹配度量作偏好信号优化,实现沉浸式立体生成。
这个动作还能解释任务吗?面向扩散语言模型智能体的反向打分
掩码解码偏差使扩散语言模型智能体陷入重试循环;免训练的反向打分可抵消该偏差,提升具身任务成功率。
科学搜索智能体何处失败:对目标曝光与检查尝试的决策检查点审计
决策检查点审计揭示科学搜索智能体的目标曝光与检查失败:关键词搜索准确率24.6%,原始搜索17.8%。
僧伽罗语连音拆分的字符级神经网络方法
首次为僧伽罗语连音拆分建立神经基准,字符级模型在复杂连音上仅达68.4%精确匹配。
在智能体强化学习中锁定关键决策以实现信用分配
ProVer定位关键决策片段,以续采样成功率差验证其优势并融入GRPO,在多任务上平均优于GRPO约7%–10%。
《Mnemon:原始记录、快速判断、慢速思考》
Mnemon将记忆分快慢两系统:原始记录留存,LLM慢规划检索、小模型快判断筛选,LoCoMo达92.2%,成本近恒定。
UniEvo-VL:一种多模态模型自我改进的同策略自蒸馏训练方案
UniEvo-VL以自评反馈为特权信息,让同一多模态模型分饰师生做同策略自蒸馏,提升图像生成。
具有语言记忆的视觉-语言-动作自动驾驶智能体
提出AD-Memo,用语言记忆扩展思维链记录关键物体并作为后续输入,经SFT与半闭环强化学习训练,提升驾驶与问答。
HIGS:用于几何与语义联合场景理解的分层隐式网格
提出分层隐式神经场,多分辨率子图统一支持几何与语义,含视觉语言特征,实现高效可扩展重建与开放词汇定位。
ReLaG:将随机划分推广至潜在关联数据的可扩展框架
ReLaG 以层次潜变量建模样本关联,用近邻图与社区检测推断相关样本组,生成独立划分;可扩展性强,适配分子与蛋白质数据,并支持无标签自适应分辨率。
基于多阶段特征对齐的模板-搜索域自适应跨模态目标跟踪
提出模板-搜索域自适应框架,以多阶段特征对齐缩小模态差异,跨模态跟踪性能优于现有方法。
SCOUT:协同推理与工具使用,保障计算机使用安全
SCOUT是两阶段智能体安全验证器,融合任务专属评分标准生成与工具探测取证,显著提升计算机使用安全验证效果。
从代码到控制:合成参数化反应式控制器
LLM合成控制器结构、搜索调参,决策时无需LLM或规划,实时性强,媲美深度强化学习且交互更少。
测试时数学推理中的预算边界效应
轨迹回放显示:上限落在推导中途时,宽松放行可减少弃答并提升准确率,但比较须兼顾实际成本与选择器。
「纠正何时成为修复?」工具使用型LLM内部干预的机制审计
SAKIKO框架经目标端验证审计LLM内部干预,揭示位移不等于修复:净增益干预会破坏过半正确决策。
语言模型是“不安全”的报告者
模型默认报喜:关键负面结果披露率仅1%,加诚实指令后升至95%;诚实与求成功在表征空间方向相反。
ReGain:在合成图像个性化中恢复主体保真度
合成图像个性化因无分类器引导膨胀而损失主体保真度,作者提出免训练采样校正法ReGain,按频段缩放引导。
保持专注:检验长时程智能体可靠性的根基
提出Long-Transduction诊断:7个开源模型在上下文延长、格式变化、复杂度提升下性能分别降62.8%、36.5%、39.9%。
重新审视奖励优化的缩放定律
奖励优化性能约随√min(log M,K)缩放,M为训练比较数,K为KL预算;理论与实证支持。
FastGuide:加速扩散大语言模型的奖励引导
混合并行与自回归解码,复用奖励引导与KV缓存,使扩散语言模型奖励引导提速最高4.4倍且质量相当。
水景的欧拉运动重建
单段非循环二维视频重建可循环四维水景,欧拉运动场驱动高斯泼溅并加残差,实现逼真新视角动画。
新鲜草图在岭回归中的优势
新鲜草图在迭代岭回归中提供可证明优势,通过残差感知采样实现更快收敛。
MM-FinEval:面向真实世界金融预测的多任务多模态基准
提出多任务多模态金融预测基准,含2045场财报电话会议文本、幻灯片、音频及12类任务,验证三模态互补有效。
揭示运动对电影运镜轨迹的价值
提出用方向与速度表示相机轨迹,提升文本对齐与生成,并提出 CineGEN 与 CineScript 数据集。
通过多步嵌入检索在视觉空间中学习路由
提出VHOP基准与VHOP-Router,将嵌入模型训为多步检索器,在视觉隐空间直接检索图像链,检索性能从<5%升至76.3%。
FlexRouter:学习互补模型集以实现灵活的大语言模型路由
FlexRouter显式建模模型互补性,以答案覆盖为目标,用DPP与贪心策略自适应路由,提升覆盖并降低冗余。
不同分词器生育率下跨语言的概念方向可靠性
情感方向可复现性跨语言差异显著,分类准确不代表方向一致,需独立评估;未证明分词粒度是成因。
NeurDuo-EEG:一种具有持久状态与显式记忆的长序列脑电基础模型
提出NeurDuo-EEG,具通道级持久记忆,预训练3955小时,五项基准四项最优,支持流式推理。
通过流匹配迈向通用 Wasserstein 重心
提出BaryFM,用流匹配逼近Wasserstein单纯形上全体重心,ODE采样,域适应基准领先。
PathAnchor:面向科学智能体的路径结构化证据
PathAnchor以路径结构化证据工作区组织科学检索,保留角色与方向,在固定预算下显著提升来源召回与引用完整性。
校准到谁?JEV 文化价值观中的人格与语言效应
审计JEV文化价值观:无角色时偏美国,设沙特角色则部分复现人类差异(英语87%>阿拉伯语62%),各设计一致。
事件驱动刷新与复现记忆:减少指代视频目标分割中的陈旧定位
提出EDRRM,仅在稳定变化点刷新模型并用循环记忆召回锚帧,减少陈旧定位与误报,提升精度效率权衡。
OpenJev-RLCD:一个可用的RLCD实现
提出RLCD两阶段方案:先校准再强化,推理任务上准确率与选择性预测优于SFT、RFT与GRPO。
JARQ:面向量化的联合交替精修
JARQ为插件式量化精修:交替联合拟合组缩放与Babai码提议,免反向传播、不增开销,广泛降困惑度。
SCALE:基于嵌入空间一致性标注的合成校准
病理模型在低一致性病例上校准更差;提出嵌入插值合成一致性校准,无需多标注者即可改善校准且不损区分。
面向 GUI 智能体的动作条件双模拟记忆
以动作条件双模拟定义记忆合并:仅当共享动作导致一致结果才合并,免训练,MiniWoB++ 成功率提升。
学习赋能的估计:样本选择偏差下的紧致刻画
提出样本选择偏差下回归可识别性的紧致刻画,突破先估选择再纠偏范式,并给出有限样本保证与高效算法。
迷失在翻译中:衡量非母语英语对大型语言模型终端用户表现的影响
非母语英语使LLM回答质量更低;模型不复制拼写错误,但会模仿提示的修辞与词汇水平。
Matisse:面向主动三维重建的证据空间推理
Matisse 为免训练框架,用生成式三维模型的证据不确定性统一主动重建与关键帧选取,提升精度与速度。
绝不走捷径:面向视频生成中途流式提示切换的状态锚定过渡
SEGUE用免训练规划器生成过渡提示,配合SPANDMD训练,使中途提示切换的状态过渡更真实。
在学生状态下向教师续写学习
OLIVE:学生生成前缀、教师续写,用其token交叉熵更新学生,优于OPD且省23.8%时间。
当推理误入歧途:失控推理的注意力动态
大型推理模型扩展推理易退化为冗余验证与循环;RADAR实时识别状态,注意力重对齐可减循环并保性能。
积极评分,隐忧暗藏:AI中介组织倾听中的员工声音披露
AI访谈中员工常先给好评、后吐实质顾虑,以缓和、推责等策略自我保护,形成"有界披露"——沉默藏于表达之中。
CineSubBench:基于多语言电影字幕评估大语言模型的长篇叙事与文化理解能力
基于六语电影字幕的长上下文基准,评测大模型在叙事重构、类型预测、各国分级与文化安全等七项任务上的表现。