AVERT-VLN:面向视觉语言导航的弃权感知视觉错误恢复与训练
提出AVERT-VLN:可插拔视觉语言监控器在线检测偏差并请求人工纠正,离线偏好学习提升导航成功率。
迈向可信赖的胶质瘤诊断AI:不确定性量化的任务感知评估
评估胶质瘤MRI多任务诊断的不确定性量化:校准依赖丢弃率,不确定性助错误检测,无方法一致占优。
重新思考多图像理解中的多图像再表征
提出视觉框架Mosaic,揭示多图像再表征收益依任务而异,智能体仅凭准确率奖励即学会自主组合操作。
切换线性注意力
SwiLA将线性注意力的状态更新建模为混合线性回归的在线EM,各输出维度动态选择组件,以定长递归状态逼近甚至超越softmax注意力。
已部署验证器套件中的硬门禁候选资格
部署验证器仅2/13通过校正;跳过检查记通过致检出上限约84%;评估须区分未运行/通过并附拒收证据。
Larry 让车停下,模型却毫无察觉:Transformer 对 M-启发式的盲视
研究表明,DeBERTa 等模型默认不运用 M-启发式,无法区分使役句式,仅在显式提示下可用。
谁让档案变暖了?大语言模型高估历史温暖程度
六个大模型从德国五百年文献提取温度指数时均出现随年代增强的暖偏误,相关性高不足以证明其可靠。
ArchitectureIQ:论训练直觉的度量
提出基准测量模型与人类的训练直觉,发现其良好但不完美、属经验性、可压缩,且对数据特性不敏感。
CAST:面向扩散模型的因果优势结构化训练与空间锚定组合奖励
CAST按模型去噪轨迹定SDE窗口,以因果场景图分解原子奖励并映射至像素空间加权,提升扩散模型组合生成能力。
HO-FL:面向异构边缘设备的混合阶联邦学习
提出HO-FL混合阶联邦学习,底层用零阶、顶层用一阶优化,按内存划分边界,并优化采样以应对数据异构。
ChronoGraph:面向交互理解与具身规划的视觉语言模型功能化4D场景图
提出功能化4D场景图ChronoGraph,统一表示观察与预期状态变化,训练视觉语言模型实现交互理解与可落地规划。
罗生门式维基百科:分歧历史叙事的数据视角主义分析
分析五语维基中罗马尼亚争议事件叙事分歧,发现引用隔离与地缘政治波动,提出Peace-Maker和解流程。
OverForge:通过策略与战术推理助力协作式终身适应
免训练分层架构OverForge分离持久策略与战术执行,提升协作智能体的长期适应与配合。
A 帮助 B,而 B 损害 A:指令微调混合中的有向迁移
任务迁移非对称:A助B而B损A。迁移图预测未见混合,跨规模选任务,推理准确率最高提升14个百分点。
PCB-MC:印刷电路板缺失元件分析
发布PCB-MC数据集,用于PCB缺失元件检测,含197种板型;基准显示现有方法在新板型上仍难奏效。
DensePed-Lite:面向遮挡下密集行人的质量感知自适应检测
提出DensePed-Lite,以质量感知自适应为原则,通过三项协同机制,在低复杂度下实现遮挡密集行人检测的精度效率更优平衡。
用于铁路车门异常检测的跨信号一致性周期感知自编码器
TCAA-CS以开停关周期无监督检测车门异常,融合重构、潜空间与跨信号一致性,召回93.8%、精确97.3%、误报0.5%。
稀疏优先推理引擎SparseEngine支持15种稀疏方法,吞吐超10倍,解码快2.5倍。
SparseEngine:稀疏优先推理引擎
信任不是分数:面向高风险 AI 智能体的运行时保障契约
提出运行时保障契约RAC,以强制门禁和证据状态动态约束高风险AI智能体权限,禁止仅凭总体评分授权行动。
InfoAgent:基于证据的信息图可追溯生成与修复
InfoAgent免训练,以类型化依赖图绑定证据,分层生成并依赖感知局部修复信息图,提升准确率、缩小修复范围。
Argus:真实 EKS 下预测 Spot 中断何时优于简单检查点
Argus在真实EKS验证:SIGTERM检查点可扛Spot回收;预测可零浪费,但提前量过大导致过迁移,周期性检查点仍是强基线。
面向蛋白质定向进化的结构感知强化学习
提出结构感知强化学习框架StructEvo,融合突变结构特征并分解突变空间,性能提升最高16.3%,发现GFP上位效应。
从失调到编排:同策略蒸馏中的教师干预
提出MAESTRO,用局部策略分歧自适应教师接管与生成时长,在八个数学推理基准领先,训练长度降67.3%。
E-MoE:面向非因子化扩散语言模型的增强型混合专家
基于MoE路由的离散共享隐变量,将反向过程建模为因子化分布混合,提升少步生成且不增参。
评估受监管智能体AI中的有限自主性:一个带有宪法奖励、升级标签与运行时治理的诊断测试装置
提出诊断框架,用六类信号与运行时治理评估受监管智能体有限自主性;小规模试验显示配置方差可压倒调参效果。
参数对称性决定过参数化非线性网络中的表征几何
参数对称性经加法、复制、缩放三种特征变换重塑表征,使表征几何分为本质与辅助成分,简并性随过参数化增长。
ResARC:面向超低码率图像压缩的残差感知自回归编码
提出ResARC,显式补偿量化与生成残差,在超低码率下保持有竞争力感知相似度并显著提升分布保真度。
泛化信号未必是模型选择信号
几何代理虽与泛化差距相关,却无法可靠选出部署最优模型:泛化信号未必是模型选择信号。
从残骸到智慧:从真实世界多视角照片中恢复碰撞力学
利用事故车多视角照片预测碰撞变形分类描述符与ΔV,为缺失结构化数据的碰撞力学估计提供参考。
通过状态增广学习无限时域平均奖励CMDP
提出首个计算高效的无限时域平均奖励CMDP算法,达到最优√T遗憾与约束违反。
QuanVI:基于量子最大混合态的分数变分推断
QuanVI结合混合态密度算符与量子张量网络,压缩参数、规避简并本征向量不唯一,高维分数变分推断有效。
OSWorld-Science:面向学习与使用科学软件的计算机使用智能体基准
OSWorld-Science基准含146项科学软件任务,以执行评估检验智能体能力,顶尖视觉语言模型仍面临挑战。
从给定证据到收集证据:面向纵向医学推理的智能体学习
提出CASE临床智能体系统,构建纵向多模态基准,通过智能体学习赋能医学推理,性能超GPT-5.4。
学习隐写术容易,学习隐写推理难
隐写推理远比隐写通信和编码推理难学,多数任务仅靠有监督微调习得;但掩护任务便利时三种方法皆可学会。
FIGS:在不惩罚共情的前提下评估多轮谄媚行为
提出双轴框架FIGS,用10轮自适应对话区分谄媚与共情,发现模型或滑向谄媚、或过度冷漠。
共语言学:AI增强的语言学理论构建
AI作为共同科学家参与语言学理论构建与评估,加速理论显式化、比较与提出,但人类仍居核心。
OmniReasoning:突破音视频联合推理极限
提出音视频联合推理基准、数据引擎与模态分解自蒸馏法,在多项基准显著提升全模态模型表现。
组件替换证据能确立什么?对LLM智能体中局部决策的批判性范围综述
综述348项研究,区分组件替换的任务收益与局部决策质量贡献,指出局部与任务指标同升不足以证明归因。
面向多线路公交驻站控制的完成感知跨保真度离线到在线强化学习
研究多线路公交驻站控制的跨保真度离线-在线强化学习,解决低乘客时间与行程未完成并存的失效模式。
哪种莎草纸文献HTR才够好?希腊语文本四项纸草学任务的字符错误率容忍度
以1–50%字符错误率测试希腊纸草文献四项任务:分类容忍20%,定年仅3%,含错重训可缓解性能下降。
ConflictGuide:让竞争性行为可见,自动研究性能得以提升
ConflictGuide 让竞争性行为可见,以探针反馈引导自动研究,任务与冲突错误最多降低 28% 和 14%。
T-Router:学习丘脑路由以实现参数高效强化学习推理
T-Router仅以0.466%参数实现丘脑式路由,复用计算块,推理超越LoRA与全参数GRPO。
正交却耦合:面向模型合并的几何分量解耦
DiGA以预训练权重为参考,将任务向量正交分解并分组件聚合重组,缓解跨组件耦合,提升模型合并性能。
覆盖优先于控制:面向可控逆合成的路线指令锚定与引导
提出RIGS两阶段框架:先训练投影器学习指令偏好,再引导冻结生成模型,兼顾备选覆盖与指令控制。
面向驾驶行为视频描述的预训练模型适配比较研究
比较自动驾驶中LLM微调与提示方法;在BDD-X上,全量微调SpaceTimeGPT部分指标超基线,并分析LoRA与VideoLLaVA提示工程的局限。
PartiCam:基于奖励引导的相机控制视频生成
提出免训练粒子滤波的奖励引导框架,以全局-局部精炼实现精准稳定的相机控制视频生成。
面向选定高斯过程近最优性证书的预序e值
以预序e值审计GP包络选择,剔除矛盾候选,用存活者最大上界作任意时间有效认证,降低误认证风险。
语料库引导的双路径传播用于图检索增强生成
提出NexusRAG,用语料级实体邻域结构引导语义与结构双路径传播,提升多跳检索证据召回率。
Muon 中的行归一化之谜
研究Muon行归一化:引入维度相关复杂度因子,合成任务更慢,大模型预训练却更优,理论实践仍成谜。
System One 模型 Jev 的评估与基准测试
零样本评测 Jev:37 个数据集多数优于 Qwen/Gemma,概率校准良好,支持选择性预测。