TexTailor:基于自适应服装条件调控的纹理保持视频虚拟试穿
TexTailor借视频扩散Transformer,以时间步自适应调制、帧对齐位置编码和多源注入,提升高分辨率虚拟试穿的纹理保持与时空一致性。
面向证据门控问答的机制边界对齐
将同一问题的支持与缺失证据变体配对训练,使模型仅在证据充分时作答,不支持回答率降低逾60个百分点。
EgoTools:迈向真实世界第一人称视频中的工具中心推理
首个第一人称工具使用理解套件,含100小时数据与千题基准,暴露模型工具推理短板,亦能提升训练效果。
你的基准并未饱和:用答案池化重振多项选择评估
提出答案池化:把同上下文各题选项合并成池,令模型为每题指定答案,无需新题即提升难度,揭示靠排除选项所得的虚高分。
为什么传统世界模型无法学会元胞自动机?
传统世界模型能预测多数像素,却难完成完整推演;缺空间、时间局部性与时间稳定性,仅调信息流即可修复。
相关性并非充分证据:在RAG生成前检测证据缺口
提出RINSE,生成前融合覆盖、可答性与小模型判断,检测RAG相关但不足的证据,六数据集领先。
面向高效自适应谱递归的共享相位与保留控制
SPARC以两个共享标量控制复模态保留与相位旋转,实现高效自适应谱递归,兼顾并行/在线学习与性能速度。
多智能体系统中隐空间通信的安全性
隐空间通信链路良性训练亦可增加有害依从;攻击可将其从27.9提至76.9,调整奖励可修复,安全对齐须看系统整体。
RunyaNER:Runyankore命名实体识别中的辅助语言选择
首个Runyankore NER基准(23.7万标注词);辅助语言选择显著影响迁移,嵌入度量比类型学特征预测力更强。
AVERT-VLN:面向视觉语言导航的弃权感知视觉错误恢复与训练
提出AVERT-VLN:可插拔视觉语言监控器在线检测偏差并请求人工纠正,离线偏好学习提升导航成功率。
迈向可信赖的胶质瘤诊断AI:不确定性量化的任务感知评估
评估胶质瘤MRI多任务诊断的不确定性量化:校准依赖丢弃率,不确定性助错误检测,无方法一致占优。
重新思考多图像理解中的多图像再表征
提出视觉框架Mosaic,揭示多图像再表征收益依任务而异,智能体仅凭准确率奖励即学会自主组合操作。
切换线性注意力
SwiLA将线性注意力的状态更新建模为混合线性回归的在线EM,各输出维度动态选择组件,以定长递归状态逼近甚至超越softmax注意力。
已部署验证器套件中的硬门禁候选资格
部署验证器仅2/13通过校正;跳过检查记通过致检出上限约84%;评估须区分未运行/通过并附拒收证据。
Larry 让车停下,模型却毫无察觉:Transformer 对 M-启发式的盲视
研究表明,DeBERTa 等模型默认不运用 M-启发式,无法区分使役句式,仅在显式提示下可用。
谁让档案变暖了?大语言模型高估历史温暖程度
六个大模型从德国五百年文献提取温度指数时均出现随年代增强的暖偏误,相关性高不足以证明其可靠。
ArchitectureIQ:论训练直觉的度量
提出基准测量模型与人类的训练直觉,发现其良好但不完美、属经验性、可压缩,且对数据特性不敏感。
CAST:面向扩散模型的因果优势结构化训练与空间锚定组合奖励
CAST按模型去噪轨迹定SDE窗口,以因果场景图分解原子奖励并映射至像素空间加权,提升扩散模型组合生成能力。
HO-FL:面向异构边缘设备的混合阶联邦学习
提出HO-FL混合阶联邦学习,底层用零阶、顶层用一阶优化,按内存划分边界,并优化采样以应对数据异构。
ChronoGraph:面向交互理解与具身规划的视觉语言模型功能化4D场景图
提出功能化4D场景图ChronoGraph,统一表示观察与预期状态变化,训练视觉语言模型实现交互理解与可落地规划。
罗生门式维基百科:分歧历史叙事的数据视角主义分析
分析五语维基中罗马尼亚争议事件叙事分歧,发现引用隔离与地缘政治波动,提出Peace-Maker和解流程。
OverForge:通过策略与战术推理助力协作式终身适应
免训练分层架构OverForge分离持久策略与战术执行,提升协作智能体的长期适应与配合。
A 帮助 B,而 B 损害 A:指令微调混合中的有向迁移
任务迁移非对称:A助B而B损A。迁移图预测未见混合,跨规模选任务,推理准确率最高提升14个百分点。
PCB-MC:印刷电路板缺失元件分析
发布PCB-MC数据集,用于PCB缺失元件检测,含197种板型;基准显示现有方法在新板型上仍难奏效。
DensePed-Lite:面向遮挡下密集行人的质量感知自适应检测
提出DensePed-Lite,以质量感知自适应为原则,通过三项协同机制,在低复杂度下实现遮挡密集行人检测的精度效率更优平衡。
用于铁路车门异常检测的跨信号一致性周期感知自编码器
TCAA-CS以开停关周期无监督检测车门异常,融合重构、潜空间与跨信号一致性,召回93.8%、精确97.3%、误报0.5%。
稀疏优先推理引擎SparseEngine支持15种稀疏方法,吞吐超10倍,解码快2.5倍。
SparseEngine:稀疏优先推理引擎
信任不是分数:面向高风险 AI 智能体的运行时保障契约
提出运行时保障契约RAC,以强制门禁和证据状态动态约束高风险AI智能体权限,禁止仅凭总体评分授权行动。
InfoAgent:基于证据的信息图可追溯生成与修复
InfoAgent免训练,以类型化依赖图绑定证据,分层生成并依赖感知局部修复信息图,提升准确率、缩小修复范围。
Argus:真实 EKS 下预测 Spot 中断何时优于简单检查点
Argus在真实EKS验证:SIGTERM检查点可扛Spot回收;预测可零浪费,但提前量过大导致过迁移,周期性检查点仍是强基线。
面向蛋白质定向进化的结构感知强化学习
提出结构感知强化学习框架StructEvo,融合突变结构特征并分解突变空间,性能提升最高16.3%,发现GFP上位效应。
从失调到编排:同策略蒸馏中的教师干预
提出MAESTRO,用局部策略分歧自适应教师接管与生成时长,在八个数学推理基准领先,训练长度降67.3%。
E-MoE:面向非因子化扩散语言模型的增强型混合专家
基于MoE路由的离散共享隐变量,将反向过程建模为因子化分布混合,提升少步生成且不增参。
评估受监管智能体AI中的有限自主性:一个带有宪法奖励、升级标签与运行时治理的诊断测试装置
提出诊断框架,用六类信号与运行时治理评估受监管智能体有限自主性;小规模试验显示配置方差可压倒调参效果。
参数对称性决定过参数化非线性网络中的表征几何
参数对称性经加法、复制、缩放三种特征变换重塑表征,使表征几何分为本质与辅助成分,简并性随过参数化增长。
ResARC:面向超低码率图像压缩的残差感知自回归编码
提出ResARC,显式补偿量化与生成残差,在超低码率下保持有竞争力感知相似度并显著提升分布保真度。
泛化信号未必是模型选择信号
几何代理虽与泛化差距相关,却无法可靠选出部署最优模型:泛化信号未必是模型选择信号。
从残骸到智慧:从真实世界多视角照片中恢复碰撞力学
利用事故车多视角照片预测碰撞变形分类描述符与ΔV,为缺失结构化数据的碰撞力学估计提供参考。
通过状态增广学习无限时域平均奖励CMDP
提出首个计算高效的无限时域平均奖励CMDP算法,达到最优√T遗憾与约束违反。
QuanVI:基于量子最大混合态的分数变分推断
QuanVI结合混合态密度算符与量子张量网络,压缩参数、规避简并本征向量不唯一,高维分数变分推断有效。
OSWorld-Science:面向学习与使用科学软件的计算机使用智能体基准
OSWorld-Science基准含146项科学软件任务,以执行评估检验智能体能力,顶尖视觉语言模型仍面临挑战。
从给定证据到收集证据:面向纵向医学推理的智能体学习
提出CASE临床智能体系统,构建纵向多模态基准,通过智能体学习赋能医学推理,性能超GPT-5.4。
学习隐写术容易,学习隐写推理难
隐写推理远比隐写通信和编码推理难学,多数任务仅靠有监督微调习得;但掩护任务便利时三种方法皆可学会。
FIGS:在不惩罚共情的前提下评估多轮谄媚行为
提出双轴框架FIGS,用10轮自适应对话区分谄媚与共情,发现模型或滑向谄媚、或过度冷漠。
共语言学:AI增强的语言学理论构建
AI作为共同科学家参与语言学理论构建与评估,加速理论显式化、比较与提出,但人类仍居核心。
OmniReasoning:突破音视频联合推理极限
提出音视频联合推理基准、数据引擎与模态分解自蒸馏法,在多项基准显著提升全模态模型表现。
组件替换证据能确立什么?对LLM智能体中局部决策的批判性范围综述
综述348项研究,区分组件替换的任务收益与局部决策质量贡献,指出局部与任务指标同升不足以证明归因。
面向多线路公交驻站控制的完成感知跨保真度离线到在线强化学习
研究多线路公交驻站控制的跨保真度离线-在线强化学习,解决低乘客时间与行程未完成并存的失效模式。
哪种莎草纸文献HTR才够好?希腊语文本四项纸草学任务的字符错误率容忍度
以1–50%字符错误率测试希腊纸草文献四项任务:分类容忍20%,定年仅3%,含错重训可缓解性能下降。
ConflictGuide:让竞争性行为可见,自动研究性能得以提升
ConflictGuide 让竞争性行为可见,以探针反馈引导自动研究,任务与冲突错误最多降低 28% 和 14%。