59358 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.LG

信号-噪声分解将干扰变异隔离到可移除子空间

通过正则强化信号-噪声分解,将干扰噪声隔离到可移除子空间,显著提升失真图像任务性能。

04:00
ArXiv AI

SpikeMoE:面向灵活脉冲专家混合模型的类脑竞争性路由

提出脑启发脉冲k-WTA路由与SpikeMoE,融合稀疏专家计算,多任务性能优且能效高,鲁棒应对缺失模态。

04:00
arXiv cs.AI

后训练中的锐化税

后训练锐化现有行为,单次准确率升但解覆盖降;预训练模型配轻量推理壳,测试预算充足时覆盖率反超。提出锐化税度量。

04:00
ArXiv AI

DRelay:面向前缀感知并行推测解码修复的全局草稿上下文

DRelay 利用全局草稿上下文对候选选择做前缀感知修复,纠正早期错误、延长接受前缀,显著提升解码速度。

04:00
arXiv cs.CL

旧观念,新问题:基于大语言模型的新颖性评估的不稳定性

提示词微调即可翻转大模型新颖性判断,准确率波动超50点;检索与长推理帮助有限,专用评估器不如简单基线,创意增益存疑。

04:00
arXiv cs.LG

混合整数规划的重构对比学习

利用等价重构自监督,提出ReMILP学习混合整数规划变量与约束表示,无需求解器标签且可迁移。

04:00
arXiv cs.CV

SALD:扩散模型的自参考优势学习

提出SALD自参考训练框架,用同模型双噪声路径误差差加权,无需外部教师或额外参数,提升生成质量。

04:00
arXiv cs.CV

VTR-Bench:评估视频生成中视觉文本渲染的系统性基准

提出VTR-Bench,评测视频生成视觉文本渲染,含300提示与自动评测,发现11个模型普遍不佳。

04:00
arXiv cs.CL

基于自适应Tversky策略优化的可控多标签视频安全检测

提出ATPO框架,用自适应Tversky奖励调节误报漏报惩罚,实现可控多标签视频安全检测。

04:00
arXiv cs.LG

可扩展的多任务逆强化学习

提出低秩多任务逆强化学习,共享数据降低覆盖要求,按秩扩展,具样本保证并优于基线。

04:00
arXiv cs.CL

LLM2Jev:大模型本身已是Jev式决策模型——何时以及如何微调它们

通用LLM无需训练即可输出校准的类别决策,微调仅对弱模型和特定任务有益。

04:00
arXiv cs.LG

中文标题:记忆任务间迁移的定位

研究记忆任务间迁移,发现等价与非等价两种模式,消融实验将迁移分解为末层幅度驱动与结构驱动两种效应。

04:00
arXiv cs.CV

在消退之前:在推理阶段强化 VideoLLM 中的时间表征

VideoLLM 的时间信息在中间层涌现却向输出层逐渐消退;无需训练的时间激活注入法可有效强化时间推理。

04:00
arXiv cs.CL

层次化连续扩散语言模型

提出层次化连续扩散语言模型HC-DLM,耦合离散词元与连续隐轨迹去噪,在推理、语言建模上优于扩散基线

04:00
arXiv cs.LG

预训练干预的事后实施:跨检查点嫁接模型信念

提出“嫁接”法:预训练检查点训练SDF适配器,再叠加到后训练模型,平均将现实漂移与偏好一致性损失减半。

04:00
arXiv cs.CV

PAGER:通过几何与关系蒸馏实现局部到全局对齐

提出PAGER,无标签蒸馏几何与关系,将局部特征对齐冻结全局3D语义空间,超越监督微调并提升迁移。

04:00
arXiv cs.CL

从知识访问到源学习:构建面向特定信息源的能力

提出SourceLearn,以自主与任务引导学习构建可持久化的源模型,13/15项设置最优,最高提升22.6分。

04:00
arXiv cs.LG

从有限时间可达性学习目标达成的拟度量几何

ReQRL以有限时域可达性约束价值梯度,解耦动力学与边界几何,在OGBench上媲美或超越现有方法。

04:00
arXiv cs.AI

注意力-残差 Transformer 中路由熵作为不确定性信号的审计

审计显示,路由熵对正确性的增益依赖控制,未超越置信度,且估计器恢复不全,不能否定条件路由信息。

04:00
arXiv cs.CV

FedCKA:表征引导的层个性化实现跨驾驶域联邦3D感知

FedCKA用CKA相似度动态生成聚合掩码,选择性共享一致层,跨域联邦3D检测NDS提升7个百分点。

04:00
arXiv cs.LG

面向合成数据选择的训练感知目标覆盖

提出训练感知目标覆盖(TATC)选择合成数据,量化其对目标任务价值,数学推理微调中优于基线。

04:00
arXiv cs.CV

VoxelSynth3D:基于配对合成CLINIC-Metal基准的可解释体图像域金属伪影校正

提出免训练的三维图像域金属伪影校正框架VoxelSynth3D,并构建配对合成基准;留出集上稳定降低组织误差,近金属处有结构折衷。

04:00
ArXiv AI

OpenMTB-Audit:揭示基于LLM的分子肿瘤委员会安全评估中的过度拒绝与临床专家视角

提出OpenMTB-Audit基准,发现LLM普遍过度拒绝,并开发MTB-AuditAgent将过度拒绝降至6.7%,准确率达91.2%。

04:00
arXiv cs.CL

关键词评测框架会误放行:面向小语言模型工具使用主张的低成本诊断阶梯

关键词评测会误判小模型工具使用;逐字复现和首词元探针定位失败,定向微调廉价修复,但仍过度触发。

04:00
arXiv cs.AI

MCRI:分析与评估智能体技能的四维框架

提出MCRI四维框架及MCRI-Eval评估法,基于6万余技能验证,可有效预测技能价值并优化下游选择。

04:00
arXiv cs.CL

基于栈的语言模型在轻度上下文敏感人工语言上的类型学对齐

研究基于栈语言模型在交叉序列依存上的泛化,工作记忆受限者泛化更佳,或解释语序类型共性。

04:00
arXiv cs.CV

数据稀缺条件下长尾出血性病灶分割的合成训练

提出无需真实病灶标注合成训练框架,用于数据稀缺下长尾出血病灶分割,cSS/CMB上优于传统滤波基线。

04:00
arXiv cs.CL

AutoCompact:学习长时程编码智能体中的上下文压缩时机

AutoCompact 训练编码智能体自主压缩上下文,在 SWE-bench 与 PolyBench 通过率提升 9.2%/5.0%。

04:00
arXiv cs.CL

Argo-Bench:评估企业级工作流中的数据智能体

提出Argo-Bench企业数据智能体评测,模拟仓库,任务需跨表推理并行动,顶尖模型均分59.5。

04:00
arXiv cs.CV

Oneira:从开放式生成到视频世界模型中的开放世界交互

Oneira用编码智能体维护可扩展世界状态,使视频世界模型中新生成实体可交互、交互结果持久。

04:00
arXiv cs.AI

迈向可靠的自动驾驶视觉语言模型

评估五种视觉语言模型在驾驶问答中面对视觉退化的可靠性,退化影响因模型和场景而异,增强方法效果不一致。

04:00
arXiv cs.CV

超越域级适应:面向间隔的语义-外观交互校正及其在个性化联邦视觉-语言模型中的应用

MOSAIC以决策感知有害性评分建模类-域残差交互并做低秩校正,提升个性化联邦视觉-语言模型精度。

04:00
ArXiv AI

vFedProtoQNAS:面向虚拟联邦学习的原型引导个性化量子神经架构搜索

提出vFedProtoQNAS,以类原型共享实现虚拟联邦协作,避免异构QNN参数聚合,精度较FedAvg提升3.70%。

04:00
arXiv cs.LG

SHARPO:面向智能体强化学习的片段级信用分配

SHARPO通过片段级师生对数概率差生成有界乘子,调节GRPO优势,在多步智能体任务上超越基线。

04:00
arXiv cs.AI

决策泰坦:面向离线强化学习长期记忆的测试时训练

提出决策泰坦,用测试时训练层增强决策Transformer,实现比上下文窗口长20倍的长期记忆。

04:00
ArXiv AI

评估自动驾驶生成式场景模型中的物理一致性与合理性

提出五层评估协议,从内部表征到车辆动力学约束检验生成场景,揭示视觉合理未必物理一致。

04:00
arXiv cs.CV

并非所有错误都能靠规模扩展消除:视觉语言推理中规模扩展的止步之处

提出可分离定律,刻画视觉语言模型性能随语言主干规模与视觉token数的变化,发现部分能力永不受益于扩展,并给出算力分配规则。

04:00
arXiv cs.LG

TrueMuse:面向文本到音乐模型的数据归因基准

提出TrueMuse基准,用受控微调数据评估文本到音乐数据归因,发现现有方法仍具挑战。

04:00
arXiv cs.AI

非黑非白:用图信息语义ID平衡语义与协同信号(GrIS)

把语义ID构建视为图上的递归聚类,提出GrIS统一框架,兼顾语义与协同信号,Hit@10最高提升52%。

04:00
arXiv cs.CL

神经音频编解码器对非洲语音的鲁棒性如何?多任务基准与感知质量的局限

七种神经编解码器的非洲语音基准:感知指标与下游任务脱节,对话域退化最重,LoRA微调可部分恢复。

04:00
ArXiv AI

智能体是系统,而非模型:重新审视智能体评估

智能体应作为可配置系统评估:配置中信息影响最大,重复运行差异约占54%,验证工具比提示更有效。

04:00
arXiv cs.CV

面向越南语视觉问答的多层融合Transformer视觉与文本表示融合

提出多层融合Transformer与交叉注意力,聚合多层图文特征,在越南语ViVQA上优于基线。

04:00
arXiv cs.AI

AI评估沙盒配置器:支持AI监管沙盒中技术评估的框架

开源框架AI评估沙盒配置器,整合测试目录与统一数据模型,满足AI法案11项要求,已试点并生成报告。

04:00
ArXiv AI

FedLore:通过共享梯度低秩投影实现通信与内存高效的联邦学习

FedLore共享并刷新低秩梯度投影,消除聚合偏差,降低通信与内存,性能超低秩基线并媲美全参数训练。

04:00
arXiv cs.CL

高价值合成监督用于紧凑日语语音模型的参数高效适配

合成日语护理语音上,LoRA以约0.85%参数接近全量微调,但临床与真实迁移未验证。

04:00
arXiv cs.CL

从网络(日志)到网络(AI):ICWSM二十届年会中的问题、平台与方法

分析ICWSM 2139篇文献:平台焦点从博客转向Twitter、Reddit,治理与危害议题上升,方法持续演进。

04:00
arXiv cs.CV

MLLM评委真的在评判编辑吗?在经验证质量保持的图像编辑评估中审计偏差

提出EditJudgeBias基准,经质量保持验证后审计五个MLLM评委,发现无关线索均造成超出自身噪声的偏差。

04:00
arXiv cs.LG

修复一个学到“癌症越严重意味着风险越低”的模型:膀胱癌复发预测中的单调约束

无约束模型将高分期/原位癌学成低复发风险,常规检查未察觉;反事实测试加单调约束可消除且不损性能。

04:00
arXiv cs.CV

重新思考扩散模型中的记忆缓解:强化文本条件

提出免训练法:高斯平滑重分配交叉注意力,强化内容词元并抑制填充,兼顾提示对齐与缓解记忆。

04:00
arXiv cs.LG

别浪费噪声:全局与局部联合约束下的重要性引导扰动分配

提出重要性引导扰动分配,在共享ℓ1预算与局部约束下,将扰动重分配至高敏感区,不增预算并提升攻击成功率。