61034 条条目 · 106 个活跃源
2026年9月30日
04:00
arXiv cs.CV

StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

将长时程任务分解为可验证子任务,按完成进度给予结构化中间奖励,显著提升VLA长时程任务表现。

04:00
arXiv cs.CV

Merlin Plus:一个大规模、多癌种、图像-掩膜-报告数据集

首个含9器官肿瘤掩膜的大规模CT数据集,用报告驱动主动学习降低标注成本,支持癌症检测、分割与纵向分析。

04:00
ArXiv AI

AdaST:面向时空预测的自适应耦合

提出AdaST框架,以分解-重组自适应建模时空耦合模式,显著提升预测性能并超越现有方法。

04:00
ArXiv AI

CoRe:协同进化奖励模型以缓解视频扩散模型中的潜空间奖励劫持

CoRe让奖励模型与生成器协同进化,以真实视频偏好锚定,避免分布漂移引发的奖励劫持,提升视频生成质量。

04:00
arXiv cs.CV

高倍放大知识为何可迁移?全切片成像中的跨分辨率蒸馏研究

跨分辨率蒸馏中,重建误差不足以衡量迁移效果,学生预测能力与模型利用共同决定下游收益。

04:00
arXiv cs.CV

压缩以记忆:通过在线策略蒸馏学习紧凑记忆以实现长视频生成

提出PACC,用在线策略蒸馏训练压缩器,将历史帧压缩为紧凑记忆标记,不改生成器即增强长视频记忆与一致性。

04:00
ArXiv AI

FigAct:让科学图表成为可主动演绎的讲解画布

将静态科学图表转为按问题生成的视觉演示,通过元素定位与视觉动作引导注意力,使讲解更清晰易懂。

04:00
arXiv cs.CV

OTT3R:以1%算力实现多视角三维重建与快速数据集生成

以1.6%算力蒸馏出1.02亿参数学生模型,3.5小时生成66.7万张图像伪标签,精度超COLMAP且快980倍。

04:00
arXiv cs.CV

LEGO-Anything:面向三维场景重建的编码智能体

编码智能体迭代编写并执行Blender代码重建三维场景,并引入评测基准与改进插件。

04:00
ArXiv AI

记忆即推导:长期智能体中的分布式证据悖论

长期智能体记忆能否由历史推导存疑:扩展历史可找回近六成无据记忆,但17%-21%仍无据,准入不可靠。

04:00
arXiv cs.AI

潜空间递归大语言模型系统的原则性思考

REST把有效思维的因果、最小、可分、稳定四性转为可微损失,与交叉熵共训,准确率提升7.5个百分点。

04:00
arXiv cs.AI

VLA 的层之谜:VLA 潜在接口的信息论分析

VLA潜在接口选层:多层融合多不如最佳单层,最佳层随模型/任务变;InfoNCE代理选层,降遗憾。

04:00
arXiv cs.CV

面向鲁棒室外激光雷达定位的时序感知融合

提出TempLoc时序感知框架,结合全局坐标估计与不确定性引导融合,提升室外LiDAR重定位鲁棒性。

04:00
arXiv cs.CV

隐蔽性是关系,而非属性:事件表示如何为基于事件感知中的时序攻击制造盲点

事件表示使隐蔽性成为观察者关系;Null重定时攻击利用时序盲区,保持受保护张量不变并获高成功率。

04:00
arXiv cs.CV

面向可扩展、上下文感知的组织学图像单细胞空间转录组预测

CELLO单次前向并行提取全细胞特征,距离衰减注意力融入局部上下文,跨12器官千万细胞,提速14倍。

04:00
ArXiv AI

更多特征并非更多证据:基于 Jev 的免训练人体活动识别的局限

Jev免训练人体活动识别远逊监督模型;更多数值特征反降性能;传感器到模型接口是评估关键。

04:00
arXiv cs.CV

RA-CFGCache:从分支级准则到无分类器引导下的引导风险控制

提出RA-CFGCache,在无分类器引导下融合分支误差与传播风险,在线控制缓存,改善效率与保真权衡。

04:00
arXiv cs.LG

随机策略基线缺失下,程序化生成泛化差距究竟衡量了什么?动作规则、收敛性与缺失的随机下限

强化学习泛化差距常缺参照,应报告同关卡随机策略下限;动作规则与收敛口径会显著改变结论。

04:00
ArXiv AI

MERID:基于递归自我改进智能体的多模态探索用于重度抑郁症分析

MERID利用递归自我改进智能体,联合优化多模态表示、融合与预测器,在抑郁症检测与严重度估计基准上最优。

04:00
arXiv cs.LG

激活流:为引导而制造激活

ActFlow无需微调,仅凭k个正确标签合成激活,将沙袋式锁定模型的准确率从0.05提升至0.85。

04:00
arXiv cs.CL

大型语言模型在被训练预测自身准确率时学会不同形式的元认知

模型置信度分双信号:近训练分布追踪准确率,其他领域追踪输出一致性;后者早现可泛化,前者晚现且局限。

04:00
arXiv cs.CL

简单扩散语言模型作为少步生成器比报道的更有效

少步生成潜力被次优采样器掩盖:适度锐化无需重训,旧模型16步超越1024步,且需联合评估质量与多样性。

04:00
arXiv cs.AI

欧盟《人工智能法案》合规检查器的实证研究与评估

实证评估12款欧盟AI法案合规检查器:质量参差,仅能早期指引,易致虚假合规,并提出设计原则。

04:00
arXiv cs.CL

具无分布风险保证的更快块扩散推理服务

Redline用校准数据选配置,在风险预算内控制相对参考的失败概率,并部署最快通过者以加速块扩散推理。

04:00
arXiv cs.LG

共享自回归上下文可能扭曲合成数据中的变量关系

大模型批量生成使前序答案成上下文,扭曲合成数据变量关系并夸大相关性,请求构造影响数据效度。

04:00
arXiv cs.CL

论高效推理中的词元价值不平等

CoT推理词元价值高度不均,对数概率可区分核心与冗余词元;TokenProbe压缩冗余词元,省76%用量并保持质量。

04:00
arXiv cs.CL

量化误差是谱平坦的:单次随机探针即可作为校准、无数据的敏感度估计器,并应用于面向预算目标的混合精度量化

量化误差谱平坦,单随机高斯探针可无校准无偏估计敏感度,RAM按字节预算分配混合精度位宽。

04:00
arXiv cs.LG

Transolver 真的需要 Transformer 吗?

该模型无需 Transformer,切片/反切片全局混合才是关键,并提出高效实现。

04:00
arXiv cs.CL

NSV-Shift:面向语音到语音模型中非言语发声理解与响应适应的对比基准

NSV-Shift对比基准:评估语音到语音模型的非言语发声理解与响应适应,发现模型检测强于情绪解读与差异化回应。

04:00
arXiv cs.LG

CAESAR:通过自主嵌入空间凝聚式重组进行聚类

无需预设簇数K,CAESAR重组预训练嵌入空间,拉近互近邻、推开非近邻,文本与图像聚类均超越强基线。

04:00
ArXiv AI

ChronoSRL:面向自监督强化学习的时间几何

赋予评论家嵌入时间几何,按到达目标时间训练,并借助生存强化学习提升策略,在导航与四足任务上超越基线。

04:00
arXiv cs.LG

优先进行重复式LLM评估以发现隐藏故障

预算约束下先浅评,再依据失败倾向优先深查零失败提示,显著提升隐藏故障发现。

04:00
arXiv cs.LG

被困于自身的采样轨迹:理解联邦在线策略蒸馏中的聚合—采样反馈

联邦在线蒸馏受聚合延迟拖累,学习率敏感掩盖协作收益;提出FedTOPS自适应更新,六项推理基准提升4.56–14.57个百分点。

04:00
arXiv cs.LG

组合式目标:在结构中学习结构

提出组合目标,测量图像部件与交互;观察者所见比关系标记更关键,谱多样性、可预测性、下游效用各自独立。

04:00
arXiv cs.CL

SlopBench:我们能在多大程度上按“AI 废话”给语言模型排名?一项重复性 AI 写作的多领域基准

SlopBench用112项任务评测18个模型近2万输出,按四项表层特征评分;重加权后排名不稳,仅一项排名无歧义。

04:00
arXiv cs.CL

面向论述性文本语义相似度分析的高层文本预处理:框架与实证演示

提出高层文本预处理,用规则分离论述结构与核心主张;实验显示可降低语义相似度虚高,并提出语义扩散指数。

04:00
arXiv cs.CL

超越单智能体与一致性:通过条件渐进剪枝为多智能体辩论正名

提出条件渐进剪枝(CPP),轻量利用多轮辩论,在严格成本下超越单智能体、一致性及现有MAD框架。

04:00
arXiv cs.LG

学习年龄:预测误差的时间持续性作为学习信号

提出“学习年龄”,度量预测错误的持续时间,区分持续欠学习与短暂失误,用于离线与流式训练的样本重加权。

04:00
arXiv cs.LG

DimPO:基于偏好优化的注意力降维

DimPO以偏好优化加top-k交叉熵离线学习Q/K投影,降注意力维度;实验表明保留关键注意力排序与集中度比复现完整分布更重要。

04:00
arXiv cs.CL

系统1决策能自洽吗?一项概率一致性研究

Jev与Laya分类概率不一致:粗细预测分歧大,准确率反向变动,提升或伴随校准恶化。

04:00
arXiv cs.AI

OTROPE:面向大语言模型的基于最优传输的鲁棒离策略评估

提出免似然OTROPE,以最优传输在语义空间校正分布偏移,双稳健评估LLM,性能稳定超越基线。

04:00
ArXiv AI

HyperZip:基于超网络个性化扩散大模型的高效数据压缩

HyperZip借助超网络与多词元预测适配扩散大模型,实现高压缩率、高吞吐的数据压缩。

04:00
arXiv cs.AI

面向缓解大型推理模型中的欺骗性安全对齐

提出DSAR指标量化推理与答案的安全不一致,并用SARA强化学习法缓解且保持有用性。

04:00
arXiv cs.CV

DynamicHOI:面向物理感知手物交互重建的耦合动力学

提出物理感知重建框架DynamicHOI,耦合手物动力学并以驱动先验抑制力学不合理运动,提升重建性能。

04:00
arXiv cs.CV

在线通用增量学习:迈向任意时刻的类别与领域无关适应

提出Online VIL:类与域无边界在线共变;TopFlow以域无关流匹配与全局拓扑保持实现SOTA。

04:00
arXiv cs.CV

DARE:以双路径自回归感知编辑缓解幻觉

提出DARE混合编辑框架,融合文本、图像对比与自回归感知信号,减少LVLM物体幻觉且保持感知性能。

04:00
arXiv cs.AI

CheatBench:衡量AI智能体中的奖励作弊行为

发布基准CheatBench,跨领域衡量AI智能体的作弊行为,助力测量并减少此类风险。

04:00
arXiv cs.AI

从表面到体积:面向蛋白质表示学习的配准几何

提出Protein-TetSphere残基级配准体积表示,统一拉普拉斯坐标并融合表面与化学信息,在口袋、界面与结合剂设计上均获提升。

04:00
arXiv cs.AI

StateTape:面向长程编程智能体的动作条件化证据生命周期建模

仓库建模为符号级代码图,磁带标记写入影响的符号,随代码变更重写智能体上下文,清除失效记录、召回所需信息。

04:00
arXiv cs.CV

事件边界处的预见:评估视频世界模型中的物理预测

基于62段自由落体视频提出事件锚定评测,发现视频世界模型能触发后果却常延迟,时序合理不等于物理一致。