10722 条条目 · 106 个活跃源
2026年10月1日
04:00
arXiv cs.CV

ResARC:面向超低码率图像压缩的残差感知自回归编码

提出ResARC,显式补偿量化与生成残差,在超低码率下保持有竞争力感知相似度并显著提升分布保真度。

04:00
arXiv cs.CV

从残骸到智慧:从真实世界多视角照片中恢复碰撞力学

利用事故车多视角照片预测碰撞变形分类描述符与ΔV,为缺失结构化数据的碰撞力学估计提供参考。

04:00
arXiv cs.CV

从给定证据到收集证据:面向纵向医学推理的智能体学习

提出CASE临床智能体系统,构建纵向多模态基准,通过智能体学习赋能医学推理,性能超GPT-5.4。

04:00
arXiv cs.CV

OmniReasoning:突破音视频联合推理极限

提出音视频联合推理基准、数据引擎与模态分解自蒸馏法,在多项基准显著提升全模态模型表现。

04:00
arXiv cs.CV

面向驾驶行为视频描述的预训练模型适配比较研究

比较自动驾驶中LLM微调与提示方法;在BDD-X上,全量微调SpaceTimeGPT部分指标超基线,并分析LoRA与VideoLLaVA提示工程的局限。

04:00
arXiv cs.CV

PartiCam:基于奖励引导的相机控制视频生成

提出免训练粒子滤波的奖励引导框架,以全局-局部精炼实现精准稳定的相机控制视频生成。

04:00
arXiv cs.CV

从前到后:面向非对称跨视角车辆重识别的视觉语言模型基准测试

提出前到后车辆重识别基准,评测视觉语言模型;其未稳定超越检索基线,推理可提升,人类更可靠。

04:00
arXiv cs.CV

面向文本到图像模型后门防御的正常扩散动力学学习

提出NDDL,仅用良性样本学习扩散轨迹正常转移动力学,以预测偏差检测并定位后门,泛化性强。

04:00
arXiv cs.CV

镜头光晕去除与重建

提出光晕去除与重建:建大型数据集,微调扩散模型去大光晕;建模光晕并与3DGS联合分解,可编辑迁移。

04:00
arXiv cs.CV

RESUME:基于运动与残差信号循环状态更新的高效视频语言建模

RESUME以锚帧初始化隐状态,逐预测帧循环更新,向视频语言模型输出时序轨迹,时序推理显著提升。

04:00
arXiv cs.CV

EffGS:高效高保真高斯泼溅

EffGS通用加速框架融合频率感知引导、局部密度控制与自适应尺度调制,提升训练渲染效率并保持高保真重建。

2026年9月30日
04:00
arXiv cs.CV

小米-OCR-0 技术报告

小米-OCR-0:0.8B统一模型,兼顾文档解析与OCR理解,1.7亿语料加渐进训练,多项基准最佳。

04:00
arXiv cs.CV

CoVLM-Bench:面向协同驾驶问答与规划的真实世界基准

提出车路协同问答与规划真实世界基准CoVLM-Bench,含2196帧、35136条标注,并构建统一VLM基线,显示问答适配与理由监督降低规划误差。

04:00
arXiv cs.CV

HEIR:学习具有功能角色的人-实体交互

HEIR基准用完整角色集合评测人-实体交互,CoRISP方法在重复角色与共享参与者事件上领先。

04:00
arXiv cs.CV

HERO:面向肿瘤学的鲁棒表示组织学编码器

HERO病理基础模型基于5亿切片训练,对中心、扫描仪和染色差异鲁棒性最强,临床任务表现领先。

04:00
arXiv cs.CV

系统化多智能体视觉语言导航:形式化、基准与方法

首次形式化多智能体视觉语言导航为约束协调问题,提出MAVLN基准与TRISS系统。

04:00
arXiv cs.CV

CoDimRecon:面向仿真就绪三维场景的智能体重建,涵盖可变形曲线、曲面与体

提出智能体框架CoDimRecon,从多视角RGB重建含刚体、铰接与可变形曲线/曲面/体的仿真就绪场景,并经行为测试修正。

04:00
arXiv cs.CV

AerialDojo-200K:面向开放世界空中目标搜索的大规模基准套件

提出大规模基准AerialDojo-200K,含42个仿真场景与20.5万任务实例,推动开放世界空中目标搜索研究。

04:00
arXiv cs.CV

持久性强制:利用像素空间扩散中的特征特化

像素空间DiT异质细化形成持久/活跃特征,PerF借此引导生成,ImageNet上取得更低FID。

04:00
arXiv cs.CV

同一几何,不同结果:视觉语言模型中模态差距的读出依赖效应

统一几何解释模态差距:均值分离近似秩一;差距修改因任务而异,可改善、损害或恢复分类与检索性能。

04:00
arXiv cs.CV

面向高效医学图像增强与分割的硬件感知函数式Kolmogorov-Arnold网络

提出硬件感知两阶段压缩FunKANLite,参数量降至1/5.6、能耗降68%、吞吐增2.9倍,保持医学图像增强与分割精度。

04:00
arXiv cs.CV

探讨从图像数据中识别拓扑关系的学习模型

构建1.1万张标注图像数据集,对比传统与深度学习模型,VGG16准确率达89.55%,凸显迁移学习优势。

04:00
arXiv cs.CV

通过免训练自适应响应几何提升度量深度补全

提出免训练自适应响应几何,将深度/对数深度/视差坐标变为图像级未知,提升度量深度补全精度。

04:00
arXiv cs.CV

FD-AA:一种用于胸部CT中偶发腹部异常检测的轻量级焦点-弥散与衰减感知分类头

FD-AA轻量器官感知头结合衰减感知与掩码广义均值池化,在冻结3D CT编码器上提升偶发腹部异常检测性能。

04:00
arXiv cs.CV

PreviewDiff:多模态评判器引导的扩散隐空间搜索

无需训练,在去噪中途解码预览,由多模态评判器反馈分支搜索并重噪隐变量,让验证算力在生成过程中主动引导。

04:00
arXiv cs.CV

LeRF:面向视角采择推理学习参考坐标系

训练视觉语言模型构建显式参考坐标系,先监督微调再强化学习,提升视角采择推理。

04:00
arXiv cs.CV

面向神经编码与解码的稀疏视角可解释三维动物行为表征

SABLE以自监督几何先验从稀疏视角重建可解释的三维行为表征,零样本泛化,助力神经编码与解码。

04:00
arXiv cs.CV

从敏锐之眼到专家思维:在 MLLMs 中内化专家知识实现篡改文本检测

提出 EKI 两阶段框架,将专家取证知识内化到 MLLM,解决双重不匹配,在篡改文本检测上达 SOTA 且推理高效。

04:00
arXiv cs.CV

生成中的表示设计:扩散 Transformer 中的跨视图类令牌对齐

在扩散变换器中引入跨视图类令牌对齐,联合流匹配训练,提升表示质量且不损生成质量。

04:00
arXiv cs.CV

三思而后修:笔画引导注意力的风险感知满文手稿修复

提出SAGE-Restore选择性修复框架,先评估需修复区域,以笔画结构线索与像素软门控,兼顾退化恢复与完好内容保留。

04:00
arXiv cs.CV

面向统一多模态模型的演化数据相互对抗自训练

提出MATE,让生成与理解分支互相对抗自训练,挑战随模型演化,在Janus-Pro-1B上提升多项基准。

04:00
arXiv cs.CV

StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

将长时程任务分解为可验证子任务,按完成进度给予结构化中间奖励,显著提升VLA长时程任务表现。

04:00
arXiv cs.CV

Merlin Plus:一个大规模、多癌种、图像-掩膜-报告数据集

首个含9器官肿瘤掩膜的大规模CT数据集,用报告驱动主动学习降低标注成本,支持癌症检测、分割与纵向分析。

04:00
arXiv cs.CV

高倍放大知识为何可迁移?全切片成像中的跨分辨率蒸馏研究

跨分辨率蒸馏中,重建误差不足以衡量迁移效果,学生预测能力与模型利用共同决定下游收益。

04:00
arXiv cs.CV

压缩以记忆:通过在线策略蒸馏学习紧凑记忆以实现长视频生成

提出PACC,用在线策略蒸馏训练压缩器,将历史帧压缩为紧凑记忆标记,不改生成器即增强长视频记忆与一致性。

04:00
arXiv cs.CV

OTT3R:以1%算力实现多视角三维重建与快速数据集生成

以1.6%算力蒸馏出1.02亿参数学生模型,3.5小时生成66.7万张图像伪标签,精度超COLMAP且快980倍。

04:00
arXiv cs.CV

LEGO-Anything:面向三维场景重建的编码智能体

编码智能体迭代编写并执行Blender代码重建三维场景,并引入评测基准与改进插件。

04:00
arXiv cs.CV

面向鲁棒室外激光雷达定位的时序感知融合

提出TempLoc时序感知框架,结合全局坐标估计与不确定性引导融合,提升室外LiDAR重定位鲁棒性。

04:00
arXiv cs.CV

隐蔽性是关系,而非属性:事件表示如何为基于事件感知中的时序攻击制造盲点

事件表示使隐蔽性成为观察者关系;Null重定时攻击利用时序盲区,保持受保护张量不变并获高成功率。

04:00
arXiv cs.CV

面向可扩展、上下文感知的组织学图像单细胞空间转录组预测

CELLO单次前向并行提取全细胞特征,距离衰减注意力融入局部上下文,跨12器官千万细胞,提速14倍。

04:00
arXiv cs.CV

RA-CFGCache:从分支级准则到无分类器引导下的引导风险控制

提出RA-CFGCache,在无分类器引导下融合分支误差与传播风险,在线控制缓存,改善效率与保真权衡。

04:00
arXiv cs.CV

DynamicHOI:面向物理感知手物交互重建的耦合动力学

提出物理感知重建框架DynamicHOI,耦合手物动力学并以驱动先验抑制力学不合理运动,提升重建性能。

04:00
arXiv cs.CV

在线通用增量学习:迈向任意时刻的类别与领域无关适应

提出Online VIL:类与域无边界在线共变;TopFlow以域无关流匹配与全局拓扑保持实现SOTA。

04:00
arXiv cs.CV

DARE:以双路径自回归感知编辑缓解幻觉

提出DARE混合编辑框架,融合文本、图像对比与自回归感知信号,减少LVLM物体幻觉且保持感知性能。

04:00
arXiv cs.CV

事件边界处的预见:评估视频世界模型中的物理预测

基于62段自由落体视频提出事件锚定评测,发现视频世界模型能触发后果却常延迟,时序合理不等于物理一致。

04:00
arXiv cs.CV

重新构想视频动态

RVD通过自监督重建,从视觉上下文中解耦出可编辑的动态令牌,实现语言引导的动态编辑与重渲染。

04:00
arXiv cs.CV

ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

提出ThinkingGuard,逐步风险归因检测多模态大模型隐式危害,构建TriggerBench

04:00
arXiv cs.CV

面向连接组学突触检测与校对的视觉语言模型基准评测

视觉语言模型在连接组学突触检测与校对:零样本近随机,微调后开源模型追平专家,跨物种合并错误识别更优。

04:00
arXiv cs.CV

医学视觉语言模型为何未充分利用其视觉编码器:皮肤科视角

医学视觉语言模型未充分利用视觉编码器,皮肤科中编码器显著更强;描述后决策与编码器辅助重排可改善。

04:00
arXiv cs.CV

SCCM:面向ERP稠密特征对应的球面一致粗匹配

SCCM通过球面先验在粗匹配阶段校正ERP的拓扑、度量与面积三重畸变,显著提升稠密特征匹配精度。