11291 条条目 · 106 个活跃源
2026年7月2日
04:00
arXiv cs.CV

VOCA: 具有编解码感知的视觉里程计

提出VOCA,利用视频编解码信息改进压缩流上的视觉里程计,实现高效高精度。

04:00
arXiv cs.CV

相信先验(或不):不确定性感知的腹主动脉瘤分割

提出不确定性门控与患者特定归一化,提升腹主动脉瘤分割泛化性与可解释性,达最优性能。

04:00
arXiv cs.CV

EgoSafetyBench:评估具身VLM作为运行时安全卫士的自我中心视频基准

EgoSafetyBench评估发现,VLM安全卫士易错过上下文危险,误导性文字使脆弱模型漏掉三分之一危险,鲁棒性多为虚假告警。

04:00
arXiv cs.CV

Does Your ViT Still Need U-Net for Segmentation?

04:00
arXiv cs.CV

Leveraging Phase Information to Boost Unrolled Network Learning for Image Deblurring

04:00
arXiv cs.CV

为触觉唤醒!MLLM中的掩码隔离触觉对齐学习

提出Splash框架,通过隔离休眠子空间选择性更新,实现非破坏性触觉扩展,保持视觉语言能力并达到最佳性能。

04:00
arXiv cs.CV

学习何时倾听:用于人体运动预测的门控情感融合

提出门控情感融合方法,面部情感仅在短中期(<30帧)有预测增益,长期仍依赖运动连续性。

04:00
arXiv cs.CV

DroneFINE: 面向无人机图像的视觉语言检测器的域感知参数高效微调

提出前景感知自适应和背景抑制机制,高效微调无人机图像检测器,性能媲美全微调且参数更少。

04:00
arXiv cs.CV

基于字体的单目距离估计方法

利用后车牌字符标准尺寸,通过单目摄像头测量字符高度估算车距,融合多种信息,误差小于0.13米。

04:00
arXiv cs.CV

CORGI:面向野外单张图像的一致性感知三维狗重建

提出CORGI框架,无需3D监督,从单张野外图像重建高保真可动画3D狗模型,利用CDOG、CA-3DGS和DCGR模块实现一致性感知,达SOTA。

04:00
arXiv cs.CV

OnPoint: 用于点监督在线时序动作定位的离线到在线多级蒸馏

提出OnPoint框架,通过多级蒸馏将离线教师知识迁移至在线学生,结合点标签与锚点改进,在五数据集上优于基线。

04:00
arXiv cs.CV

RetailSMV:零售场景下外视角与内视角的基础视频世界模型自适应

仅外视角训练优于结合内外视角;外视角数据提升内视角但反之有害;短预测窗口适应收益最大。

04:00
arXiv cs.CV

Rosetta:可组合的原生多模态预训练

Rosetta通过模块化专家和动量锚定正交投影,实现无损模态扩展,避免灾难性遗忘。

04:00
arXiv cs.CV

MVDGC:基于双几何约束的联合3D与2D多视角行人检测

提出MVDGC框架,用3D圆柱查询联合优化BEV定位和2D框,消除投影失真实现精准检测。

04:00
arXiv cs.CV

AEGIS:用于乳腺X线摄影的多任务联合嵌入预测架构

提出Aegis架构,自监督JEPA预训练,在乳腺癌分诊和密度分类上分别达0.949和0.953 AUC,零样本跨人群验证成功。

04:00
arXiv cs.CV

MedCAGD:上下文感知门控解码器用于高效医学图像分割

提出上下文感知门控解码器,通过多尺度通道重校准与门控跳跃融合提升医学图像分割准确性,在11个基准上优于基线。

04:00
arXiv cs.CV

基于视觉语言模型上下文推理的个性化对象识别与定位

提出POIL任务及IPLoc-ID算法,借助VLMs上下文推理实现目标定位与负样本拒识,有效抑制假阳性。

04:00
arXiv cs.CV

学习组合:重新审视零样本组合图像检索的代理任务设计

FoCo通过聚焦相关视觉与语义补全两阶段学习组合函数,实现零样本组合图像检索最优性能。

04:00
arXiv cs.CV

SFDA跟踪:恶劣天气下的广义无源域自适应跟踪

提出SFDATrack,利用双交互Mamba和超球原型投影实现无源域自适应恶劣天气跟踪,性能优越。

04:00
arXiv cs.CV

MEPA:基于专家混合的视觉自回归建模多尺度表示对齐

提出MoE架构与残差特征聚合,提升多尺度表示学习,ImageNet上半轮训、少参数即达更优FID。

04:00
arXiv cs.CV

面向高效图像到3D扩散变压器的活力感知压缩

首个图像到3D扩散变压器压缩方法,实现66%模型缩减并保持几何保真度。

04:00
arXiv cs.CV

LIST3R:长序列实例感知的3D重建

提出基于实例锚点的长序列3D重建框架,通过跨子序列锚点匹配实现全局一致重建,显著提升轨迹和重建质量。

04:00
arXiv cs.CV

DriveVer:自动驾驶的轻量级测试时轨迹验证器

DriveVer是轻量级即插即用测试时验证器,以仅34M参数融合多视角视觉与运动特征,实时提升轨迹规划性能。

04:00
arXiv cs.CV

径向相互作用层析成像:从单幅扩张范围图像识别非传递性进化博弈

从单幅扩张图像提取几何信号恢复边界流场,识别非传递性进化博弈,并证明端点可观测性和稳定性。

04:00
arXiv cs.CV

文本到图像扩散模型安全对齐中的高效用幻觉

安全对齐导致语义坍缩,细粒度语义失败;提出SAGE正则化恢复结构化效用,TIFA提升5%。

04:00
arXiv cs.CV

GenSP:通过学习形状生成模型实现一致的球面参数化

GenSP通过生成模型实现球面参数化的一致性,减少几何失真,提高跨形状对应性。

04:00
arXiv cs.CV

DroneIQA-VLE:基于视觉语言集成的多任务无人机图像质量评估

提出DroneIQA-VLE框架,集成视觉编码器与多模态大模型,通过算术平均预测全局质量,获挑战赛第二名。

04:00
arXiv cs.CV

MindAU:基于双流流形对齐的脑电条件面部动作单元编辑

MindAU通过双流流形对齐实现脑电引导的面部动作单元编辑,达成高保真身份保留。

04:00
arXiv cs.CV

EO-VGGT:基于轨道射线条件的卫星多视图重建三维基础模型

EO-VGGT框架通过几何约束选图、推扫视线编码和适配器,实现卫星多视图3D重建。

04:00
arXiv cs.CV

信息正则化注意力:面向视觉中心推理

IRA机制通过随机注意力显式控制视觉信息注入,抑制冗余信号,提升VLM稳定性与表示学习。

04:00
arXiv cs.CV

HyFL-CLIP:双曲微调CLIP以增强鲁棒长上下文理解

HyFL-CLIP通过双曲微调和跨流形蒸馏建模层次关系,增强CLIP长上下文鲁棒性,文本扰动下检索提升19.5%。

04:00
arXiv cs.CV

VideoSearch-R1: 基于软查询优化的迭代视频检索与推理

提出VideoSearch-R1框架,通过软查询优化在连续潜在空间调整搜索,结合GRPO训练,实现迭代检索与推理,在视频语料时刻检索任务上达到最优性能。

04:00
arXiv cs.CV

MindEdit-Bench:基于野外照片的VLM物体级反事实空间推理基准测试

新基准测试VLM物体级反事实空间推理,准确率仅8%-31%,远低于人类81%-97%,差距显著。

04:00
arXiv cs.CV

StochasT:基于随机对话轮次深度的视觉指令微调学习

提出StochasT随机分组任务,解决多轮训练与单轮测试不匹配,提升模型鲁棒性。

04:00
arXiv cs.CV

通过非对称互变分学习实现多模态连续推理

提出AMVL框架,用双向KL校准解决多模态连续推理中的训练-推理不匹配与答案泄露,在BLINK基准上平均提升+10.83。

04:00
arXiv cs.CV

ECoSim:面向可控交通模拟的高效数据微调

提出轻量控制适应框架,仅需不到1%数据实现多模态可控交通模拟,保持驾驶真实性与安全性。

04:00
arXiv cs.CV

通过部分单目观测的生成式重建的鲁棒3D对齐

提出无需训练的几何对齐框架,利用Sim(3)变换和粗到细策略鲁棒对齐,有效抑制生成幻觉,性能超越现有方法。

04:00
arXiv cs.CV

基于先验锚定的长尾多器官病理报告生成去偏方法

提出PriorAnchored框架,用视觉原型和元报告锚定去偏,提升长尾多器官病理报告生成性能。

04:00
arXiv cs.CV

AnF-DiffPET:解剖与频率引导的PET/CT去噪扩散模型

提出AnF-DiffPET框架,结合解剖与频率引导,增强多尺度特征及频域一致性,在PET/CT去噪中优于现有方法。

04:00
arXiv cs.CV

Restore3D: 通过形状与纹理修复为破损物体注入生机

Restore3D框架同时修复破损物体的形状与纹理,利用多视图图像和自感知掩码生成高分辨率一致图像并重建网格。

04:00
arXiv cs.CV

Cross4D-JEPA: 用于4D点云表示学习的密集跨模态对应蒸馏

提出Cross4D-JEPA,通过密集跨模态对应蒸馏冻结的2D/视频模型到4D点云编码器,在四个基准上超越现有方法。

04:00
arXiv cs.CV

NoPA:非参数化在线三维场景图生成

NoPA用非参数分布表示对象,保留几何细节,通过最大均值差异合并,实时生成高质量3D场景图。

04:00
arXiv cs.CV

SPECSIA:基于绘图的3D动画中新颖视角增强的风格化数据集

提出SPECSIA-15K数据集和DraViE模块,消除新颖视角伪影,提升保真度和时间一致性,降低成本。

04:00
arXiv cs.CV

HieDG:一种层次化离散几何引导的多动物追踪框架

HieDG通过离散几何令牌对齐视觉嵌入,解决连续几何不稳定问题,在多动物追踪基准中取得最优关联性能。

04:00
arXiv cs.CV

GEAR-Seg: 面向推理分割与数据引擎的可解释基础智能体

GEAR-Seg将推理分割解耦为可追踪逻辑链,零样本推理性能领先,自动构建大规模基准,轻量模型逼近人工标注上限。

04:00
arXiv cs.CV

EgoGapBench:多智能体场景中自我中心动作选择的基准测试

提出多智能体场景自我中心动作选择基准,人类可靠,多模态大模型表现差且难以从第一人称数据习得。

04:00
arXiv cs.CV

BrainFIBRE:通过信息分解的脑微结构基础模型

首个脑微结构基础模型,采用自监督部分信息分解与反事实候选构建,从NODDI图中提取可迁移表示,在多任务预测中达最优性能,提供可解释的神经生物学交互模式。

04:00
arXiv cs.CV

描述瓶颈模型

CaBM用自由文本替代预定义概念集,实现无泄漏架构,自动发现数据集特定概念。

04:00
arXiv cs.CV

EPO:基于边缘位姿优化提升三维基础模型

EPO通过边缘图对齐实现几何优化,无需特征提取,性能媲美BA,内存更低,适合消费级硬件。

04:00
arXiv cs.CV

主动空间引导:消除视觉Transformer中注入的位置机制

提出主动空间引导训练目标,无需位置注入,通过坐标回归损失提升ViT性能,优于传统位置编码方法。