11301 条条目 · 106 个活跃源
2026年6月23日
04:00
arXiv cs.CV

差异图:基于解剖结构差异对齐的医学图像再识别

提出解剖结构差异对齐的GoD方法,医学图像再识别Rank-1提升7.1pp(眼底)和3.1pp(CXR),零样本泛化提升。

04:00
arXiv cs.CV

超越灾害评估:基于轻量级补丁框架的航空灾害影像可回收材料检测

提出轻量级方法高效检测灾害影像中可回收材料,实验验证潜力,并提供公开数据集。

04:00
arXiv cs.CV

VLM在零样本程序错误检测中的惊人有效性

提出ZeProM框架,用单个VLM实现零样本程序错误检测,性能接近甚至超越全监督方法。

04:00
arXiv cs.CV

多模态广义类别发现中的协同双分支自适应

提出SDBA框架,通过跨模态协同适配与邻域互学习,在多模态GCD任务中达到最优性能。

04:00
arXiv cs.CV

OSOG:一种面向微光学环境的可微分、物理信息合成数据引擎

OSOG引擎可微分合成微光学数据,实现实时生成与零样本迁移。

04:00
arXiv cs.CV

半监督视觉-语言-动作模型

SemiVLA自蒸馏框架利用伪动作与可靠性控制器,在10%标注下提升VLA性能8个百分点。

04:00
arXiv cs.CV

原生空间管线在皮层下结构分割中优于模板空间管线

原生空间分割在皮层下结构中更准确,7T模型迁移至3T性能下降,合成数据改善有限。

04:00
arXiv cs.CV

ICRA 2026 GOOSE 2D细粒度语义分割挑战技术报告:探索基于查询的分割与增强空间上下文以理解室外场景

采用基于查询的Mask2Former架构和增大训练裁剪尺寸,结合测试时增强,mIoU达69.6%,有效提升室外细粒度分割。

04:00
arXiv cs.CV

EnTrust:为可信多模态医学图像分析建模模态间冲突

EnTrust将模态冲突作为不确定性源,实现高精度分割并降低40%校准误差,单模型性能超越5倍深度集成。

04:00
arXiv cs.CV

中文标题:将观测历史压缩到智能体记忆中:将Transformer蒸馏为循环Transformer

中文摘要:提出蒸馏方法,将全历史Transformer的压缩策略转移至循环Transformer,通过瓶颈表示监督记忆,缩小性能差距。

04:00
arXiv cs.CV

MIRCaps:用于细粒度视觉语言学习的大规模混合域数据集,包含图像级和区域级描述

涵盖141K图像及百万级层次描述,提升轻量VLM在图像描述和目标检测中的细粒度学习能力。

04:00
arXiv cs.CV

一种基于新型高拥挤课堂数据集的智能课堂行为分析框架

提出高拥挤课堂行为数据集HCCB和检测框架ODER-HSFNet,通过三项创新提升密集场景下的行为检测性能。

04:00
arXiv cs.CV

UnityShots: 基于记忆驱动的多镜头音视频生成与边界感知门控

提出UnityShots系统,利用边界感知门控与长短时记忆实现多镜头音视频连贯生成,性能超越开源基线,媲美最强闭源系统。

04:00
arXiv cs.CV

T-MOR:面向人体动作识别的运动感知骨架表征学习

T-MOR利用多模态对比学习从骨架学习动作表征,仅用轻量骨架推理,在多个基准上提升动作识别性能,且小样本和零样本泛化强。

04:00
arXiv cs.CV

径向基函数网络作为自监督学习中的投影头

用径向基函数网络替代MLP投影头,利用其参数派生无标签质量指标SNS,有效评估表示质量。

04:00
arXiv cs.CV

掩膜引导边界:面向弱纹理工业零件的少样本实例分割方法

提出Boundary-by-Mask框架,用SDF预测边界实现弱纹理工业零件少样本可靠分割。

04:00
arXiv cs.CV

φ-Scene:物理约束下的图像到3D场景重建

提出物理驱动方法,将场景重建视为拓扑驱动的物理组装,解决穿透和接触稳定性,实现物理合理的3D场景重建。

04:00
arXiv cs.CV

μMatch:电子显微镜中基于基础模型的半监督学习与域适应

提出μMatch框架,利用基础模型实现EM半监督学习和域适应,显著减少标注工作量。

04:00
arXiv cs.CV

面向doScenes指令驾驶挑战的DVDrive方法

提出DVDrive方法,通过分割视图感知模块减少跨视图干扰,提升指令条件轨迹预测精度。

04:00
arXiv cs.CV

无标注野生动物监测的跨模态验证

利用专家活动模式知识,实现视觉与声学管道及行为先验的三方一致性验证,无需人工标注。

04:00
arXiv cs.CV

CurvSegFlow:时间条件流匹配用于噪声生物医学图像中曲线结构的鲁棒分割

CurvSegFlow通过时间条件流匹配迭代细化噪声初始化,提升低信噪比下曲线结构的分割精度与连续性。

04:00
arXiv cs.CV

Chehre:基于表情符号提示的视频数据集,用于感知多样性的面部表情识别

Chehre数据集研究动态面部表情感知多样性,两大任务挑战大,最佳模型准确率仅32.5%。

04:00
arXiv cs.CV

分位数自适应温度缩放用于置信度校准

提出QaTS方法,通过分位数空间自适应调整温度,显著提升置信度校准,优于现有方法。

04:00
arXiv cs.CV

面向单域泛化的对抗性域提示调优与生成

首次用预训练文生图模型生成数据,提出渐进对抗提示调优框架,学习域不变与域特定提示,性能达最优。

04:00
arXiv cs.CV

超越平面标签:面向层级细粒度视觉分类的层级受限对比学习

提出层级受限对比学习,限制同级对比并组平衡,提升层次一致性与准确率,iNat21平均准确率提升30.47%。

04:00
arXiv cs.CV

从梯度裁剪到结构细化:改进用于医学图像分割的DPSGD

评估DPSGD变体在医学分割中的表现,提出结合裁剪与结构细化及自适应DP-Morph方法提升隐私保护下分割质量。

04:00
arXiv cs.CV

Motion-Aware Reinforcement Learning For Object Localization

04:00
arXiv cs.CV

RAPID:一种可复现的多智能体管道,用于基于卫星和街景图像的可解释灾害损害评估

RAPID多智能体管道无需微调,融合卫星与街景图像零样本评估灾害损害,准确率达0.92。

04:00
arXiv cs.CV

VT-DUDA:面向扩散引导无监督域适应的视觉令牌条件化

VT-DUDA利用视觉令牌提供实例级条件,改善扩散合成目标域数据,提升无监督域适应精度。

04:00
arXiv cs.CV

Enlight: 通过多目标优化和阴影感知精化实现快速低光照图像增强

ENLIGHT是一种零样本低光照增强框架,通过两阶段全局-局部优化(全局光照调整+阴影感知精化)实现快速、高质量增强,无需训练。

04:00
arXiv cs.CV

HPP:通过解耦感知与推理的分层程序化探测方法用于长视频理解

提出HPP框架,解耦感知与推理,通过迭代程序化探索分层视频,在长视频理解任务中取得显著提升。

04:00
arXiv cs.CV

离散标记空间中数据集蒸馏的结构评估:理解与指导

提出结构分数评估离散token组合,平衡组合提升蒸馏性能,高分数样本指导扩散型DD。

2026年6月19日
04:00
arXiv cs.CV

PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

提出PerceptionDLM,利用扩散语言模型并行解码,实现多区域同时感知,显著提升推理效率,并构建相应基准。

04:00
arXiv cs.CV

TeleMorpher:迈向鲁棒的同步运动-位置编辑

提出TeleMorpher框架,通过解耦主体与背景、姿态变形及运动先验注入,实现鲁棒的同步运动-位置编辑。

04:00
arXiv cs.CV

语言指令引导的视觉嵌入:实现可控与可泛化感知

LIVE以语言动态引导视觉编码生成任务嵌入,无需重训练,减少幻觉34%,泛化到未见任务。

04:00
arXiv cs.CV

GB-LSR:一种采用单一全局带宽的快速局部频谱图像表示,用于连续重建和超分辨率

GB-LSR用单一全局带宽的局部频谱表示,实现高效连续图像重建与超分辨率,性能优且速度快。

04:00
arXiv cs.CV

LEAP: 通过自适应进度实现层跳过效率的视觉Transformer蒸馏

LEAP提出自适应进度层跳过训练课程,加速ViT蒸馏收敛,ImageNet-100准确率90.1%,节省25%训练资源。

04:00
arXiv cs.CV

Mix-QVLA:任务证据感知的视觉-语言-动作模型混合精度量化

Mix-QVLA任务证据感知混合精度量化,低比特下成功率96.3%,内存4.1GB,推理加速1.52倍。

04:00
arXiv cs.CV

使用修正流变换器扩展胸部X光影像生成基础模型

首个十亿参数胸部X光生成基础模型,支持可控生成与编辑,图像逼真度临床专家无法区分。

04:00
arXiv cs.CV

ImageWAM:世界动作模型真的需要视频生成,还是只需图像编辑?

ImageWAM用图像编辑替代视频生成,大幅降低计算与延迟,性能超越基线,证明图像编辑是世界动作建模的有效替代方案。

04:00
arXiv cs.CV

LooseControlVideo:利用空间分块实现导演式视频控制

提出LooseControlVideo,使用稀疏定向3D盒子作为空间分块代理,实现多对象视频的直观导演控制,在轨迹误差、运动一致性等指标上显著优于现有方法。

04:00
arXiv cs.CV

学习何时去噪:优化潜在扩散的异步调度

提出学习异步调度方法,以极少额外计算提升扩散模型收敛速度与质量,用更少训练达到SOTA。

04:00
arXiv cs.CV

Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval

04:00
arXiv cs.CV

QueryGaussian:可扩展且无需训练的开放词汇3D实例检索

提出无需训练的查询框架,通过解耦语义与几何,降低内存70%,加速180倍,实现消费级硬件上的大规模3D实例检索。

04:00
arXiv cs.CV

无需训练的合成目标检测数据度量:检测器性能的代理指标

提出CCDM度量族预评估合成数据效用,Spearman相关达1.0,优于现有指标。

04:00
arXiv cs.CV

Vortex:面向智能视频检索的多模态融合系统

Vortex融合CLIP与SigLIP2,采用混合检索与反馈机制,实现高效视频检索,比赛获优秀成绩。

04:00
arXiv cs.CV

基于3D先验引导扩散模型的单次新颖视角与姿态人体图像合成

提出3D先验引导扩散模型,从单张图像合成新视角与姿态人体,解决遮挡部分,性能领先。

04:00
arXiv cs.CV

NEST:面向长视频理解的时间叙事事件结构

提出含1005部电影的多模态叙事事件数据集,事件发现<11%,关系抽取可达44% F1。

04:00
arXiv cs.CV

HypOProto:用于左心室充盈压分类的双曲序数原型

提出首个基于双曲序数原型的可解释LVFP分类框架,达到最优性能,保持透明度。

04:00
arXiv cs.CV

VFACamou:面向环境自适应物理规避的视图融合对抗伪装

提出端到端对抗伪装框架,融合UV渲染与扩散生成器,实现多视角光照下稳定物理攻击,保持自然外观。