11301 条条目 · 106 个活跃源
2026年6月25日
04:00
arXiv cs.CV

OrthoTrack: 基于公开正射影像的连续六自由度无人机轨迹估计

利用公开正射影像与表面模型,无需训练,实时估计无人机连续六自由度绝对尺度轨迹,性能大幅领先。

04:00
arXiv cs.CV

异构与专长快照蒸馏用于3D语义分割

提出异构与专长快照知识蒸馏,以多模态教师和模型快照专家提升3D语义分割性能,无需额外代价。

04:00
arXiv cs.CV

多语言血液学视觉问答数据集

提出临床验证的英乌双语血液学VQA基准,含11万问答对,支持多语言医疗AI系统。

04:00
arXiv cs.CV

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

提出PQSG层次化评估流程,通过问题图检测视频物理违规,与人类判断相关性更高。

04:00
arXiv cs.CV

ESTANet:通过预测不一致性实现程序视频中的高效在线错误检测

基于预测不一致性,ESTANet轻量框架高效在线检测程序错误,实时且达SOTA。

04:00
arXiv cs.CV

利用线性时间状态空间蒸馏视觉基础模型的高效遥感实例分割

RS4D方法通过线性状态空间模型蒸馏视觉基础模型,实现遥感实例分割,参数量减8倍、计算量减9倍,精度相当。

04:00
arXiv cs.CV

REViT: 旋转反射等变卷积视觉Transformer

提出离散旋转反射群等变卷积注意力视觉Transformer,在图像分类中优于现有方法。

04:00
arXiv cs.CV

LEVIRDet:面向通用遥感目标检测的百万级159类别数据集与基础模型

最大遥感目标检测数据集LEVIRDet-159(159类256万框)及基础模型LEVIRDetNet,跨域泛化SOTA,9基准平均提升5.02 mAP。

04:00
arXiv cs.CV

V-Zero:用于细粒度视觉推理的无需答案标签的在线策略蒸馏与对比证据门控

V-Zero无需标注答案标签,通过对比证据门控进行在线策略蒸馏,显著提升细粒度视觉推理,训练速度比监督微调快5倍以上、比强化学习快10倍以上。

04:00
arXiv cs.CV

图像合成检测的极简预处理方法

基于梯度的高通滤波预处理法,低计算资源实现高精度图像合成检测,适合低端设备。

04:00
arXiv cs.CV

室内医疗监测摄像头的评估协议与验证

提出两种摄像头验证协议,评估五种设备,发现深度偏差和3D重建误差差异显著,为医疗监控选型提供指导。

04:00
arXiv cs.CV

KidRisk:儿童危险行为识别基准数据集

提出KidRisk数据集,含2500视频和1万图像,视觉语言模型识别危险行为准确率达96.14%。

04:00
arXiv cs.CV

HiFiVe:利用自回归二维生成先验的高保真车辆生成

提出HiFiVe框架,通过自回归纹理细化和3D几何约束,无需训练即可生成高保真车辆,显著提升几何与纹理质量。

04:00
arXiv cs.CV

状态空间模型遇见遥感:一项综述

本文综述状态空间模型在遥感中的应用,解决密集预测、多模态与时序数据挑战,为遥感研究提供基础参考。

04:00
arXiv cs.CV

发票干草堆:强视觉同质性下文档检索与视觉问答基准测试

提出Invoice Haystack基准,针对视觉同质文档检索难题,VL-RAG方法召回率提升13.5%。

04:00
arXiv cs.CV

PRISM:基于几何扭曲残差建模的前馈式单图像三维重建

PRISM提出前馈框架,分解多视角预测为几何先验和残差校正,推理仅36秒,重建质量媲美扩散方法。

04:00
arXiv cs.CV

用于逻辑视觉异常检测的超图正常世界模型

提出超图正常世界模型,通过超图统计检测逻辑异常,性能从0.8434提升至0.9279。

04:00
arXiv cs.CV

跟随你的轨迹:基于3D轨迹的精确骨骼动画控制

提出ACT框架,用骨骼与3D轨迹实现精确动画控制,路由轨迹注入器提升保真度和时间一致性,性能超越现有方法。

04:00
arXiv cs.CV

超越视觉鉴证:合成医学图像检测的多模态鲁棒性审计

发现VLM在图像-记录输入中因元数据改变致预测不一致,提出多模态鲁棒性审计基准。

04:00
arXiv cs.CV

教以致思:自我提升教师引导的竞争式推理

T2R框架通过对比监督与自我竞争机制优化CXR VQA推理,效果显著优于基线方法。

04:00
arXiv cs.CV

面向扩展空间中换脸的可迁移攻击

提出AIR攻击,结合重照明与加性扰动扩展攻击空间,无需替代模型即可高迁移性对抗换脸,性能最优。

04:00
arXiv cs.CV

解剖条件潜在扩散模型实现数据高效的少样本跨域3D胶质瘤MRI合成

提出ALDM,仅用16张目标图像生成高质量3D胶质瘤MRI,FID达85.40,AUC达0.987,优于GAN。

04:00
arXiv cs.CV

中文标题:胃镜视图合成:一个新的真实数据集与评估

中文摘要:首个真实胃镜NVS数据集GastroNVS,包含图像、位姿和点云,评估3DGS方法,为胃镜视野扩展和数字孪生提供基础。

04:00
arXiv cs.CV

路径追踪立体视觉中的跨视图方差相关性:合成训练数据中的一个隐藏捷径

路径追踪立体数据中方差场跨视图高度相关(ρ≈0.75),可作为匹配线索,构成模拟到现实的隐藏捷径。

04:00
arXiv cs.CV

EchoStyle: 利用反向数据合成解锁高保真视频风格化

提出EchoStyle框架,通过自动反向合成数据集V-Style20k和滑动窗口推理,实现任意长度视频的高保真风格化。

04:00
arXiv cs.CV

LinStereo:用于多尺度迭代立体匹配的线性复杂度全局注意力

LinStereo引入线性注意力与深度先验,在退化的水下场景实现SOTA,误差降低28%以上。

04:00
arXiv cs.CV

C3-Bench:一个上下文感知的变化描述基准

提出C3-Bench基准,评估32个模型,揭示变化描述中传统模型与先进LMMs的领域盲点。

04:00
arXiv cs.CV

TACO:面向视频识别中任务一致的开集词汇自适应

提出TACO框架,通过相对结构蒸馏与专业化投影,解决微调与评估目标不一致,实现最优开集视频识别。

04:00
arXiv cs.CV

Causal-rCM:面向流式视频生成与交互世界模型的统一教师强制与自强制自回归扩散蒸馏开放配方

提出Causal-rCM统一蒸馏框架,两步采样达SOTA VBench 84.63,实现流式视频生成,并支持交互世界模型。

04:00
arXiv cs.CV

C²RM-Seg: 基于结构-语义先验的因果反事实推理用于弱监督组织病理学组织分割

C²RM-Seg通过因果反事实推理与结构语义增强,消除CAM噪声伪标签,实现弱监督病理组织分割SOTA。

04:00
arXiv cs.CV

HG-Bench:面向自动作业评估的多页手写答案区域定位基准

提出HG-Bench基准,用于多页手写答案定位,揭示步骤级定位差距,提供微调参考。

04:00
arXiv cs.CV

PatchINR:基于块的隐式神经表示实现高效可扩展推理

提出基于块的INR方法,一次前向预测整块像素,在FPGA上实现硬件加速,推理延迟降低75%,PSNR达34.97 dB。

04:00
arXiv cs.CV

时空混合模态专家扩散框架用于从不完整MR序列合成定量DCE-MRI

ST-MoME条件扩散模型融合多模态特征,通过时空门控生成权重引导去噪,在脑肿瘤数据集上实现最优参数合成。

04:00
arXiv cs.CV

前沿图像生成模型的概念移除

提出替换瓶颈层为转码器的新方法,实现前沿扩散与自回归模型的概念移除,保持生成质量且鲁棒。

04:00
arXiv cs.CV

ScaleHP:度量空间中的手部姿态估计

ScaleHP利用手部骨骼比例先验,透视约束最小二乘法恢复度量坐标,实现SOTA手部姿态估计。

04:00
arXiv cs.CV

SAC$^2$-Net: 面向多模态微表情识别的语义锚定与互补协同融合网络

提出语义锚定与互补协同融合网络,通过语义锚定对齐和可靠性感知融合,在多模态微表情识别中达到最优性能。

04:00
arXiv cs.CV

FeVOS: 前瞻性表达视频目标分割

提出前瞻性表达视频目标分割任务,构建FeVOS数据集与FeVOS-R1模型,实现未来事件预测与最先进性能。

04:00
arXiv cs.CV

VPA-Guard:针对视觉提示攻击的图像到视频生成防御与基准测试

提出视觉提示攻击基准VVA-Bench及防御框架VPA-Guard,攻击成功率降低44.2%,危害评分降低73.4%。

04:00
arXiv cs.CV

H-Adapter:基于注意力推导与源对齐的头发掩膜实现姿态鲁棒发型迁移

H-Adapter通过区域解耦损失导出源对齐掩膜指导扩散修复,实现姿态鲁棒发型迁移,在姿态差异下指标最优。

04:00
arXiv cs.CV

Expresso-AI:基于视频的可解释深度学习抑郁诊断模型

提出可解释视频深度学习框架,通过面部区域和时间语义分析,提升抑郁诊断准确性与模型可解释性。

04:00
arXiv cs.CV

中文标题

提出疾病中心混合视觉编码VLP框架,结合CNN-ViT、疾病级对比学习和诊断提示,高效提升3D CT零样本诊断。

04:00
arXiv cs.CV

TensorLDM:一种面向稀疏DWI体素DTI重建的分量级潜在扩散模型

TensorLDM利用分量级潜在扩散与跨分量注意力,从稀疏DWI实现高精度物理有效张量重建,SPD违规率仅1.54%。

04:00
arXiv cs.CV

高效跨尺度可逆隐藏网络:空间-频率协作与非可逆机制

提出CrosInv,利用跨尺度空间-频率协作与非可逆机制增强非线性表示,实现高质量图像隐藏。

04:00
arXiv cs.CV

SSMNBench:基于单视图充分性与多视图必要性诊断图像跨视角人-物理解

SSMNBench揭示MLLMs依赖单图像语义平均,无法真正融合跨视图证据,暴露其分心退化与整合缺陷。

04:00
arXiv cs.CV

基于视觉语言模型的零样本噪声测试时适应的双重分布估计

提出双重分布估计框架,通过正负分布建模,零样本无训练提升噪声测试时适应性能,显著提高准确率并降低误检率。

04:00
arXiv cs.CV

Falcon:面向X射线组合推理的功能组装与语言

Falcon通过结构化安全状态表示实现X射线图像组合威胁推理,提升功能接地与连贯评估。

04:00
arXiv cs.CV

通过物理启发的全局-局部解耦实现高效真实世界去雾

提出PGL-Net,物理启发全局-局部解耦去雾,性能SOTA,Tiny变体PSNR提升2.6dB,延迟降10倍。

04:00
arXiv cs.CV

大脑看到了什么?多视角神经表征揭秘大脑-视觉对齐

提出多视角EEG表示学习,联合时间、频谱与空间结构,实现54.8% Top-1零样本视觉解码,达SOTA。

04:00
arXiv cs.CV

UniTeD:自动驾驶中联合感知与规划的统一时序扩散模型

UniTeD通过统一时序扩散联合感知与规划,双向迭代去噪与噪声条件训练提升鲁棒性,达多项基准最优。

04:00
arXiv cs.CV

基于全局与局部重建的点云扩散用于实例级3D异常检测

提出PCDiff框架,通过实例级多模态注意力生成弱缺陷,联合局部-全局重建提升检测精度。