10772 条条目 · 106 个活跃源
2026年9月24日
04:00
arXiv cs.CV

从变化描述到变化检测:面向遥感变化检测的语义-外观一致性框架

变化描述引导遥感变化检测,语义-外观一致性框架融合语义与RGB差异定位变化,免人工掩码。

04:00
arXiv cs.CV

Diff-RF:基于退化感知学习的互增强图像配准与融合

提出退化感知互增强扩散框架,耦合配准融合与信息恢复,提升复杂退化下配准精度与融合质量。

04:00
arXiv cs.CV

ODPure:基于集成式损坏共识的目标检测后门净化

提出ODPure,以集成式损坏共识实现目标检测输入阶段黑盒后门净化,防御多种攻击并保持精度。

04:00
arXiv cs.CV

从对齐到融合:三维视觉语言

提出“先对齐后融合”框架,用成对余弦对齐和正交映射融合点云、体素、多视图特征,多项3D视觉语言任务性能提升。

04:00
arXiv cs.CV

中心偏倚会传播吗?病理基础模型在全切片图像分类中的鲁棒性

评估六种病理基础模型在全切片分类中的中心相关鲁棒性,提出AUCC;中心偏倚会传播,ComBat增益不一致。

04:00
arXiv cs.CV

EmbodiedMemory-Bench:面向长时程具身任务的具身记忆基准评测

提出EMem-Bench基准评估长时程具身记忆,并给出外部记忆系统与8B策略,模型记忆能力仍普遍薄弱。

04:00
arXiv cs.CV

两个全局裁剪足矣:定位DINO式自监督学习中的语义涌现

DINO式自监督学习的语义表征主要源于同一图像不同全局视图间的一致性对齐,掩码目标仅细化既有结构。

04:00
arXiv cs.CV

深度引导的对比学习:让2D表征具备3D空间感知

提出DGCL,用深度将3D邻近关系转为对比相似度,以相对距离比较注入空间感知,提升2D表征及下游任务。

04:00
arXiv cs.CV

遥感图像有向目标视觉定位的统一框架与数据集

提出遥感有向目标视觉定位统一框架O²-VG及数据集DIOR-R-RSVG,兼容判别与生成模型并提升性能。

04:00
arXiv cs.CV

从心电信号到用于生物特征识别的代表性形态热力图

提出代表性形态热力图表示ECG,在三个数据集上平均降低EER 9.59个百分点、提升Rank-1 24.69点。

04:00
arXiv cs.CV

冻结流会遗忘:诊断并恢复潜流世界模型中丢失的运动

冻结潜流世界模型虽稳定却丢失运动;DART以解码监督重训流,恢复运动并缩小差距,且发现像素误差奖励冻结预测。

04:00
arXiv cs.CV

RoomLight:面向室内环境的 2.5D 光照先验

提出面向室内环境的2.5D空间感知光照先验,联合建模HDR辐射与深度,提升光照恢复保真度。

04:00
arXiv cs.CV

基于注意力掩码、潜变量锚定与精修的零样本物体移除

提出免训练零样本物体移除框架,融合注意力掩码、反演、潜变量锚定与局部精修,有效移除并保持背景一致。

04:00
arXiv cs.CV

AnchorReasoning:面向长尾自动驾驶场景的视觉定位与因果推理数据集

41.6万帧视觉接地思维链数据集,以课程微调提升长尾自动驾驶定位推理与轨迹预测,且推理更快更省。

04:00
arXiv cs.CV

基于高分辨率深度与超低分辨率RGB的隐私保护语义分割

结合高分辨率深度与超低分辨率RGB,提出隐私保护语义分割与2D到3D融合,ScanNet领先且零样本迁移。

04:00
arXiv cs.CV

BronchoTop:基于纯RGB拓扑定位的支气管镜导航

仅用RGB支气管镜视频,无需CT或外部传感器,即可实时拓扑定位导航,真实数据精度提升超20%。

04:00
arXiv cs.CV

RAMP:面向边缘CPU视觉模型的鲁棒自适应混合精度量化

评测13种敏感度指标,JS散度零灾难失效,配合K-Means聚类实现近无损量化,平均加速1.81倍。

04:00
arXiv cs.CV

LightMIS:无需逐阶段解码器的超轻量级医学图像分割

提出无逐阶段解码器的超轻量医学图像分割网络LightMIS,仅0.131M参数,Dice达86.71%,可端侧部署。

04:00
arXiv cs.CV

高光谱基础模型用于高光谱解混的基准评测

系统评测高光谱基础模型解混性能,并比较特征上采样方法;简单上采样即可在四个数据集上达到领先效果。

04:00
arXiv cs.CV

基于双编码器Transformer的卫星辐射数据行星边界层高度估计

提出双编码器Transformer,以掩码输入实现全天候行星边界层高度估计,MAE达155.8米,优于全部八种基线。

04:00
arXiv cs.CV

MultiVENT-Raw:原始视频检索与推理基准

发布MultiVENT-Raw多语言基准,含近12万原始视频、130事件与222查询,支持检索和生成,基线显示仍具挑战。

04:00
arXiv cs.CV

过往塑造未来:面向自回归视频生成的记忆机制

系统综述自回归视频生成的记忆机制,从形式、功能、操作、学习与评估五方面梳理并展望挑战。

04:00
arXiv cs.CV

皮肤受限的Reinhard变换:亮度保持约束下的唯一性

提出皮肤受限Reinhard变换:保亮度匹配色度,参数唯一,实测优于传统匹配。

04:00
arXiv cs.CV

HaRP:通过双反向快门扫描实现高动态范围照片序列成像

提出双反向扫描方案,结合RSGR与反向RSGR视图,平衡动态范围,实现高动态场景的HDR照片序列重建。

04:00
arXiv cs.CV

论高维潜空间的可扩散性

微调重建编码器虽恢复细节却降低表征维度;改用x₀预测聚焦信号流形,可提升文生图生成性能。

04:00
arXiv cs.CV

生理信息引导的数字听诊用于长期护理机构居民肺炎检测

多通道数字听诊结合X线监督的卷积网络可辅助长期护理老人肺炎诊断,三通道即保持性能。

04:00
arXiv cs.CV

预测青少年特发性脊柱侧凸的进展

用Transformer结合DXA时序预测青少年特发性脊柱侧凸进展,合成训练、真实微调后准确。

04:00
arXiv cs.CV

激光跟踪仪辅助的移动机器人相机-机器人标定

提出激光跟踪仪辅助手眼标定法,链式连接多个标定靶,放宽机器人相机配置假设,通用性更强。

04:00
arXiv cs.CV

弯曲时钟:以提前预测战胜事件相机目标检测中的延迟

ChronoFuse用因果跨时间融合预测输出可用时刻的目标状态,仅增0.17M参数,基本消除延迟损失。

04:00
arXiv cs.CV

面向希腊传统音乐的姿态感知多模态自动标注

利用舞者姿态补充音频,希腊传统音乐多模态自动标注;三模态融合较最优音频基线宏ROC-AUC提升4个百分点。

04:00
arXiv cs.CV

ASAP:用于识别与分析AI生成图像中图像模式的视觉分析

ASAP是交互式可视化系统,用CLIP适配编码器定位关键像素,量化分析真假图像中的欺骗模式。

04:00
arXiv cs.CV

当视觉质量产生误导:渲染虚拟化身失真下的意图识别

研究通过受控实验发现,渲染3D虚拟化身视觉质量高不代表意图识别准确,失真导致质量与准确率脱节,需意图感知评估。

04:00
arXiv cs.CV

视觉语言模型能描述,却无法测量:面向机器人操作的物体中心场景理解

提出VLM驱动的模块化感知框架:单张RGB-D图像分割物体、VLM标注并融合深度构建物体中心表示;151个桌面场景实验显示定位与深度估计显著优于直接VLM推理,且可接入任务规划执行。

04:00
arXiv cs.CV

DAVIO:前馈初始化与位姿条件化建图的稠密单目惯性SLAM

DAVIO用单目惯性前馈初始化与位姿条件化稠密建图,实现实时度量SLAM,精度超越SOTA。

04:00
arXiv cs.CV

基于空间门控特征相关表示的车载毫米波旋转雷达位置识别

提出SGCA-Net,利用空间门控相关聚合提升旋转雷达位置识别,抗航向变化,优于SOTA并具泛化性。

04:00
arXiv cs.CV

面向多源遥感图像分类的语义引导融合网络

提出语义引导融合网络SGFNet,用语义混合卷积与频域调制融合缓解空间错位,提升多源遥感分类性能。

04:00
arXiv cs.CV

面向视觉-语言机器人操作少样本泛化的任务原型引导流匹配

提出TP-Flow少样本框架,将示范转为任务原型令牌引导流匹配,提升视觉语言机器人操作泛化与实时性。

04:00
arXiv cs.CV

基于下半框架的图像去噪

提出基于无限方向下半框架的盲图像去噪方法,用四方向差分协方差白化盲估噪声,结合维纳收缩与迭代重建。

04:00
arXiv cs.CV

局部SVD熵图作为全参考与无参考图像质量评估的互补结构表示

提出局部SVD熵图作为全参考/无参考IQA互补结构表示,与SSIM结合提升性能,无参考中也有效。

04:00
arXiv cs.CV

面向基于学习算法的递归不确定性门控图像配准

提出RUGI,用不确定性或残差门控迭代细化配准,聚焦难配区域;心脏MRI与超声精度提升,可增强VoxelMorph等预训练模型,MSE降27–37%。

2026年9月23日
04:00
arXiv cs.CV

用于活动性沙眼分类的DINOv2比较性能与参数高效适配

DINOv2微调主导活动性沙眼分类,ECA仅5参数即媲美大模型,最高准确率91.66%,其增益依赖训练目标。

04:00
arXiv cs.CV

MotionJEPA:通过在潜在空间中捕捉视觉变化防止时序特征坍缩

MotionJEPA提出DISReg正则化,预测时序差分嵌入以平衡动静特征,防止潜在表征坍缩。

04:00
arXiv cs.CV

重新思考扩散分割:何时依赖其噪声状态,扩散真的重要吗?

审计12种扩散分割法,发现状态依赖取决于监督路径;匹配纯图像基线常不逊色,扩散专有计算未必带来优势。

04:00
arXiv cs.CV

WebMRIQC:面向资源受限环境的可及性MRI图像质量评估的MRIQC网页版实现

开源网页平台WebMRIQC封装MRIQC引擎,零安装实现DICOM转BIDS与自动质控,13项指标验证与原生MRIQC等效。

04:00
arXiv cs.CV

DFD-Lab:模块化音视频深度伪造检测流水线

提出模块化音视频深伪检测流水线DFD-Lab,整合三种检测器与可配置实验流程;跨数据集检测困难,JPEG增强提升AUROC却降低准确率。

04:00
arXiv cs.CV

Colon3R:基于单目结肠镜视频的跨域三维重建

提出Colon3R跨域半监督框架,将标注体模及仿真数据的几何迁移至无标注在体结肠镜,重建更完整一致。

04:00
arXiv cs.CV

Video-STLayout 预训练

提出利用目标检测框的时空布局特征,通过对比学习对齐视频特征,提升复杂场景下的活动识别效果。

04:00
arXiv cs.CV

评估神经影像基础模型在非洲脑MRI上的泛化能力

非洲脑MRI测试中,四个神经影像基础模型冻结后仅输出多数类,端到端ViT3D最优(53.4%)。

04:00
arXiv cs.CV

InterHier:面向开放词汇目标检测的互联层次语义学习

提出以前置可学习上下文替代固定连接器,构建层次感知提示并对齐视觉文本嵌入,提升开放词汇目标检测性能。

04:00
arXiv cs.CV

U-PEN Mamba:面向高效视网膜血管分割的渐进扩展与选择性状态空间建模

提出U-PEN Mamba,融合渐进扩展与选择性状态空间建模,高效分割视网膜血管,mIoU领先。