10822 条条目 · 106 个活跃源
2026年9月16日
04:00
arXiv cs.CV

哪种预训练任务更具可迁移性?肺超声自监督预训练目标

在相同骨干与协议下比较对比学习、掩码重建与JEPA,发现最优目标跨数据集迁移时排名反转。

04:00
arXiv cs.CV

VPRef:面向指代遥感图像分割的跨域基准

构建首个跨域指代遥感图像分割基准VPRef及SAM3-LoRA高效域适应基线,仅调1.08%参数。

04:00
arXiv cs.CV

用于预测视觉问答可回答性的视觉与文本Transformer

提出VT-Transformer,融合视觉与文本特征,将可回答性预测建模为回归任务,在VizWiz 2020上验证有效性。

04:00
arXiv cs.CV

Counterfactual Reasoning for Robust Visual Question Answering

04:00
arXiv cs.CV

高效文本到图像生成:面向扩散模型的自适应步数调度控制器

提出免训练自适应控制器,按提示复杂度动态调整步数,混合步长调度并依据误差切换,提速同时保持画质。

04:00
arXiv cs.CV

GraLoD:图形学启发的图像恢复连续细节层次学习

受图形学LOD渲染启发,提出即插即用框架GraLoD,将恢复尺度建模为空间可变、阶段依赖的连续变量,提升图像恢复效果。

04:00
arXiv cs.CV

FLAT:将图像与文本重采样为面向检索与生成的一维可变长度对齐跨模态Token

FLAT联合优化多模态编码器与生成解码器,把图文映射为一维变长对齐Token,单次预训练即兼顾检索与生成。

04:00
arXiv cs.CV

FRPSS:面向单图像生成的预形状空间特征重排

提出FRPSS,以预形状空间特征重排替代随机噪声,增强结构约束,提升单图像生成的结构对齐与多样性。

04:00
arXiv cs.CV

EgoPathBench:评估视觉语言模型的零样本第一人称路点决策

提出EgoPathBench第一人称路点决策基准,评测九款VLM最高仅28.3分,并发布训练资源。

04:00
arXiv cs.CV

G3AR:面向可扩展多序列航空影像配准的图引导神经视觉几何

G3AR以图引导分块和Sim(3)配准实现可扩展多序列航空影像神经几何,提升位姿精度与效率。

04:00
arXiv cs.CV

JewelTry:无掩码的尺度感知珠宝虚拟试戴

提出无掩码尺度感知框架JewelTry及基准JVTO-Bench,用尺度令牌实现精准尺度的珠宝虚拟试戴。

04:00
arXiv cs.CV

知识迁移参数可以学习吗?面向高效机器人视觉的 LePoKet

LePoKet将知识迁移参数与子网络联合优化,免蒸馏损失,在CIFAR与光流任务上显著降低误差。

04:00
arXiv cs.CV

弥合感知鸿沟:面向无参考图像质量评估的残差增强降采样与流形感知对齐适配

CMPA以流形感知对齐与残差增强降采样,恢复CLIP中被语义淹没的感知信号,显著提升NR-IQA。

04:00
arXiv cs.CV

SAVOR:基于置信度校准强化学习的自感知视觉定位,以缓解多模态幻觉

SAVOR通过置信度校准强化学习实现自感知视觉定位,不确定时回看图像,减少多模态幻觉且保持通用能力。

04:00
arXiv cs.CV

幻觉揭示了多模态推理的什么?——通过对比解码探针诊断视觉接地失败

提出免训练SAFE,对比视觉有据与消融路径,检测并惩罚无据token;发现视觉依赖衰减、幻觉成簇,早期干预可减少成簇。

04:00
arXiv cs.CV

ViD:面向大型视觉语言模型的视觉主导性别偏见缓解

提出 ViD,以视觉主导交叉注意力缓解大型视觉语言模型性别偏见,无需额外训练且提升公平性。

04:00
arXiv cs.CV

SAVTrack:面向可靠性感知点云跟踪的选择性投票聚合

SAVTrack通过选择性投票聚合,利用局部与运动上下文评估投票可靠性,剔除低置信假设,提升稀疏点云跟踪性能。

04:00
arXiv cs.CV

面向视觉状态空间对偶的通道级与令牌感知训练后量化

CTOAC按通道学习裁剪并令牌均衡重建,提升VSSD低比特量化精度,RTX4090加速1.42倍。

04:00
arXiv cs.CV

面向边缘视觉语言模型的高效量化感知蒸馏与跨模态对齐

统一框架联合蒸馏与量化,借助RGB引导的跨模态适配器缩小模态差距,提升边缘部署效率。

04:00
arXiv cs.CV

IMVS:基于测试时自适应的交互式医学体分割——标注放射学数据集的新方法

IMVS闭环框架:在线微调2D适配器、冻结3D跟踪器传播矫正掩码,标注效率提升14.4倍。

04:00
arXiv cs.CV

以病灶为中心的结肠镜检查三维建图:在公开基准视频上验证分层集成流程

四层流程在公开结肠镜视频中实现病灶定位、重访检测与局部三维重建,无需全结肠重建。

04:00
arXiv cs.CV

PriorPose:面向类别级物体位姿估计的参考引导联合变形与对齐

提出PriorPose,参考引导联合变形与对齐,显式保留类别先验,多项指标达最优。

04:00
arXiv cs.CV

基于条件整流流与优化采样策略的高效三维全身PET图像去噪

单次条件三维整流流框架结合优化采样,30秒重建全身PET,超低剂量去噪优于3D DDPM/DDIM

04:00
arXiv cs.CV

MEgoVista:面向野外场景的公制4D手部与头部多视角自我感知运动估计

MEgoVista 从单段第一视角视频重建公制双手与头部运动,统一于重力对齐世界坐标系,以标定双目定尺度,并经独立动捕评测。

04:00
arXiv cs.CV

MAETrack:释放预训练几何先验在3D单目标跟踪中的潜力

发现MAE浅层保留几何、深层特化于重建,提出浅层选择性初始化与几何残差门控的MAETrack,低开销超越微调基线。

04:00
arXiv cs.CV

HLC-GS:面向光学卫星影像DSM重建的风险图引导高度层一致性高斯泼溅方法

针对3DGS重建DSM时高度层混合致高程失真,提出风险图引导的高度层一致性高斯泼溅法HLC-GS,有效提升精度。

04:00
arXiv cs.CV

De-GAN——面向三维医学图像分割的动态参数调优GAN:迈向泛化的一步

提出DE-GAN:融合动态卷积、风格混合与坐标编码的增强GAN,生成自适应FLAIR提升脑肿瘤分割泛化性。

04:00
arXiv cs.CV

FSANet:用于图像分割的频率-空间感知网络

提出频率-空间感知网络FSANet,融合先验与双域求解,并发布SceneX数据集,提升分割鲁棒性。

04:00
arXiv cs.CV

统一语义先验与高频痕迹:以混合专家增强 V-JEPA 实现鲁棒的合成图像取证

提出 MoE-JEPA 双流架构,融合 V-JEPA 语义先验与高频噪声专家,SID-Set 准确率达 95.54%,刷新最优。

04:00
arXiv cs.CV

TEDi:面向手术器械分割的时序记忆增强与去噪Transformer

提出TEDi,以查询级记忆库检索历史帧特征,并用时序一致参考去噪,提升手术器械分割的稳定性与精度。

04:00
arXiv cs.CV

Hyper-RED:通过语义超图蒸馏实现可扩展的事件预训练

提出Hyper-RED,借超图对齐图像与事件token高阶语义,经关系蒸馏实现可扩展事件预训练。

04:00
arXiv cs.CV

PSMP-CLIP:面向基于CLIP的零样本异常检测的块提示SAM与多语义提示

PSMP-CLIP融合块提示SAM2分割与多语义提示正则,提升CLIP零样本异常检测,14数据集领先。

04:00
arXiv cs.CV

衡量手写天城文识别的标注效率:四种预训练机制的样本复杂度曲线

手写天城文识别中,合成预训练仅需81个标注词达CER0.50,随机初始化需355个,标注增益4.40倍,且随精度提高而减弱。

04:00
arXiv cs.CV

什么会破坏局部水印?局部不可见图像水印鲁棒性基准

首个局部水印鲁棒性基准,覆盖55种变换并评测五法,发现均存脆弱,几何错位和生成式编辑危害最大。

04:00
arXiv cs.CV

StackTok:基于预算自适应视觉令牌选择加速VLM推理

StackTok是免训练的视觉令牌选择器,以查询相关性为目标、视觉覆盖为预算校准支撑,自适应平衡二者,仅用5.6%令牌即保留95.26%性能。

04:00
arXiv cs.CV

RegRet:增强大型多模态模型的区域级检索

提出RegRet框架增强LMM区域级检索,兼顾全局性能,构建REGMB基准,实验显著提升。

04:00
arXiv cs.CV

TecoPrompt:面向视觉语言模型的时间保守提示学习

TecoPrompt:用时间稳定窗口与EMA置信门筛选最优传输伪标签,抑制确认偏差,提升鲁棒提示学习。

04:00
arXiv cs.CV

FAHCD-Net:面向鲁棒人脸关键点检测的频率自适应热图条件扩散网络

提出频率自适应热图条件扩散网络,结合平滑正则损失,抑制噪声,提升复杂场景人脸关键点检测鲁棒性。

04:00
arXiv cs.CV

面向实例分割的质心位置编码加速解码

优化CUDA解码算法,降低质心位置编码的解码开销与端到端延迟,优于CPU及朴素GPU实现。

04:00
arXiv cs.CV

NeuroSymbEAD:面向全向具身自动驾驶的大规模神经符号描述数据集

提出NeuroSymbEAD大规模神经符号描述数据集,基于KITTI-360构建自车中心知识图谱与多层级文本,服务交通场景理解及可解释自动驾驶。

04:00
arXiv cs.CV

SPEAR NeXT:面向光谱-时序地球表征学习的跨多时域因果潜在预测

SPEAR NeXT将时序自监督设为仅用历史观测预测多时域潜在地球状态,实现光谱时序表征学习。

04:00
arXiv cs.CV

TCNeRV:面向隐式神经视频压缩的双域时序上下文建模

TCNeRV在特征与嵌入双域利用重建上下文,约3M参数下PSNR达36.08dB,BD-rate较HM降低22.06%。

04:00
arXiv cs.CV

GRACE:几何与射线感知的相机高效多视角行人跟踪

GRACE融合体引导特征与射线条件化实现相机高效多视角跟踪,BTR仅用低置信检测续轨,双相机将MOTA升至91.07。

04:00
arXiv cs.CV

VOR-Bench:面向视频对象移除的人类感知驱动基准

提出VOR-Bench视频对象移除基准,含配对视频与掩码数据集、自动生成框架及VLM感知评分,评估与人类高度一致(ρ>0.9)。

04:00
arXiv cs.CV

NeuroTS-Net:多模态MRI中小儿脑肿瘤的多类语义分割

提出NeuroTS-Net三维编解码网络,多模态MRI小儿脑肿瘤多类分割,Dice达0.94/0.93。

04:00
arXiv cs.CV

面向纵向血管造影图像的时间一致性血管图提取与匹配

提出先匹配、后联合细化血管图的策略,缓解分割微小差异造成的图不一致,提升匹配面积且不碎片化。

04:00
arXiv cs.CV

面向嵌入向后兼容的多模态知识保持适配器

提出首个仅适配器方法,无需更新多模态大模型主干,通过多级保持损失维持嵌入几何,实现跨模态检索向后兼容且高效。

04:00
arXiv cs.CV

PiPS:面向可解释语义分割的事后原型解释

提出首个全事后原型解释法PiPS,为语义分割提供直观空间解释,无需改模型且不损原性能。

04:00
arXiv cs.CV

MedPCFM-TED:基于教师引导端点蒸馏的一步点云流匹配植入物生成

提出教师引导端点蒸馏TED,一步生成点云颅骨植入物,无需路径拉直,重建质量不降,0.04秒/样本。

04:00
arXiv cs.CV

超越分布内指标:先天性心脏病分割的系统性分布外评估

首个先心病分割分布外评估:分布内指标难反映跨队列鲁棒性,架构比预训练更关键,少量目标域标注即可提升。