10742 条条目 · 106 个活跃源
2026年9月28日
04:00
arXiv cs.CV

何处与何时强制:面向流式虚拟人的路由式强制

按语义区域与噪声阶段路由蒸馏,人物/高噪用DFD,嘴部/背景/低噪用DMD,提升动态多样性并保质量。

04:00
arXiv cs.CV

自监督感知可解释的单目深度估计

提出自监督框架PIMDE,分解图像为感知特征图并分支估计、融合,KITTI上兼顾精度与可解释性。

04:00
arXiv cs.CV

FARE:面向诱饵替换式图像生成器检测的取证接受域估计

提出FARE,利用生成器特有伪影构建接受域,仅凭单张图像即可检测部署时生成器被暗中替换,优于基线。

04:00
arXiv cs.CV

算力用在何处:面向高效视频扩散的异构注意力

提出HetA-DiT异构注意力,按token去噪难度自适应分配算力,仅约20%token走稠密注意力,兼顾质量与效率。

04:00
arXiv cs.CV

STORM-Bench:在演化且不完整证据下评估在线视频问答

STORM-Bench评测证据演化且不完整的在线视频问答;14个模型准确率最高60.3%,可靠性却仅5.7%–35.6%,普遍过度自信。

04:00
arXiv cs.CV

PhoenixSR:生成式异构蒸馏赋能高效真实世界超分辨率模型

PhoenixSR以生成式异构蒸馏迁移扩散先验至前馈超分网络,推理无扩散开销,多骨干感知提升、保真度保持。

04:00
arXiv cs.CV

FLIP:面向视觉-语言模型的最终层推理时探测

提出FLIP最终层推理时探针,验证VLM内部干预是否支持结构化任务计算,而非一般性扰动;属验证非引导。

04:00
arXiv cs.CV

PICO:面向六自由度手术器械位姿估计的投影信息引导一致性优化

端到端PICO预测分割、深度与位姿,用投影及点对点损失提升几何一致性,遮挡下旋转估计仍具竞争力。

04:00
arXiv cs.CV

利用空间结构进行全切片图像的转导式小样本分类

提出SlideTIM,结合空间-潜层正则与类别先验,改进全切片图像转导式小样本分类,宏F1显著提升。

04:00
arXiv cs.CV

TRACKGRAPH:基于图像空间跟踪的在线开放词汇3D场景图

TRACKGRAPH在图像空间跟踪2D掩码后融合为3D,实现在线开放词汇场景图,比OVI-MAP快1.7倍、省3.3倍显存。

04:00
arXiv cs.CV

利用条件随机场优化细胞学预测

提出CytoCRF,改进条件随机场并融合多骨干;细胞学数据集仅50标注即较零样本提升33.7个百分点

04:00
arXiv cs.CV

看见语义转变:差异感知的手语视频句子级时序分割

SignShift通过帧间差异建模和句数预测,实现纯视觉手语句子级分割,性能显著领先。

04:00
arXiv cs.CV

波段选择稳定性与语义分割性能:一项关于高光谱城市的研究

六种波段选择方法中,方法内稳定性因方法而异,与分割性能无一致关联;Top-K可媲美基线且推理更快,但性能不随K单调提升。

04:00
arXiv cs.CV

谁说了什么:音视频大语言模型中的符号化三模态绑定机制

揭示音视频LLM的符号化三模态绑定机制,失败主因视听错位;提出ASD提示,免训练提升多项基准。

04:00
arXiv cs.CV

面向交替曝光HDR视频的双流配准与金字塔融合

提出双流配准与金字塔融合框架,用光流和中点位移处理过曝,重建交替曝光HDR视频,性能超越现有方法。

04:00
arXiv cs.CV

DepthEvidence:统一多模态语言模型中的度量深度预测与几何推理

DepthEvidence以自预测度量深度为对象级证据,统一多模态语言模型中的度量深度预测与几何推理。

04:00
arXiv cs.CV

Pocket-STVG:面向时空视频定位的轻量级架构

提出Pocket-STVG轻量级级联架构,复用预训练组件,参数不足90M,支持弱监督与零样本时空视频定位,性能相当而成本更低。

04:00
arXiv cs.CV

ReG-SAM:面向二维基础血管分割的参考图驱动SAM

ReG-SAM利用参考图集的图提示与血管原型嵌入,提升SAM二维血管分割,在19个数据集上优于基线。

04:00
arXiv cs.CV

FedHisto-PAST:面向跨站点肺组织病理分类的参数高效染色感知联邦学习

以冻结病理基础模型加参数高效染色感知联邦学习,仅调1.25%参数,跨站点肺三分类宏F1达0.729。

04:00
arXiv cs.CV

HyperErase:面向文生图模型多概念擦除的尺度校准超网络

HyperErase通过尺度校准超网络按提示生成LoRA,解耦校正,实现多概念擦除且无需推理梯度更新。

04:00
arXiv cs.CV

TaskIR:基于退化自适应与任务反馈的任务驱动图像复原

TaskIR:两阶段任务驱动统一复原框架,融合退化自适应与任务反馈精修,提升多退化复原和下游性能。

04:00
arXiv cs.CV

DyMD:在少步视频世界模型中通过分布匹配蒸馏保持交互动态

DyMD通过自适应教师重噪与动态伪评分,将14B教师蒸馏为四步1.3B学生,提升交互动态及规划成功率。

04:00
arXiv cs.CV

用于新视角合成的光场基元

光场基元将稠密光线库压缩为可微基元,在4D光线空间直接优化实时渲染,支持抗锯齿、重聚焦、鱼眼与折射。

04:00
arXiv cs.CV

面向组合图像检索的保留与组合训练

提出PACT训练法,以源图像视觉证据补充目标字幕监督,无需目标图像,在四个零样本CIR基准上表现优异。

04:00
arXiv cs.CV

WeaveAgent:面向超高分辨率遥感影像的两阶段工具路由智能体

WeaveAgent两阶段解耦路由与感知,工具路由由0%升至80.75%,准确率达0.518。

04:00
arXiv cs.CV

高斯你所需:跨场景尺度的紧凑高斯泼溅

提出TangoGS,以拍摄信息定模型规模、用训练反馈控高斯增减,跨尺度实现质量与规模的最佳平衡,无需重调参。

04:00
arXiv cs.CV

多视图图像集中的几何不一致定位

提出DeformView数据集与DEFECt3R,实现宽基线多视图图像对几何不一致的像素级定位。

04:00
arXiv cs.CV

CytoSPM:基于结构化提示库的开放词汇细胞病理学检测

提出多领域细胞病理基准PentaCyto及两阶段检测器CytoSPM,实现高效开放词汇检测。

04:00
arXiv cs.CV

UniAR:多视角提示学习增强的统一自闭症识别框架

提出UniAR,以多粒度提示学习生成词句级诊断描述并与视觉对齐,在MRI与面部基准上超越SOTA。

04:00
arXiv cs.CV

MoTop:面向微动作单元检测的运动-拓扑模型

提出MoTop运动-拓扑模型,融合可学习运动上下文与面部关键点拓扑变化,线性外推增强微AU表征,CD6ME上达最优。

04:00
arXiv cs.CV

CG-HAF:面向智能体护肤支持中序数型痤疮严重度分级的可解释全局—局部皮损负荷融合框架

融合整体严重度概率与皮损负荷特征,可解释分类器提升痤疮序数分级,重症增益最大,跨数据集需对齐标准。

04:00
arXiv cs.CV

ClearGS:面向手持视频的可靠性感知高斯泼溅

提出ClearGS,用可靠性感知视图分配与渲染引导视频内修复,无需清晰参考即从手持视频重建高质量3D高斯泼溅。

04:00
arXiv cs.CV

开放词汇域遗忘

提出开放词汇域遗忘(OVDU),用Fisher掩码与目标流形散射实现类无关遗忘,4样本超8样本基线。

04:00
arXiv cs.CV

高光谱视频压缩的隐式神经表示

隐式神经表示用于高光谱视频压缩,逐帧传统法PSNR增4.99dB、码率降88.88%,提升目标跟踪。

04:00
arXiv cs.CV

从奖励信号到视觉效用:医学视觉语言模型后训练的受控审计

审计医学VLM后训练:准确率提升有限,视觉获益和图像敏感性反降,优化目标与有用视觉行为存在差距。

04:00
arXiv cs.CV

诊断视觉-语言模型组合性失败的来源:一项受控分析

COMPASS受控分析发现:VLM组合失败中整合成本仅部分,各技能受自身负载拖累,交叉负载多有益,属多因素。

04:00
arXiv cs.CV

KneePreM:面向三维膝关节MRI基础模型的大规模无标注预训练与标签高效微调

KneePreM为膝MRI三维自监督模型,经1.9万例无标注预训练,分类与分割的迁移性能及标签效率显著提升。

04:00
arXiv cs.CV

SatNav:基于卫星影像的可扩展长时程无人机视觉语言导航基准

提出基于卫星影像的可扩展长时程无人机视觉语言导航基准,涵盖18城11.8万回合,验证卫星到无人机迁移可行。

04:00
arXiv cs.CV

ContraFM-S2O:基于流匹配与对比学习的一步式SAR到光学图像翻译模型

提出ContraFM-S2O,以流匹配和对比学习实现一步SAR到光学图像翻译,细节更优、推理更快,达SOTA。

04:00
arXiv cs.CV

OpenVAM:基于视觉语言模型的开放世界视觉注意力建模

提出OpenVAM框架,解耦视觉定位与VLM语义解释,跨域预测显著图并生成what/why解释。

04:00
arXiv cs.CV

AxonSynth:面向光片显微镜零样本三维轴突分割的域随机化合成数据

AxonSynth以域随机化合成数据实现光片显微镜轴突零样本3D分割,无需真实标注。

04:00
arXiv cs.CV

针对CLIP中隐蔽嵌入空间后门的区域级黑盒防御

CLIPGuard通过分段嵌入扰动检测并语义修复可疑区域,黑盒防御CLIP嵌入空间后门。

04:00
arXiv cs.CV

INRs 能走多远?面向脑部 MRI 的跨域参数高效 INR 语义分割

探究INR脑MRI分割跨域表现:低参数下优势显著;提出分层架构HierINRSeg,Dice最多提升8.2个百分点。

04:00
arXiv cs.CV

面向可解释关键安全视野评估的结构化推理智能体框架

提出结构化推理智能体框架,以场景图与子准则验证分解CVS评估,实现可解释判读,mAP达68.1%。

04:00
arXiv cs.CV

OC-GS:面向不规则转台采集的高斯泼溅重建

OC-GS以共享运动模型联合优化图像几何与视角,显著提升稀疏不规则转台采集的重建质量。

04:00
arXiv cs.CV

GraphWrit3R:端到端三维场景图生成

GraphWrit3R以点云或高斯泼溅为输入,端到端输出JSON三维场景图,免真值标注,在3DSSG上达SOTA。

04:00
arXiv cs.CV

FreshLatent:面向资源受限具身VLM感知的信道感知潜空间适配

冻结VLM、仅训练轻量信道感知潜适配器,0 dB下分割精度显著提升,参数与能耗远低于重型编解码方案。

04:00
arXiv cs.CV

FuseReg:正则化层融合缓解表征自编码器中的重建-生成差距

FuseReg以随机编码器层子集训练正则化融合,单解码器适配多融合,缩小重建-生成差距,gFID降29%。

04:00
arXiv cs.CV

取证双生:面向AI生成图像取证的自监督残差学习

提出自监督残差学习框架,仅用真实图像训练,可零样本检测27种未见AI生成器,AUC达97.99%。

04:00
arXiv cs.CV

VkVIO:基于Vulkan的跨平台GPU加速视觉惯性里程计

首个基于Vulkan的跨平台GPU加速视觉惯性里程计VkVIO,多设备实时高精度,性能超越CUDA方案。