11141 条条目 · 106 个活跃源
2026年7月27日
04:00
arXiv cs.CV

Oxygen-TryOn:面向任何商品的时尚原生基础虚拟试穿模型

Oxygen-TryOn是时尚原生基础模型,通过三阶段训练实现多物品高保真试穿,在多项基准领先。

04:00
arXiv cs.CV

闭环:自回归生成渲染的无训练重访一致性

利用3D引擎的时空对应修复自回归生成中的重访不一致,无需训练且性能更优。

04:00
arXiv cs.CV

风险路由隐式边界细化用于鲁棒超声图像分割

RIBR用隐式残差校正和边界正则化提升超声分割鲁棒性,在9个数据集上边界误差最小。

04:00
arXiv cs.CV

保持一致!利用一致性约束增强LVLM的鲁棒视觉推理

提出ConVBench基准及ConVLM方法,通过GRPO强化学习与一致性奖励,提升LVLM视觉推理的逻辑一致性和鲁棒准确率。

04:00
arXiv cs.CV

使用残差U-Net和文本提示SAM3精化从1米NAIP影像进行农田范围与可见边界制图

用ResUNet和文本提示SAM3精化,从1米NAIP影像制图农田范围与边界,测试精度高,有效处理复杂场景。

04:00
arXiv cs.CV

学习用于三维占用的自适应语义高斯分配

提出SAGFormer,通过评分选择高斯集,减少语义混合,增强体素支持,显式容量分配补充高斯优化。

04:00
arXiv cs.CV

中文标题:当照片列队包含来自大型图库的非匹配排名第一图像时,准确性会如何?

图库越大,目击者错误识别率及错误信心越高,质疑此类照片列队用于逮捕的合理性。

04:00
arXiv cs.CV

SCALE:先进节点下局部P&R DRV修复的自监督约束感知布局生成

SCALE自监督框架经布局生成与VLM微调,提升亚2nm局部DRV修复率12-25%。

04:00
arXiv cs.CV

重新思考基础模型时代下车辆重识别中的多分支与跨骨干融合

基础模型时代,改进单一骨干网络加重排序比多分支融合更有效。

04:00
arXiv cs.CV

扩散模型在医学图像修复中的应用:挑战、解决方案分类与未来方向

综述扩散模型在医学图像修复中的进展,分析架构与挑战,提出分类法,指出缺乏标准化基准等问题。

04:00
arXiv cs.CV

医学检查清单:评估多模态模型对医学图像的理解能力

Medical-Checklist通过二选一测试评估多模态模型对医学图像的理解,发现现有模型理解不足,临床应用前景遥远。

04:00
arXiv cs.CV

基于全景感知与视觉语言模型的低空信道多径预测

提出PanoLAMP框架,用视觉语言模型预测低空多径参数,性能优于基线方法。

04:00
arXiv cs.CV

TextSLIP:面向医学报告生成的文本自监督CLIP

通过文本自监督对比学习增强CLIP的语义监督,提升医学报告生成性能。

04:00
arXiv cs.CV

重新思考视觉基础模型自适应的逐层信息分配

提出提示信息瓶颈(PIB)框架,优化逐层信息分配,仅调优0.35%参数即达92%+精度。

04:00
arXiv cs.CV

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

04:00
arXiv cs.CV

EVL-MCoT:增强视觉-语言多链式思维用于有害模因检测

EVL-MCoT采用多链式思维与原型引导解码,增强视觉-文本对齐,提升有害模因检测性能。

04:00
arXiv cs.CV

小型视觉语言模型知错却难言:真实图像退化下言语置信与内部置信的双模型研究

小VLM知错但说不出口:内部概率比口头置信更可靠,但严重低光下两者均不可信。

04:00
arXiv cs.CV

一种面向同质结构弱边界分割的平滑相分离模型

提出基于Cahn-Hilliard方程的平滑相分离模型,集成softmax拟合与相场正则化,有效分割弱边界同质结构,精度与边界定位优于对比方法。

04:00
arXiv cs.CV

ReCowGnition:一个用于奶牛面部识别的现实生物特征基准

提出真实场景奶牛面部识别基准数据集,含6838张图像、161头奶牛,定义评估协议,提供六种模型结果。

04:00
arXiv cs.CV

CARDIAG:面向冠状动脉造影的深度学习架构密集段分类基准

发布CARDIAG基准,评估24种模型进行冠状动脉造影像素分类,最佳集成F1=0.479,强调高低分辨率特征。

04:00
arXiv cs.CV

缓解小样本类增量学习中的区域捷径

针对小样本类增量学习中模型因区域捷径误分类新类的问题,提出组合学习方法学习公共与判别基元集,有效缓解并提升准确性与可解释性。

04:00
arXiv cs.CV

InnoText:统一视觉文本生成与编辑模型

提出InnoText统一框架,通过字体尺寸感知、小字符增强等方法,实现高质量中英文文本生成与编辑。

04:00
arXiv cs.CV

CommandLM:自车行为层级的数据驱动描述器

CommandLM多模态大模型从传感器数据生成自车行为描述,CIDEr 0.67,人类评价58%准确合规,支持透明审计。

04:00
arXiv cs.CV

扩散模型中减少曝光偏差的频谱先验

提出频谱对齐(SPA)方法,校准功率谱减少曝光偏差,仅增3-4%开销,兼容CFG。

04:00
arXiv cs.CV

FAIR:面向AI生成虚假图像检测的特征增强隐式正则化

FAIR通过场景结构先验抑制纹理偏置,提升AI假图检测跨生成器泛化,精度提升8%,实现零样本鲁棒性。

04:00
arXiv cs.CV

使用多平台激光扫描的单木生长重建框架

提出多平台激光扫描单木生长重建框架,通过深度学习分割和生长模型实现胸径与材积准确估计,误差稳定。

04:00
arXiv cs.CV

GLI-AL:一个具有统一解剖-病灶标签的多模态胶质瘤MRI标签资源

提出BraTS-GLI Anatomy-Lesion资源,含1251个统一八类标签,扩展前景监督,提升共存病灶敏感度。

04:00
arXiv cs.CV

投影追踪CPCANet用于域泛化

PP-CPCANet利用投影追踪在Stiefel流形学习全局正交基,克服协方差秩亏,域泛化达SOTA。

04:00
arXiv cs.CV

LayoutLite:面向高效文档OCR的令牌级隐式布局分析

提出轻量模块LayoutLite,通过令牌级隐式布局分析去除低信息视觉令牌,降低推理成本,保持OCR质量。

04:00
arXiv cs.CV

面向视觉异常检测的深度卷积大间隔$\ell_p$-SVDD

提出DLM-SVDD,联合学习卷积特征与核决策边界,用大间隔$\ell_p$-SVDD优化,性能优于现有方法。

04:00
arXiv cs.CV

从水平集演化到阈值优化:一种用于图像分割的灰度水平集框架

本文证明长度项非必要,提出灰度水平集框架,将PDE演化转为阈值搜索,实现快速分割大规模退化图像。

04:00
arXiv cs.CV

基于新颖视图合成在混叠低纹理环境中从稀疏视图进行视觉重定位

提出结合多视图立体与LiDAR深度的3D高斯溅射重定位法,提升行星类似地形的单图6自由度位姿估计精度。

04:00
arXiv cs.CV

JustDepth:基于单扫描激光雷达监督的实时雷达-相机深度估计

JustDepth单阶段融合雷达和相机,仅用单扫描LiDAR训练,推理快39.7倍,条纹伪影减少66%。

04:00
arXiv cs.CV

基于深度学习的腹部CT肠梗阻检测与定位

提出多任务深度学习框架,同时检测肠梗阻并定位过渡区,准确率93%,定位命中率95%。

04:00
arXiv cs.CV

dRAE:基于超球面编码的表征自编码器

提出超球面量化(HSQ)解决度量不匹配,实现可扩展离散表征自编码器,码本利用率100%,词汇量达131k性能持续提升。

04:00
arXiv cs.CV

TRaM-VSR:面向一步扩散视频超分辨率的重要性感知令牌路由与合并

利用运动与语义评估令牌重要性,动态路由合并,在一步扩散VSR中加速推理并保持高质量与时间一致性。

04:00
arXiv cs.CV

AgentHOI:基于多智能体推理与隐式表示对齐的人-物交互视频生成

AgentHOI通过多智能体推理与隐式文本-运动对齐,无需显式运动输入即可从文本生成人-物交互视频,显著提升交互自然性和指令遵循。

04:00
arXiv cs.CV

先填后进:面向场景专用遥感多模态大模型的能力差距驱动后训练

提出FBA方法,先填补能力差距再场景专用化,后训练显著提升港口遥感任务性能。

04:00
arXiv cs.CV

SLIP:面向三维医学图像的低延迟交互式提示分割

SLIP框架解耦图像编码与交互推理,实现低延迟、可逆提示的3D医学图像交互分割,优于现有方法。

04:00
arXiv cs.CV

fMRI2Face: 全高清fMRI-视频数据集及几何引导的神经解码框架用于动态人脸重建

首个全高清fMRI-视频数据集结合几何引导框架,从脑活动重建动态人脸,显著提升保真度与一致性。

04:00
arXiv cs.CV

RadSight:迈向感知可靠的多模态放射影像理解

RadSight提出感知驱动模型,双编码器四阶段学习,在百万级基准六维度超越现有模型,证实低层视觉感知是可靠临床诊断关键。

04:00
arXiv cs.CV

几何2D场景图生成

提出基于Faster R-CNN和注意力图卷积网络的方法,不依赖语义数据,在小数据集上生成装配场景图。

04:00
arXiv cs.CV

SiPhy:单图像物理属性推理

SiPhy框架从单张RGB图像推理物理属性,结合视觉与语言知识,性能超越多视图方法,可用于物理理解数据标注。

04:00
arXiv cs.CV

通过强化数据选择的主动少样本分割

提出强化学习框架优化支持集选择,实现少样本医学图像分割的联合优化,提升分割性能。

04:00
arXiv cs.CV

IR275K:面向高效遥感的多帧红外超分辨率基准

提出红外多帧超分基准IR275K(594视频/27.5万帧),轻量模型CGMamba达33.19dB PSNR,证实2D旋转位置编码的关键作用。

04:00
arXiv cs.CV

时间反演成像:重建过去人类-环境交互的多模态基准与框架

提出时间反演成像,从热、紫外、可见光谱衰退痕迹重建过去交互,构建TRACE-HEI数据集,用多模态扩散模型方法验证可行性。

04:00
arXiv cs.CV

可变形三角形喷射:用于实时辐射场渲染的灵活基元

提出可变形三角形,用边缘控制点实现非凸形状表示,可微分渲染,性能优于现有方法。

04:00
arXiv cs.CV

扩散模型的感知相关性与保持高斯性的鲁棒潜在角度水印方法

提出LAW方法,将水印编码为潜在对的反点角度,保持高斯性并实现鲁棒嵌入。

04:00
arXiv cs.CV

Twins: 用焦点损失学习预测统一表示

Twins通过通道级联ViT和VAE特征形成统一连续token空间,并用焦点回归克服优化不平衡,显著提升生成质量。

04:00
arXiv cs.CV

CARA:面向可解释碰撞预测的概念感知风险注意力

CARA利用事故叙事提取风险概念,通过视觉语言对齐形成动态轨迹,实现可解释碰撞预测,提升准确性与预警及时性。