11301 条条目 · 106 个活跃源
2026年6月10日
04:00
arXiv cs.CV

利用度量深度改进相对深度预测

利用大规模预训练模型的零样本度量深度能力,有效提升足球场景相对深度预测精度,取得2.68e-3评分。

04:00
arXiv cs.CV

ManiSplat: 基于解耦3D高斯泼溅的单目视频操控轨迹合成

提出ManiSplat框架,从单目视频重建解耦3D高斯数字孪生,实现高保真可控动态场景,支持机器人任务。

04:00
arXiv cs.CV

Envision4D:通过前馈4D高斯泼溅展望自动驾驶中的视觉未来

Envision4D提出全自监督前馈框架,通过预测未来姿态和条件运动提升,实现自动驾驶中无位姿的未来外推,性能领先。

04:00
arXiv cs.CV

ZODS-RS:面向遥感的零训练检测与分割

提出无需训练的遥感水平框检测与实例分割统一闭式流水线,有效处理旋转/尺度变化,提升小目标和拥挤场景性能。

04:00
arXiv cs.CV

向量地图作为语言:迈向统一的遥感矢量制图

提出VecLang范式,将多类矢量制图转化为结构化文本生成,实现跨类别统一表示与泛化。

04:00
arXiv cs.CV

别浪费SAM

微调SAM提升垃圾分割IoU达30+,接近最优性能,说明不应浪费其基础模型潜力。

04:00
arXiv cs.CV

使用YOLOv12模型验证生产线网络线缆(跳线)中线芯正确颜色顺序

基于YOLOv12模型检测网络线缆线芯颜色顺序,精度达98%,实时自动验证,减少人工错误,提升效率。

04:00
arXiv cs.CV

STEDiff: 在扩散模型中强化文本嵌入以提升文本到图像对齐

提出无训练方法STEDiff,通过增强[EOT]词元语义和空间约束损失,提升复杂提示下的语义一致性。

04:00
arXiv cs.CV

基于深度学习分析骨髓涂片的急性髓系白血病患者层面诊断

提出深度学习流程,利用16类细胞及CBLC分类实现急性髓系白血病诊断,外部验证F1达0.91。

04:00
arXiv cs.CV

DD-INR: 动态驱动隐式神经表示加速全脑功能性MRI重建

DD-INR通过分离静态背景与动态成分,聚焦动态变化的隐式神经表示,加速fMRI重建并提升激活模式恢复质量。

04:00
arXiv cs.CV

分析无训练的目标检测数据集损坏检测

免训练特征空间方法能可靠检测目标检测数据集的语义错误,但位置错误难以检测。

04:00
arXiv cs.CV

FadeMem:面向自回归视频扩散的距离感知记忆巩固

FadeMem通过距离感知机制分层缓存KV,近密远疏,固定预算下提升长视频连贯性与稳定性。

04:00
arXiv cs.CV

推进菲律宾木材识别技术:利用Xylorix平台高效开发与部署五种关键树种的AI模型

利用Xylorix平台,非编程专家成功开发五种菲律宾硬木AI识别模型,AUC最高1.000,四物种达AA级,适用于供应链检查点现场部署。

04:00
arXiv cs.CV

深度学习在回声测深数据中的应用

深度学习处理水下声学数据效果有限,需针对声学特性定制方法,且缺乏标准数据集与格式。

04:00
arXiv cs.CV

空间选择性自训练用于无监督建筑变化检测

提出SST-CD框架,用时空差异作伪标签,仅在可靠像素训练检测器,三数据集F1达83-92%,优于现有无监督方法。

04:00
arXiv cs.CV

第一人称手部检测的多模态RGB事件数据集

提出RGB合成事件数据方法,生成第一人称多模态手部检测集,性能近SOTA。

04:00
arXiv cs.CV

从瓦片到患者:数字病理学中图块到全切片性能可迁移性的研究

图块级线性探针可高效预测切片级性能,二者高度相关,能筛选候选模型,但最终仍需切片级验证。

04:00
arXiv cs.CV

SCAIL-2:通过端到端上下文条件统一受控角色动画

提出端到端角色动画框架,直接拼接驱动视频,构建MotionPair-60K数据集,用上下文掩码和偏好优化,显著优于现有方法。

04:00
arXiv cs.CV

HarmoView:协调多视角约束以实现身份一致视频生成

提出HarmoView框架,通过多级特征注入、代理令牌和跳转RoPE,结合渐进视角课程,实现高性能身份一致视频生成。

04:00
arXiv cs.CV

LIBERO-Occ:通过视角想象评估和改善场景遮挡下的视觉-语言-动作模型

提出LIBERO-Occ遮挡基准和视角想象(VIM)方法,生成互补视角提升VLA模型鲁棒性,无需额外摄像头。

04:00
arXiv cs.CV

基于施密特分解的高效量子图像编码方法

施密特分解低秩近似使FRQI编码电路深度减少97%,MSE约0.27,实现高效量子图像编码。

04:00
arXiv cs.CV

地球-全视觉:扩展遥感多模态大语言模型以支持更多传感器模态和任务

Earth-OneVision是2B参数的遥感多模态大模型,统一6类传感器与9类任务,通过三种机制实现跨模态融合,性能超越更大参数模型。

04:00
arXiv cs.CV

通过定制化概念嵌入改进前景条件外画的文本-实例对齐

提出CCE-Diffusion框架,定制概念嵌入并引入实例感知损失,有效减少前景条件外画中的伪影,提升图像质量。

04:00
arXiv cs.CV

听、看、学:通过SAM-Audio实现无遗忘学习

利用SAM-Audio视听先验,通过引导注意力和双层蒸馏缓解遗忘,在类增量学习中性能超越现有方法。

04:00
arXiv cs.CV

IPSM-Bench:锌基可吸收生物材料微观结构图像中的新型中间相分割基准

构建最大锌合金中间相分割数据集IPSM-Bench,提出融合空间上下文先验的SCoP-SAM方法,达SOTA并泛化良好。

04:00
arXiv cs.CV

PENet+:面向高效图像隐写分析的轻量级残差Transformer框架

PENet+通过分类器精简、激活感知HPF和MobileNetV2骨干,在几乎不损失精度下减少45.5%参数和97%FLOPs,实现高效隐写分析。

04:00
arXiv cs.CV

Pose-ICL:面向姿态可控主体定制的3D感知上下文学习

提出Pose-ICL免调优框架,融入3D感知上下文学习,通过表面锚定位置嵌入提升主体定制的姿态准确性与身份一致性。

04:00
arXiv cs.CV

首届PortraitCraft挑战赛:CVPR 2026研讨会肖像构成理解与生成竞赛

该挑战赛聚焦肖像构成理解与生成,设两个互补赛道,发布5万张带标注肖像数据集,推动美学分析与可控图像生成研究。

04:00
arXiv cs.CV

超越模型规模:通过训练微型模型探究视觉上下文学习中的差距

训练百万参数微型模型挑战大规模VICL,揭示任务编码、预训练及度量选择上的评估缺陷,亟需创新。

04:00
arXiv cs.CV

视觉上下文学习何去何从?跨领域和任务的统一基准

构建VIBE基准,评估6模型在14数据集12任务上的适应性,揭示局限与方向。

04:00
arXiv cs.CV

普及相机陷阱AI:面向英国哺乳动物检测的开源模型

发布开源YOLO26x模型,检测31类英国哺乳动物和鸟类,mAP达0.984,假阴性率0.17%,非商业许可面向生态学家。

04:00
arXiv cs.CV

AnimaSpark:一种用于驱动任意3D对象动画的前馈方法

提出AnimaSpark管线,利用2D子空间建模关节变换,从渲染图像生成视频并跟踪关键点,提升为3D动画。

04:00
arXiv cs.CV

数据记者智能体:将数据转化为可验证的多模态故事

Data2Story多智能体框架实现端到端数据新闻,通过证据锚定和多模态工具产出可验证的多媒体故事。

04:00
arXiv cs.CV

自适应放疗中剂量累积的不确定性估计框架:应用于宫颈癌CBCT引导放疗

提出IMPACT-DoseAcc框架,通过传播配准不确定性量化宫颈癌自适应放疗累积剂量变异。

04:00
arXiv cs.CV

世界奥林匹克:你的世界模型能否通过三项全能赛?

WorldOlympiad基准从物理、几何、交互三维度评估世界模型,揭示模型在物理推理、3D一致性及长程交互上的显著不足。

04:00
arXiv cs.CV

UniPET:一种面向不同剂量降低因子的高质量PET图像去噪通用网络

UniPET通过域泛化的风格对齐和区域感知学习,实现跨不同剂量因子的高质量PET去噪。

04:00
arXiv cs.CV

MOFA-VTON:虚拟试穿中的细粒度适应带来更多时尚可能性

提出MOFA-VTON,通过用户草图实现衣服细粒度调整,生成多样时尚试穿效果,超越现有方法。

04:00
arXiv cs.CV

均值流蒸馏:面向流匹配模型的鲁棒稳定蒸馏方法

提出均值流蒸馏框架,抑制高频优化噪声,保证轨迹一致性,实现高维流匹配模型高保真单步生成。

04:00
arXiv cs.CV

P3D-Bench:用于参数化3D生成与结构推理的多模态大语言模型基准测试

P3D-Bench评估MLLM参数化3D生成,发现装配最难,模型全局形状可但参数精度和部件建模不足。

04:00
arXiv cs.CV

IDEAL: 深度对齐实现离散表示自编码器

通过深浅层VFM特征联合对齐,提升离散视觉token保真度与语义,ImageNet重建rFID 0.61,生成gFID 1.89创SOTA。

04:00
arXiv cs.CV

U-TTT:通过测试时训练实现泛化性PET图像去噪

U-TTT利用测试时训练和双域自适应机制,动态调整参数,提升PET去噪在分布偏移下的泛化能力。

04:00
arXiv cs.CV

FADA: 通过选择性蒸馏的统一视觉-语言模型实现可及的胎儿超声解读与标注

FADA统一视觉-语言模型,通过选择性蒸馏实现胎儿超声解读、检测与分割,无需外部标签,可在消费GPU和手机部署,提升资源有限地区诊断可及性。

04:00
arXiv cs.CV

ARM:一种统一离散表示的自回归大型多模态模型

ARM通过离散语义分词器和强化学习,统一了图像理解、生成与编辑,实现跨任务协同提升。

04:00
arXiv cs.CV

连续神经重参数化作为鲁棒固定图表UV修复的深度几何先验

提出连续神经重参数化框架,结合多种几何先验,实现固定图表UV展开零翻转,鲁棒性优于传统方法。

04:00
arXiv cs.CV

Next Forcing:基于多块预测的因果世界建模

提出多块预测框架,加速训练收敛、提升高帧率精度,实现2倍推理加速,刷新多项基准。

04:00
arXiv cs.CV

论扩散编辑中的可控性与保真度前沿

研究扩散编辑中控制与保真度的权衡,提出理论界与算法,实验揭示身份漂移等失败模式,讨论伦理安全。

04:00
arXiv cs.CV

草图到布局:一种面向人的约束感知模块化光生物反应器计算合成代理

提出模块化光生物反应器立面系统,用草图驱动布局合成(约束满足)结合弱监督健康监测,实现近实时制造就绪配置。

04:00
arXiv cs.CV

SPARX:面向边缘RISC-V SoC的安全与隐私感知近似CNN加速

SPARX集成RISC-V指令扩展与近似CNN加速,ILM乘法器面积降51.7%、功耗降81.5%、吞吐提2.13倍,精度降2.82%,FPGA能效58.4 GOPS/W。

04:00
arXiv cs.CV

MinhwaNet:韩国民俗画中忠实但不足的对象定位

韩国民俗画中,对象定位虽忠实但不足以预测题材,题材由符号排列而非出现决定。

04:00
arXiv cs.CV

GHOST: 用于机器人操作泛化的分层子目标策略

GHOST通过分层子目标策略和空间接口,提升机器人操作泛化性,并利用人类演示快速适应新任务。