11071 条条目 · 106 个活跃源
2026年8月10日
04:00
arXiv cs.CV

流校正形状优化:驯服高维3D模型中的流形漂移

提出优化器-校正器框架,交替梯度下降与流匹配校正,避免流形漂移,兼顾保真与高效

04:00
arXiv cs.CV

面向潜在生成的表示驱动内窥镜视觉嵌入对齐

提出最大内窥镜生成模型,利用领域预训练编码器对齐扩散特征,实现高质量生成与特征提取,性能媲美或超越现有模型。

04:00
arXiv cs.CV

通过玩“色相与线索”实现人类与AI的感知对齐

用“色相与线索”游戏评估视觉语言模型,发现抽象主观领域偏离人类,存在语义误分类与蓝色崩溃,精选数据更优。

04:00
arXiv cs.CV

基础模型适配用于多视角多模态心脏MRI分割与直接射血分数估计

微调组合CMR基础模型,多视角分割与LVEF回归效果好;LGE疤痕分割仍有挑战。

04:00
arXiv cs.CV

任意视频时间定位器的共形覆盖保证

校准非一致性得分,包装任意视频时间定位器,使输出区域以1-α概率覆盖真实时刻,有限样本保证。

04:00
arXiv cs.CV

SkySeaLand:宽幅卫星交通基准与超轻量检测基线

提出SkySeaLand:1307卫星图、19101框,评估12检测器,给出超轻量基线SkyDet。

04:00
arXiv cs.CV

EliSeg:报告驱动异常分割的可验证目标构建

无需预定义目标,通过生成-验证-修订框架从报告构建分割目标,有效抑制无关提及,性能优于现有方法。

04:00
arXiv cs.CV

H2AL:基于配准的小样本医学图像分割的双曲层次感知聚合学习

提出H2AL框架,利用双曲空间层次建模与梯度聚合,增强配准与分割的协同学习,提升伪标签质量。

04:00
arXiv cs.CV

相同的注意力,不同的真相:用Logit-Lens审视视觉注意力以检测和缓解LVLM物体幻觉

发现真实与幻觉物体注意力相同,用Logit-Lens解码可区分,归因于视觉不确定性和上下文先验,提出免训练检测-缓解框架,达SOTA。

04:00
arXiv cs.CV

GeoDistill-Refine:轮廓优先的几何蒸馏实现无标注航天器分割

提出GeoDistill-Refine两阶段框架,融合SAM3伪掩膜,先学轮廓再细化几何,显著提升航天器分割精度。

04:00
arXiv cs.CV

UniJEPA:面向任务无关视觉世界建模的统一联合嵌入预测架构

UniJEPA统一图像与视频预测,单损失即可训练,无需EMA,支持零样本规划,性能媲美任务专用模型。

04:00
arXiv cs.CV

面向视频世界模型的可寻址记忆

提出无训练记忆框架,用可寻址缓存压缩视频历史,分别提升时间一致性与场景回忆,并引入新基准评测。

04:00
arXiv cs.CV

我在视频中寻找你:面向人物中心视频推理的身份条件查询

提出身份条件查询任务与ISYV方案,构建基准与75K数据集,模型超越强基线、逼近闭源。

04:00
arXiv cs.CV

SimWAM:一种用于端到端自动驾驶的简单世界动作模型

SimWAM将视频生成仅作训练信号,协同训练视频与动作专家,推理时无需未来帧,性能超SOTA且延迟低。

04:00
arXiv cs.CV

用于兼容表示学习的λ-正交正则化

提出在仿射变换中引入λ-正交正则化,兼顾分布适应与保留原表示,实验证明保持零样本性能并确保模型更新兼容。

04:00
arXiv cs.CV

R2S-EGO:稀疏采集真实到仿真的双代理细化

R2S-EGO以双代理细化稀疏采集的真实到仿真,六视图PSNR19.06,成功率82.5%

04:00
arXiv cs.CV

MirrorWorld:驯服视频扩散模型生成镜面反射

提出MirrorWorld框架,用语义关系蒸馏和几何变换对齐生成镜面反射,效果优于基线。

04:00
arXiv cs.CV

DREAMS:参与和注意力心智状态的不同反应数据集

介绍DREAMS数据集,含32人面部视频,分析参与和注意力状态,发现多任务学习效果更优,且高参与注意力与低认知负荷及更好表现相关。

04:00
arXiv cs.CV

AtlasVLA:用于视觉-语言-动作模型的持久世界-自我状态建模

提出AtlasVLA双记忆架构,克服感知遗忘,仅凭腕部相机在长时程任务中超越多视角基线,成功率提升9.4%和17.5%。

04:00
arXiv cs.CV

TRACE:主动场景重建的遍历轨迹优化

将主动重建作为遍历覆盖问题,轨迹时空统计匹配信息分布,核遍历规划器优化,PSNR提升1.5dB。

04:00
arXiv cs.CV

SubtleTalk:基于残差流匹配的3D说话头可控弱相关面部动态生成

提出新框架,用多条件建模和残差流匹配生成自然可控的弱相关面部动态,并构建大规模数据集,提升真实感与多样性。

04:00
arXiv cs.CV

隐式神经散斑去噪

提出无训练框架,结合时空隐式神经表示与孔径感知最大似然,恢复动态无散斑图像,提升空间保真度与时间一致性。

04:00
arXiv cs.CV

前向预测够用吗?JEPA世界模型的物理状态锚定

提出物理状态锚定的PSG-JEPA,在预测外增加本体感知与关节角变化两个目标,提升辨识、规划与策略性能。

04:00
arXiv cs.CV

IceHorizon:冰覆盖海域地平线检测数据集及方法比较评估

针对冰覆盖海域地平线检测难题,比较六种算法,混合方法精度最高,船载图像优于无人机图像,数据集与代码已开源。

04:00
arXiv cs.CV

撒网!重访MasterFace冒充攻击

利用公开商业API,通过MasterFace将冒充率提升至标准FMR的9.5倍,并形式化为最大覆盖问题。

04:00
arXiv cs.CV

CAS2UML:用于类图和活动图的手绘草图转PlantUML数据集

发布557幅手绘UML图及PlantUML代码,含验证工具,支持草图转UML的可复现基准测试。

04:00
arXiv cs.CV

CADSpotting:大规模CAD图纸上的鲁棒全景符号定位

提出基于密集采样点与滑窗聚合的新方法,实现大规模建筑图纸全景符号定位,性能显著优于现有方法。

04:00
arXiv cs.CV

AutoIntervene:面向动作分块模仿学习策略的校准干预

AutoIntervene以视觉-动作支持记忆评估动作块,校准策略与操作者交接阈值,提升任务成功率并降低人工干预时间。

04:00
arXiv cs.CV

C2Dex:单目视频中接触一致的灵巧操作重建与重定向

C2Dex提出稳定物体接触表征,引导单目视频手物交互重建与灵巧手重定向,大幅超越基线,实物实验验证可行。

04:00
arXiv cs.CV

TEMPO:面向视觉-语言-动作模型的语义-动作解耦强化学习后训练

提出TEMPO框架,解耦VLA模型的语义与动作,分双速率强化学习,冻结视觉语言主干,提升操控任务表现。

04:00
arXiv cs.CV

基于深度学习图像分割与几何建模的零回波时间MRI自动测量结果与专家手动读数一致

深度学习分割与几何建模实现零回波时间磁共振自动测量髋关节撞击角度,多数角度与专家手动结果高度一致。

04:00
arXiv cs.CV

视觉地点识别模型是在识别地点还是条件?干扰增强评估与条件抑制

提出DAR评估视觉地点识别,发现模型常按条件而非地点匹配;抑制条件信息可提升抗干扰性,且不损召回。

04:00
arXiv cs.CV

驾驶视觉-语言-动作模型中规划令牌的逐层探测与剪枝

驾驶VLA逐层探测计划令牌:语义可早解码,轨迹兼容渐升;剪8/32层仅增5%误差,提速1.33倍。

04:00
arXiv cs.CV

Grad-ECLIP:基于梯度的CLIP视觉与文本解释方法

提出基于梯度的CLIP解释方法,生成视觉与文本热力图,优于现有方法,并用于微调。

04:00
arXiv cs.CV

UniREditBench:统一的基于推理的图像编辑基准

提出统一推理图像编辑基准,含2700样本、多模态双参考评估,并构建数据集提升编辑性能。

04:00
arXiv cs.CV

DA-Cal:面向语义分割的跨域校准

针对语义分割中跨域校准问题,提出新框架,以元温度网络与双层优化优化软伪标签,提升目标域校准与性能。

04:00
arXiv cs.CV

MotionStrata:用于紧凑视频自动编码的分层运动潜变量

MotionStrata将运动潜变量分层组织,分离全局与细节,经频率引导路由和粗到细训练,在不增维度下提升视频压缩重建质量,优于均匀表示。

04:00
arXiv cs.CV

PURe:面向视觉网络的即插即用乘积单元残差模块

提出即插即用的乘积单元残差模块PURe,在分类和CT分割中改善精度-参数权衡。

04:00
arXiv cs.CV

大语言模型驱动的符号图形编程

提出强化学习可验证奖励提升文本到SVG生成,媲美前沿模型,揭示符号图形编程的跨模态对齐价值。

04:00
arXiv cs.CV

Pathryoshka:通过多教师知识蒸馏与嵌套嵌入压缩病理基础模型

提出Pathryoshka多教师蒸馏框架,压缩病理基础模型86-92%且性能持平,优于同级单教师模型,便于本地部署。

04:00
arXiv cs.CV

Raster2Seq:用于平面图重建的多边形序列生成

Raster2Seq将平面图重建转为序列生成,用带标签多边形序列编码几何语义,自回归解码器借锚点聚焦图像区域,在多个基准达最优。

04:00
arXiv cs.CV

结合文本先验学习序数退化表示,用于基于扩散的盲图像超分辨率

提出OD-CLIP,借助文本先验建模连续退化程度,提升盲超分辨率的保真度和内容一致性。

04:00
arXiv cs.CV

通过引导视觉令牌注意力实现直接视觉定位

提出一种注意力损失,直接监督视觉令牌注意力,使答案令牌关注相关图像区域,显著提升多种视觉定位任务。

04:00
arXiv cs.CV

面向大型视觉-语言模型中任务感知令牌剪枝的解耦相似度

提出DeSAP方法,用解耦相似度与视觉显著性指导视觉令牌剪枝,大幅降低计算开销,保持性能,优于现有方法。

04:00
arXiv cs.CV

SparseVoxelDet:面向高效事件无人机检测的全稀疏体素网络

首个坐标稀疏3D事件体素目标检测器,全流程无稠密网格,反卷积融合避免支撑膨胀,稀疏性保精度且效率高,FRED上AP50达87.01。

04:00
arXiv cs.CV

在噪声层级标签下学习粗到细的骨关节炎表征

噪声下简单双头监督利用粗/细层级标签,改善骨关节炎表征,形成有序潜在结构与软骨对齐。

04:00
arXiv cs.CV

面向自动驾驶的轻量级视觉语言模型中的视觉概念探测

线性探针揭示VLM两类失败:感知失败(信息未编码)与认知失败(未对齐语言);距离增大降低线性可分性。

04:00
arXiv cs.CV

身份即在场:面向外观与声音个性化的联合音视频生成

提出身份即在场框架,实现多主体外观与声音联合生成,通过统一身份注入与多阶段训练提升音视频质量与一致性。

04:00
arXiv cs.CV

SciLT:科学图像领域下的长尾图像分类

提出SciLT框架,融合多层特征与双监督学习,在科学长尾图像分类中平衡头尾类性能,优于现有方法。

04:00
arXiv cs.CV

MILE:跨领域与模态持续语义分割的增量LoRA专家混合

MILE用LoRA专家增量学习新任务,原型门控选专家,防遗忘且高效可扩展。