11221 条条目 · 106 个活跃源
2026年7月14日
04:00
arXiv cs.CV

ABot-N1:迈向通用视觉语言导航基础模型

提出解耦认知与控制的慢快架构,用像素锚点统一多任务,城市场景导航POI到达率提升35%。

04:00
arXiv cs.CV

垂直融合:压缩内部表示以实现鲁棒ViT分类

VFusion通过垂直聚合ViT内部层级特征,利用中间层冗余纠正最后一层错误,显著提升分类鲁棒性。

04:00
arXiv cs.CV

自监督自动抠图

SSMatte首次实现无需标注的自监督自动抠图,通过分解语义锚定与细节抠图,性能媲美全监督方法。

04:00
arXiv cs.CV

SynthDocBench:面向长上下文视觉文档理解的受控基准

提出合成基准SynthDocBench,系统控制多因素,揭示VLM在长文档中的长度退化、位置敏感性和图表理解崩溃三大失败模式。

04:00
arXiv cs.CV

TVT-PAPD:面向自监督全切片图像分类的病理感知原型蒸馏

提出TVT-PAPD,利用病理感知原型蒸馏学习WSI形态模式,在脑胶质瘤分类中达93%和90%加权F1,跨队列泛化好。

04:00
arXiv cs.CV

乳腺摄影基础模型在域偏移下的鲁棒性基准测试

多数据集评估发现乳腺摄影基础模型鲁棒性参差不齐,数据集级域外评估是关键。

04:00
arXiv cs.CV

物理启发的伪异常生成与原型特征引导的三维异常检测

提出PA3AD框架,通过物理启发生成伪异常和原型特征引导,有效学习分布偏移,实现领先的3D异常检测性能。

04:00
arXiv cs.CV

BOCCHI:基于MSDCT-UNet的更真实、更具挑战性的局部运动模糊检测基准

提出BOCCHI基准与MSDCT-UNet网络,克服梯度捷径,仅用633张训练图像实现跨数据集最优迁移。

04:00
arXiv cs.CV

无标注家具编码:编码内容与迁移能力

自监督FSQ点云编码可替代类别和姿态标注,训练目标控制旋转信号,迁移性因形状而异。

04:00
arXiv cs.CV

SPORT:面向不完整多视图聚类的结构感知原型解耦

提出SPORT框架,通过解耦原型共享与专有成分、结构感知对比学习及混合插补,提升不完整多视图聚类性能。

04:00
arXiv cs.CV

格拉斯曼喷溅 I: 用于动态场景渲染的移动秩2时空面元

提出格拉斯曼喷溅,用秩2面元实现闭合运动模型,训练速度最快,质量排名第二。

04:00
arXiv cs.CV

不是所有颜色类别都同样稳定:一项多语言自由颜色命名实验

多语言实验发现,绿色命名最稳定,黄色易被描述为金、棕色,红色居中,有助于感知颜色模型开发。

04:00
arXiv cs.CV

光流模型在现实世界的泛化性研究

研究揭示光流模型在现实世界泛化不足,合成基准无法准确预测真实表现,扩大训练数据无济于事。

04:00
arXiv cs.CV

走向自主且可审计的医学影像模型开发

AMID框架通过数据条件规划与验证优化,实现医学影像模型自主开发,性能接近人工方案。

04:00
arXiv cs.CV

NanoVSR:面向边缘设备的实时视频超分辨率

提出全卷积架构NanoVSR,利用结构重参数化兼容硬件,无需光流,在边缘设备实现实时高性能。

04:00
arXiv cs.CV

通过聚类截断提升自回归文本到图像生成中的样本多样性

提出基于聚类截断的熵截断采样策略,在保持图像质量和提示对齐前提下显著提升多样性。

04:00
arXiv cs.CV

领域为何重要:水下目标检测与标注质量的领域感知基准评估

通过领域感知框架,揭示领域因素对水下检测与标注质量的显著影响,指导数据收集与基准评估。

04:00
arXiv cs.CV

基于惩罚加权最小二乘和引导全变分的量子压缩感知CT重建算法

提出PWLS-GTV量子压缩感知CT算法,融合光子统计加权与引导全变分,稀疏视图下PSNR达36.64dB。

04:00
arXiv cs.CV

DiffUE:通过扩散自编码器增强不可学习示例的效用-不可学习性权衡

DiffUE将噪声注入语义空间,在保持图像质量的同时实现鲁棒不可学习性,有效抵抗高级再学习策略。

04:00
arXiv cs.CV

模拟天气条件下基于无人机的车辆再识别基准测试

模拟天气影响无人机车辆再识别,雨天影响大于雾天,AdaSP方法鲁棒性最强。

04:00
arXiv cs.CV

答案条件化思维链蒸馏:面向小VLM的少样本工业视觉

仅用18-30张图像微调小VLM,工业视觉任务平均提升1.7-4.4pp,超越GPT-4.1。

04:00
arXiv cs.CV

基于深度学习的端到端实时无人机人员检测框架

提出YOLOv8-nano框架,在16-25米高度实现高可靠性人员检测,帧率41-50FPS。

04:00
arXiv cs.CV

WasteAssistant:法规引导的智能垃圾分类与可持续管理视觉问答框架

提出法规引导的视觉问答框架,结合多模态模型,在21类垃圾分类数据集上BLEU达0.8291,提升分类准确率与合规性。

04:00
arXiv cs.CV

利用视觉语言模型计算两视频帧相似性并分组以检测异常帧,提取专家工人独特动作

提出基于视觉语言模型对比手册与专家视频帧相似性,检测异常帧提取专家隐性知识,提取率达66.9%。

04:00
arXiv cs.CV

视觉-语言模型中基于谱热流的保守令牌凝聚

SpecFlow用谱热流保守凝聚视觉令牌,无需训练,压缩88.9%令牌仍保留95.6%性能,实现高效准确平衡。

04:00
arXiv cs.CV

光谱一致流:一步式三维医学图像翻译

提出SC-Flow,利用光谱一致性校正器实现一步3D医学图像翻译,精准还原解剖细节并保持结构一致性。

04:00
arXiv cs.CV

标题:迈向高效弱监督语义分割:仅使用低倍镜组织病理图像

摘要:研究证明低倍镜病理图像在弱监督分割中可媲美高倍镜,并发现关键退化点,为高效存储设计提供指导。

04:00
arXiv cs.CV

使用对称注意力的水面倒影检测

利用非完美反射对称性,SAWRD-Net结合等变卷积与矩阵分解解码器检测水面反射轴,真阳性率0.890。

04:00
arXiv cs.CV

基于3D高斯三角化的增量式在线场景重建

直接三角化高斯表示,在线增量重建高保真网格,支持高质量渲染并降低长序列开销。

04:00
arXiv cs.CV

HyperBank:用于少样本球体显微镜分割的可微分经典先验库

HyperBank可微分经典算子库在少样本球体分割中与基础模型竞争,揭示经典视觉线索的有效性。

04:00
arXiv cs.CV

基于噪声残差聚类的有效合成图像检测

提出免训练方法,利用噪声残差聚类区分真实与合成图像,平均准确率82.2%,泛化能力强。

04:00
arXiv cs.CV

Traj-VLN: 通过自回归轨迹生成学习像素空间交互

在像素空间中通过自回归轨迹生成学习导航交互,微调视觉语言模型实现跨场景泛化,有限资源下达到最优性能。

04:00
arXiv cs.CV

TOLiD:通过令牌提升蒸馏弥合视觉基础模型到激光雷达预训练的架构差距

TOLiD将激光雷达点云特征转为视觉令牌,通过令牌级蒸馏弥合架构差距,实现高效自监督预训练。

04:00
arXiv cs.CV

RED-Sphere: 用于跨人群眼底疾病领域泛化的超球面残差边缘去偏方法

提出RED-Sphere框架,通过超球面残差边缘去偏与反事实正则化,消除外观捷径干扰,提升跨人群眼底疾病分类鲁棒性。

04:00
arXiv cs.CV

能量引导就是所需的一切?用于驾驶世界模型的免训练规范注入

免训练能量引导可操控驾驶世界模型轨迹,但视频未完全遵循,需跨流耦合实现端到端控制。

04:00
arXiv cs.CV

TriCons-Pose: 类别级物体姿态估计的三角形不变性几何一致性学习

提出三角形不变性几何一致性学习,通过稳定关键点检测和姿态不变聚合,实现鲁棒准确的类别级姿态估计。

04:00
arXiv cs.CV

利用温度采样和方差校正时间偏移实现扩散模型的多样性

提出方差校正时间偏移,使温度采样有效增加扩散模型多样性,无需重训且质量损失小。

04:00
arXiv cs.CV

检测AI生成视频:视觉-语言双视角综述

提出视觉-语言双视角分类法,将任务重定义为事实保真度验证,实现从痕迹匹配到语义验证的范式转变。

04:00
arXiv cs.CV

h-Flow:基于Doob h-变换的灵活流式图像编辑

提出h-Flow,利用Doob h-变换实现无需训练的流编辑,通过速度正交分解可控权衡源一致性与目标对齐。

04:00
arXiv cs.CV

大型视觉语言模型中的认知专家混合

提出认知分层推理框架,分解专家输出并追踪推理轨迹,提升感知能力,减少幻觉。

04:00
arXiv cs.CV

MAC-Splat:多属性一致性实现高保真稀疏视角重建

提出MAC-Splat,通过多属性一致性损失直接监督3D,解决稀疏视图几何伪影,显著提升重建保真度,PSNR提升超4.5dB。

04:00
arXiv cs.CV

中文标题:用于视频中复杂装配动作理解的组合上下文微调视觉语言模型

中文摘要:提出CCFT和LP-AT方法,分解动作元素微调视觉语言模型,在装配视频理解中优于基线。

04:00
arXiv cs.CV

对齐与分割:基于未对齐标签的无监督建筑分割方法

提出对齐与分割方法,同时学习标签对齐和分割,无需精确标签,实现高质量建筑分割。

04:00
arXiv cs.CV

3D-DefectBench:细粒度3D生成缺陷的视觉语言模型评估管道受控因子研究

提出3D-DefectBench基准,系统分析VLM缺陷检测管道,发现模型选择最关键,六视图RGB性价比高,但最优VLM仍不及人工标注。

04:00
arXiv cs.CV

OmniX: 通过前馈轨迹场实现任意视角与任意时间的4D重建

OmniX解耦动静态,用动态令牌生成轨迹场,实现任意视角/时间4D重建,性能达SOTA。

04:00
arXiv cs.CV

学习聚焦:解剖引导的注意力正则化用于医学图像分类

提出Locus框架,利用预训练分割模型引导分类器关注解剖区域,通过注意力正则化提升医学图像分类性能。

04:00
arXiv cs.CV

基于动作单元引导的微表情识别合成视频生成

提出EquiME合成微表情数据集,75K视频由AU引导生成,跨数据集性能优异。

04:00
arXiv cs.CV

Design Choices in Splitting-Based Self-Supervised Sparse-View CT Reconstruction

04:00
arXiv cs.CV

TreeSoc:面向足球视频理解的树结构动态推理与工具协同

TreeSoc采用树结构动态推理与工具协同,将视频问答转为层次搜索,在SoccerBench上三任务均达85%以上SOTA,跨域泛化至NExT-QA 74.16%。

04:00
arXiv cs.CV

X-GuideAR:一种减少透视引导过程中辐射暴露的增强现实框架

X-GuideAR增强现实框架通过合成X光预览减少62.3%透视次数,提升螺钉置入精度与骨包容,降低辐射暴露。