11301 条条目 · 106 个活跃源
2026年6月19日
04:00
arXiv cs.CV

HilDA: 基于扩散的分层蒸馏技术推进自监督激光雷达预训练

提出HilDA框架,融合分层蒸馏与扩散,实现自监督LiDAR预训练,在3D检测等任务上达最优。

04:00
arXiv cs.CV

一次蒸馏,终身适应:探索数据集蒸馏在持续测试时适应中的应用

提出DO-ALL框架,用数据集蒸馏生成合成锚点,通过源回放等实现稳定持续适应,无需原始源数据。

04:00
arXiv cs.CV

使用角色-环境和谐视频生成模型的电影级合成

提出三掩码引导视频扩散框架,联合建模角色与环境双向交互,实现电影级动态视频合成。

04:00
arXiv cs.CV

DeepForestVisionV2:生态驱动分类扩展用于非洲热带森林相机陷阱监测

DeepForestVisionV2将分类从35类扩展到64类,适应垂直分层、开放场景等,准确率0.86,误报大幅减少,显著提升野外实用性。

04:00
arXiv cs.CV

PRISM:视频扩散模型中间状态中的偏好表示

PRISM利用视频扩散模型中间隐变量解码偏好,实现高准确度与鲁棒性,支持早期过滤提升效率。

04:00
arXiv cs.CV

BAFIS:评估现代文本到图像模型中职业偏见与人类偏好的数据集与框架

研究开发BAFIS平台评估五个主流模型,发现系统性偏见,强调人类偏好对公平模型的重要性。

04:00
arXiv cs.CV

单阶段分层纠正用于弱监督组织病理学分割

提出单阶段分层纠正框架,主动过滤浅层异常,直接生成高保真激活图,训练时间减少2-5倍,性能更优。

04:00
arXiv cs.CV

SPOT-E:面向冻结视觉语言模型的测试时熵塑形与视觉聚光灯方法

SPOT-E通过GRPO优化视觉聚光灯进行测试时熵塑形,增强冻结VLM的证据接地,提升性能与鲁棒性。

04:00
arXiv cs.CV

U²Mamba:一种用于显著性目标检测的双层嵌套U型结构Mamba

提出U²Mamba,采用双层嵌套U结构及分层训练监督,显著提升显著性目标检测性能。

04:00
arXiv cs.CV

CUPID:重建UV纹理图以实现可解释的重点人物深度伪造检测

CUPID利用UV纹理图与掩码自编码器重建,无需深度伪造样本,实现可解释且鲁棒高效的重点人物深度伪造检测。

04:00
arXiv cs.CV

GEN-Guard:纠正联邦手术AI部署中的泛化失败

提出GEN-Guard框架,通过CBE与DAD检测并修复性能泄漏,显著提升跨机构与零样本泛化能力。

04:00
arXiv cs.CV

CMDS-AD:跨模态双流解耦用于小样本异常检测

提出跨模态双流解耦框架,利用扩散模型低通滤波提取低频正常表征,1-shot下MVTec 3D-AD提升5.7%I-AUROC和2.0%AUPRO,达SOTA。

04:00
arXiv cs.CV

InfantFace:新生儿临床环境中的婴儿面部检测

提出YOLOv11m婴儿面部检测模型,域适应后AP50达0.96,但新生儿数据集匮乏制约进展。

04:00
arXiv cs.CV

HumanScale:自我中心人类视频在具身预训练中超越真实机器人数据

自我中心人类视频经精心处理后,在具身预训练中优于真实机器人数据,损失降24%,成功率提52.5%-90%。

04:00
arXiv cs.CV

无训练AI生成图像检测器有多脆弱?——分数方向、预处理与压缩的受控审计

审计发现无训练检测器:实现细节冒充方法差异,分数方向由超参数决定,数据集格式偏差夸大鲁棒性。

04:00
arXiv cs.CV

S-Agent: 空间工具使用激发空间智能推理

S-Agent通过时空证据积累与工具记忆机制,无训练提升VLM空间推理,微调后媲美顶尖模型。

04:00
arXiv cs.CV

FreeStyle: 从社区LoRA挖掘实现风格-内容双参照生成的自由控制

FreeStyle框架基于社区LoRA挖掘构建三元组数据,采用两阶段课程解耦机制,平衡风格对齐、内容保持与泄漏抑制。

04:00
arXiv cs.CV

基于几何感知的超像素图变换器结合元数据的皮肤病变分类

提出图学习框架,将病变建模为超像素图,融合几何与元数据,用边缘感知图变换器实现高精度分类。

04:00
arXiv cs.CV

面向冻结姿态流视频异常检测的可靠性感知原型校准

RPC后处理校准法利用原型偏差与可靠性门控,在八组数据集上平均提升AUROC 2.03个百分点。

04:00
arXiv cs.CV

PCFootprint:用于从机载LiDAR点云中提取矢量化建筑足迹的大规模数据集与基准

PCFootprint是首个大规模机载LiDAR建筑足迹数据集(33000瓦片),含跨域测试集与基准,揭示复杂环境挑战。

04:00
arXiv cs.CV

FlowBender:面向自纠正条件流的反馈感知训练

FlowBender利用推理时反馈误差训练自纠正策略,同时提升约束忠实度与生成合理性。

04:00
arXiv cs.CV

谱QK乘积权重引导用于无训练VLM幻觉缓解

提出QK乘积引导,抑制中间层主导奇异模式,无训练零代价降低VLM物体幻觉,CHAIRs降4%。

04:00
arXiv cs.CV

SARLO-80:全球斜距SAR语言光学数据集80厘米

构建了含119,566个三元组的高分辨率SAR-光学-文本数据集,覆盖72国,支持多模态对齐。

04:00
arXiv cs.CV

VisDom: 基于可见域约束的稀疏新视角合成

VisDom通过最小可见域约束,无需学习参数即改进稀疏新视角合成,实现高质量对象中心重建。

04:00
arXiv cs.CV

CalTennis:大规模多视角网球视频数据集与单目转3D姿态估计基准

CalTennis超1100万帧,为大10倍的多视角运动视频基准,发现深度与脚部接触估计不足,提出步法、稳定性新指标。

04:00
arXiv cs.CV

框式思维:让真实图像的3D编辑变得简单

利用3D框作为结构化规范,提供精确控制,通过深度对齐平面和两阶段训练,实现真实图像中大型3D编辑的突破。

04:00
arXiv cs.CV

SSD:空间投机解码加速自回归图像生成

利用2D空间相关性同时预测相邻与下方Token,加速自回归图像生成最高13.3倍,保持高保真度。

04:00
arXiv cs.CV

FID抽奖:量化生成模型评估中的隐藏随机性

实验发现重新训练比重新采样引起更大FID变化,建议报告多训练种子误差条,低于1.3%变异系数差距无定论。

04:00
arXiv cs.CV

当前世界模型缺少持久状态内核

现有世界模型在被观察时场景连续,但未被观察时事件停滞,缺乏内部状态持续演化能力,需将状态稳定性作为设计目标。

04:00
arXiv cs.CV

JanusMesh:通过跨空间去噪实现快速且零样本的3D视觉幻觉生成

提出跨空间去噪与视图条件纹理合成框架,3-5分钟生成高质量双语义3D幻觉,性能优于现有方法。

04:00
arXiv cs.CV

TimeProVe:先提出假设后验证——面向日常生活活动的长视频高效时序推理

提出TimeProVe框架,先轻量生成动作证据假设,再调用VLM验证,性能提升7.3%,成本降低93%。

04:00
arXiv cs.CV

UNIEGO:代理作为中介的统一第一人称视频表示学习

层次化多教师蒸馏框架UNIEGO,利用代理模型融合多视角多模态知识,选择性蒸馏实现第一人称视频表示最优。

04:00
arXiv cs.CV

3D场景图:开放挑战与未来方向

综述3D场景图的统一定义、建模、构建与应用评估,聚焦开放挑战与未来方向。

04:00
arXiv cs.CV

高效连接真实场景与合成数据生成:面向基于AI的认知机器人与计算机视觉应用

探讨AI视觉模型在认知机器人中的挑战,通过训练数据生成弥合模拟与现实的差距。

04:00
arXiv cs.CV

SAFE-Cascade:面向图表问答的成本自适应视觉-语言路由

SAFE-Cascade通过成本自适应路由,减少26.9%VLM调用和9.3%成本,准确率与全VLM基线持平。

04:00
arXiv cs.CV

面向端到端驾驶的自对弈规模扩展

提出大规模自对弈训练端到端驾驶模型,通过高吞吐量模拟器Gigapixel结合特权教师蒸馏实现像素级策略,适应真实世界数据达领先性能。

04:00
arXiv cs.CV

FrequencyFormer:面向频域视觉Transformer推理的传感器-处理器协同设计流水线

FrequencyFormer通过频域令牌化实现128倍压缩,通信能耗降230倍,总能耗降2.22倍,兼容ViT预训练模型。

04:00
arXiv cs.CV

世界引擎:迈向自动驾驶后训练时代

后训练合成高风险交互,可显著提升自动驾驶安全性并减少故障。

04:00
arXiv cs.CV

轮廓约束可变形配准用于头颈外科手术引导的特征参数分析

轮廓约束可变形配准将头颈手术标本配准误差降低49.41%,并揭示轮廓权重对横向变形组织主导作用。

04:00
arXiv cs.CV

全自我诊断(FSD):基于物理的视觉生物标志物推断——通过逆问题与算子学习从智能手机视频中实现

FSD框架从9秒手机人脸视频推断生理状态,集成物理模型与算子学习,实验MARD 29.86%,97.57%安全。

04:00
arXiv cs.CV

MMD-SLAM: 结构增强的多元高斯分布引导的视觉SLAM

MMD-SLAM利用Atlanta世界假设与多元高斯表示,通过点线融合与结构先验,实现跟踪与建图性能最佳,ATE降低48.56%,PSNR提高5.71%。

04:00
arXiv cs.CV

Tri-Info:基于信息理论的VLA模型可泛化可解释失败预测

Tri-Info基于信息论,可泛化可解释地检测VLA失败,跨域迁移无需重训,真实任务准确率83%

04:00
arXiv cs.CV

面向自主导航中注视引导的主动感知的快速人类注意力预测

提出GazeLNN模型,仅需0.61 GFLOPs,计算成本降99.40%,推理加速6倍,在无人机导航中实现人类注视引导的感知。

04:00
arXiv cs.CV

令牌是群元素:论矩阵李群上的李代数注意力

提出李代数注意力,令牌为矩阵李群元素,用相对位姿代数范数为分数,无需表示论,在仿射群上高效且参数更少。

04:00
arXiv cs.CV

CoMo:从互联网视频中学习连续潜运动以实现可扩展的机器人学习

CoMo从网络视频学习连续潜运动,运用早期时间差分和时序对比学习增强运动线索,生成伪动作标签,零样本泛化以提升机器人策略。

04:00
arXiv cs.CV

用于低光照场景下光场目标跟踪的角度-时间交互网络

提出对极平面结构图像表示与自监督角度-时间交互网络,在低光照光场目标跟踪中取得最优性能。

04:00
arXiv cs.CV

LaTtE-Flow: 逐层时间步专家流式Transformer

提出LaTtE-Flow,基于预训练VLM,采用逐层时间步专家流式架构,图像生成速度提升约6倍,同时保持强理解性能。

04:00
arXiv cs.CV

组合对象检索:通过组合表达式实现的对象级检索

提出对象级组合检索任务及数据集COR125K和端到端模型CORE,实现细粒度目标检索与定位。

04:00
arXiv cs.CV

多视图融合的层次互蒸馏:从所有可能的视图组合中学习

提出HMDMV方法,利用所有视图组合进行层次互蒸馏与不确定性加权融合,实现高精度分类,且推理灵活。

04:00
arXiv cs.CV

面向高质量3D生成的协同多模态编码

TriMM模型通过协同多模态编码和扩散模型,从少量多模态数据生成高质量3D内容,性能媲美大规模训练模型。