11281 条条目 · 106 个活跃源
2026年7月3日
04:00
arXiv cs.CV

基于多视角拍摄的大规模高质量3D高斯头部重建

提出HeadsUp方法,用编码器-解码器从多视角重建高质量3D高斯头部,在万级数据集上达到SOTA,泛化强且无需测试优化。

04:00
arXiv cs.CV

ROGLE:面向文本行人搜索的鲁棒全局-局部对齐与自动区域监督

ROGLE通过自动区域监督与多粒度学习,构建P-VLG基准,在长查询文本行人搜索中大幅超越现有方法。

04:00
arXiv cs.CV

FreeTimeGS++:动态高斯泼溅的奥秘与原理

揭示4DGS隐藏因素(时间分区、光度运动解耦),提出FreeTimeGS++提升稳定性与可重复性。

04:00
arXiv cs.CV

TriDE:用于全局相机位姿估计的三角形一致平移方向

TriDE利用三角形一致性验证信号,通过消息传递优化成对方向,显著提升方向精度和相机位置估计。

04:00
arXiv cs.CV

HIR-ALIGN:基于扩散数据生成的高光谱图像恢复增强

HIR-ALIGN利用扩散模型生成目标域合成数据,增强高光谱图像恢复,无需干净参考,性能优于现有无监督方法。

04:00
arXiv cs.CV

对抗图像扰动的拟态检测器

提出无需训练的拟态检测器,基于Corbino-Castillo算子,单次O(HW)检测,有效区分FGSM/PGD对抗扰动,对平滑扰动不敏感。

04:00
arXiv cs.CV

使用Clear2Fog管道的合成雾目标检测数据效率研究

C2F管道生成合成雾;混合密度雾75%数据达100%性能,节省25%数据;预训练+高学习率微调提1.17 mAP。

04:00
arXiv cs.CV

SOCO:视觉基础模型中的语义对象对应基准测试

SOCO基准含100类百万级对应点对,评估模型语义对应能力,揭示跨类别对应弱、语言定位优于视觉匹配的差距。

04:00
arXiv cs.CV

REALM:用于跨模态感知的RGB与事件对齐的潜在流形

REALM通过LoRA桥接RGB-事件模态差距,实现零样本跨模态感知,在深度估计、语义分割和特征匹配上达到SOTA。

04:00
arXiv cs.CV

分而治之:多模态世界模型的解耦表示对齐

提出M²-REPA,解耦多模态特征并与专家模型对齐,提升多模态视频生成的视觉质量和长期一致性。

04:00
arXiv cs.CV

PoseShield:用于人体自碰撞解决的神经碰撞场

提出PoseShield,在SMPL姿态空间构建神经碰撞场,利用Eikonal方程优化求解,高效解决人体自碰撞,成功率95.8%。

04:00
arXiv cs.CV

可解释性感知的视锥攻击:揭示基于LiDAR的3D目标检测器的结构性漏洞

提出EFA攻击,利用显著性图扰动关键视锥,以更少扰动使检测召回率降低超15%,揭露3D检测器结构性漏洞。

04:00
arXiv cs.CV

3D场景自适应轨迹可控人体图像动画与相机运动

提出场景自适应人体动画框架,利用地面自适应重定向和视角自适应融合,生成轨迹可控的人体与相机运动视频。

04:00
arXiv cs.CV

CWT增强的振动传感与基于YOLO的时频区域定位

提出CWT增强振动传感框架,利用YOLO检测CWT谱图局部时频区域,轴承故障监测mAP达99.5%,提升可解释性与鲁棒性。

04:00
arXiv cs.CV

基于卷帘快门图像的球形物体速度与自旋估计

利用卷帘快门畸变作为时间信息,单帧无对应估计球形物体3D平动和角速度,实现高速运动参数准确恢复。

04:00
arXiv cs.CV

平面SfM:通过单应图嵌入的相机位姿估计

提出利用平面约束的SfM框架,通过单应图嵌入和谱嵌入过滤不可靠边,实现鲁棒位姿估计,在平面和一般场景均表现优异。

04:00
arXiv cs.CV

多样性是多模态学习中不可避免且固有的挑战

多样性源于模态内在特性,是多模态学习的根本瓶颈,影响数据构建、训练和评估。

04:00
arXiv cs.CV

多模态深度转换模型中卒中结局预测的可解释性

结合统计与神经网络,利用Grad-CAM和Occlusion生成解释图,在卒中预测中达AUC 0.81,揭示年龄等关键因子及空间模式。

04:00
arXiv cs.CV

FLAT:揭示联邦学习中隐藏的潜在条件后门故障

FLAT揭示联邦学习后门审计中隐藏的多触发单目标失败模式,评估防御响应,强调目标级ASR报告必要性。

04:00
arXiv cs.CV

Concept Alignment Contrast and Long-Short Prompt Memory for Test-Time Adaptation of SAM3 in Medical Image Segmentation

04:00
arXiv cs.CV

使用密集具身思维链监督训练视觉-语言-动作模型

ZR-0模型通过密集具身思维链监督实现跨具身对齐,预训练于6千万帧数据,在单臂、双臂、人形等平台表现优异。

04:00
arXiv cs.CV

KAGE-Bench:面向强化学习的快速已知轴视觉泛化评估

提出KAGE-Bench,通过独立控制视觉轴评估RL泛化,发现背景与光度变化导致严重失败,且单一回报可能掩盖泛化问题。

04:00
arXiv cs.CV

QuadLink: 基于点关系学习的自回归四边主导网格生成

提出QuadLink框架,通过锚点预测和中心条件链接生成各向异性四边主导网格,提高几何保真度和拓扑质量。

04:00
arXiv cs.CV

规则视觉语言导航:通过语义推理与几何校正桥接感知与合规

针对VLN忽视规则问题,构建首个规则合规导航基准Rule-VLN,并提零样本SNRM模块,实现CVR降19.26%、TC升5.97%。

04:00
arXiv cs.CV

SlowBA:一种针对基于VLM的GUI代理的效率后门攻击

提出SlowBA后门攻击,利用触发器诱导长推理链,显著增加响应延迟而不影响准确率,揭示GUI代理被忽视的安全漏洞。

2026年7月2日
04:00
arXiv cs.CV

通过多尺度层注意力增强甲骨文识别

多尺度层注意力(MSLA)通过建模多尺度和跨层特征交互,显著提升甲骨文识别准确性与鲁棒性。

04:00
arXiv cs.CV

基于扩散共生信息交互的医学图像增强与分割联合方法

提出DiSIINet,基于扩散模型联合增强与分割,通过共生信息交互相互促进,显著提升多模态医学图像性能。

04:00
arXiv cs.CV

主动学习中相变的机制驱动理论

将预算阶段重定义为泛化机制主导转变,提出数据驱动、过渡、模型驱动三阶段,指导策略对齐。

04:00
arXiv cs.CV

协同感知-推理治理:通过可验证解剖证据锚定医学多模态大模型

提出无训练证据注入框架,利用ROI先验校准视觉与文本轨迹,提升医学MLLM准确性约6%,减少开放式幻觉约35%。

04:00
arXiv cs.CV

迷失在长尾:应对城市视觉地点识别中的地理不均衡

针对城市视觉地点识别中数据长尾导致的地域不平衡,提出DAPR框架均衡梯度贡献,在多个基准上提升性能。

04:00
arXiv cs.CV

PixelEyes:解耦感知与推理实现精确视觉证据搜索

PixelEyes通过解耦感知与推理,引入掩码引导搜索和语义区域广度优先搜索,消除冗余定位轨迹,提升多轮视觉推理效率。

04:00
arXiv cs.CV

快与慢分割:基于双路径处理的实时开放词汇视频实例分割

提出SegFS双流框架,将实例传播转为特征空间调节,轻量网络高效分割后续帧,延迟降低14倍且精度不减。

04:00
arXiv cs.CV

基于合成驱动的装配步骤识别视觉系统

用合成数据替代真实标注,1小时内完成装配监测模型训练,准确率92.4%。

04:00
arXiv cs.CV

分解、比较与决策:多模态大语言模型是隐式少样本学习器

提出DeCoDe技术,将少样本分类分解为成对图像比较,利用MLLM的logit评分,无需训练即达最优。

04:00
arXiv cs.CV

MG-SpaIR:面向无训练数据图像恢复的多级稀疏引导隐式表示

无训练数据恢复混合退化图像,多级稀疏隐式表示与粗到细残差优化,性能优于Deep Image Prior。

04:00
arXiv cs.CV

渐进式姿态引导的单目视频4D动物重建

提出渐进优化框架,利用3D高斯泼溅与姿态引导解耦变形,实现单视频高保真4D动物重建,泛化性强。

04:00
arXiv cs.CV

多假设测试时自适应以缓解欠指定问题

提出多假设粒子多样化框架,从多层次探索多个适应轨迹,缓解欠指定,提升TTA鲁棒性和稳定性。

04:00
arXiv cs.CV

DriftScope:衡量扩散模型适配的隐藏效应

扩散模型适配会系统性损害无关概念,聚合指标无法察觉;DriftScope工具通过软提示识别概念漂移,实现可解释审计。

04:00
arXiv cs.CV

PRISM-VO:使用光度光场集束调整的尺度感知视觉里程计

提出纯优化的稀疏光度光场视觉里程计,联合优化位姿与深度,实现精确尺度感知,无需初始化,性能领先。

04:00
arXiv cs.CV

窃取补丁尺寸:对抗性操控视觉语言模型

黑盒攻击通过合成网格与隐藏补丁对齐时精度周期下降,窃取VLM补丁尺寸和预处理配置,实现对抗操控。

04:00
arXiv cs.CV

VOCA: 具有编解码感知的视觉里程计

提出VOCA,利用视频编解码信息改进压缩流上的视觉里程计,实现高效高精度。

04:00
arXiv cs.CV

相信先验(或不):不确定性感知的腹主动脉瘤分割

提出不确定性门控与患者特定归一化,提升腹主动脉瘤分割泛化性与可解释性,达最优性能。

04:00
arXiv cs.CV

EgoSafetyBench:评估具身VLM作为运行时安全卫士的自我中心视频基准

EgoSafetyBench评估发现,VLM安全卫士易错过上下文危险,误导性文字使脆弱模型漏掉三分之一危险,鲁棒性多为虚假告警。

04:00
arXiv cs.CV

Does Your ViT Still Need U-Net for Segmentation?

04:00
arXiv cs.CV

Leveraging Phase Information to Boost Unrolled Network Learning for Image Deblurring

04:00
arXiv cs.CV

为触觉唤醒!MLLM中的掩码隔离触觉对齐学习

提出Splash框架,通过隔离休眠子空间选择性更新,实现非破坏性触觉扩展,保持视觉语言能力并达到最佳性能。

04:00
arXiv cs.CV

学习何时倾听:用于人体运动预测的门控情感融合

提出门控情感融合方法,面部情感仅在短中期(<30帧)有预测增益,长期仍依赖运动连续性。

04:00
arXiv cs.CV

DroneFINE: 面向无人机图像的视觉语言检测器的域感知参数高效微调

提出前景感知自适应和背景抑制机制,高效微调无人机图像检测器,性能媲美全微调且参数更少。

04:00
arXiv cs.CV

基于字体的单目距离估计方法

利用后车牌字符标准尺寸,通过单目摄像头测量字符高度估算车距,融合多种信息,误差小于0.13米。

04:00
arXiv cs.CV

CORGI:面向野外单张图像的一致性感知三维狗重建

提出CORGI框架,无需3D监督,从单张野外图像重建高保真可动画3D狗模型,利用CDOG、CA-3DGS和DCGR模块实现一致性感知,达SOTA。