11301 条条目 · 106 个活跃源
2026年6月12日
04:00
arXiv cs.CV

SemanticXR:面向对象级设备-云架构的低功耗实时可查询语义建图

首创设备-云对象级语义建图,低功耗实时查询,延迟降2.2倍,上行带宽<2.5Mbps,功耗仅增2%。

04:00
arXiv cs.CV

对视觉-语言-动作模型的轨迹级重定向攻击

提出命令保留的提示攻击,使VLA模型在看似正常指令下将机器人轨迹重定向至攻击者目标,暴露轨迹级漏洞。

04:00
arXiv cs.CV

ViPER:基于视觉的打包感知编码器用于稳健的恶意软件检测

ViPER通过打包感知门控和联合学习,实现稳健恶意软件检测,AUC达0.926。

04:00
arXiv cs.CV

用于鲁棒分类的分布损失

提出双模态高斯分布损失,隐式处理类模糊性,增强决策边界鲁棒性,低数据场景提升显著。

04:00
arXiv cs.CV

比较商用深度传感器在医疗应用中的精度

四种深度传感器在猪骨、猪肚和硅胶肾模型上测试,Zivid 2M+ 60精度最佳,ZED在真实组织上排名第二,但在模型上最差。

04:00
arXiv cs.CV

ReFoCUS:强化引导的帧优化以实现上下文理解

首个将强化学习用于视频LLM帧选择的框架,无需显式监督,自动学习最优帧组合以提升视频问答推理精度。

04:00
arXiv cs.CV

SPARC:大规模机器人演示中的可靠空间标注

SPARC利用时空结构自动生成可靠空间标注并评估可靠性,减少噪声,在物体定位基准上最优且保留更多样本。

04:00
arXiv cs.CV

使用杰弗里引导实现扩散模型的更通用控制

提出Jeffrey引导框架,扩展扩散模型控制,通过条件规则更新分布,显著降低FID并应用于公平性。

04:00
arXiv cs.CV

Mana: 铰接工具的灵巧操作

提出Mana框架,将灵巧操作视为动画问题,自动生成数据,实现零样本模拟到现实迁移。

04:00
arXiv cs.CV

逐步偏好优化驱动的多模态智能体迭代工具探索

无需人工数据,通过逐步偏好优化使多模态智能体自主优化工具使用策略,性能提升6.41%和3.64%。

04:00
arXiv cs.CV

Radar-Guided Polynomial Fitting for Metric Depth Estimation

04:00
arXiv cs.CV

水下场景的视觉增强与三维表示:综述

综述水下视觉增强与3D重建,涵盖物理模型、从传统方法到NeRF/3D高斯泼溅等技术,评估算法并指出未来方向。

04:00
arXiv cs.CV

面向神经模型编辑的强化学习

用强化学习编辑神经模型,通过奖励反馈学习策略,在遗忘和偏见任务上保持高保留率、低遗忘率。

04:00
arXiv cs.CV

VideoMDM:基于2D监督的3D人体运动生成

VideoMDM从2D姿态直接训练3D运动先验,无需3D真值,效果接近全3D监督,生成运动更受人类偏好。

04:00
arXiv cs.CV

NavWAM:面向目标条件视觉导航的导航世界动作模型

NavWAM将世界模型预测转化为可执行动作,通过联合学习未来预测与动作值,实现直接闭环控制,优于规划基线。

04:00
arXiv cs.CV

视觉与视觉-语言应用中模态感知的特征匹配:综合综述

全面回顾多模态特征匹配,涵盖传统与深度方法,强调跨模态适应性提升。

04:00
arXiv cs.CV

CPAM:面向零样本真实图像编辑的上下文保持自适应操控

提出CPAM零样本框架,通过保存适应与局部提取模块,实现复杂非刚性图像编辑,保持纹理身份,优于现有方法。

04:00
arXiv cs.CV

QueryOcc:基于查询的三维语义占用自监督方法

QueryOcc提出4D时空查询自监督学习连续3D语义占用,引入收缩场景表示,性能提升26%,速度11.6 FPS。

04:00
arXiv cs.CV

从看到体验:用强化学习扩展导航基础模型

提出S2E框架,结合离线视频预训练与模拟强化学习,提升导航模型的交互性与安全性,并构建了评估基准。

04:00
arXiv cs.CV

Periodic-MAE: 面向rPPG估计的周期性视频掩码自编码器

提出Periodic-MAE自监督框架,通过周期感知掩码和生理频带约束学习通用rPPG表示,显著提升跨数据集和真实场景性能。

04:00
arXiv cs.CV

ShowFlow:从稳健单概念到无额外条件多概念生成

ShowFlow提出KronA-WED适配器与语义注意正则化,实现稳健单概念生成,并扩展至无需额外条件的多概念生成。

04:00
arXiv cs.CV

骨架稀疏化与密集化尺度空间

提出骨架稀疏化与密集化尺度空间,实现形状层次简化,用于鲁棒骨架化、压缩和增材制造。

04:00
arXiv cs.CV

GAE:可泛化动作专家释放视觉语言模型的物理潜能

GAE将高层稀疏规划转化为机器人连续动作,通过大规摸预训练与轻量微调实现强泛化。

04:00
arXiv cs.CV

基于投票与排序的自我进化视觉-语言模型用于图像质量评估

EvoQuality使视觉语言模型通过自生成伪标签与迭代优化,无需标注即可在图像质量评估中提升31.8%性能,甚至超越监督模型。

04:00
arXiv cs.CV

Proto-LeakNet:面向合成人脸图像中信号泄露感知的归因方法

利用扩散模型信号泄露实现可解释归因,闭合与开放集均达SOTA,宏AUC 98.13%。

04:00
arXiv cs.CV

用大型多模态模型导航千兆像素病理图像

GIANT无需训练,让通用多模态模型自主导航WSI,迭代选多倍率区域聚合证据,在MultiPathQA四个基准达SOTA。

04:00
arXiv cs.CV

龟裂纹的魅力:一种基于变分生成模型的绘画裂纹检测方法

提出混合方法,将裂纹检测建模为逆问题,用生成模型和变分函数分解图像,获得像素级裂纹定位图。

04:00
arXiv cs.CV

仅使用后处理技术改进预训练的成人胶质瘤分割模型

提出自适应后处理技术,在BraTS 2025挑战中提升分割指标14.9%和0.9%,推动可持续高效策略。

04:00
arXiv cs.CV

EyeTheia:一个轻量级且易于使用的眼动追踪工具包

基于网络摄像头的轻量开源眼动追踪工具箱,实时视线估计,用户微调降低误差,适用低成本实验与临床研究。

04:00
arXiv cs.CV

为何商用WiFi传感器在多人步态识别中失效:基于ESP32的系统分析

基于ESP32实验,多人步态识别准确率仅39%-56%,传感质量是主因,商用WiFi CSI不具实用性。

04:00
arXiv cs.CV

VDE Bench:评估图像编辑模型修改视觉文档的能力

首个双语密集文本视觉文档编辑基准VDE Bench,含942样本及OCR级评估,人工验证一致。

04:00
arXiv cs.CV

LatentLens:揭示LLM中高度可解释的视觉标记

LatentLens通过最近邻比较将视觉标记映射为自然语言描述,发现多数视觉标记在各层可解释,且描述语义更丰富。

04:00
arXiv cs.CV

Ex-Omni:为全模态大语言模型实现3D面部动画生成

Ex-Omni开源模型解耦语义推理与时间生成,实现语音伴随3D面部动画,提升视听同步与效率。

04:00
arXiv cs.CV

可适应多种脑肿瘤的分割流程,结合放射组学引导的亚型分类与病灶级模型集成

提出灵活模块化分割流程,利用放射组学引导亚型分类和病灶级模型集成,在多种肿瘤数据集上取得高性能。

04:00
arXiv cs.CV

测量可塑性:面向视觉语言模型的传感器级自适应

提出MVP,将相机曝光参数作为物理提示,多视角选择与硬投票实现测试时自适应,无需梯度,性能更优。

2026年6月11日
04:00
arXiv cs.CV

EventRadar:通过时空事件传感实现远距离视觉无人机探测

利用螺旋桨时域周期性,结合事件相机与SAGE/CHG算法,实现700-1500米无人机高精度探测。

04:00
arXiv cs.CV

NSVQ:通过稳定向量量化中的编码器漂移来缓解码本崩溃

NSVQ采用非平稳嵌入损失、码本替换和分阶段编码器冻结,缓解码本崩溃并提升重建质量,保持100%码本利用率。

04:00
arXiv cs.CV

LAST:通过Gromov-Wasserstein对齐连接视觉-语言与动作流形

LAST利用Gromov-Wasserstein对齐,通过全局线性化与局部离散化解决视觉-语言与动作流形不匹配,提升收敛与泛化。

04:00
arXiv cs.CV

CFCamo:一种用于伪装目标检测的反事实检测或拒绝框架

提出CFCamo反事实框架及CF-COD基准,通过配对优化提升伪装目标检测在目标缺失时的拒检能力。

04:00
arXiv cs.CV

基于正交Sigmoid的公共与风格监督对比学习实现鲁棒特征解耦

提出OSCS-SupCon,用sigmoid对比损失和正交约束解决负样本稀释与特征纠缠,在六个数据集上超越现有方法。

04:00
arXiv cs.CV

特质更深

提出特质特异性非对称融合框架,通过模态选择性建模与分布校准,使人格评估均方误差降低25%并获最佳成绩。

04:00
arXiv cs.CV

TRON:光线追踪驱动神经渲染器实现3D高斯重建

TRON融合光线追踪与神经渲染,实现3D高斯重建的真实感可控渲染与交互编辑,性能领先。

04:00
arXiv cs.CV

i1: 一种简单且完全开放的强文本到图像模型配方

系统实验发现简单设计原则,训练3B参数i1模型,仅用公开数据即达领先,平均超开源模型29.5%

04:00
arXiv cs.CV

面向辅助技术的节点与边图语义分割

提出新颖的节点链接图语义分割模型,在合成数据集上像素准确率超93%,助力辅助技术。

04:00
arXiv cs.CV

DarkVGGT:利用热几何穿透黑暗,免于日光代价

提出物理感知热建模的RGB-T框架,通过热分解与几何路由实现低光鲁棒3D重建,提升深度与位姿估计。

04:00
arXiv cs.CV

探索自适应掩码重建用于自监督骨架动作识别

提出自适应掩码重建(AMR),解耦编解码器并引导聚焦运动信息,加速预训练并提升识别精度。

04:00
arXiv cs.CV

VL-DINO:利用CLIP视觉语言知识进行开放词汇目标检测

本文提出VL-DINO,通过构建高质量正样本、融合视觉语义和区域对齐,有效利用CLIP知识,在LVIS上达36.3和38.1 AP,超越先前方法。

04:00
arXiv cs.CV

PT-WNO:基于小波神经算子的点Transformer用于三维点云语义分割

PT-WNO集成小波神经算子分支,捕获全局多尺度频谱上下文,提升点云语义分割性能。

04:00
arXiv cs.CV

中文标题:迈向全自动考试评分:基于基础模型的公平性感知手写答案识别

中文摘要:利用视觉语言模型识别手写答案,准确率98.4%,假阴性率0.58%,实现公平性感知的全自动评分。

04:00
arXiv cs.CV

基于深度学习的生物特征欺骗检测研究

评估MobileNetV2等模型检测人脸欺骗攻击,MobileNetV2达92%准确率,需提升领域适应与混合架构。