11181 条条目 · 106 个活跃源
2026年7月20日
04:00
arXiv cs.CV

Exo2EgoPose:利用外视演示的视觉语言引导自我中心3D手部姿态预测

Exo2EgoPose通过双层级外视重建与全局到局部调制,以外视演示补偿自我视角局限,精准预测3D手部姿态,性能大幅领先。

04:00
arXiv cs.CV

PIXIE:一种零样本纹理无关6D姿态估计框架,针对带有装配缺陷的未见物体

提出零样本纹理无关6D姿态估计框架,仅用无纹理3D模型,鲁棒于光照纹理,处理装配缺陷,无纹理物体达SOTA。

04:00
arXiv cs.CV

树形视频搜索:面向接地长视频问答的自我修正智能体

提出VideoTreeSearch框架,通过自适应时序树和四种操作实现自我修正搜索,在多个基准上取得最佳性能。

04:00
arXiv cs.CV

VLMs如何失败?组合式VQA中的视觉-操作错位

VLMs组合式VQA失败源于视觉-操作错位,四种失败模式需不同修正策略。

04:00
arXiv cs.CV

ArtChart:集成文本渲染的艺术化图表忠实生成基准

首个同时实现数学忠实、文本准确与艺术风格融合的图表生成框架ArtChart。

04:00
arXiv cs.CV

用于可持续氢技术的电解槽组件多模态语义分割:一种双分支深度学习方法

HREM-Net双分支框架融合高光谱与RGB,实现电解槽材料高精度分割,mIoU达0.82。

04:00
arXiv cs.CV

自适应对比度增强与优化特征匹配的RootSIFT掌静脉识别

提出ILACS-BGOT方法增强图像对比度,融合RootSIFT与MMD滤波器,在三个数据集上显著提升识别性能。

04:00
arXiv cs.CV

面向实时移动3D重建的语义通信

提出语义通信框架,通过置信度引导几何估计,提升实时移动3D重建的位姿精度与结构一致性。

04:00
arXiv cs.CV

基于注意力引导的显著性图用于解释视觉语言模型中的可视化素养

提出注意力聚合的显著性图方法,无梯度定位VLM生成答案的视觉关注区域,用于解释可视化素养,验证因果忠实性。

04:00
arXiv cs.CV

CLIFE:用于路边弱势道路使用者感知的边缘部署型相机-激光雷达融合框架

提出CLIFE边缘融合框架,实现无目标标定与轻量后融合跟踪,在嵌入式设备上实时(53.2FPS),增强感知范围与鲁棒性。

04:00
arXiv cs.CV

针对危险驾驶情绪反应的视觉语言助手

KYA系统通过视觉模块实时检测危险驾驶,语言模块按用户偏好生成情绪化回应,最佳组合YOLOv8s+ChatGPT-4o得分4.29。

04:00
arXiv cs.CV

面向有限标注与导航预算的具身主动学习目标检测

提出有限预算下具身主动学习方法,利用空间一致性选择有效样本提升目标检测精度。

04:00
arXiv cs.CV

FVAttn:面向视频生成的运行时负载均衡自适应稀疏注意力

FVAttn通过运行时负载均衡和稀疏增强,解决自适应稀疏注意力负载不均,实现4.41倍加速。

04:00
arXiv cs.CV

小米机器人-1:基于10万小时真实轨迹的视觉-语言-动作模型扩展

提出两阶段训练的VLA模型,预训练用10万小时真实轨迹,后训练对齐指令,在RoboCasa365达57.6%成功率,创下新纪录。

04:00
arXiv cs.CV

MotionForesight:重新利用视频模型预测未来三维场景流

利用视频预测模型先验,仅观察帧即可预测物体未来3D轨迹,无需物体属性假设,少量视频即实现泛化。

04:00
arXiv cs.CV

智能体会梦见虚假记忆吗?多模态AI智能体长期记忆的黑盒视觉攻击

提出Lucid黑盒攻击框架,通过不可察觉扰动实现记忆中毒与注入,暴露多模态记忆管道结构性漏洞。

04:00
arXiv cs.CV

认识自我,理解世界:面向多模态大模型的无人机时空推理双认知基准

提出无人机双认知基准UAV-DualCog,评估自我与环境时空推理,现有MLLMs表现不可靠,具可扩展性。

04:00
arXiv cs.CV

STSBench:用于建模灵长类视觉皮层背侧流神经元活动的大规模数据集

提出含超2000个颞上沟神经元记录的大规模数据集,用于背侧流编码模型基准测试和视觉输入重建。

04:00
arXiv cs.CV

Beyond Frontiers: Scene-Anomaly Guided Autonomous Exploration

04:00
arXiv cs.CV

在图处理器上渲染3D高斯

首次在仅有片上SRAM的IPU实现3D高斯渲染,评估片间带宽、容量、负载不均瓶颈,探讨无DRAM架构前景。

04:00
arXiv cs.CV

深度在手术视觉基础模型中的作用:RGB-D预训练的实证研究

多模态深度预训练显著提升手术视觉模型性能,仅用25%标注数据即超越全量RGB模型,且推理时无需深度输入。

04:00
arXiv cs.CV

VTLoc:视觉点云中基于学习的触觉接触定位

VTLoc融合视觉点云与触觉数据,通过几何多模态对齐和迭代更新,精准定位接触点,减少局部-全局对应歧义。

04:00
arXiv cs.CV

音频-视觉火烈鸟:面向长时复杂视频的开放式音视频智能

开源音视频大模型AV-Flamingo,通过新数据集与三阶段课程训练,长视频理解性能领先。

04:00
arXiv cs.CV

基于深度学习的骨骼康复评估标准化基准

整合康复数据集为Rehab-Pile,提出基准框架,评估多种深度学习架构,公开资源以促进自动化康复评估。

04:00
arXiv cs.CV

切于流形:为扩散模型发现黎曼度量

基于得分函数雅可比矩阵谱结构,提出无训练黎曼度量,引导路径沿流形切向,提升插值与生成质量。

04:00
arXiv cs.CV

MVI-Bench:用于评估大型视觉语言模型对误导性视觉输入鲁棒性的全面基准

首个评估误导性视觉输入对LVLMs鲁棒性的基准,含三层次1248实例,揭示模型脆弱性。

04:00
arXiv cs.CV

视频场景解析综合综述:进展、挑战与前景

综述五任务与架构演进(手工到基础模型),聚焦时间闪烁、身份切换等挑战,展望开放世界系统

04:00
arXiv cs.CV

基于PID-CNN的双眼视觉目标三维运动感知

训练PID卷积网络感知双目目标三维运动,精度近输入极限,探讨高维卷积及PID记忆注意力优势。

04:00
arXiv cs.CV

MindDrive:基于在线强化学习的自动驾驶视觉-语言-动作模型

提出MindDrive,用双LoRA大模型将在线强化学习引入自动驾驶,通过离散语言决策高效探索,取得领先成果。

04:00
arXiv cs.CV

CloudDiffusion: 基于扩散模型的点云场景补全

CloudDiffusion通过多token高斯VAE、锚点ICP精炼和单步扩散,近实时完成点云场景补全,表明数据质量主导模型设计。

04:00
arXiv cs.CV

WeEdit:面向文本中心图像编辑的数据集、基准和字形引导框架

提出WeEdit系统,含数据管道、基准和字形引导两阶段训练,显著提升文本编辑精度。

04:00
arXiv cs.CV

生成模型通晓空间:挖掘隐式3D先验用于场景理解

VEGA-3D利用视频生成模型隐式3D先验,无需显式3D监督,显著提升多模态大模型的空间理解与推理能力。

04:00
arXiv cs.CV

视频流思考:视频大语言模型可实现边看边想

VST范式实现流式视频边看边推理,提升实时理解和效率,响应快且性能强。

04:00
arXiv cs.CV

通过统一混合掩膜感知Transformer实现高保真壁画修复

提出HMAT框架,结合掩膜感知动态滤波与Transformer,实现结构修复与纹理保留,在严重缺失下表现优异。

04:00
arXiv cs.CV

VidNum-1.4K:视频数值推理综合基准测试

提出VidNum-1.4K视频数值推理基准,含1379人工标注,三层级测试。当前最强模型仅60%准确率,开源模型25-45%,揭示VLM缺乏稳定世界模型。

04:00
arXiv cs.CV

面向领域泛化的开放词汇目标检测:一种渐进式领域不变跨模态对齐方法

提出PICA方法,通过多级课程学习稳定跨模态对齐,提升领域泛化下的开放词汇目标检测鲁棒性。

04:00
arXiv cs.CV

LVSum:时间戳感知的长视频摘要基准

LVSum基准包含72个16分钟视频及时间戳摘要,评估显示模型过度依赖转录,时间定位与指令遵循能力不足。

04:00
arXiv cs.CV

更大更糟:数据稀缺下模型选择的实践指南

数据稀缺时,大模型反而不如小模型高效,小模型配合高分辨率是关键,规模法则失效。

04:00
arXiv cs.CV

KD-Judge:面向边缘设备的功能性健身动作的知识驱动自动评判框架

提出KD-Judge框架,将健身规则转化为可执行表示,在边缘设备上实现实时准确评判,加速达15.91倍。

04:00
arXiv cs.CV

多模态大语言模型中优先可靠性的细粒度生成

针对细粒度生成可靠性差问题,提出GranFact基准与层次评估,及可靠性优先优化方法,提升细粒度生成并保持可靠性。

04:00
arXiv cs.CV

ReCal3R:面向流式三维重建的可靠性校准学习率方法

提出ReCal3R方法,通过可靠性校准学习率抑制不可靠令牌更新,使长序列重建ATE降低3.7倍。

04:00
arXiv cs.CV

Orca: 世界存乎于心

Orca通过Next-State-Prediction统一建模世界状态,融合无意识与有意识学习,预训练后冻结骨干,下游生成任务超越基线。

04:00
arXiv cs.CV

神经执行器:机器人动力学与外力感知的神经驱动建模

提出NeuralActuator,联合预测扭矩代理、外力与电机状态,通过可微仿真与Transformer实现低成本至高端平台通用,提升策略学习与力感知。

04:00
arXiv cs.CV

整体融合:任务与配置无关的机器人定位与状态估计(基于因子图)

提出任务无关的多模态融合框架,因子图联合优化状态与参考帧,实现低延迟低漂移定位,已开源验证。

04:00
arXiv cs.CV

SloMo-Fast: 用于无源持续测试时适应的慢动量与快自适应教师模型

SloMo-Fast双教师框架:慢教师保留长期域知识,快教师快速适应新域,在无源持续测试时适应中性能全面领先。

04:00
arXiv cs.CV

临床验证的全面肺部病理学解读基础模型

该模型经多中心前瞻性验证和随机对照试验,在32项任务中达临床级性能,提高诊断准确率并减轻病理医生负担。

04:00
arXiv cs.CV

配对子宫全切片图像与病理报告的多模态计算病理学

介绍TUM-Uteria子宫病理数据集,含全切片与配对报告,支持多模态计算病理研究。

04:00
arXiv cs.CV

Gabor场:用于体渲染的方向选择性细节层次

提出Gabor Fields实现方向选择性连续频率滤波,通过剪枝原语降低频率内容加速体渲染,并支持程序化云设计。