10981 条条目 · 106 个活跃源
2026年8月21日
04:00
arXiv cs.CV

聚类与令牌去噪:更快速、更鲁棒的视觉语言模型

无训练算法,用注意力聚类与残差收缩去噪,压缩令牌97%,抗噪性提升20%。

04:00
arXiv cs.CV

在分布偏移下,边际覆盖能否保证零样本VLM的类别条件安全性?

边际覆盖仅平均可靠,偏移下类别尾部崩溃,最差类覆盖近0,10-12%类低于零下限,不能视为安全保证。

04:00
arXiv cs.CV

CAViAR:真实场景下细粒度事故因果推理的视频数据集

CAViAR数据集含2249个真实事故视频,标注因果与责任,评测VLM发现感知-推理差距。

04:00
arXiv cs.CV

超越识别:紧凑型多领域阿拉伯文手稿HTR,结合候选选择分析与证据保留审查

凤凰模型将CER从19.98%降至14.93%,阿塔尔流程保留视觉证据、限定候选并导出可审计TEI/PAGE-XML,支持将手稿识别视为可审计证据管理而非静默文本替换。

04:00
arXiv cs.CV

HiRA-CAM:保留梯度基视觉解释中的细粒度空间相关性

提出HiRA-CAM方法,自适应融合CNN各层激活图,生成更聚焦的显著性图,优于LayerCAM和Grad-CAM。

04:00
arXiv cs.CV

基于分数的扩散模型中条件化的即插即用解释

提出即插即用条件机制,分离条件影响,推导条件随机微分方程与常微分方程,引入正则化提升常微分采样,实验效果好。

04:00
arXiv cs.CV

SceneGTMM:基于共形映射的场景感知可迁移GNN-Transformer双图交互地图匹配框架

提出共形映射双图交互地图匹配框架,融合GNN-Transformer与CRF,抗噪可迁移,定位误差大时准确率超80%,跨城迁移领先。

04:00
arXiv cs.CV

CVSD-Reg:跨模态视觉语义先验蒸馏用于鲁棒激光雷达配准

提出CVSD-Reg,从视觉基础模型蒸馏语义先验至激光雷达,实现跨传感器鲁棒配准,无需相机,成功率领先。

04:00
arXiv cs.CV

VideoRun2D演示:无标记人体追踪用于跑步生物力学分析

基于44名跑者314次冲刺,无标记追踪评估髋膝角误差为5.30-9.87度,可用于跑步生物力学分析。

04:00
arXiv cs.CV

MUST-PET:跨示踪剂的多模态自监督学习用于全身PET/CT病灶分割

提出MUST-PET多模态自监督框架,跨示踪剂学习,提升全身PET-CT病灶分割泛化性与标签效率。

04:00
arXiv cs.CV

Block3D:基于分块扩散的高效文本到3D生成

提出Block3D分块扩散框架,分块自回归生成并联合去噪,用置信度引导纠正误差,推理提速5.15倍且保真。

04:00
arXiv cs.CV

Mix&Fix-Net:面向AIS与视觉来源船舶数据的双阶段轨迹预测模型

提出Mix&Fix-Net双阶段轨迹预测模型,融合AIS与视觉数据,在多数指标上优于现有基线。

04:00
arXiv cs.CV

PEA-DPO:用于多模态大模型对齐的感知增强直接偏好优化

提出PEA-DPO框架,通过显式利用视觉偏好信号,解决多模态对齐中视觉不敏感问题,减少模型幻觉,提升多模态对齐效果。

04:00
arXiv cs.CV

VGI-BENCH:探测视频生成模型的视觉智能

提出VGI-bench:27任务810实例评测视频生成模型视觉推理,最强仅51%,自纠正能力有限。

04:00
arXiv cs.CV

TextRefine:提升产品海报文本编辑中的文本保真度、空间布局与字形渲染

提出TextRefine框架:结合监督微调与奖励优化,解决产品海报文本插入替换中的保真、放置和字形问题,效果优于基线。

04:00
arXiv cs.CV

当引导偏离尺度:模拟存内计算非理想性下扩散Transformer的重校准

针对模拟存内计算非理想性扭曲CFG残差,提出免训练引导尺度重校准,恢复扩散Transformer生成质量,大幅降低FID。

04:00
arXiv cs.CV

Stream4D:流式自回归扩散视频模型的4D一致性

提出Stream4D,用前馈4D重建奖励替换静态批评,建模动态场景,提升视频生成的一致性和运动质量。

04:00
arXiv cs.CV

S²GS:面向边缘物联网设备的高效自由视点视频重建的结构化稀疏高斯流式方法

提出S²GS框架,利用时空稀疏性选择更新高斯残差,降低边缘设备每帧优化时间和存储,保持视觉质量。

04:00
arXiv cs.CV

PL-NBA:支持多种视觉理解任务的回合级通用篮球视频数据集

首个回合级篮球视频数据集,含1.1万进攻片段及事件标注,支撑识别、描述、定位与预测,挑战性强。

04:00
arXiv cs.CV

远离喧嚣:基于地理隔离的可扩展自监督学习

提出地理隔离课程学习法,仅用位置元数据排序样本,训练效率提升2-5倍,下游性能最高+5mAP,预计算成本降140倍。

04:00
arXiv cs.CV

StreamSoccer:用于流式足球解说的事件驱动记忆

流式足球系统采用事件驱动记忆,固定预算整合视频流,支持当前/近期/历史三种解说模式,性能领先且计算可控。

04:00
arXiv cs.CV

思维支架:优化多模态推理的潜在视觉目标表示

思维支架法优化潜在视觉目标表示,并学习RL采样均值和方差,弥补两阶段缺陷,多模态推理平均提升5.2%。

04:00
arXiv cs.CV

RIPE++:仅利用正样本对的强化关键点学习

仅用正样本对的几何一致性设计奖励,强化关键点学习,无需位姿或负样本,提升稀疏匹配,支持弱监督训练。

04:00
arXiv cs.CV

退化视觉条件下水下机器人的鲁棒跨模态基础模型感知

水下视觉退化时,冻结基础模型并自适应融合声纳,极端退化下平衡精度提升33.5%。

04:00
arXiv cs.CV

中文标题

提出SEFS无风格编码器风格化框架,用低分辨率裁剪提取风格,边缘分割约束内容,提升内容一致性与泄漏诊断。

04:00
arXiv cs.CV

学习搏动:表型引导的潜流与区域运动先验实现双心室运动合成

提出表型引导的区域运动潜流模型,从单舒张期网格合成全周期双心室运动,精度与功能保真度优于现有方法。

04:00
arXiv cs.CV

伽利略-4D:冻结主干集成用于动态4D重建

零训练更新,冻结预训练主干,集成三种推理解码配置,以0.58356 APD获挑战赛第三名。

04:00
arXiv cs.CV

TempJail:利用字幕调度对大型视觉语言模型进行时间越狱攻击

TempJail优化字幕时间调度,利用时间漏洞对LVLM进行黑盒视频越狱,攻击成功率显著提升。

04:00
arXiv cs.CV

多模态视觉问答中的问题引导式证据获取

Q-Guide按问题定向获取证据,在DocVQA2026和Manga109超越基线,增益来自感知定向。

04:00
arXiv cs.CV

Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training

04:00
arXiv cs.CV

Core-KAN: Continuous Vision Kernels with Kolmogorov-Arnold Networks

04:00
arXiv cs.CV

Coupled Optimal Transport with Landmark Constraints

04:00
arXiv cs.CV

AutoLumNet: Monotone Optimal Transport for Single-Shot Exposure Correction

04:00
arXiv cs.CV

Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment

04:00
arXiv cs.CV

A 360-Degree Vision Dataset for Learning Yaw Control on GPS-Denied Micro-UAVs in Disaster-Response-Relevant Environments

04:00
arXiv cs.CV

AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures

04:00
arXiv cs.CV

Unified and Efficient Point-Line Local Features

04:00
arXiv cs.CV

DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations

04:00
arXiv cs.CV

Flow Matching Meets 3D Curvilinear Structure Segmentation in Medical Imaging

04:00
arXiv cs.CV

V-REX:面向兽医X光的高效专家VLM训练

兽医放射学中,从零训练的专用VLM以少量参数和数据超越大型基础模型,高效生成诊断报告。

04:00
arXiv cs.CV

STEP:基于分数的时间能量用于人体姿态视频异常检测

提出STEP框架,用PCA将姿态序列投影到白化PC空间,避免噪声产生不合理姿态,提升视频异常检测性能。

04:00
arXiv cs.CV

ID-VTG:图像消歧的视频时间定位

提出图像消歧视频时间定位任务,用图文查询定位实例动作,构建基准并验证框架最优。

04:00
arXiv cs.CV

已知光照下基于点的稀疏视图三维重建

提出基于β面元与伴随光传输的稀疏视图重建,仅用267个基元,倒角距离降低28.5%

04:00
arXiv cs.CV

从街景图像到街道质量指标:面向郊区15分钟城市的视觉语言推理

用视觉语言模型分析法国尼斯郊区街景,评估步行友好性,发现优质街道稀缺,展示AI支持大规模城市诊断的潜力。

04:00
arXiv cs.CV

结构化亲和力:深度人工免疫网络中的无监督视觉类增量记忆

深度人工免疫网络利用结构化亲和力与响应图保留,实现无需回放的视觉类增量学习,在数字数据集上达到高准确率与初始类保留。

04:00
arXiv cs.CV

基于仿射或旋转协变特征的重力感知部分标定绝对位姿估计

结合IMU重力与特征几何,提出两种求解器,实现部分标定绝对位姿与焦距联合估计,高效准确。

04:00
arXiv cs.CV

超越蒙版:评估视频物体移除中的因果与物理一致性

提出BeyondMasks基准与CORE协议,发现现有方法虽局部修复好,但常遗漏阴影反射等物理效应,需因果一致评估。

04:00
arXiv cs.CV

HandMvNet:基于多视角交叉注意力融合的实时3D手部姿态估计

HandMvNet用多视角交叉注意力融合,实时估计3D手部姿态形状,无需相机参数,性能优越。

04:00
arXiv cs.CV

ArmorOCR:基于观测迁移自蒸馏的定位式对抗视觉感知

提出对抗OCR定位感知基准AdvSpot及两阶段框架ArmorOCR,用自蒸馏和策略优化增强对抗文本感知,同时保持通用OCR能力。

04:00
arXiv cs.CV

迈向手术世界动作建模:用于手术运动规划的初步联合视觉-轨迹预测

联合预测视觉与轨迹,分块自回归优于一步预测,但长程仍存在视觉退化与轨迹误差累积。