10722 条条目 · 106 个活跃源
2026年9月30日
04:00
arXiv cs.CV

FM-ReID:面向目标重识别的选择性竞争令牌路由

提出FM-ReID,以选择性竞争令牌路由挖掘局部判别线索,联合整体表示提升多类目标重识别。

04:00
arXiv cs.CV

超越可读性:统一视频生成中的视觉文本渲染与原位编辑基准评测

提出VidScribe基准,覆盖四类视频文本生成与编辑,评测11系统,揭示编辑瓶颈并提供训练信号。

04:00
arXiv cs.CV

并非每次修正都有益:增益引导的持续测试时自适应

GAIN无反向传播,以增益决定历史修正强度,兼顾精度与校准,ImageNet-C达61.9%。

04:00
arXiv cs.CV

CrossTimeEdit:跨越十年的跨视角数据集与面向历史街景生成的奖励引导编辑

构建跨十年、11城、4.3万组的跨视角街景数据集,提出奖励引导编辑式生成模型,性能提升17.12%。

04:00
arXiv cs.CV

AffectReveal:超越视觉表象的事件锚定情感识别

提出事件锚定情感识别,构建基准,并推出免调优框架AffectReveal,借事件证据校验提升识别。

04:00
arXiv cs.CV

超越二元偏好:面向肢体运动描述的分级偏好优化

提出FlexBench与GPA评分,设计GM-DPO分级偏好优化,减少肢体描述错误与幻觉。

04:00
arXiv cs.CV

OCA:面向图像到点云配准的ODE驱动交叉注意力

提出ODE驱动交叉注意力OCA,缓解图像到点云配准注意力歧义,召回率最高提升15%。

04:00
arXiv cs.CV

FocusVTC:基于自适应分辨率的高效高性能视觉文本压缩

FocusVTC以自适应分辨率压缩视觉文本,2.9倍压缩下大幅提升性能并保持多模态能力。

04:00
arXiv cs.CV

VLM4Cluster:视觉-语言预训练时代的深度聚类基准评测

VLM4Cluster基准评测17种方法与20个数据集,语言辅助聚类提升效果与泛化,细粒度场景增益有限。

04:00
arXiv cs.CV

为推理扩展视频生成:代价几何?

研究视频生成扩展能否推理隐藏信息及代价;MSE不保证推理,小模型低算力更准,符号监督显著提升。

04:00
arXiv cs.CV

用于高鲁棒性车载远程光电容积脉搏波的逐像素曝光

提出PixExpo:按循环曝光序列采集并逐像素非迭代融合,选取最接近rPPG目标强度的观测,大幅提升车载心率监测鲁棒性。

04:00
arXiv cs.CV

一次重编程即足:重新思考视觉重编程中的长时训练

提出YORO,仅需一次前向遍历,用贝叶斯判别映射从冻结响应构建下游预测器,免反向传播,精度显著提升。

04:00
arXiv cs.CV

通过结构化提示重参数化重编程视觉语言模型

RVP框架:类内聚合多提示、类间残差校正,可重参数化为线性分类器,近乎零开销,11个基准均领先。

04:00
arXiv cs.CV

ReWorld-Track:一种用于语言引导多摄像头跟踪的递归事件世界模型

提出递归事件世界模型,保留关联不确定性以预测后续摄像头,提升语言引导多摄像头跟踪的身份连续性。

04:00
arXiv cs.CV

DSPO:面向鲁棒情感推理的多样性感知主观策略优化

提出DSPO,融合情感分布先验、多样性奖励与反事实视觉门控,跨域准确率超EMO-R3 10.8%。

04:00
arXiv cs.CV

当语义至关重要时:面向共语手势生成的可靠性感知语义-节奏控制

提出可靠性感知语义-节奏控制框架,选择增强语义引导,提升鲁棒性并平衡表达、同步与多样性。

04:00
arXiv cs.CV

AESplat:通过解耦外观建模推进无位姿前馈3D高斯泼溅

解耦视角相关与无关外观,零阶SH免训练导出、高阶SH由浅层MLP预测,无位姿3DGS渲染质量领先。

04:00
arXiv cs.CV

拖拽即证据:面向拖拽式编辑的运动锚定潜在重组

提出MoRe-Drag:将像素变形作为运动证据注入生成轨迹,区域感知重组,提升拖拽精度与语义一致性。

04:00
arXiv cs.CV

FastVR:基于一步扩散的高效流式视频修复

FastVR用一步扩散做流式视频修复,轻量VAE配分块因果注意力,1080p单卡11FPS性能领先。

04:00
arXiv cs.CV

面向视觉-语言类增量学习的双模式低秩学习器与桥接原型集成

提出DuLBE,双模式低秩学习与桥原型集成,用于无样本视觉-语言类增量学习,性能SOTA且参数高效。

04:00
arXiv cs.CV

NesTok:用于自回归图像生成的嵌套自对齐一维分词器

NesTok嵌套自对齐一维分词器强化短序列重建,ImageNet rFID0.98、gFID1.46。

04:00
arXiv cs.CV

解码情感细微差别:通过层次化情感推理与对比判别剪枝增强多模态大语言模型

提出免训练框架DAN,融合层次化情感推理链与对比判别视觉剪枝,显著提升多模态大模型细粒度情感辨识能力。

04:00
arXiv cs.CV

Causal-EVC:通过时空定位与反事实干预打破情感虚假因果

提出Causal-EVC,以时空定位与反事实干预破除情感伪因果,实现可解释的忠实视频描述。

04:00
arXiv cs.CV

视频扩散模型中的运动概念遗忘

提出免训练运动概念遗忘法MUTE,在CFG前用概念方向与空间门校正,实现视频动作精准擦除且动态自然。

04:00
arXiv cs.CV

看见本应听见的:诊断与修复全模态大语言模型中的跨模态捷径

发现全模态大模型答音频题时依赖图像,提出DMC-Repair抑制该捷径,图像影响降约六成且不损性能。

04:00
arXiv cs.CV

场景重定向:基于类比迁移的物体放置学习

将场景重定向定义为跨布局的簇级语义迁移,保留语义上下文并施加物理约束,性能超越现有方法。

04:00
arXiv cs.CV

MeteoVerse:统一的天气可控视频世界模型

提出天气可控视频世界模型MeteoVerse,显式建模天气转换,统一天气保持、引入与移除的精细控制。

04:00
arXiv cs.CV

EGSD:面向流式视频理解的事件锚定自蒸馏

提出事件锚定自蒸馏EGSD,以可验证事件增量更新记忆,解决偏好错位与记忆坍缩,流式视频理解性能领先。

04:00
arXiv cs.CV

CurvSpec:面向部分相关视频检索的自适应多曲率学习

CurvSpec学习内容自适应曲率,融合欧氏与双曲注意力,以语义质心抑制稀释,检索性能最优。

04:00
arXiv cs.CV

RED:面向可泛化AI生成图像检测的重建演化动力学

RED利用多尺度重建演化中的token可预测性聚合证据,实现可泛化AI生成图像检测,准确率92.5%。

04:00
arXiv cs.CV

基于自洽性的扩散视频推理学习

提出自洽测试时扩展与拒绝微调,蒸馏多轮共识到扩散视频模型,视觉搜索准确率由48.4%升至99.0%。

04:00
arXiv cs.CV

ProGuT:面向森林场景的标签高效全景分割

ProGuT借助CLIP特征聚类与结构张量几何先验生成全景伪标签,无需逐图掩码,森林分割性能显著超越无监督基线。

04:00
arXiv cs.CV

RoXDrive:通过动作忠实推演实现端到端自动驾驶的闭环强化学习

RoXDrive:识别动作忠实世界模型推演,进行闭环强化学习后训练,显著减少自动驾驶安全违规。

04:00
arXiv cs.CV

无法恢复从未被测量之物:量化超低场MRI超分辨率的信息上限

真实64mT MRI个体信息仅约3–4mm;合成数据高估可恢复性,超分细节难辨恢复与虚构。

04:00
arXiv cs.CV

社交性锚点:迈向群体边界约束的轨迹预测

提出 Socialality 框架,以可解释锚点和扩展窗口实现个体化、上下文自适应分组与群体轨迹预测。

04:00
arXiv cs.CV

同策略视觉证据蒸馏

提出ReVuE同策略视觉证据蒸馏,对比学生轨迹诊断获取/读取/对齐失败,反思重加权token蒸馏损失,提升视觉推理。

04:00
arXiv cs.CV

VGGT 系列模型需要用到所有层吗?

VGGT 系列前馈几何模型的可删层集中于前段与后段,剪枝并经线性校准后可减少44%参数而精度持平。

04:00
arXiv cs.CV

S4VY:前馈4D视觉几何中的任意分割

提出S4VY,基于前馈4D视觉几何实现类无关4D实例分割,支持提示与语言引导,性能领先。

04:00
arXiv cs.CV

GlassFormer:基于雷达-深度融合的实时玻璃分割学习

融合雷达与RGB-D,提出GlassFormer,以跨模态注意力实现实时透明表面分割,低光下稳健。

04:00
arXiv cs.CV

更少监督,更好泛化:扩散编辑图像中的弱监督伪造区域定位

提出弱监督框架ReGFLoW定位扩散编辑伪造区域,仅需图像级标签,以扩散重建误差引导多示例学习,跨域泛化优于全监督。

04:00
arXiv cs.CV

S2T-Unet:一种面向跨模态MRI转换的结构到风格框架

提出S2T-Unet,分离模态不变结构与风格,量化编码结构并转换风格,IXI实验达或超SOTA。

04:00
arXiv cs.CV

DiffReID:面向目标重识别的判别式扩散模型

提出判别式扩散模型DiffReID,结合CLIP提示调优与视觉引导去噪,学习身份感知分布并生成身份不变特征,五个重识别基准超越多数SOTA方法。

04:00
arXiv cs.CV

SafeVantage:面向可靠具身决策的视角感知记忆

视角感知记忆与主动采集框架,记录支持视角,预测可见性指导选视,校准输出是/否/弃权,提升决策可靠性。

04:00
arXiv cs.CV

用于跨被试EEG到图像检索的结构化视觉目标学习

提出结构化视觉目标学习与免训练细化,提升跨被试EEG到图像检索,Top-1达48.1%。

04:00
arXiv cs.CV

Seg3DParts:基于分割的可控部件级三维生成

将分割作为显式锚定信号,结合跨部件全局交互,从单图直接生成对齐的部件网格,并发布20万物体、百万部件的大规模数据集。

04:00
arXiv cs.CV

表征动态揭示多模态大语言模型视觉 Token 剪枝的语义显著性与相似性

视觉token表征动态揭示语义显著性与相似性;据此提出免训练剪枝MSDG-Prune,大幅压缩视觉token并提速。

04:00
arXiv cs.CV

WeLike2Party!面向多人图像动画的上下文动作迁移

提出免显式姿态的多人动画框架,以参考非对称RoPE与身份绑定监督实现上下文动作迁移,构建MotionTwin数据集与基准。

04:00
arXiv cs.CV

SFE-VGGT:面向事件相机单目深度估计的无源VGGT蒸馏

无源SFE-VGGT用事件重建代理帧蒸馏VGGT几何先验,可靠性加权,无需配对RGB,夜间误差降15%。

04:00
arXiv cs.CV

DispFlow-GS:面向单目可变形三维高斯泼溅的位移流监督与运动解耦

提出位移流监督与运动解耦框架,缓解高斯流与光流域差异,并引入形变-渲染一致性指标,显著提升运动定位与一致性。

04:00
arXiv cs.CV

先验驱动的3D高斯泼溅增强:法线与深度正则化

提出融合表面法线与稠密深度先验的3DGS优化方法,提升几何精度与视觉质量,在复杂场景中表现稳健。