11301 条条目 · 106 个活跃源
2026年6月12日
04:00
arXiv cs.CV

LaME:基于信息瓶颈的隐空间推理多模态嵌入

LaME用可学习令牌在隐空间完成推理,消除文本CoT依赖,性能相当且推理提速60倍。

04:00
arXiv cs.CV

迭代视觉思维:通过视觉反馈教导视觉语言模型空间自我修正

提出迭代视觉思维框架,通过视觉反馈实现模型自我修正,仅用2400样本在单GPU上显著提升空间定位精度。

04:00
arXiv cs.CV

统一MRI脑图像翻译:通过层级肿瘤结构比较

提出HTSCGAN模型,利用层级肿瘤结构比较提升多模态脑图像翻译质量及临床适用性。

04:00
arXiv cs.CV

Transformer-Guided Graph Attention for Direct Cardiac Mesh Reconstruction: A Structural Digital Twin Framework

04:00
arXiv cs.CV

PP-OCRv6:从1.5M到34.5M参数,在OCR任务上超越十亿级视觉语言模型

PP-OCRv6轻量OCR系统以34.5M参数,在识别和检测上超越千亿级VLM,小型模型CPU推理提速3.9倍。

04:00
arXiv cs.CV

TimeLens:面向大埃及博物馆的设备端文物识别与检索增强问答

TimeLens实现设备端文物识别与双语RAG问答,优化数据质量和延迟,用于大埃及博物馆。

04:00
arXiv cs.CV

文化遗产的零样本描述生成:传统印尼服饰的自动图像分析

提出Custom ZeroCLIP框架,通过检索增强实现印尼传统服饰零样本描述生成,在低资源文化遗产场景中显著提升文化词汇恢复和描述质量。

04:00
arXiv cs.CV

HYDRA-X:具有整体视觉分词器的原生统一多模态模型

首个单ViT统一图像视频分词的UMM,通过因果时序注意与层级压缩实现高效重建,7B模型表现强劲。

04:00
arXiv cs.CV

DuET:用于扩散图像编辑的双专家轨迹

DuET通过临时切换至文本到图像阶段,无需训练即可提升编辑的指令相关性与质量。

04:00
arXiv cs.CV

ReFree: 基于无奖励强化学习与多级语音指导的逼真共话视频生成

提出ReFree-S2V框架,利用多级语音表示与无奖励强化学习,实现高唇同步与自然表情动作,性能领先。

04:00
arXiv cs.CV

跨模态掩码组合概念建模以增强视觉-语言组合性

提出MACCO框架,遮蔽单模态组合概念并跨模态重建,增强跨模态组合对齐,显著提升视觉语言模型组合能力。

04:00
arXiv cs.CV

双域等变生成对抗网络用于多模态CT-PET合成

提出双域等变GAN,结合空间与频率域并嵌入旋转等变性,显著提升CT-PET合成质量与鲁棒性。

04:00
arXiv cs.CV

面向3D脑部MRI的掩码与预测自监督基础模型

研究MAE与JEPA两种自监督范式,引入频谱损失和方差正则化,发现任务结构决定下游收益。

04:00
arXiv cs.CV

MagPlus:通过可学习放大技术连接微表情与常规表情

MagPlus通过可学习放大将微表情转为常规表情,处理后恢复,使预训练模型生成更真实微表情。

04:00
arXiv cs.CV

OR-Action:多角色视频理解与细粒度动作

提出首个手术室细粒度多角色动作基准,纯视觉模型显著提升识别性能。

04:00
arXiv cs.CV

基于情境运动的人物识别

提出交互式人物识别新范式,通过视觉刺激-运动响应序列最大化互信息,报告五个公开数据集及自有数据集上的高识别率。

04:00
arXiv cs.CV

JointEdit3D: 统一潜在空间中的前馈3D场景编辑

提出JointEdit3D框架,统一RGB-几何潜在空间实现高效前馈3D编辑,并创建15K样本数据集与基准,提升编辑区域质量和结构完整性。

04:00
arXiv cs.CV

预算约束的步骤级扩散缓存

BudCache固定预算离线搜索最优缓存策略,结合模拟退火与爬山算法,在相同推理预算下提升生成质量。

04:00
arXiv cs.CV

OmniDirector:无需交叉配对数据的通用多镜头相机克隆

提出OmniDirector框架,利用网格运动视频实现无需交叉配对的通用多镜头相机运动克隆,性能优越。

04:00
arXiv cs.CV

VietFashion:面向文化服饰的草图-文本组合图像检索基准

VietFashion是越南奥黛的草图文本组合检索基准,采用多目标设置,揭示细粒度文化语义与多模态组合的显著性能差距。

04:00
arXiv cs.CV

VISA:VLM引导的实例语义审计用于3D占据世界模型

VISA方法利用VLM审计3D占据模型实例语义,通过蒸馏提升mIoU,证实VLM更适合作可靠性感知语义审计器。

04:00
arXiv cs.CV

逐点几何感知Transformer用于计算机辅助手术中局部到全局点云配准

GAPR-Net融合卷积与Transformer,跨注意力对齐局部与全局几何特征,实现高精度局部到全局点云配准(召回率94.2%,RMSE≈2mm)。

04:00
arXiv cs.CV

MoVerse:基于全景高斯骨架的实时视频世界建模

MoVerse从单张窄视场图像实时构建可交互全景世界,通过高斯骨架与生成视频渲染,实现8FPS场景漫游。

04:00
arXiv cs.CV

双约束扩散图像压缩用于操作率-失真-感知优化

DCIC通过失真与幂等双约束引导扩散解码,实现无需额外码率的率-失真-感知最优权衡及连续可调平衡。

04:00
arXiv cs.CV

SmartFont:用于少样本字体生成的动态条件分配

SmartFont通过多级条件分配平衡全局与局部,实现少样本字体生成的高质量字形与细节保真。

04:00
arXiv cs.CV

非结构化环境中基于异构LiDAR早融合与学习重排序策略的鲁棒长期场所识别

提出MinkUNeXt-VINE++,融合异构LiDAR与学习重排序,在非结构环境中场所识别Recall@1提升20%-30%。

04:00
arXiv cs.CV

Surflo:具有全局状态的一致三维表面流模型

Surflo将多视点图像压缩为全局潜变量,通过流匹配解码任意分辨率三维表面点,速度快且一致性好。

04:00
arXiv cs.CV

基于视觉的室内定位中测量校准的多相机融合

提出测量校准融合方法,通过量化单相机误差优化融合,显著降低轨迹方差并提高运动平滑性。

04:00
arXiv cs.CV

旧法新用:经典降维技术用于高效显著性引导的生物特征攻击检测

提出基于PCA和LDA的高效显著性图方法,无需人工标注,在多个生物攻击检测任务中超越基线。

04:00
arXiv cs.CV

MaskWAM:统一掩码提示与预测的世界动作模型

MaskWAM以对象为中心,通过统一掩码输入与预测提供语义监督和空间锚点,显著提升机器人操控鲁棒性。

04:00
arXiv cs.CV

编辑比特,差异化编码:面向视觉自回归模型的按位残差编辑方法

提出无需训练的BitResEdit方法,通过按位引导与多尺度残差组合实现文本对齐最优,CLIP提升1.07且背景保持佳。

04:00
arXiv cs.CV

EvTexture++:事件驱动的视频超分辨率纹理增强

提出EvTexture++框架,利用事件信号增强视频超分辨率纹理细节,达到最优性能。

04:00
arXiv cs.CV

对比度信息增强与域对抗训练用于成人到新生儿磁共振重建泛化

对比度信息增强与域对抗训练显著提升成人到新生儿MR重建泛化,加速因子R=4和R=8下性能最优。

04:00
arXiv cs.CV

面向杂乱背景下的自动化废品回收的有效废品分割

提出融合空间与谱域特征及辅助增强模块的废品分割网络,有效提升杂乱背景下的分割性能。

04:00
arXiv cs.CV

长尾监控场景下的车辆颜色识别再探讨

通过生成式数据增强与多技术融合,将长尾监控车辆颜色宏准确率提升8.2个百分点至79.7%。

04:00
arXiv cs.CV

世界追踪:超越可见的生成式像素对齐几何

提出世界追踪,预测每像素多层3D点,同时重建可见与遮挡几何,性能优于现有方法,支持文本编辑与视频合成。

04:00
arXiv cs.CV

EquiDexFlow:基于接触的SE(3)等变灵巧抓取生成流

联合预测腕姿、关节、接触与力,保证摩擦锥约束,实现SE(3)等变,零摩擦违规,硬件可行并成功抓取。

04:00
arXiv cs.CV

Flex4DHuman:用于4D人体重建的灵活多视图视频扩散

提出Flex4DHuman,通过相对相机姿态条件从单目/稀疏视频生成密集多视图视频,实现4D人体重建,无需几何先验,性能领先。

04:00
arXiv cs.CV

RepWAM:基于表征视觉-动作分词器的世界动作建模

RepWAM采用语义视觉-动作潜在空间联合建模未来状态与潜在动作,超越重建型分词器,实现强泛化操作。

04:00
arXiv cs.CV

SpatialClaw:重新思考智能体空间推理的动作接口

提出SpatialClaw框架,以代码为动作接口,灵活组合感知结果,在20个基准上平均准确率59.9%,领先11.2个百分点。

04:00
arXiv cs.CV

面向可扩展空间生成的模态强制

提出模态强制法,实现图像与深度联合生成,利用T2I可扩展性,在稀疏深度上训练,达到SOTA深度估计性能。

04:00
arXiv cs.CV

AudioX-Turbo:高效任意内容到音频生成的统一框架

AudioX-Turbo实现多模态到音频的高效生成,仅需4步采样,性能优越且评估次数减少25倍。

04:00
arXiv cs.CV

地理空间多模态基础模型的新兴柔性设计

公平比较多模态地理空间基础模型架构,揭示灵活性、对齐与性能权衡,指导下一代模型设计。

04:00
arXiv cs.CV

InterleaveThinker:强化智能体式交织生成

InterleaveThinker通过规划与批评双智能体及GRPO强化,赋予图像生成器交织生成能力,性能媲美GPT-5。

04:00
arXiv cs.CV

Amnesia:对持续学习梦境的一种隐蔽重放攻击

Amnesia通过可控索引选择实施重放攻击,在审计约束下最大化模型退化,揭示持续学习系统的可审计威胁面。

04:00
arXiv cs.CV

在图上选择样本:用于无损训练加速的统一数据集剪枝框架

提出图统一剪枝框架,建模为加权图与最大权重团问题,理论保证性能,ImageNet-1k训练加速40%无损精度。

04:00
arXiv cs.CV

采集状态表现为一种结构化、可测量的变量,主导肺结节AI:核驱动测量不稳定性和噪声驱动检测脆弱性,对DICOM元数据不可见

采集状态是影响AI性能的结构化变量,噪声影响检测,核影响测量,DICOM元数据无法捕捉,需纳入验证。

04:00
arXiv cs.CV

ComAct:通过COM即行动范式重构专业软件操作

提出COM-as-Action范式,将专业软件操作转为程序合成,创建ComCADBench基准,开发ComActor代理实现SOTA性能。

04:00
arXiv cs.CV

联合源-信道-生成编码(JSCGC)用于无线生成通信

提出JSCGC,用生成模型替代解码器,将通信转为受控生成以最大化互信息,提升语义质量。

04:00
arXiv cs.CV

边界框即目标:基于神经符号规划的语言条件抓取

GRASP框架通过神经符号规划与边界框检测,零样本实现自然语言抓取,成功率73.3%。