11111 条条目 · 106 个活跃源
2026年7月31日
04:00
arXiv cs.CV

从飞行中通过稳健3D化身放置学习理解身体语言

提出无人机人体语言数据集,将化身精确置入航拍场景,显著提升动作意图识别准确率。

04:00
arXiv cs.CV

现在,我给予了健康的关注:用于脑部MRI修复的U-DiT

提出U-DiT修复脑MRI,限制注意力仅关注健康组织并加入对侧对称先验,在BraTS-2026取得SSIM 0.864。

04:00
arXiv cs.CV

DECODE:应对持续AI生成图像检测中的表征与决策退化

提出DECODE框架,联合缓解表征与决策退化,19个生成域精度99.36%,遗忘仅0.39%。

04:00
arXiv cs.CV

一块补丁足矣:面向MLLM场景文本识别的强化优化视觉标记定位

提出SPaTS,用单锚点视觉标记实现场景文本定位,结合强化学习与方向对齐、增强解码,性能超越前沿模型。

04:00
arXiv cs.CV

ARD-REFSM:非对称去噪与旋转等变增强反射对称检测

提出非对称去噪与旋转等变匹配模块,抑制干扰、提升旋转一致性,新基准GMSYM上达最优性能。

04:00
arXiv cs.CV

统一视觉-语言模型中的对抗鲁棒模型专家

提出CARE协作微调框架,统一多个对抗鲁棒专家,嵌入对齐融合知识,得单一鲁棒模型,优于个体。

04:00
arXiv cs.CV

FiRE:通过细粒度上下文学习增强多模态大语言模型的复杂图像检索能力

提出自动构建细粒度多模态五元组数据集及两阶段微调策略,提升MLLM在复杂图像检索中的性能。

04:00
arXiv cs.CV

LAST:末查询令牌引导视觉令牌剪枝,用于边缘-云协同多模态大语言模型推理

LAST利用最后查询令牌注意力剪枝视觉令牌,边缘-云协同推理仅留12.5%令牌即95.4%精度。

04:00
arXiv cs.CV

FootprintNet:状态转移引导的多时相遥感变化检测动态足迹学习

提出城市建筑动态检测与足迹网络,用状态转移约束建模变化轨迹,引入新指标评价时序邻近性,优于现有方法。

04:00
arXiv cs.CV

CoRE-UIR:先验引导的共性与残差专家用于高效全能遥感图像恢复

提出CoRE-UIR,共性+低秩残差,PSNR升1.05dB,快11.83倍,省显存85.3%。

04:00
arXiv cs.CV

基于深度学习的相机陷阱图像昆虫分层分类

针对昆虫监测数据稀缺与类别失衡,提出五级34类分层分类模型,利用生物分类层级特征,按置信度阈值预测,准确率达80-99%。

04:00
arXiv cs.CV

ViP-Rig:基于视觉提示的可控绑定

视觉提示控制骨骼与蒙皮预测,冻结预训练模型,实现显式局部控制。

04:00
arXiv cs.CV

mmRadarTwin:面向室内毫米波雷达的测量校准信号级数字孪生平台

提出mmRadarTwin测量校准信号级数字孪生平台,融合实测与UE仿真,实现路径归因,有效区域召回70.8%。

04:00
arXiv cs.CV

超越分类:病理学基础模型作为有丝分裂象的检测编码器

病理基础模型可直接用于有丝分裂象检测,H-optimus-0与Virchow性能有竞争力,且对域外数据更鲁棒。

04:00
arXiv cs.CV

分裂与驱动:实时高斯头部虚拟人的双轴解耦

提出单图实时高斯头部虚拟人,双轴解耦免外部追踪,三分支建模,速度最快。

04:00
arXiv cs.CV

ENCORE:事件辅助的互补运动细化用于学习型视频压缩

提出事件辅助互补运动细化框架,利用事件相机补充帧间运动,仅细化光流,事件为辅助,显著提升压缩性能。

04:00
arXiv cs.CV

带诱导度量的地标形状空间

统一Kendall形状空间与Sobolev度量,新空间防碰撞、消刚体运动、固定尺度,可解匹配与测地线。

04:00
arXiv cs.CV

TongueReenact:几何锚定的面部重演舌头合成

提出首个跨身份舌头动态迁移框架,用空间约束掩码扩散模型合成舌头,指标超基线两倍,并用VLM协议验证优越性。

04:00
arXiv cs.CV

源于推出误差的时间聚焦:文本到视频扩散的隐式偏好优化

提出cIPO框架:以去噪重建误差为隐式偏好,集中优化高误差时间片段,提升视频真实感与时间一致性。

04:00
arXiv cs.CV

BladeYOLO:有限标注与弱显著性感知下的风机叶片缺陷检测

提出BladeYOLO,融合自监督预训练与Mamba增强,解决叶片缺陷弱显著性和标注有限问题,在多个数据集上检测性能领先。

04:00
arXiv cs.CV

深度学习为何在中医舌诊中有效?一项全面消融研究

系统消融20余模型发现:ConvNeXt-Tiny最优,BCE损失提升2.7%,数据扩增需克制,弱集成提升2.1%,数据规模增益20.6%,标签扩维致崩溃。

04:00
arXiv cs.CV

FaithEyes:通过多智能体过程图像验证实现忠实工具使用

提出多智能体自评判框架,判断过程图像是否有用,调整工具奖励并注入推理,提升工具忠实度和准确性。

04:00
arXiv cs.CV

OPLD:多模态推理的在线策略潜在蒸馏

提出在线策略潜在蒸馏法,将多模态思维链推理蒸馏至潜在表征,超越现有方法。

04:00
arXiv cs.CV

基于凸特征嵌入学习的人脸与语音跨模态关联

提出凸特征嵌入学习人脸-语音跨模态关联,利用跨模态注意力减少误判,在VoxCeleb上超越现有方法。

04:00
arXiv cs.CV

面向人脸超分辨率和稳健重识别的协同特征聚合

提出协同特征聚合,融合多视角/序列人脸特征,级联超分恢复高分辨率,提升超分与重识别性能。

04:00
arXiv cs.CV

面向医学影像无监督域适应的实用算法选择

提出无标签准则联合选择UDA算法与超参数构建参考预测选一致性最高模型在脑MRI和胸X光上更优

04:00
arXiv cs.CV

结合图像外信息:时空信息增益驱动的农田分割智能体

现有农田分割仅看当前图像易混淆,提出FarmSeeker按需查询时空信息增益,构建全球基准,分割更稳定。

04:00
arXiv cs.CV

基于卷积神经着色的多视图图像高质量三维重建

提出卷积神经着色法,用神经着色器与位移网络从多视图重建3D形状,暗部及边界细节显著优于现有方法。

04:00
arXiv cs.CV

扩展视觉语言模型不足以缓解偏见

研究194个视觉语言模型发现,规模对缓解多属性偏见作用微弱,数据质量更关键,精选数据提升25%

04:00
arXiv cs.CV

S-Avatar:扩散引导的单图像高斯头部化身

提出S-Avatar:扩散引导生成三维高斯并绑定FLAME模型,从单图实时重建动态头部化身,兼顾一致性与真实感。

04:00
arXiv cs.CV

EgoGenesis:基于在线锚定投影记忆与Action-3D RoPE的自我中心世界-动作建模

提出自我中心世界动作模拟器,通过两类几何感知机制合成高质量操纵视频,将真实机器人成功率提升至84%(单臂)和70%(双臂)。

04:00
arXiv cs.CV

AdaAnchor4D:面向单目无人机4D重建的锚定条件时空特征聚合

提出自适应锚定变形框架,通过锚定条件特征聚合等模块,提升无人机动态场景重建质量,兼顾实时性能。

04:00
arXiv cs.CV

MSCM-net:一种基于多尺度卷积与Mamba的高光谱图像分类方法

提出MSCM-net,多尺度卷积与Mamba结合,加SENet与双分支聚合,高效提取光谱空间特征,降低复杂度。

04:00
arXiv cs.CV

TARS:时间步感知数据缩放用于免3D视频重拍摄

提出TARS:时间步感知数据缩放,免3D先验与配对视频,实现文本驱动的视频重拍摄。

04:00
arXiv cs.CV

Space2Ground 2.0:融合街景与卫星影像的多源农业监测数据集与框架

提出多源框架,融合卫星与街景图像,自动生成4.6万标注图,关联8581地块,提升作物分类精度。

04:00
arXiv cs.CV

使用RGB-D相机在嵌入式设备上填充可供性分割的帕累托最优前沿

提出结合深度信息的搜索与微调方法,在嵌入式设备上实现可供性分割,平衡精度与硬件效率,达到实时低能耗。

04:00
arXiv cs.CV

Theia:面向无数据蒸馏的Incidents1M数据集大规模多模态描述与自动验证

面向灾害响应,构建经大语言模型自动验证的大规模多模态描述数据集,高精度低召回,支持无数据蒸馏。

04:00
arXiv cs.CV

超越视觉模糊:通过详细长描述引导挑战性场景中的鲁棒单目深度估计

提出CapDepth框架,用详细长描述引导单目深度估计,非朗伯表面误差降25%,恶劣天气降22%。

04:00
arXiv cs.CV

MonoVoc:解耦几何与语义的轻量级单目开放词汇三维高斯

无需训练,从单目视频解耦几何与语义,生成对象级语义高斯图,内存较最先进方法降低一个数量级

04:00
arXiv cs.CV

ObjectStream:潜在对象作为流式视频理解的记忆锚点

以潜在对象为记忆锚点,免训练优化流式视频理解,降低显存与延迟。

04:00
arXiv cs.CV

相同的分支,不同的树:用于冠状动脉分割与FFR-CT决策一致性的分叉连通性指标

提出分叉连通性评分(BCS),弥补Dice等指标忽视连通性的缺陷,提升FFR-CT决策一致性,建议同时报告分支恢复与连通性指标。

04:00
arXiv cs.CV

视觉语言模型能否推理图像中的AI编辑?

用强化学习训练视觉语言模型推理图像AI编辑,无需显式监督,性能媲美现有检测器,并提出新指标。

04:00
arXiv cs.CV

ShadowDancer:从视频及其影子学习统一动态表示,教视频世界模型任意动作

提出ShadowDancer,用影子对和跨影子预测从视频演示学习统一动作表示,实现任意动态精确控制与迁移,无需标签或微调。

04:00
arXiv cs.CV

大基础模型时代的手-物体交互:重建、生成与具身迁移

系统综述基础模型在手物交互中的应用,梳理六任务八类先验,分析几何/语义/视觉先验,并探讨机器人学习与未来方向。

04:00
arXiv cs.CV

捕捉令牌趋势:多模态大语言模型的免训练令牌剪枝

提出趋势感知剪枝,捕捉注意力流动量,动态恢复被低估的晚期重要令牌,以近八成令牌削减保持性能。

04:00
arXiv cs.CV

基于自动提取的概念激活向量解释图像相似性

提出基于稀疏自编码器概念向量的图像相似性解释方法,支持成对与群体分析及示例检索,实验验证其忠实性。

04:00
arXiv cs.CV

面向业务制图与影响分析的大规模跨区域遥感洪水监测框架

提出融合SAR、光学与DEM的洪水监测框架,比较监督与自监督模型,成功评估2019年图伦洪水影响,结果贴近官方。

04:00
arXiv cs.CV

阴性对照揭示影像组学与影像基础模型特征中的体积驱动混杂

提出体积保留阴性对照框架,检验影像组学与基础模型特征,发现多种模型在结构破坏后仍保性能,提示体积混杂。

04:00
arXiv cs.CV

ViewMind3D:模块化视图感知推理实现免训练3D问答

免训练模块化3D问答框架,视图推理分解四步,在ScanQA等数据集表现优异,空间问题尤佳。

04:00
arXiv cs.CV

视觉路由器:基于查询的视觉采样用于长视频理解

提出视觉路由器,无需训练,按查询类型自适应采样,兼顾相关性与时间覆盖,提升长视频理解。