11221 条条目 · 106 个活跃源
2026年7月13日
04:00
arXiv cs.CV

用于具身动作条件世界模型的因果去偏潜在动作模型

提出因果去偏框架CD-LAM,通过三种微调目标消除动作无关偏差,提升潜在动作可控性,仅需6k微调步骤,适配效率提升12倍以上。

04:00
arXiv cs.CV

Glob3R:基于3D基础模型的全局运动结构恢复

提出Glob3R,结合3D基础模型与全局优化,通过密集匹配和滑动窗口实现鲁棒准确的SfM重建。

04:00
arXiv cs.CV

多少像素才足够?SEAMS:基于MSE保持软掩码的充分性显著性

提出SEAMS方法,通过优化软掩码保留模型输出,生成紧凑可解释的充分性显著性图,无需辅助数据集。

04:00
arXiv cs.CV

YeTI: 仅需两张含噪图像即可生成真实世界sRGB噪声

YeTI用两张含噪图像即可生成逼真sRGB噪声,无需干净图像或元数据,有效提升去噪性能。

04:00
arXiv cs.CV

AnythingReality: 面向开放词汇VR场景探索的鲁棒在线高斯泼溅SLAM

提出在线高斯泼溅SLAM,结合ORB-SLAM3与VR,支持语音VLM交互,性能显著提升,物体识别率达88%。

04:00
arXiv cs.CV

动态逆渲染增强材质-光照分解

利用刚性运动物体的光-面交互观测,可显著提高逆渲染中材质与光照的解耦准确性。

04:00
arXiv cs.CV

面向动物重识别的参数高效视觉-语言适应与连续元数据条件化

提出连续元数据条件化CLIP框架,实现参数高效动物重识别,提升长期外观和时间偏移鲁棒性,测试无需元数据。

04:00
arXiv cs.CV

Simon-SR:用于文本增强超分辨率的多空间自适应调制与视觉提示适应

Simon-SR通过可学习提示实现文本-图像融合超分辨率,结合对比提示学习与空间自适应精炼,性能超越当前最优。

04:00
arXiv cs.CV

CtrlVTON: 基于视觉实例提示分割的可控虚拟试穿

提出VIP-SAM实现实例级分割,引入CtrlVTON框架通过像素级控制实现可控虚拟试穿,效果优于现有系统。

04:00
arXiv cs.CV

SVF-CR: 同步视觉-面部交叉优化用于多模态矛盾与犹豫识别

提出同步视觉-面部交叉优化框架,通过跨模态互优化与证据融合,在BAH数据集上macro-F1达0.7156。

04:00
arXiv cs.CV

面向自动驾驶的多模态场景相似性搜索

融合视觉与轨迹的多模态检索框架,证实外观与运动互补,实现最佳场景相似性搜索。

04:00
arXiv cs.CV

Rethinking Monocular Depth Embedding for Generalized Stereo Matching

04:00
arXiv cs.CV

REMIND:用于室内导航的基于记忆的重识别

提出REMIND在线跟踪器,融合特征记忆与空间上下文实现室内物体长期重识别,IDF1达90.35%,大幅超越现有方法。

04:00
arXiv cs.CV

从分类到定位与临床验证:泰国胸部X光片疾病检测深度学习系统的大规模开发

基于87万张泰国胸片开发,实现多病种分类与病灶定位,准确率高,跨13家医院泛化,获放射科医生高度信任。

04:00
arXiv cs.CV

TextileNet:面向手稿的零样本文本风格分割

提出仅用合成数据训练的TextileNet,实现手稿零样本文本风格分割,建立人类基线,发现笔迹性别识别需谨慎。

04:00
arXiv cs.CV

Robustifying Vision-Language Models via Test-Time Prompt Adaptation

04:00
arXiv cs.CV

Hydra++:实时分层三维场景图构建与对象级形状估计

Hydra++集成学习型形状估计与重投影一致性检查,实现实时分层3D场景图构建,提升对象和场景重建质量。

04:00
arXiv cs.CV

计数存在但错位:理解与纠正视觉语言模型中的计数失败

VLMs内部编码正确计数但输出错误,检测引导自纠正方法提升计数准确率15.6%

04:00
arXiv cs.CV

解耦语言引导与骨干网络用于文本引导医学分割

BTHA框架通过适配器和分层监督解耦语言引导与骨干,泛化多种编码器,提升分割性能。

04:00
arXiv cs.CV

注视引导的动态标记选择用于鲁棒且高效的视觉Transformer

受人类视觉启发,FDT模型通过注视引导动态标记选择,在降低34.57%计算量的同时实现81.9%准确率,超越DeiT-S。

04:00
arXiv cs.CV

SigLIP-HD:通过由细到粗的监督

提出SigLIP-HD,用由细到粗监督让中分辨率图像模仿高分辨率特征,相同推理预算下提升视觉token质量,OCR任务效果显著。

04:00
arXiv cs.CV

VGGT对重叠的了解:探测几何基础模型中的共视性

发现VGGT隐式编码共视性,层L17为负锚点;Co-VGGT冻结骨干训练轻量MoE头,性能超越基线超25%。

04:00
arXiv cs.CV

DGSfM:深度引导的尺度感知全局运动恢复结构

提出深度引导全局SfM,利用单目深度图解决尺度模糊,显著提升位姿精度。

04:00
arXiv cs.CV

视觉免费,言语有偿:揭示边缘VLM推理的真正能耗瓶颈

输出tokens数量是能耗关键,解码时长比输入高11-39倍,控制输出长度可节省97%能耗。

04:00
arXiv cs.CV

ALICE:从视觉、视觉-语言和全切片级别专家中学习通用病理学基础模型

ALICE通过多阶段聚合蒸馏整合多种专家模型,在96项下游任务中取得最佳平均排名。

04:00
arXiv cs.CV

PanoWorld:真实世界全景生成

利用旋转等变性质,提出PanoWorld,通过DPRC和GMA实现全景世界模型的长程记忆,大幅超越现有方法。

04:00
arXiv cs.CV

Wan-Dancer:一种用于分钟级连贯音乐到舞蹈生成的层次化框架

提出层次化框架,通过全局关键帧规划和局部时间细化,突破时长限制,生成超一分钟稳定高清舞蹈视频。

04:00
arXiv cs.CV

TCLA:面向医学视觉语言模型的无训练类别级逻辑适配

TCLA通过少量样本无训练校正推理logits,提升医学视觉语言模型在域外数据上的性能,优于现有基于训练的方法。

04:00
arXiv cs.CV

可提示概念分割(自上而下视角):评估SAM 3在遥感中的零样本与单样本能力

SAM 3遥感零样本/单样本评估:视觉提示有效,文本提示干扰;避免过拟合但受限于亚像素分辨率与语义盲点。

04:00
arXiv cs.CV

合成数据与标签分布对油菜分枝计数的影响

合成数据与真实图像比例1:7及高斯平滑标签分布,使油菜分枝计数平均绝对差降低14.7%。

04:00
arXiv cs.CV

4DR360:面向4D雷达-相机全场景感知的联合3D检测与占据预测的状态推理

提出4DR360框架,将语义占据作为持续状态,通过跨模态状态推理实现雷达-相机360°联合检测与占据预测。

04:00
arXiv cs.CV

OpenLongTail:长尾驾驶数据的生成式扩展

OpenLongTail通过生成式视图合成将异构长尾数据转为一致多视图,提升自动驾驶处理长尾事件的鲁棒性。

04:00
arXiv cs.CV

面向语言智能的可扩展视觉预训练

挑战纯文本预训练假设,视觉预训练在同语料上表现更优,是实现可扩展语言智能的有效途径。

04:00
arXiv cs.CV

使用Kolmogorov-Arnold网络重新审视欧拉角回归

提出范围感知欧拉建模与KAN框架,利用其加性结构,有效提升欧拉角回归的精度与效率。

04:00
arXiv cs.CV

SplatCtrl:基于高斯场景表示与反应式机器人控制的感知-动作耦合

基于3D高斯泼溅的实时场景重建与反应式运动生成框架,实现动态环境中的无碰撞机器人控制。

04:00
arXiv cs.CV

聚焦局部:以对象为中心的视觉Transformer作为高效分割的基础模型

FLIP通过生物启发的选择性采样,用0.51M参数达79.9%mIoU,超越SAM2-L,速度快2倍。

04:00
arXiv cs.CV

GReFEM:多模态大语言模型作为物理引导的3D网格细化的零样本语义助手

本文提出GReFEM框架,利用多模态大语言模型零样本实现物理引导的3D网格细化,实验证明其高精度。

04:00
arXiv cs.CV

联合嵌入预测架构用于太阳能光伏板故障分类

提出JEFFNet,融合自监督语义与监督卷积特征,高效实现光伏热红外故障分类,参数减47.2%,F1达93%以上。

04:00
arXiv cs.CV

ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes

04:00
arXiv cs.CV

基于背景融合的原型少样本医学图像语义分割

提出背景融合原型法,通过特征校准与层级注意力融合背景,提升医学图像少样本分割性能。

04:00
arXiv cs.CV

基于多模态基础模型与几何的零样本三维通用障碍物检测

零样本3D障碍检测,融合多模态基础模型与几何,时序LiDAR聚合,定位100米内,召回率提升10-25%。

04:00
arXiv cs.CV

人眼视觉约束的超分辨率

受人类视觉启发,动态指导超分辨率,降低计算复杂度,减少FLOPS而不损失感知质量。

04:00
arXiv cs.CV

论视觉位置识别中的运动模糊与去模糊

针对VPR中运动模糊影响研究不足,提出新基准评估运动模糊与去模糊,并给出自适应策略。

04:00
arXiv cs.CV

VerteNet——一种多上下文混合CNN Transformer,用于侧位脊柱DXA图像中精确的椎骨标志点定位

提出VerteNet混合模型,利用双分辨率注意力捕获局部与全局信息,实现高精度椎骨标志点定位,归一化均值误差4.92。

04:00
arXiv cs.CV

白色聚合与恢复:面向小样本3D点云语义分割

提出WARM模块,用白化和着色变换生成确定性原型,解决注意力分布差距,在S3DIS上达到最优。

04:00
arXiv cs.CV

AffordanceSAM:在功能可供性定位中再分割一切

提出AffordanceSAM,通过适应模块和三阶段训练扩展SAM到功能可供性定位,实现SOTA性能。

04:00
arXiv cs.CV

基于监督式跨模态特征匹配的单帧点-像素配准

提出无检测器框架实现单帧LiDAR与图像直接点-像素匹配,利用可重复性评分抑制不可靠匹配,在多个基准上达SOTA。

04:00
arXiv cs.CV

面向真实世界错位观测的鲁棒自监督跨模态超分辨率

RobSelf自监督模型联合优化翻译器和滤波器,实现错位对齐与高保真超分,速度提升15.3倍。

04:00
arXiv cs.CV

Memory-SAM: 基于检索生成提示的无需人工提示舌体分割

Memory-SAM通过检索历史病例自动生成提示,引导SAM2实现高精度舌体分割,无需人工标注,mIoU达0.9863。

04:00
arXiv cs.CV

AV-Master:双路径综合感知提升音视频问答性能

AV-Master以动态聚焦与模态偏好策略,增强跨模态协作,在复杂音视频问答中表现优异。