11281 条条目 · 106 个活跃源
2026年7月3日
04:00
arXiv cs.CV

NI-Tex: 基于非等距图像的服装纹理生成

提出非等距图像服装纹理生成方法,借助数据集、图像编辑和迭代烘焙,生成高质量PBR纹理。

04:00
arXiv cs.CV

RoadBench:城市道路场景下MLLMs细粒度空间理解与推理的基准测试

提出RoadBench基准,评估MLLMs在城市道路场景的细粒度空间理解与推理,发现其性能显著不足,甚至低于简单基线。

04:00
arXiv cs.CV

PanoGrounder:基于全景场景表示连接2D与3D的VLM三维视觉定位框架

PanoGrounder利用全景场景表示和2D VLM,实现强泛化3D视觉定位,在ScanRefer等数据集上取得SOTA。

04:00
arXiv cs.CV

MonoMSK: 单目三维肌肉骨骼动力学估计

混合数据驱动与物理仿真,从单目视频恢复逼真3D人体运动与力,大幅提升精度。

04:00
arXiv cs.CV

GimbalDiffusion:重力感知的视频生成摄像机控制

提出GimbalDiffusion框架,以重力为参考实现极端角度摄像机控制,解决视角冲突并建立新基准。

04:00
arXiv cs.CV

SONIC:用于一致性修复的噪声频谱优化

通过线性近似和频谱预处理优化初始噪声,实现无需训练的即用型文本到图像模型修复,性能领先。

04:00
arXiv cs.CV

TetraSDF:基于多分辨率四面体网格的解析等值面提取

提出TetraSDF框架,用多分辨率四面体编码与ReLU MLP实现精确零等值面提取,保持网格编码器表现力。

04:00
arXiv cs.CV

通过自重采样实现自回归视频扩散的端到端训练

本文提出无教师框架,通过自重采样解决曝光偏差,实现端到端训练,长视频时间一致性更优。

04:00
arXiv cs.CV

被动场景声音与野外视频的视听相机位姿估计

首次利用被动场景声音结合视频实现相对相机位姿估计,在视觉退化时保持鲁棒,显著提升性能。

04:00
arXiv cs.CV

VisReason:用于视觉思维链推理的大规模数据集

VisReason大规模数据集(489K样本)及专家级子集VisReason-Pro,提升多模态大模型逐步视觉推理与泛化能力。

04:00
arXiv cs.CV

Magic-MM-Embedding:基于多模态大语言模型的高效视觉令牌通用多模态嵌入

提出Magic-MM-Embedding,采用视觉令牌压缩与多阶段渐进训练,实现高效且领先的通用多模态嵌入。

04:00
arXiv cs.CV

分布混合至关重要:面向高效视频扩散Transformer的动态稀疏注意力

MOD-DiT通过分布混合预测与在线块掩码,无采样实现动态稀疏注意力,加速视频扩散Transformer,提升生成质量。

04:00
arXiv cs.CV

通过语义注入实现针对扩散模型图像编辑的通用图像免疫

提出首个通用对抗扰动免疫框架,通过语义注入干扰扩散模型编辑,有效阻止未经授权的语义操控。

04:00
arXiv cs.CV

MMLoP: 多模态低秩提示用于高效视觉-语言适配

MMLoP仅需11.5K参数,通过低秩分解与三种正则化组件,在多数据集上实现高精度-效率平衡

04:00
arXiv cs.CV

AFFMAE:面向桌面硬件的高分辨率显微图像分割的可扩展视觉预训练

AFFMAE提出掩码友好分层预训练框架,通过自适应离格令牌合并,实现显微分割预训练速度提升2倍、内存减半,支持桌面级高分辨率训练。

04:00
arXiv cs.CV

UniDrive-WM:自动驾驶的统一理解、规划与生成世界模型

提出统一VLM世界模型,联合场景理解、轨迹规划与未来图像生成,L2误差降7.3%,碰撞率降10.4%。

04:00
arXiv cs.CV

GryphOne: 面向离线手写数学表达式识别中结构精化的符号感知掩蔽扩散

GryphOne离散扩散框架通过迭代符号精化,在MathWriting上达5.51% CER和59.9% EM,超越商业系统且泛化性强。

04:00
arXiv cs.CV

SpatialMosaic: 面向部分可见性的多视角VLM数据集

提出面向部分可见性的多视角VLM数据集SpatialMosaic,含2M问答对,集成几何编码器提升空间推理,实验验证有效。

04:00
arXiv cs.CV

基于可控扩散的病灶修复用于可扩展的组织病理学数据增强

PathoGen扩散模型生成逼真病灶,提升分割Dice达0.18,解决病理学数据稀缺与标注成本。

04:00
arXiv cs.CV

双解耦视觉语言模型用于零样本分心驾驶员检测

提出双解耦框架,消除外观干扰并正交化文本嵌入,提升零样本分心驾驶检测准确性。

04:00
arXiv cs.CV

长视频混合VLM的状态化令牌缩减

提出状态化令牌缩减方法,利用Mamba保持丢弃令牌信息,实现3.8-4.2倍加速并保持精度,优于基线。

04:00
arXiv cs.CV

NOVA:自动驾驶中3D多目标跟踪的下一步开放词汇自回归

NOVA提出自回归关联法,将跟踪转为序列补全,利用LLM建模轨迹时空语义,新颖类AMOTA提升20.21%。

04:00
arXiv cs.CV

利用视频扩散先验的超低比特率图像压缩中的下一帧解码

提出超低比特率图像压缩新范式,将解码转为下一帧预测,锚帧保留语义,比特率节省超50%,解码加速5倍。

04:00
arXiv cs.CV

Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution

04:00
arXiv cs.CV

基于扰动高斯集成的主动视图选择用于层析重建

针对稀疏CT主动视图选择,提出扰动高斯集成框架,通过密度随机缩放选高方差视角,消除几何伪影,性能优于基线。

04:00
arXiv cs.CV

OSCAR:基于占用率的声学神经隐式表示的形状补全

提出声学神经隐式占用率形状补全,从超声无标签重建完整椎骨,HD95提升80%。

04:00
arXiv cs.CV

SkipGS:面向高效3DGS训练的后致密化反向跳过

SkipGS通过视图自适应跳过反向传播,减少后致密化阶段42%时间,端到端训练提速23.1%,质量相当。

04:00
arXiv cs.CV

论线索冲突的可靠性及其超越

指出当前线索冲突基准存在不稳定偏差估计,提出REFINED-BIAS框架用于可靠、可解释的形状纹理偏差诊断。

04:00
arXiv cs.CV

Geo-ID:测试时几何一致性的跨视图本征分解

Geo-ID通过测试时几何一致性耦合单视图预测,无需重训即可实现跨视图本征一致分解,提升多视图一致性。

04:00
arXiv cs.CV

RC-GeoCP:雷达-相机协同感知的几何一致性

提出RC-GeoCP,利用几何一致性实现低成本、天气鲁棒的雷达-相机协同感知,通过GSR、UAC、CDA模块解决跨智能体对齐,平衡精度与通信。

04:00
arXiv cs.CV

Dress-ED: 指令引导的虚拟试穿与试脱编辑

首个大规模统一虚拟试穿/试脱与文本编辑基准Dress-ED,含14.6万四元组,提出统一多模态扩散框架。

04:00
arXiv cs.CV

用于活体共聚焦显微镜的自监督ImageNet表示:无需分割图的迂曲度分级

本文用自监督ImageNet特征实现活体共聚焦显微镜迂曲度分级,无需分割图,准确率达84.25%。

04:00
arXiv cs.CV

SegFly:面向大规模航拍RGB-热红外语义分割的数据集与2D-3D-2D范式

提出2D-3D-2D范式,自动生成97%RGB和100%热红外标注,构建含2万+RGB和1.5万+RGB-T对的SegFly数据集。

04:00
arXiv cs.CV

IRIS:从单目视频中逆向恢复与识别物理动态系统的真实世界基准

IRIS是首个真实世界基准,含240个4K视频,用于评估从单目视频逆向恢复物理参数和识别方程,发现系统故障模式。

04:00
arXiv cs.CV

Interact3D:交互物体的组合式3D生成

提出Interact3D框架,通过统一3D引导、两阶段组合和VLM精炼,从单张图像生成物理合理的交互式3D物体组合。

04:00
arXiv cs.CV

KGS-GCN:运动学驱动的高斯溅射与概率拓扑的骨架动作识别

提出KGS-GCN,利用运动学高斯溅射和概率拓扑图卷积,仅1.4M参数高效建模复杂时空动态,提升低保真传感器数据感知鲁棒性。

04:00
arXiv cs.CV

重新审视自回归模型用于生成式图像分类

利用任意顺序自回归模型进行顺序边缘化预测,超越扩散模型且效率高25倍,分类性能与判别模型相当。

04:00
arXiv cs.CV

用于分心驾驶行为时间定位的两阶段Transformer框架

提出两阶段Transformer框架,结合VideoMAE与SPPF模块,实现高效高精度分心驾驶定位,mAP达92.67%。

04:00
arXiv cs.CV

FUMO:基于先验调制的扩散模型用于单图像反射去除

提出FUMO扩散模型,融合强度与高频先验,经粗到细训练实现空间自适应反射去除,效果领先。

04:00
arXiv cs.CV

重新思考视觉隐私:一个基于VLMs的组合隐私风险严重性评估框架

提出CPRT组合隐私风险分级框架,发现VLM低估组合风险,8B SFT模型性能接近前沿。

04:00
arXiv cs.CV

E-TIDE:基于事件序列的快速、结构保持运动预测

提出轻量级架构E-TIDE,高效时空交互模块实现事件张量预测,性能相当但模型更小,适合实时部署。

04:00
arXiv cs.CV

GaussianGPT:迈向自回归三维高斯场景生成

提出自回归Transformer模型GaussianGPT,通过逐token预测直接生成3D高斯,支持逐步可控场景生成。

04:00
arXiv cs.CV

FCL-COD:基于频率感知与对比学习的弱监督伪装目标检测

提出FCL-COD框架,融合频率感知与对比学习,提升弱监督伪装检测性能,超越现有方法。

04:00
arXiv cs.CV

莫尔条纹视频认证:对抗AI视频生成的物理签名

利用莫尔纹物理特性,通过光栅条纹相位与位移的线性耦合,有效区分真实视频与AI生成视频。

04:00
arXiv cs.CV

EgoSim:面向具身交互生成的自我中心世界模拟器

EgoSim是闭环自我中心世界模拟器,持续更新3D场景,生成空间一致交互视频,支持跨具身迁移。

04:00
arXiv cs.CV

Salt:用于快速视频生成的自一致分布匹配与缓存感知训练

提出SC-DMD与缓存分布感知训练,显著提升低步数视频生成质量并兼容多种缓存机制。

04:00
arXiv cs.CV

DriveVA:视频动作模型实现零样本驾驶

DriveVA联合解码未来视觉与动作序列,利用视频生成先验,实现零样本跨域驾驶,性能大幅提升。

04:00
arXiv cs.CV

Stitch4D: 基于时空插值的稀疏多地点4D城市重建

Stitch4D通过时空插值合成中间视图,解决稀疏多地点城市4D重建不稳定的问题,在U-S4D基准上优于现有方法。

04:00
arXiv cs.CV

从同步到序列:通过插值实现外视角到内视角生成

提出Syn2Seq-Forcing,通过视频插值将外视角到内视角生成转化为连续序列建模,有效解决同步数据引发的时空不连续性难题。

04:00
arXiv cs.CV

RF-HiT:用于通用医学图像分割的整流流层次Transformer

RF-HiT整流流层次Transformer,线性复杂度3步推理,ACDC Dice 91.27%,BraTS 87.40%,高效分割。