10911 条条目 · 106 个活跃源
2026年9月2日
04:00
arXiv cs.CV

高斯核心LoRA:面向广泛概念擦除的分布感知动态适配

针对宽概念擦除,提出高斯核心LoRA,用混合高斯估计原型,动态重构低秩空间,显著降低ASR并提升图像质量。

04:00
arXiv cs.CV

TempCloze:视频大语言模型能否识别缺失的中间片段?

提出视频完型基准TempCloze,模型据首尾片段从四选项中识别缺失中段;评测显示时间对齐是主要瓶颈。

04:00
arXiv cs.CV

真实退化下人脸伪造检测的空间、频谱与自监督线索基准评测

真实退化下人脸伪造检测性能下降,自监督DINOv3最鲁棒,频谱线索需结合RGB。

04:00
arXiv cs.CV

重新审视跨视角补全:基于重建误差比较的自监督预训练

Gekko通过比较跨视角与掩码自编码误差,自监督学习共视性,无标注提升3D视觉任务,性能超越CroCo。

04:00
arXiv cs.CV

DualDiff3D:双重结构-外观扩散先验提升三维高斯溅射的可靠性

提出双重结构外观扩散先验,区分视图间结构差异与外观一致性,并通过渲染细化优化循环增强三维高斯溅射可靠性。

04:00
arXiv cs.CV

基于视觉Transformer的肾透明细胞癌分级的语义引导多模态预处理

语义引导多模态预处理:ViT肾癌分级平衡准确率达0.916,较RGB基线提升21个百分点,抗误差稳健

04:00
arXiv cs.CV

BS: 借助提示——基于涂鸦条件的ResEnc U-Net实现交互式多示踪剂PET/CT病灶分割

提出涂鸦条件U-Net,利用前景背景涂鸦引导PET/CT病灶分割,经五次修正后Dice从0.554升至0.751,交互显著提升性能。

04:00
arXiv cs.CV

UI-VISA:U-Net初始化的血管图像分割架构

提出UI-VISA,以U-Net预测为种子,CNN引导区域生长,细化血管分割并提升连通性,DSA图像上clDice显著提高。

04:00
arXiv cs.CV

H3-World:将语言理解转化为世界控制

H3-World将大视频生成器的语言理解转化为精确的时序世界控制,仅需少量样本和参数即可操控角色与镜头。

04:00
arXiv cs.CV

跨域监控场景下车辆属性分类基准

提出面向跨域监控场景的车辆属性基准,评估朝向、车型识别适宜性及颜色清晰度,发现域偏移影响大于架构选择。

04:00
arXiv cs.CV

基于线图元的逆向渲染建模

提出用显式线段逆向渲染重建毛绒等模糊几何,经随机可微光栅化优化,质量堪比体积法且兼容标准图形管线。

04:00
arXiv cs.CV

揭示原生统一多模态模型中的理解-生成协同:从表征、任务到系统

理解与生成在表征上互益,但同路径易失衡;任务解耦、共享知识与端到端优化可化共存为协同。

04:00
arXiv cs.CV

基于势引导的粒子转向实现否定约束灵巧抓取

新框架无需否定样本,结合粒子滤波与无分类器引导,实现“抓指定处并避开禁忌区”,违规率仅17.2%。

04:00
arXiv cs.CV

专家在环掩码条件渐进学习实现专家级骨骼超声分割

ExiL以掩码条件渐进学习,标注时间降至1/3,Dice提升0.045,实时自我改进。

04:00
arXiv cs.CV

熊猫外交:高能与核物理中跨粒子成像探测器的基础模型预训练

提出点云自蒸馏框架,跨三种粒子探测器预训练,用极少标注即可超越或匹敌专用模型,实现高效粒子重建与识别。

04:00
arXiv cs.CV

空间卫士:面向文生图的基于驾驭引导的可验证空间推理

空间卫士解析提示为三维布局,经视觉实现与一致性验证,以可编辑布局状态保持约束,提升复杂文生图空间一致性。

2026年9月1日
04:00
arXiv cs.CV

通过度量三维融合理解开放词汇无人机感知的时间语义稳定性

通过度量三维融合评估无人机开放词汇分割的时间语义稳定性,发现语义闪烁,观测持续性影响一致性评估。

04:00
arXiv cs.CV

BaryCache:内存高效的扩散Transformer免训练加速

提出BaryCache免训练加速法:重心外推稳定预测采样,降低内存占用,最高提速3.30倍。

04:00
arXiv cs.CV

面向视频推理的多智能体自改进强化学习

多智能体强化学习框架用冻结验证器引导训练,提升视频推理零样本迁移,增益稳定但边界精度有限。

04:00
arXiv cs.CV

开放集牛鼻纹识别:泄漏控制的基准与评估协议

构建防泄漏开放集牛鼻纹识别基准,阈值校准与嵌入质量关键,混合模型与基础模型各有优劣。

04:00
arXiv cs.CV

利用孪生神经网络测量艺术图像与AI生成图像之间的相似性

采用孪生网络与CLIP编码器,三元组损失优化,测试准确率99.4%,有效区分艺术与AI图像。

04:00
arXiv cs.CV

通过结构化视频提示改进视频语言模型的时空推理

提出结构化视频提示在推理时给视频添加时空结构无需训练即可提升视频语言模型的时空推理能力

04:00
arXiv cs.CV

FrameScope:自动驾驶系统中流式主动学习的时序数据估值

提出时序数据估值框架,在车端筛选高价值帧,仅向云端请求其标签,提升样本效率、缓解灾难性遗忘并降低带宽。

04:00
arXiv cs.CV

多曝光HDR成像:像素级与特征级重建方法综述

综述多曝光HDR成像,重点分类像素级与特征级重建,涵盖融合与去鬼影,总结数据集、指标及未来方向。

04:00
arXiv cs.CV

MIRAGE-CAD:基于构造中介的多模态可执行CAD程序生成

从多模态输入生成可执行CAD程序,以显式构造计划为中介,构建成功率55.4%–70%,STEP导出率52.3%–66.2%。

04:00
arXiv cs.CV

AdaptAV:基于云端Oracle的自动驾驶车辆视觉模型持续适应

针对自动驾驶轻量视觉模型泛化不足,云端高精度Oracle指导车辆模型重训并传回,提升推理精度。

04:00
arXiv cs.CV

改进率失真权衡的分布式语义分割

提出两种新源码编解码器,极低比特率下提升率失真性能,分布式语义分割达SOTA。

04:00
arXiv cs.CV

FLM:面向生成式图像压缩的频率感知语言模型

频率感知语言模型FLM,用DCT系数序列自回归概率建模,提升图像压缩率失真性能,优于JPEG。

04:00
arXiv cs.CV

培育林分,而非单树:联合树冠生成再现树冠羞避

联合生成林分而非单树,流匹配模型再现树冠羞避,证实其为林分整体属性。

04:00
arXiv cs.CV

多传感器融合的脆弱城市住区制图:基于SAR、多光谱与高光谱影像的阿根廷科尔多瓦案例研究

融合SAR、多光谱和高光谱影像的深度学习框架,有效绘制非正规住区,并揭示更广泛的城市脆弱性模式。

04:00
arXiv cs.CV

中文标题

提出HERBIOME自动化流水线,融合检测、识别与语义解析,高效提取植物标本标签元数据,支撑多模态AI。

04:00
arXiv cs.CV

投影感知的360度视频端到端学习压缩

研究发现投影效率依赖编解码器:神经压缩中等距柱状投影最优,传统编码器则立方体贴图更佳,为学习式360度视频压缩选投影提供参考。

04:00
arXiv cs.CV

CARD:通过逆向扩散中的一致性校准实现域外MRI分割

利用逆向扩散中形状先验与分割器的不一致轨迹,逐像素校准置信度,在MRI域移中45/49优于最强基线。

04:00
arXiv cs.CV

使用现成VLM评估SVG生成的约束迭代细化

现成VLM生成SVG:约束解码提升编译成功率,迭代细化暴露视觉推理与自纠错不足,有潜力但受限。

04:00
arXiv cs.CV

数据多样性,而非频率不变性:压缩鲁棒深度伪造检测的受控与自我审计研究

频率不变性无益于压缩鲁棒深度伪造检测;数据多样性(多码率)才是关键,普通模型即可超越复杂频率方法。

04:00
arXiv cs.CV

防御可穿戴VLM遭受私有属性推断

提出TGAP防御可穿戴VLM令牌泄露,隐私推断准确率从56.7%降至7.4%,保持可用性。

04:00
arXiv cs.CV

超越视觉边界:重新思考电影RAG的场景分割

研究发现现有场景分割不适用于电影RAG,叙事中心的分割优于均匀分块。

04:00
arXiv cs.CV

编织视觉叙事:超越原子视觉匹配的智能图像包组合

提出图像包组合新范式及BundleWeaver智能框架,动态组合关联图像,打破原子匹配局限,显著提升检索性能。

04:00
arXiv cs.CV

SNF-Bench:在长时程固定相机视频生成中分离静态漂移与自然流动

新基准将场景分为静态支撑与动态流,独立评估保真度、流动持续性与漂移泄漏,避免整帧指标混淆。

04:00
arXiv cs.CV

Inter-3D VQA:面向3D时空定位视觉问答的路侧多模态基准

提出Inter-3D VQA,40.7万路侧3D时空问答,及Inter-Geo,优于图像VLM。

04:00
arXiv cs.CV

随机液体形变场:动态3D高斯泼溅的闭式连续时间细胞SDE泛化

将液体网络的随机噪声加入CfC形变场,训练时用噪声,无需求解器,在合成场景优于MLP,但真实场景噪声无益。

04:00
arXiv cs.CV

文档视觉语言模型中基于状态条件的视觉证据检索用于细粒度感知

提出状态条件视觉证据检索,按需获取细粒度信息,提高文档解析效率与鲁棒性。

04:00
arXiv cs.CV

指令蒸馏:文本指令作为视觉示例

提出指令蒸馏,为每图生成结构化指令,推理无需图像,性能相当,词元降2.9倍,延迟降3.3倍,与图像互补。

04:00
arXiv cs.CV

MANTLE:基于模块化上行链路原则的自适应行星原位感知框架

提出多任务网络MANTLE,共享DINOv2骨干,地形分类准确率92.56%,巨石分割IoU 0.753,支持模块化上行持续学习。

04:00
arXiv cs.CV

TopoAgent:基于大型视觉语言模型的结构感知图表到图拓扑抽取感知-推理框架

提出TopoBench-180基准与TopoAgent框架,实现图表到图的拓扑抽取,性能优于现有视觉语言模型。

04:00
arXiv cs.CV

用于高分辨率目标检测的可变粒度标记化

提出无需训练的VGTok,按区域设定可变粒度,固定标记预算,航拍检测刷新最优,大幅降低算力内存。

04:00
arXiv cs.CV

文本驱动的艺术布景:从绘画中获取姿态、光照与相机参考

从绘画重建姿态、光照与相机,提出文本驱动的可编辑3D布景生成任务,模型优于CLIP检索。

04:00
arXiv cs.CV

文本引导模型用于人脸编辑的大规模评估

首次大规模评估六种文本引导模型人脸编辑,覆盖169属性:发型饰品佳、姿态差,存过度编辑偏差。

04:00
arXiv cs.CV

无人机与卫星图像的像素级地理配准

提出SkyReg数据集与基准,用于无人机-卫星像素级地理配准,训练几何感知重建管道达最优。

04:00
arXiv cs.CV

超越表示学习:面向3D脑MRI的联合嵌入预测生成的系统研究

提出Med-D-JEPA,将联合嵌入预测生成用于3D脑MRI,生成质量优于基线,合成预训练显著提升分类与分割性能。