11081 条条目 · 106 个活跃源
2026年8月10日
04:00
arXiv cs.CV

Raster2Seq:用于平面图重建的多边形序列生成

Raster2Seq将平面图重建转为序列生成,用带标签多边形序列编码几何语义,自回归解码器借锚点聚焦图像区域,在多个基准达最优。

04:00
arXiv cs.CV

结合文本先验学习序数退化表示,用于基于扩散的盲图像超分辨率

提出OD-CLIP,借助文本先验建模连续退化程度,提升盲超分辨率的保真度和内容一致性。

04:00
arXiv cs.CV

通过引导视觉令牌注意力实现直接视觉定位

提出一种注意力损失,直接监督视觉令牌注意力,使答案令牌关注相关图像区域,显著提升多种视觉定位任务。

04:00
arXiv cs.CV

面向大型视觉-语言模型中任务感知令牌剪枝的解耦相似度

提出DeSAP方法,用解耦相似度与视觉显著性指导视觉令牌剪枝,大幅降低计算开销,保持性能,优于现有方法。

04:00
arXiv cs.CV

SparseVoxelDet:面向高效事件无人机检测的全稀疏体素网络

首个坐标稀疏3D事件体素目标检测器,全流程无稠密网格,反卷积融合避免支撑膨胀,稀疏性保精度且效率高,FRED上AP50达87.01。

04:00
arXiv cs.CV

在噪声层级标签下学习粗到细的骨关节炎表征

噪声下简单双头监督利用粗/细层级标签,改善骨关节炎表征,形成有序潜在结构与软骨对齐。

04:00
arXiv cs.CV

面向自动驾驶的轻量级视觉语言模型中的视觉概念探测

线性探针揭示VLM两类失败:感知失败(信息未编码)与认知失败(未对齐语言);距离增大降低线性可分性。

04:00
arXiv cs.CV

身份即在场:面向外观与声音个性化的联合音视频生成

提出身份即在场框架,实现多主体外观与声音联合生成,通过统一身份注入与多阶段训练提升音视频质量与一致性。

04:00
arXiv cs.CV

SciLT:科学图像领域下的长尾图像分类

提出SciLT框架,融合多层特征与双监督学习,在科学长尾图像分类中平衡头尾类性能,优于现有方法。

04:00
arXiv cs.CV

MILE:跨领域与模态持续语义分割的增量LoRA专家混合

MILE用LoRA专家增量学习新任务,原型门控选专家,防遗忘且高效可扩展。

04:00
arXiv cs.CV

SynthRender与I-AsSET:面向工业物体感知的双向仿真-现实迁移的开源框架与数据集

提出SynthRender与I-AsSET,实现工业物体感知双向仿真-现实迁移,mAP超95%。

04:00
arXiv cs.CV

教师特征漂移:基于预训练扩散表示的一步扩散蒸馏

利用教师中间特征作表示,单漂移损失加模式覆盖损失实现一步扩散蒸馏,简化框架且性能优异。

04:00
arXiv cs.CV

RemoteZero:零标签地理空间推理

提出无标签框架,用多模态大模型评估裁剪图与查询一致性为奖励,实现地理空间推理,超监督基线并自我进化。

04:00
arXiv cs.CV

以貌取书:探究多模态大语言模型用于多页手写文档转录

提出零样本多页手写文档转录法,融合OCR与多模态大模型,引入新基准和数据集,提示策略超越现有方法。

04:00
arXiv cs.CV

WAM-Diff2:面向高效自动驾驶VLA的分层自回归到扩散蒸馏

三阶段分层蒸馏将自回归VLA转扩散模型,消除暴露偏差且性能持平,解码加速2.8倍,优化后15.1倍。

04:00
arXiv cs.CV

面向四足机器人的全景多模态语义占用预测

提出四足机器人全景多模态占用数据集PanoMMOcc及框架VoxelHound,缓解姿态扰动,mIoU提升4.16。

04:00
arXiv cs.CV

面向多速率稀疏视图CT的分辨率无关神经算子

提出CT神经算子CTO,首个神经算子框架,跨采样率泛化,性能超CNN,推理比扩散快500倍。

04:00
arXiv cs.CV

重新思考基于区间边界传播的认证训练中的评估范式

深度网络易受对抗扰动,认证训练需平衡自然与认证精度,但单一配置评估有误导。用Pareto前沿多目标优化评估,发现先前方法欠调优,新方法刷新最优,且先前进展被高估。

04:00
arXiv cs.CV

VLA-Arena:用于基准测试视觉-语言-动作模型的开源框架

VLA-Arena开源基准,三维度量化VLA能力,揭示记忆化、浅层感知等局限。

04:00
arXiv cs.CV

RenderFormer++:可扩展且物理信息启发的前馈神经渲染

提出物理信息传输引导与层级物体中心分词,降低计算成本,实现复杂大规模场景的高效可扩展全局光照渲染。

04:00
arXiv cs.CV

iFAN:面向普通掩码Transformer的推理感知学习

iFAN通过推理感知训练,调整掩码排序并跨层蒸馏,分割平均提升1.2/1.3/0.63个百分点,零开销。

04:00
arXiv cs.CV

胎儿超声中时间与采集偏差的交叉解耦

交叉分析解耦胎儿超声时间和采集偏差:扫描至分娩间隔主导误差,像素间距影响弱,需防混淆。

04:00
arXiv cs.CV

以人类方式对图像融合排名:面向红外-可见光融合评估的学习成对偏好度量

提出LPIFM模型,学习成对偏好以预测人类对红外-可见光融合比较,精度高、一致性好,并公开数据。

2026年8月7日
04:00
arXiv cs.CV

MapTCL:通过双向对齐的时间一致性学习用于矢量化高清地图构建

提出MapTCL辅助训练策略,用双向对齐保持时序一致性,稳定高清地图生成,无需额外推理开销,显著提升现有模型性能。

04:00
arXiv cs.CV

上下文强制:揭示自回归视频扩散中的上下文效应

提出上下文强制法,用递减噪声上下文引导自回归视频扩散,增强时序一致性,支持并行去噪,加速推理且不损性能。

04:00
arXiv cs.CV

StyleComposer:无需训练的多参考风格组合

该方法无需训练,将色彩、纹理、结构分别路由到最优表示,按去噪时间协调,实现多参考风格组合与强度控制。

04:00
arXiv cs.CV

NeuroAdaptTrainer:基于YOLO的神经元分割、交互校正与迁移学习的Fiji/ImageJ插件

开源Fiji插件,集成YOLO神经元分割,支持交互校正与迁移学习,内置验证模块,降低深度学习使用门槛。

04:00
arXiv cs.CV

LoDA:一种检测级别感知方法及面向目标级变化检测的多模态传感基准

提出目标级三维变化检测流程融合检测限感知配准几何代理与位移线索构建LoDA基准精度95%优于基线。

04:00
arXiv cs.CV

Grad-CAM在视觉Transformer中的应用:可解释AI方法论歧义的系统分类与审计

系统审计175篇论文,发现ViT版Grad-CAM多被当作CNN直接扩展,适配细节常被省略,存在严谨性与可复现性风险。

04:00
arXiv cs.CV

一段话胜过千条标题:重新思考视觉语言检索中的文本监督

段落级文本监督可显著提升长描述图文检索性能,无需改架构即可超越Long-CLIP;短标题训练超60词后失效,硬负样本反而有害。

04:00
arXiv cs.CV

无辜画面,仇恨故事:多轮视觉故事生成中仇恨意图的评估与检测

提出多轮仇恨故事提示集,前沿模型完成率超八成,现有审核漏检,需交互感知防御。

04:00
arXiv cs.CV

面向胸部X光报告生成的正-未标记偏好优化

针对漏报噪声,提出PU-DPO框架,以正-未标记学习构建偏好,提升病理检出率与鲁棒性。

04:00
arXiv cs.CV

上下文至关重要:上下文医学图像分割中的支持集选择与失败检测

支持集选择影响上下文医学图像分割性能;相似性选择优于随机,分类器可预判失败。

04:00
arXiv cs.CV

OmniMech:面向三维重建的全能多模态机械基准

OmniMech首个百万级机械基准,评估大模型从工程图生成可执行CAD及三维重建,现有模型仍难达工业精度。

04:00
arXiv cs.CV

基于视觉-语言基础模型的文本引导多序列胶质瘤亚区分割优化

三维视觉-语言基础模型可依文本指令精修胶质瘤亚区分割正确指令优于空白矛盾指令提示需临床交互验证

04:00
arXiv cs.CV

隐形捷径:为什么视觉编码器知道你的相机

视觉编码器利用像素级元数据痕迹作为捷径,元数据与语义关联越强,性能下降越大;缓解可提升泛化,同时解释生成图像检测能力。

04:00
arXiv cs.CV

CDSeg:一种用于图像到3D标签迁移的可渲染高斯载体

用高斯原语作可渲染载体,无需3D分割训练,经渲染可见性与投票融合多视图掩码,实现图像到3D标签迁移,性能优。

04:00
arXiv cs.CV

利用级联语义适配视觉基础模型

提出级联语义提示调优,融合图像基本特征与注意力先验,仅调0.74%参数即提升下游任务性能。

04:00
arXiv cs.CV

MOSAIK:面向高效生成的图像Token多补丁内容感知空间分配

MOSAIK按区域和去噪步动态分配补丁大小,用轻量预测器估计损伤,降低70%算力与83%令牌,性能几乎无损。

04:00
arXiv cs.CV

VideoArgus:基于智能评分标准的视频生成与编辑统一评测框架

提出统一评分标准框架,覆盖五类视频生成编辑任务,生成可复用规则,结合视觉问答与工具产出证据评分,评测结果更贴合人类判断,并发布基准数据集。

04:00
arXiv cs.CV

DynaPix:视觉语言模型能否识别确切的未来?

该基准要求从相似候选中选真实未来帧。模型靠事件标记成功,只凭时间则近乎随机,人类正常,暴露时间锚定缺陷。

04:00
arXiv cs.CV

HERA:潜在世界模型中物理预测的历史证据路由适配器

提出HERA路由适配器,将历史证据接入冻结的潜空间预测器,显著提升遮挡场景下的物理预测。

04:00
arXiv cs.CV

APQF:智能体画像引导的结构化剪枝与混合精度量化及自适应微调

APQF以智能体画像引导结构化剪枝与混合精度量化,计算量大幅降低且精度几乎不变,优于现有联合方法。

04:00
arXiv cs.CV

无人机航拍图像目标导航的不确定性感知世界模型

提出UA-NWM,将轨迹评分视为分布外检测,仅用不可解释残差评分,性能优且延迟低。

04:00
arXiv cs.CV

SCI-CLIP:面向无训练开放词汇分割的片段中心推理与参考记忆

提出片段中心推理框架,无需训练,结合区域图重构与参考记忆,显著提升开放词汇分割性能。

04:00
arXiv cs.CV

三维点云生成的层次流匹配

提出层次流匹配,通过双层流分别建模全局形状与局部细节,仅需15步采样,在ShapeNet和ModelNet上性能领先。

04:00
arXiv cs.CV

从体育到安全:多模态大语言模型主动风险推断的基准测试

提出SPRINT基准评估MLLM体育视频风险推断,发现模型预警灵敏但原因识别差、易误报。

04:00
arXiv cs.CV

CoordRefer:基于多视图图像的坐标感知三维视觉定位

提出CoordRefer框架,解耦坐标帧选择与坐标条件化框回归,利用3D IoU奖励优化,显著提升多视图三维视觉定位精度。

04:00
arXiv cs.CV

EffectLearner:面向真实世界视频物体移除的世界感知物体-效果推理

提出EffectLearner,融合视觉语言推理与扩散擦除,实现复杂真实场景视频物体及效果移除,性能优于基线。

04:00
arXiv cs.CV

超越帧选择:用多模态大模型重新思考长视频理解

提出视频路由器,用全局与局部证据协同理解长视频,以验证路由选答案,在VideoMME上超帧选择法2.9分。