11261 条条目 · 106 个活跃源
2026年7月8日
04:00
arXiv cs.CV

通过迁移学习增强建筑自动化焊接机器人的焊缝分割:解决双边分割网络的局限性

基于迁移学习的焊缝分割框架提升反射鲁棒性,Joint IoU提高22.36%,恢复96.33%零IoU失败,适用于轻量实时焊接机器人。

04:00
arXiv cs.CV

MobileWan:弥合移动视频扩散的质量差距

MobileWan首个将5B参数视频扩散模型部署至手机,通过循环蒸馏和压缩实现高质量、低延迟视频生成,VBench得分83.79创纪录。

04:00
arXiv cs.CV

Visual graphs for image classification: does the structure affect performance?

04:00
arXiv cs.CV

用于细粒度图像识别的视觉-语言模型中的结构化压缩提示调优

提出结构化压缩提示调优,通过语义关系编码与压缩损失增强语义对齐,在细粒度识别中取得最优性能。

04:00
arXiv cs.CV

PhyMRI-SR:迈向物理感知的MRI图像超分辨率

提出物理感知超分辨率法,动态处理分辨率,结合先验与物理约束,实现最优MRI重建。

04:00
arXiv cs.CV

VendorBench-100:深度伪造图像检测的统一跨范式基准

提出VendorBench-100基准,评估36个模型,发现商业API最优,但指标分歧(MCC与AUC)是核心发现。

04:00
arXiv cs.CV

MAC-XA:基于X射线血管造影的冠状动脉狭窄报告的多视角解剖对应融合

提出对齐约束多视角融合方法,利用合成数据学习解剖对应,提升狭窄报告一致性与评估质量。

04:00
arXiv cs.CV

不完全多视图聚类的直路径流匹配

提出直路径流匹配替代扩散模型,结合视图补全与聚类对齐,实现不完全多视图聚类新SOTA。

04:00
arXiv cs.CV

AlayaWorld:长时序且可玩的视频世界生成

提出AlayaWorld全栈开源框架,支持实时交互与多样动作,统一生成世界开发流程,奠定基础。

04:00
arXiv cs.CV

EeveeDark:面向低光视频增强的事件引导传感器级融合二值神经网络框架

EeveeDark融合RAW与事件流,用二值神经网络实现低光视频增强,性能优于先前BNN方法且兼顾效率。

04:00
arXiv cs.CV

MoWorld:一个闪速世界模型

MoWorld实现50FPS实时交互,推理成本仅为现有模型的30%-50%,高效低耗。

04:00
arXiv cs.CV

WING:基于窗口先验的门控Inception生成网络用于跨模态CT合成

WING利用窗口先验分解CT回归,门控Inception生成多窗口预测,Transformer融合细化,达最优跨模态合成。

04:00
arXiv cs.CV

基于令牌的双视图融合与大型视觉模型自适应乳腺癌分类

提出令牌双视图学习框架,在冻结ViT中通过融合令牌实现多深度交叉视图交互,提升乳腺癌分类性能。

04:00
arXiv cs.CV

VaseMuseum:古希腊陶器数字智能博物馆

提出VaseMuseum框架,结合多模态感知与知识检索,控制证据来源与响应,减少幻觉,提升可靠性。

04:00
arXiv cs.CV

XRFormer:面向XRF表示学习的多尺度标记化

提出XRFormer,多尺度标记化Transformer实现XRF光谱分析,自监督预训练提升性能,参数效率高。

04:00
arXiv cs.CV

类别无关运动预测的合成到真实场景迁移

提出目标感知运动预测与增强框架,弥合域差距,构建首个合成4D LiDAR数据集,提升真实场景预测性能。

04:00
arXiv cs.CV

增强RGB-噪声表示学习的通用合成图像检测

提出RNSIDNet,双分支架构结合硬样本对比学习,增强RGB-噪声表示,实现鲁棒通用合成图像检测,性能达SOTA。

04:00
arXiv cs.CV

以教师对齐修复桥接扩散模型剪枝与步骤蒸馏

提出教师对齐修复阶段,桥接剪枝与一步蒸馏,实现单步生成,在ImageNet-512上FID超越原模型。

04:00
arXiv cs.CV

FADRA:频率感知扩散与残差自适应视频人脸修复

提出FADRA,结合频率感知扩散和迭代残差自适应,在预训练视频扩散模型上高效恢复高质量且时间一致的人脸细节。

04:00
arXiv cs.CV

图像无法言说之处:语言引导的嗅觉表征学习

SCENT框架用语言引导对齐视觉与嗅觉,通过VLM生成场景描述学习气味表征,实现跨模态检索与气味解缠。

04:00
arXiv cs.CV

身份证件中光学可变器件的时序建模

提出自监督时序建模验证身份证件全息图动态,无需攻击样本,超越现有方法。

04:00
arXiv cs.CV

HoloCount: 面向多模态大模型的整体视觉计数基准

提出HoloCount基准,从语义、分析、鲁棒性三层面评估MLLM计数能力,揭示其在复杂推理场景的显著性能瓶颈。

04:00
arXiv cs.CV

EgoPolice:高风险警察执法记录仪视频中的自我中心视频理解基准

EgoPolice数据集用于高风险执法记录仪视频理解,精细标注,挑战性强,顶级模型仍难预测“武器出鞘”等高风险动作。

04:00
arXiv cs.CV

点云为骨架:累积点云增强的自回归生成用于闭环自动驾驶仿真

提出点云骨架框架,用累积点云增强自回归生成,提升闭环自动驾驶仿真视觉逼真度。

04:00
arXiv cs.CV

PIPBench:包含用户画像的个性化图像生成评估框架

提出首个包含用户画像的评估基准PIPBench,揭示现有方法关键限制,指明个性化文生图新挑战与机遇。

04:00
arXiv cs.CV

代理分析法:VLM作为条件编码器时的定位信号

通过代理分析发现,VLM作为条件编码器时定位信号未传到预设层,而是隐藏在不同中间表示中,导致编辑精度下降。

04:00
arXiv cs.CV

身份证件中动态全息行为的验证

提出新数据集MIDV-DynAttack和新验证方法,可检测动态全息攻击,无需动态样本训练,开源代码与数据集。

04:00
arXiv cs.CV

Andha-Dhun:印地语音频描述初探

首个印地语音频描述数据集,比较直接生成与翻译方法,发现机器翻译缺乏文化适应,需面向印度视障观众调整内容。

04:00
arXiv cs.CV

基于提示适配器的上下文路由实现参数高效的多镜头长视频外推

PACR-Video利用冻结扩散模型、低秩适配器和递归提示路由,实现参数高效多镜头长视频外推,性能超越基线。

04:00
arXiv cs.CV

缓解条件式户型图生成中的领域偏移:面向数据高效自适应的合成预训练

提出合成预训练强制物理约束,显著缓解户型图生成领域偏移,低数据微调性能提升40%。

04:00
arXiv cs.CV

气流攻击:针对红外遥感视觉-语言模型的热气流对抗扰动

首次用热气流扰动攻击红外遥感视觉-语言模型,跨模型攻击成功率达48.5%,暴露严重漏洞。

04:00
arXiv cs.CV

一种融合日间视觉性能与夜间反光性能评估的VLM增强交通标志状况综合评估框架

提出VLM日间评估与LiDAR夜间反光一体化框架,LLaVA/Qwen表现优异,462个标志中识别68个需更换。

04:00
arXiv cs.CV

视觉作为统一的多模态生成

提出将计算机视觉视为统一多模态生成,使用统一模型处理多种视觉任务,无需特定架构,表现媲美专业系统。

04:00
arXiv cs.CV

MonoIR-RS: 基于CLIP和VLM自适应的红外遥感视觉-语言学习

MonoIR-RS数据集通过CLIP对比学习和VLM指令微调,将红外遥感图像与语言对齐,显著提升召回率和红外线索覆盖。

04:00
arXiv cs.CV

GEM-Occ:从视觉几何证据到具身语义占用记忆

提出HIOcc室内占用基准和GEM-Occ框架,通过高斯证据内存将视觉几何转化为语义占用记忆,提升预测与建图性能。

04:00
arXiv cs.CV

CAIRN:基于拓扑感知的大型多模态模型的跨房间3D场景理解

CAIRN提出拓扑感知3D-LLM,利用图神经网络和分层注意力实现跨房间理解,在多房间基准上大幅领先。

04:00
arXiv cs.CV

ELSA3D:面向统一3D理解与生成的弹性语义锚定

ELSA3D通过弹性语义锚定统一3D理解与生成,实现稀疏精准跨模态交互,性能最优且计算减半。

04:00
arXiv cs.CV

多站点乳腺X线摄影钙化分类的无监督域适应

提出无监督域适应框架,结合风格迁移与Swin Transformer,使多站点乳腺钙化分类AUC从0.68提升至0.72-0.73。

04:00
arXiv cs.CV

面向法医合成媒体检测的概率AI模型的溯因佐证

采用溯因推理佐证多模型输出,显著降低合成媒体检测误报率,并首次实证评估SynthID。

04:00
arXiv cs.CV

BitFair: 适用于超低功耗XR视觉的12nm位串行CNN加速器,具有可学习早期终止与自适应位排序

BitFair通过可学习早期终止和自适应位排序,在12nm工艺下实现亚毫秒延迟、高能效,准确率提升达9.2%。

04:00
arXiv cs.CV

ProxyPose:通过视频到视频翻译的六自由度姿态追踪

将6-DoF姿态追踪转为视频到视频翻译,仅需视频和单像素标记,利用扩散模型生成代理视频后经典求解,无需额外输入,处理困难材质与遮挡,达SOTA。

04:00
arXiv cs.CV

从RGB生成到密集场读出:基于文本到图像模型的像素空间密集预测

提出ReChannel,去除目标解码器,以线性头直接映射token到像素块,在多项密集预测任务上达SOTA,速度提升2.48倍。

04:00
arXiv cs.CV

OrchardBench:基于物理的GPU并行苹果园仿真基准

OrchardBench是物理精确的GPU并行苹果园仿真,为农业机器人采摘提供基准,基线成功率约40%。

04:00
arXiv cs.CV

SSA-3DGS:面向3D高斯泼溅的屏幕空间伪影无监督去除方法

提出无监督框架SSA-3DGS,联合优化3D场景与2D覆盖层消除伪影,PSNR提升达9dB。

04:00
arXiv cs.CV

GraspIT:弥合模拟与真实世界双向鸿沟的验证抓取SE(3)姿态生成数据集

GraspIT提供2.3M抓取候选(83%优质),经滑移测试验证,双向映射模拟与真实,含316k标注帧,开源。

04:00
arXiv cs.CV

Lift3D-VLA:将VLA模型提升到具备3D几何与动力学感知的操作

提出Lift3D-VLA框架,融合显式3D点云推理与时空一致动作生成,在模拟和真实操作任务中成功率提升超10%。

04:00
arXiv cs.CV

TMF-RSE: 三模态融合结合区域语义与证据不确定性用于肺部严重程度评分

提出TMF-RSE三模态融合框架,整合外观、结构、语义特征,利用证据回归实现肺部严重程度评分与不确定性估计,性能超越基线。

04:00
arXiv cs.CV

WristMimic: 基于手腕引导的全身人形控制操作

WristMimic通过手腕引导分离身体与手指操作,无需手指姿态监督,实现高效物体操控。

04:00
arXiv cs.CV

标签层级转换:深入挖掘类别层级以增强深度分类器

提出标签层级转换(LHT)框架,利用转换网络和混淆损失挖掘层级相关性,提升深度分类器性能。

04:00
arXiv cs.CV

从像素到肖像:说话头部生成技术与应用综述

综述说话头部生成四大技术,剖析评估差距与趋势,聚焦身份保持、唇同步等核心挑战。