11301 条条目 · 106 个活跃源
2026年6月1日
04:00
arXiv cs.CV

基于直方图正则化潜在扩散模型的可控肺结节合成

提出直方图正则化潜在扩散模型,约束结节强度分布,合成真实且亚型一致的肺结节,提升CT数据增强效果。

04:00
arXiv cs.CV

机器学习中的数学形态学

将形态学引入ML,提出快速聚类与高效距离度量,比欧氏快329倍,k-NN在26/33数据集上准确率超平均。

04:00
arXiv cs.CV

WristCompass:动力学耦合作为自我相机朝向的可学习视觉概念

利用手腕与相机动力学耦合,以少量参数零样本迁移,解决手部遮挡下的朝向估计,性能接近大模型。

04:00
arXiv cs.CV

PInVerify:面向主动实例验证的离线具身基准

提出主动实例验证任务及离线基准PInVerify,通过多视角验证细粒度描述,最佳MLLM基线准确率85.6%。

04:00
arXiv cs.CV

ReGuLaR:面向大型视觉-语言模型的基于关系隐层推理

ReGuLaR将隐推理扎根于视觉对象关系,训练时引导、推理时无额外开销,取得多项基准最优。

04:00
arXiv cs.CV

工业视觉模拟到现实中的先验可用性:CAD引导与CAD不可用模式综述

重新定义域差距问题,区分CAD可用与不可用模式,强调先验决定部署决策。

04:00
arXiv cs.CV

ConTrans:学习文本增强的局部-全局时间表示用于零样本时间动作定位

提出ConTrans模型,融合卷积与Transformer,捕获局部-全局时间特征,显著提升零样本时间动作定位性能。

04:00
arXiv cs.CV

Crafter:面向多输入可编辑科学图表生成的多智能体框架

Crafter多智能体框架可生成可编辑SVG科学图表,支持多种输入与类型,性能超越现有方法。

04:00
arXiv cs.CV

先见后议:用视觉证据对齐多智能体共识

提出EAGLE框架,通过对齐视觉证据实现多智能体可信共识,在VQA基准上取得最佳平均性能。

04:00
arXiv cs.CV

Immuno-VLM: 通过生成语义抗体为开放世界可信性免疫大型视觉语言模型

提出Immuno-VLM框架,利用大语言模型生成语义抗体主动界定决策空间,解决开放世界可信性悖论,实现新SOTA。

04:00
arXiv cs.CV

密集城市环境中的视觉定位:中国城中村案例研究

针对城中村GPS不可靠,提出双摄像头视觉定位方案,以广州石牌村评估模型,旨在改善导航与应急管理。

04:00
arXiv cs.CV

基于群对称性下流匹配的等变潜在对齐

残差潜流框架纠正等变潜在未对齐,提升新视角合成质量。

04:00
arXiv cs.CV

用于病例级病理概要报告生成的简单令牌高效视觉语言模型

提出简单令牌高效病理报告生成模型,采用大图块和高效训练,仅需半张H100 GPU即可实现高质量多WSI报告生成。

04:00
arXiv cs.CV

Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding

04:00
arXiv cs.CV

DisPlace:多参考视觉地点识别中的判别性地点投影

DisPlace通过广义特征值融合多参考描述符,增强地点判别性,抑制条件变化影响,优势显著。

04:00
arXiv cs.CV

SLAP:面向变分视频-语言建模的语义最小作用量原理

从概率生成转向变分力学,用黎曼流形路径建模视频插值,通过离散欧拉-拉格朗日方程保持语义一致性。

04:00
arXiv cs.CV

文本引导的跨模态步态识别特征解耦

提出文本引导的跨模态特征解耦网络TCFDNet,利用语言先验对齐异构模态,实现跨模态步态识别新SOTA。

04:00
arXiv cs.CV

CameraNoise: 通过几何流引导的噪声扭曲实现视频扩散中的忠实相机控制

提出CameraNoise,用几何流引导噪声扭曲将相机运动嵌入噪声空间,保持高斯先验,实现高保真视频生成与忠实轨迹控制。

04:00
arXiv cs.CV

MechVQA:面向机械图纸全面理解的多模态大语言模型基准测试与增强

MechVQA数据集含3.3k图像21k问答,覆盖识别、推理与判断三层次;MechVL模型超越最强闭源7.57个百分点。

04:00
arXiv cs.CV

LegSegNet:一种用于下肢CT组织分割与量化的公开深度学习系统

首个公开的端到端下肢CT组织分割与量化系统,测试集平均Dice达89.31。

04:00
arXiv cs.CV

DSD-GS:面向高效高保真动态场景重建的高斯溅射动静分解

提出动静分解高斯溅射框架,消除静态冗余,实现高效高保真重建,训练仅10分钟,渲染超700 FPS。

04:00
arXiv cs.CV

Robust Dreamer: 用于动作控制自回归视频生成的偏差感知潜在高斯记忆

提出Robust Dreamer,通过潜在高斯记忆和偏差学习,解决长程视频生成中的视觉退化和训练-推理差距。

04:00
arXiv cs.CV

计数万物

提出跨域文本引导计数模型Count Anything,构建六域CLOC数据集,双粒度枚举实现多域泛化。

04:00
arXiv cs.CV

是什么让大型视觉语言模型减少幻觉?——揭示幻觉稳健性背后的架构因素

首次系统探索架构三维度(语言、视觉、对齐)对幻觉影响,发现联合提升视觉与对齐最有效减少三类幻觉。

04:00
arXiv cs.CV

Function2Scene:从功能规范生成3D室内场景布局

提出从功能规范生成3D室内布局的框架,通过迭代评估与优化,94.3%情况下优于现有方法。

04:00
arXiv cs.CV

面向3D CT重建、增强与生成的基础变分自编码器

自然图像预训练的基础VAE无需微调,统一用于CT重建、增强与生成,提升重建精度和生成质量。

04:00
arXiv cs.CV

GUI-C$^2$:基于难度感知强化学习的由粗到细GUI定位

通过难度评分筛选训练样本,结合由粗到细区域门控与阶段奖励,简化决策,高效提升GUI定位精度,达最优性能。

04:00
arXiv cs.CV

SteerFace:通过自适应残差扰动实现合成人脸生成的去偏

SteerFace通过自适应扰动身份嵌入,惩罚生成器依赖非身份视觉线索,缩小合成与真实人脸识别差距。

04:00
arXiv cs.CV

MergeTok:通过令牌合并实现连续与离散视觉令牌化的统一

MergeTok用令牌合并统一连续离散令牌化,实现语义对齐与稳定训练,降低重建和生成误差。

04:00
arXiv cs.CV

DiTTo: 可扩展的排序感知一体化图像修复代理

提出DiTTo框架,通过高效模拟和排序感知对齐实现可扩展扩展,在多地退化修复中达到最优性能。

04:00
arXiv cs.CV

关注证据:面向多模态RLVR的基于证据锚定的空间注意力监督

EASE方法用视觉证据监督增强多模态RLVR,锚定证据区域引导注意力,使多个模型基准分数提升2.5-3.1分。

04:00
arXiv cs.CV

MultiAct:通过定制注意力引导从复合文本生成运动

无需重训练的框架,自适应放大注意力分数,处理复合文本多动作生成,提升语义覆盖与运动真实感。

04:00
arXiv cs.CV

IAF-Net: 面向低光城市道路分割的照度自适应融合

提出IAF-Net,通过照度自适应融合和亮度调制注意力解码器,实现低光道路分割鲁棒,在nuScenes-NRS上达SOTA。

04:00
arXiv cs.CV

PRISM:基于迭代槽记忆的渐进式推理视觉架构

PRISM通过分组视觉特征、检索记忆并循环细化,提升遮挡等不完整观测下的鲁棒性。

04:00
arXiv cs.CV

变分适配器用于跨模态相似性表示

针对跨模态相似性受二分类标注限制问题,提出变分适配器VACSR,通过变分推断构建潜在空间正则化,提升检索和泛化性能。

04:00
arXiv cs.CV

全监督运动编辑:通过正负学习平衡变化与不变性

提出OmniME框架,整合三组件平衡编辑变化与不变性,在文本驱动运动编辑中达最优性能。

04:00
arXiv cs.CV

BEV感知能否在传感器故障下优雅降级?

Grace-BEV通过主动可靠性评估实现传感器故障下的优雅降级,LiDAR失效时恢复至34.7% mAP,并提升干净精度1.4%。

04:00
arXiv cs.CV

生成报告还是重复模板?测量与缓解三维CT报告生成中的模板崩塌

3D CT报告模板崩塌致漏诊罕见病变,CLarGen解耦检测与生成,F1从0.189提至0.487。

04:00
arXiv cs.CV

BiSegMamba:面向3D医学图像分割的高效双向三方向Mamba

BiSegMamba采用双向三方向Mamba和自适应融合,在多种3D医学分割任务上精度高,计算量降低77.9%。

04:00
arXiv cs.CV

中文标题

提出迭代数据增强方法,利用CNN错误生成指纹变体,扩展婴儿指纹多样性,保留视觉相似性。

04:00
arXiv cs.CV

SlotMemory:面向流式长视频生成的以对象为中心的键值记忆

提出SlotMemory,以对象为中心的KV记忆机制,通过语义槽实现实体持久化和提示感知检索,提升长视频动态一致性,质量得分81.61。

04:00
arXiv cs.CV

针对多对象3D高斯泼溅场景的单步修复方法基准测试

重建型2D修复器优于扩散模型,从头初始化场景比微调更好,3D修复需先移除物体,引入新多对象场景数据集。

04:00
arXiv cs.CV

PEEK: 通过高效知识蒸馏挑选关键帧

提出PEEK动态帧采样方法,用知识蒸馏学习帧相关性,低帧预算下性能最优,计算开销仅增5.2%。

04:00
arXiv cs.CV

视觉信息在视觉-语言-动作模型驾驶行为中是否起到决定性作用?

引入视觉扰动框架分析VLA驾驶模型,揭示视觉依赖性因评估而异,呼吁结构化设计。

04:00
arXiv cs.CV

GGT-100K:面向通用真实世界图像恢复的生成式真值

利用生成式多模态基础模型构建真实低质-高质量配对数据集GGT-100K,显著提升图像恢复模型的泛化能力。

04:00
arXiv cs.CV

重新思考高效裂缝分割:任务对齐的结构-方向建模

提出RIFT模型,采用任务对齐的结构-方向建模,0.47M参数实现高效裂缝分割,性能超越复杂混合架构。

04:00
arXiv cs.CV

HQ-JEPA:混合量子联合嵌入预测架构用于跨模态遥感表示学习

HQ-JEPA混合量子经典架构,通过掩码预测与量子相似性损失优化跨模态遥感表示,性能优越。

04:00
arXiv cs.CV

LVSA:无需训练的长视频扩散稀疏注意力

LVSA通过窗口与旋转锚点实现无训练块稀疏注意力,降低长视频扩散计算量3倍以上,扩展生成时质量提升。

04:00
arXiv cs.CV

Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining

04:00
arXiv cs.CV

再论熵在识别错误标注图像中的应用

提出有符号熵积分统计量,利用训练中熵变化差异高效识别错误标签,在医学影像数据集上表现最优。