11041 条条目 · 106 个活跃源
2026年8月13日
04:00
arXiv cs.CV

GeoUniPR:一种几何一致性的跨模态地点识别统一框架

提出几何一致的统一框架GeoUniPR,将激光雷达点云投影成深度图,融合强度与法向信息,用双ViT编码器高效训练,并设计空间一致对比损失,在跨模态地点识别中达到SOTA。

04:00
arXiv cs.CV

SegPAR:面向语义分割的类中心决策式稀疏攻击

提出类中心决策式稀疏攻击SegPAR,采用新差异奖励,提升稀疏效率与MIoU下降,媲美白盒。

04:00
arXiv cs.CV

CLEAR:基于结构化采样的类别级专家聚合用于长尾分类

提出CLEAR框架,用结构化采样生成专家,按类别可信度聚合,提升长尾分类及少样本性能。

04:00
arXiv cs.CV

低倍率荧光成像用于乳腺癌切缘检测的临床可行性:基于纹理分析与深度学习

4x与10x放大MUSE图像诊断性能相当,深度学习和纹理分析均达高准确率,低倍率视野更大、成像更快,可用于术中切缘评估。

04:00
arXiv cs.CV

代码与图像推理的自我进化

让模型用代码执行视觉算法,并通过自我反思进化技能,显著提升推理准确率。

04:00
arXiv cs.CV

唐诗基准:面向诗转图生成的多维评测基准与基于评分标准的评估器

提出唐诗图像生成多维基准(十维人工标注)及评估器PAE,媲美Claude,可扩展至新图。

04:00
arXiv cs.CV

基于概念的任意场景注视目标估计

提出概念驱动的可提示注视目标估计任务,构建数据集Gaze-Co与模型GazeAnywhere,实现端到端估计并达到最优性能。

04:00
arXiv cs.CV

用于临床文本引导医学图像分割的双域跨模态解码

提出DD-CMD双域跨模态解码,结合空间注意与频谱调制,用于临床文本引导肺部感染分割,性能显著提升。

04:00
arXiv cs.CV

视觉语言模型在水下图像重建系统评估中获胜

提出系统评估方法,从准确性、一致性、水参数效应评估水下重建;视觉语言模型显著优于物理模型。

04:00
arXiv cs.CV

COGENT:容积医学图像的反事实高斯解释

提出COGENT框架,在高斯参数空间进行反事实优化,为容积医学图像生成稀疏、局部且保持解剖一致的解释。

04:00
arXiv cs.CV

高斯元空间增强用于多模态IPMN风险分层中的堆叠集成

胰腺癌风险分层中,提出cUPMI方法增强堆叠集成,对高容量树模型效果稳定,融合影像组学与2.5D CNN达最佳预测性能。

04:00
arXiv cs.CV

手部可见性检测器:逐关键点可见性估计

首次将手部关节可见性估计作为独立任务,利用预训练姿态模型提升精度,并用于多视角三角测量降误差。

04:00
arXiv cs.CV

以梵高之眼:基于扩散模型的全局风格迁移

提出全局风格迁移(GST),多对一聚合艺术家作品,在扩散模型隐空间学习风格偏移,兼顾内容对齐,实现高保真风格化。

04:00
arXiv cs.CV

多智能体目标存在性验证与学习式掩膜几何细化:2026年第八届LSVOS挑战赛MeViS-Text赛道冠军报告

提出多智能体协同验证目标存在性,辅以风格细化掩膜,破解误导性无目标表达式,勇夺MeViS-Text赛道冠军。

04:00
arXiv cs.CV

由矩阵谱分解导出的新型正交多小波滤波器

利用快速鲍尔法构造两种超紧支撑正交多小波,具正交与对称性,图像压缩去噪中SSIM等指标优于现有滤波器。

04:00
arXiv cs.CV

生成式语义分割:可观测语义-图像接口与层次化生成器证据对齐

提出语义棱镜框架,用单步生成渲染语义图,结合类颜色码本与层次特征对齐,Cityscapes达72.07% mIoU,并改进像素误差排序。

04:00
arXiv cs.CV

从合成到去除:基于物理的反射模拟与扩散视频去反射

提出闭环框架,物理模拟反射视频数据,训练扩散模型单步去反射,并建立首个基准,性能领先且推理更快。

04:00
arXiv cs.CV

利用层次化监督复用基于RGB的基础模型实现热图像深度估计

提出RGB-HS框架,利用RGB基础模型的分层监督对齐多级特征,实现热图像深度估计,性能优越。

04:00
arXiv cs.CV

面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习

语言结构化关系Q学习提升威胁感知但未转化为自适应控制,存在识别-控制鸿沟。

04:00
arXiv cs.CV

大型视觉-语言模型中的测试时幻觉调控

提出免训练TTH:零样本多模态分类器生成辅助logits,熵加权融合,抑制LVLM对象幻觉。

04:00
arXiv cs.CV

Hybrid-LUT:通道感知的混合查找表与滤波实现高效图像去噪

提出Hybrid-LUT,Y通道用LUT恢复纹理,UV通道滤波保持色彩;存储降2/3,421KB达最优,真实数据CPSNR提升0.63dB。

04:00
arXiv cs.CV

基于分层引用的生成式视频压缩

提出分层引用生成式视频压缩GVCHR,利用分层参考与注意力减少伪影,显著提升压缩效率和视觉质量。

04:00
arXiv cs.CV

ProtoHGF-Net:面向RGBT目标检测的原型超图融合与模态内校准

提出原型超图融合网络,结合教师掩码校准抑制背景干扰,在多个数据集上取得最优性能。

04:00
arXiv cs.CV

用于蚊媒疾病检测的视觉Transformer与门控循环单元混合框架

ViT+ConvGRU框架用于蚊媒疾病检测,准确率88.88%,优于RNN/LSTM/GRU。

04:00
arXiv cs.CV

驾驶世界模型如何进行反事实预测?

驾驶世界模型做反事实预测时,直接动作条件预测未利用事实延续导致失败;简单免训练方法可显著提升效果。

04:00
arXiv cs.CV

面向手术器械实例分割的拓扑感知查询选择

拓扑感知查询选择将手术器械实例分割视为关系型集合问题,源域F1提升、失败率降低,跨域迁移不稳定。

04:00
arXiv cs.CV

CAM引导的显著性裁剪与基于图像的恶意软件分类

测试HiResCAM引导裁剪,对比随机、高低显著性裁剪,发现恶意软件图像裁剪无效,自然图像低显著性裁剪略有效。

04:00
arXiv cs.CV

KANResDiff:通过Kolmogorov-Arnold网络学习局部残差扩散用于模糊医学图像分割

提出KANResDiff,用KAN学习局部残差扩散,分阶段建模模糊性,指标SOTA。

04:00
arXiv cs.CV

隐身斗篷:实时隐私保护的体积视频流

针对体积视频流隐私泄露,提出隐形流,用目标检测与深度掩码,跨视图传播决策,仅融合净化点云,实时隐私保护。

04:00
arXiv cs.CV

AI艺术检测器在生成器变化下的鲁棒性

人工智能艺术检测器在生成器变化下泛化不足,常将新图像误判为人类,CLIP模型效果最佳,但差距显著,需分层防御。

04:00
arXiv cs.CV

运动即提示:利用运动引导的跨帧视觉提示增强多模态大语言模型的运动推理

提出运动即提示框架,跨帧轨迹标记增强运动推理,无需训练,两基准分别提升4.2%与8.9%

04:00
arXiv cs.CV

Zero-OVCD:桥接免训练基础模型与伪标签学习的开放词汇变化检测

提出Zero-OVCD两阶段框架,无需像素级标注,结合掩膜细化与噪声抑制生成伪标签,训练检测器,显著提升开放词汇变化检测精度。

04:00
arXiv cs.CV

让每一步都算数:成像逆问题的时空信息分配

提出频谱自适应调度与测量优先注意力,无需训练平衡时空信息分配,提升图像复原质量。

04:00
arXiv cs.CV

从多模态伪标签中学习以实现稳健的开放词汇实例与全景分割

提出多模态伪标签框架,结合CLIP和GPT增强视觉-文本对齐,显著提升开放词汇实例与全景分割性能。

04:00
arXiv cs.CV

STAR: 面向可泛化三维场景理解的空间-拓扑感知路由框架

提出空间-拓扑感知路由框架STAR,结合自监督预训练与动态专家分配,解决跨传感器拓扑差异,提升室内外3D场景理解性能。

04:00
arXiv cs.CV

推进MLLM无人机图像理解与推理:基准与免训练多智能体系统

构建UAVQA-Bench基准,提出免训练多智能体系统UAV-MAS,32B模型准确率77.0%,超Gemini 3 Pro达4%,8B版提升8.7%。

04:00
arXiv cs.CV

解字:大规模专家审核的古文字训诂数据集与基准

构建古文字训诂VQA数据集及基准,含50万问答对;现有模型在字形、语义、历时分析上不足,微调后全面提升。

04:00
arXiv cs.CV

商业猪舍环境中边界增强的猪只点云分割

提出边界增强猪点云分割法,用八叉树变换器融合多尺度特征,软距离监督加双向跨边界语义模块缓解粘连,提升精度。

04:00
arXiv cs.CV

EGM-Det:面向无人机RGB-IR目标检测的熵引导多模态自适应融合

熵引导自适应融合EGM-Det,门控+蒸馏助RGB-IR检测,三基准SOTA,VEDAI涨超10%

04:00
arXiv cs.CV

LiveAnimate:实时稳定的长时流式人体动画

实时流式人体动画系统,基于140亿视频扩散模型,检索式缓存,双卡19.63 FPS,三分钟质量稳定。

04:00
arXiv cs.CV

榛子X射线图像自动二分类:质量评估的深度学习基准

榛子X光图像二分类基准:最优集成模型平衡精度86.3%;多划分评估与标签精修对小型不平衡数据至关重要。

04:00
arXiv cs.CV

视觉模型能否读懂雷达显示屏?——雷达图像用于空中交通复杂度估计的可行性研究

视觉变换器可从雷达图像回归交通复杂度,准确率高,且扰动响应与飞机贡献一致,证明雷达图像可行。

04:00
arXiv cs.CV

UniSwap:说话视频的流式音视频身份替换

首个流式音视频身份替换框架,用统一扩散变换器同步换脸换声,保留内容动态,支持长视频稳定生成。

04:00
arXiv cs.CV

双模态提示扩散先验用于零样本高光谱全色锐化

提出双模态提示扩散模型,融合低分辨率高光谱与全色提示,加全色引导正则化,零样本高光谱全色锐化性能最优。