11201 条条目 · 106 个活跃源
2026年7月15日
04:00
arXiv cs.CV

通过类别对比影响引导扩散模型用于少样本医学分类

提出C2I标准,通过梯度影响力量化样本对分类的贡献,引导扩散模型生成高价值边界样本,提升少样本医学分类准确性与鲁棒性。

04:00
arXiv cs.CV

可调可见性增强的虚拟染色内镜

提出虚拟增强染色内镜,结合图像翻译与增强,用户可调增强水平,统一模型生成多样图像。

04:00
arXiv cs.CV

超越定位:从跨视角定位中学习语义、结构与几何

提出CROSS框架,通过3D对齐与结构感知匹配,从跨视角定位中学习语义、结构与几何,达SOTA。

04:00
arXiv cs.CV

MQAdapter:多模态量子适配器用于视觉语言模型从粗到细微调

提出MQAdapter,利用量子纠缠和叠加增强跨模态特征,实现粗到细微调,参数高效提升细粒度判别。

04:00
arXiv cs.CV

DeGuNet:深度引导的超紧凑骨干网络用于高效激光雷达-相机三维检测

提出DeGuNet深度引导超紧凑骨干,通过稀疏感知对齐图像与稀疏LiDAR,内存降低66.5%,mAP提升6.20。

04:00
arXiv cs.CV

ARDepth:渐进式视觉调节的自回归单目深度估计

ARDepth将深度估计建模为自回归生成,通过渐进视觉调节和语义引导,从粗到细逐步构建深度,实现结构一致的预测。

04:00
arXiv cs.CV

让RGB成为视觉的语言

提出RINO范式,将各类视觉信息统一为RGB图像,任务转化为RGB到RGB编辑,实现零样本跨任务迁移。

04:00
arXiv cs.CV

空间中的自我:无人机具身智能中自我意识与空间认知的基准测试

提出SIS-Bench基准,评估无人机自我意识与空间认知,发现MLLM局限,运动感知建模可提升性能。

04:00
arXiv cs.CV

WanToFight:面向多人对战交互的实时生成式游戏引擎

WanToFight:首个实时多人对抗生成引擎,30FPS模拟双人《拳皇97》,融合多人控制、物理交互与推理。

04:00
arXiv cs.CV

DiTailed: 确保文本-图像到图像流匹配模型中的视觉对象一致性

本文通过ABO-Edit数据集、条件嵌入空间预测性质发现及FlowMirror辅助损失,提升图像编辑中的对象一致性。

04:00
arXiv cs.CV

RealSkin:面向图像到3D属性传递的空谱部分神经伴随映射

RealSkin自监督框架,结合空间引导配准与谱感知网络,克服拓扑差异与非等距对应,实现真实-合成场景领先属性传递。

04:00
arXiv cs.CV

TerraLogic:地球观测中的分层地理空间推理基准

TerraLogic含545个场景驱动的分层地理空间推理任务,覆盖光学、SAR和红外遥感,HieraPlan代理实现分层推理与容错,提供强基线。

04:00
arXiv cs.CV

DynTrace:在多模态大语言模型中追踪动态对象证据以实现4D时空推理

提出无训练框架DynTrace,通过动态轨迹可视化与动态追踪标记,持续追踪动态对象证据,显著提升MLLM的4D时空推理性能。

04:00
arXiv cs.CV

CGRL:概念引导的剪枝与表示学习用于全切片图像分类

提出概念引导剪枝和表示学习框架,利用类别概念原型优化弱监督全切片图像分类,提升准确率并降低计算成本。

04:00
arXiv cs.CV

面向长视频理解的事件感知视觉分配的高斯混合建模

GMM-EVA利用高斯混合模型建模事件结构,差异化分配视觉预算,仅用一半token即达可比性能。

04:00
arXiv cs.CV

边缘感知的热红外无人机群跟踪

提出基于自适应运动学卡尔曼滤波的在线管道,兼顾实时效率与轨迹连续性,应对热红外无人机跟踪挑战。

04:00
arXiv cs.CV

持续虚假语音检测中对抗遗忘的回溯翻译器

使用回溯翻译器映射新特征至原空间,冻结检测器持续学习,高效抵抗遗忘并保持高检测率。

04:00
arXiv cs.CV

无视觉CIR框架:属性增强评分与LLM重排序实现零样本组合图像检索

属性增强评分与LLM重排序补偿文本信息损失,CIRR上R@1达44.04%,超现有方法8.79%。

04:00
arXiv cs.CV

ReflectVLN:通过反思推理训练视觉-语言导航代理

ReflectVLN通过双向交互的意图与执行代理,实现闭环反思推理,提升导航成功率和路径效率。

04:00
arXiv cs.CV

基于季节性卫星图像的奶牛场场址弱监督时空候选发现

提出弱监督流水线,利用季节性图像与地理先验,通过多季节编码和规则评分排序候选簇,缩小人工审查范围。

04:00
arXiv cs.CV

面向CAD楼层平面图的文本辅助多模态全景符号检测

通过编码文本注释语义并与图形基元对齐,提升CAD平面图符号检测性能,实现最优结果。

04:00
arXiv cs.CV

MAGE:胃肿瘤分类中的颜色不变性与空间知识蒸馏

提出MAGE框架,通过掩码消色引导与双目标蒸馏,抑制颜色背景,学习形态特征,提升胃肿瘤分类性能及可解释性。

04:00
arXiv cs.CV

Decouple and Reason: Anatomically Guided Two-Stage Voxel-Level Grounding of Free-Text Findings in 3D Chest CT

04:00
arXiv cs.CV

面向多标签遥感场景分类域泛化的标签解耦风格增强

提出标签解耦增强框架,限制风格扰动到标签区域,多数据集平均精度71.5%,比基线高1.3点。

04:00
arXiv cs.CV

MambaPSA:YOLO26中基于Mamba的C2PSA替代方案

替换C2PSA实现轻量高效,参降2.9%、算力降12.1%、CPU吞吐提17.6%,精度几乎不变。

04:00
arXiv cs.CV

中重度创伤性脑损伤病变分割:AIMS-TBI 2025挑战赛中基于nnU-Net的自适应归一化方法

使用nnU-Net配合脑实质自适应归一化,总体Dice 0.6305,病变0.4805,非病变0.9324,有效分割msTBI病变。

04:00
arXiv cs.CV

通过相机-显示耦合实现色彩直通

将相机与显示视为耦合系统,端到端优化,准确再现原始场景色彩感知。

04:00
arXiv cs.CV

UniVR: 在视觉空间中思考以实现统一视觉推理

UniVR通过强化学习从纯视觉演示中学习推理、物理动态和长期规划,性能提升25%,开源。

04:00
arXiv cs.CV

RFMSR:用于图像超分辨率的残差流匹配

基于低质量潜码减少传输距离,两阶段训练实现单步/多步高质量超分,性能达SOTA。

04:00
arXiv cs.CV

CRC-HGD:结直肠癌分级组织病理学图像数据集

CRC-HGD数据集含1914张H&E染色图像,三级分化评级及四倍率,助力结直肠癌AI分级诊断。

04:00
arXiv cs.CV

中文标题

VisCo复用预训练VLM作为内在压缩器,通过参数共享自编码器压缩视觉标记,高效且性能优于现有方法。

04:00
arXiv cs.CV

EvoGraph-R1:面向智能体检索的自演化多模态知识超图

EvoGraph-R1将检索建模为马尔可夫决策过程,通过智能体动作使超图自演化,显著提升多模态RAG准确率与可追溯性。

04:00
arXiv cs.CV

HSEmotion团队在第11届ABAW挑战赛中的成果:多任务学习与矛盾/犹豫视频识别

采用轻量级面部特征提取器与系统后处理,在多任务学习和矛盾/犹豫视频识别上超越基线,无需微调大模型,实现高效灵活部署。

04:00
arXiv cs.CV

Hallo4D: 缓解多模态幻觉以实现一致时空生成

Hallo4D利用大语言模型检测并修正3D/4D生成中的时空幻觉,通过共识优化提升一致性,无需重训练。

04:00
arXiv cs.CV

MBTI:一种基于基础模型的高光谱图像分类的多分支高效微调框架

提出MBTI框架,通过多分支预处理保留全波段光谱信息,结合独立LoRA模块和注意力融合,仅微调2.33%-2.36%参数即达优异分类性能。

04:00
arXiv cs.CV

ExtraGS:通过扩散引导的3D高斯泼溅增强内窥镜视野外推

ExtraGS利用扩散模型引导3D高斯泼溅,主动探索盲区,置信度加权优化,减少内窥镜外推伪影,性能最优。

04:00
arXiv cs.CV

CoRe:视觉语言模型中跨图像比较推理的综合框架

CoRe框架包含大规模数据集、结构化奖励和专用基准,跨图像比较推理性能提升28.2个百分点。

04:00
arXiv cs.CV

AVSCap:为全模态视频字幕编排音频-视觉协同

提出AVSCap框架,通过显式跨模态事件绑定和两阶段训练,提升非语音音频覆盖与音视频协同,性能领先开源模型。

04:00
arXiv cs.CV

Open-KNEAD:基于知识代理分解的营养估计

Open-KNEAD框架通过智能分解与检索增强,无需训练即可提升食物份量估计精度,超越前沿模型并保障隐私。

04:00
arXiv cs.CV

打破似曾相识:基于视觉-语言推理的视觉地点识别独立审计方法

提出视觉-语言模型审计框架,无需先验知识,召回率提升13.6%,错误接受率降至12%。

04:00
arXiv cs.CV

图像异常检测的统计非线性重构损失

提出基于sigmoid的统计非线性重构损失,有效抑制异常泄露,在MVTec-AD和VisA上取得99.0%/97.3%及95.3%/99.0%的高AUROC。

04:00
arXiv cs.CV

LARAD: 基于空间逻辑推理的布局感知道路异常检测

LARAD通过空间逻辑推理与违背合成训练,实现高效鲁棒的道路异常检测,刷新最佳性能。

04:00
arXiv cs.CV

度量引导的深度学习合成图像数据渲染,兼容智能体AI

GraNatPy包用度量引导渲染改进,提升检测性能并自动化参数优化。

04:00
arXiv cs.CV

Hy-Embodied-VLM-1.0:高效的物理世界智能体

提出面向物理世界具身智能体的高效基础模型,仅激活3B参数即达32B模型性能,在38项基准中19项最佳。

04:00
arXiv cs.CV

抑制自注意力:增强视觉Transformer的聚焦能力

提出抑制自注意力(ISA),利用负注意力分数抑制无关特征,增强目标聚焦,提升ViT泛化与鲁棒性。

04:00
arXiv cs.CV

UniMedSeg:面向多范式2D/3D医学图像分割的统一上下文内学习

提出统一上下文内学习框架,融合视觉示例、交互与语言指令,线性注意力复杂度,无需微调实现多范式医学图像分割SOTA。

04:00
arXiv cs.CV

秩一身份共识比分数阈值更准确地预测1:N人脸匹配中的库注册状态

1-一致性方法通过多匹配器排名共识,无需阈值即可准确预测库注册状态,性能媲美最优阈值法且更稳健。

04:00
arXiv cs.CV

基于差异引导适应与频率解耦蒸馏的域增量遥感变化检测

提出DG-FDD框架,结合差异引导适应与频率解耦蒸馏,有效缓解域增量遥感变化检测中的灾难性遗忘,实现历史知识与新域适应的平衡。

04:00
arXiv cs.CV

手术中的点追踪——2025年红外手术纹身挑战赛(STIRC2025)

STIRC2025挑战赛评估点追踪算法,七支队伍参赛,数据集与代码公开。

04:00
arXiv cs.CV

GaitSpan: 从行走到奔跑的人形运动成长

GaitSpan框架通过节奏生成、步幅塑造和残差适应,将步行策略扩展到奔跑,实现连续速度、跨形态和零样本部署。