11291 条条目 · 106 个活跃源
2026年7月2日
04:00
arXiv cs.CV

GADA:基于图像高斯泼溅的几何感知可变形聚合

GADA以可变形偏移修正空间错位,结合隐式置信权重,保持高频质量且速度提升2倍。

04:00
arXiv cs.CV

基于语义引导的具有大型语言模型的历史亚美尼亚报纸阅读顺序重建

混合方法结合语义检测与LLM,将历史亚美尼亚报纸阅读顺序错误降低76%,并发布数据集与OCR模型。

04:00
arXiv cs.CV

基于扩散的多类正态性用于OOD检测:在CDP认证中的应用

基于扩散的多类正态框架,通过重构误差检测CDP伪造,无需伪造样本训练,性能领先。

04:00
arXiv cs.CV

检索图像作为视觉思维:针对开闭差距的无训练多模态上下文学习

ReVisIT通过检索标注图像作为视觉思维单元,无需训练即可实现多模态上下文学习,显著提升开放场景性能。

04:00
arXiv cs.CV

识别潜在概念与结构以实现广义类别发现

提出CPF-GCD,通过低秩组合原始场分解图像,使潜在结构可识别,新类别自然涌现,提升GCD性能。

04:00
arXiv cs.CV

面向内存高效的自回归视频生成:实例特定参数吸收

ISPA框架通过将部分注意力层转为局部注意力,将历史上下文吸收进模型权重,减少50%KV缓存,实现近无损视频生成。

04:00
arXiv cs.CV

不确定性感知的树高变化回归

提出CHC数据集,实现连续冠层高度变化及不确定性估计,引入不确定性感知回归任务,评估地理空间基础模型。

04:00
arXiv cs.CV

DART:面向零样本视频时序定位的难度自适应路由

DART提出难度自适应路由,简单查询快速预测,复杂查询分解标注,零样本时序定位性能SOTA且用帧减少7倍。

04:00
arXiv cs.CV

ABot-M0.5:统一的移动与操作世界动作模型

提出ABot-M0.5,通过三级对齐实现移动操作世界动作模型,在长周期任务和精细控制中达到SOTA。

04:00
arXiv cs.CV

学会观看:通过交错策略优化实现的主动视频异常理解

提出Anom-π主动框架,以交错策略优化实现视频异常理解,2B参数超越大型模型。

04:00
arXiv cs.CV

LUMA:通过轻量级通用掩码适配器进行分割基准测试

LUMA轻量通用掩码适配器基准测试发现:普通ViT效率最优,预训练目标主导分割质量。

04:00
arXiv cs.CV

Imprint:面向长时程自我中心问答的在线记忆压缩

Imprint用在线记忆压缩代替摘要,基于重复、近时、独特性信号压缩交互,提升长时程问答准确率与检索效率。

04:00
arXiv cs.CV

并非所有预测目标都能在流形上保持无训练扩散引导

x预测使引导样本更稳定在数据流形上,是训练自由引导的最佳基础。

04:00
arXiv cs.CV

创建有影响力的自动驾驶数据集:从研究缺口到基准的战略指南

诊断数据或评估问题,选择最小数据算子填补缺口,构建自动驾驶数据集战略框架,以KITScenes为例。

04:00
arXiv cs.CV

面向视频异常推理的语言相对策略优化

LRPO从推理轨迹提取语义优势构建异常经验先验,无需参数更新,大幅提升无调优视频异常检测效果。

04:00
arXiv cs.CV

部分骨架可见性下的动作识别:一种受限视野方法

提出PartialVisGraph超图框架,利用虚拟超边和可见性先验,在受限视野下实现鲁棒骨架动作识别,准确率提升达68.8%。

04:00
arXiv cs.CV

AV-SyncBench:时间与语义音视频同步的解耦基准

提出AV-SyncBench,首个解耦时间与语义评估的音视频同步基准,含3269视频及38390样本,覆盖10场景5任务。

04:00
arXiv cs.CV

ConRTF: 边缘约束的边界分布细化用于实时Transformer表格结构识别

提出EFL损失,利用表格结构不对称性训练时引导边界细化,数据高效,GriTS提升+1.6。

04:00
arXiv cs.CV

GKDT:通用关键点检测Transformer

提出MegaKPT数据集和GKDT模型,基于DINOv3支持多模态提示,在22个测试集多数类别[email protected]超90%。

04:00
arXiv cs.CV

原型记忆引导的无训练产前超声异常分类与定位

提出无需训练的多类产前超声异常分类与定位框架,利用原型记忆及软合并机制,在1149例数据上表现优异。

04:00
arXiv cs.CV

迈向鲁棒的驾驶感知:面向自监督单目深度估计的灵活尺度驱动系列

FlexDepth自监督深度估计模型族,采用静态-动态解耦与尺度驱动解码器,高效高精度,最小模型0.7GFLOPs、移动端37.6FPS。

04:00
arXiv cs.CV

基础模型驱动的盲扫超声胎儿出生体重估计关键解剖帧选择

首次用盲扫超声视频,通过基础模型选择关键解剖帧估计胎儿体重,MAE仅161.3克,优于传统方法。

04:00
arXiv cs.CV

GaussianFusion: 统一三维高斯表示用于多模态融合感知

提出基于3D高斯表示的多模态融合框架,保留细节,性能优于BEVFusion,速度快450%。

04:00
arXiv cs.CV

面向级联对象检测的主动学习:在表格提取流水线中平衡覆盖度与不确定性

提出两种流水线感知的主动学习变体UHerding,平衡覆盖与不确定性,减少表格提取标注成本。

04:00
arXiv cs.CV

FrameONE:面向通用多视图超声心动图关键帧检测的分层运动建模

提出分层运动建模的FrameONE,通过视图内多任务与视图间通用学习,实现多视图超声关键帧检测,跨视图泛化强。

04:00
arXiv cs.CV

Pano2World:通过统一多视图序列的端到端3D生成

提出Pano2World,输入单张室内全景图直接生成可探索3D场景,通过联合去噪与潜在特征适配器实现跨视图一致性,性能优。

04:00
arXiv cs.CV

解耦引导:文本到图像个性化中的主体与上下文路径分离

提出解耦引导框架,分离主体身份与上下文路径,解决保真度-可编辑性权衡,无需修改模型即可提升个性化性能。

04:00
arXiv cs.CV

中文标题:ClinRAG-GRAPH:基于临床先验的检索增强图模型与领域对抗学习用于乳腺pCR预测

中文摘要:提出ClinRAG-GRAPH框架,融合多模态数据与领域对抗学习,实现乳腺癌新辅助化疗pCR鲁棒预测,多中心验证AUC达0.815。

04:00
arXiv cs.CV

通过分层实体探索实现高分辨率视觉感知

提出无需训练的分层实体探索方法,动态引导高分辨率图像感知,显著提升准确率和效率。

04:00
arXiv cs.CV

通过CLIP引导去噪优化的扩散模型无训练去偏

提出TES框架,通过CLIP引导的文本嵌入优化实现无训练去偏,两阶段策略保证公平性且不牺牲质量。

04:00
arXiv cs.CV

斑点:基于位置信息的相机陷阱调查中鬣狗和豹的再识别

融合视觉与时空信息,Spotted框架提升鬣狗和豹再识别准确率9pp,减少专家查询69pp。

04:00
arXiv cs.CV

缝合嵌入:3D服装与2D图案的统一潜在空间

首个无模拟框架,统一3D服装重建与2D图案推断,利用预训练3D模型先验和BoxMesh中间表示,实现高精度高效建模及新应用。

04:00
arXiv cs.CV

Soft混合递归:走向更深的递归视觉Transformer

提出SoftMoR,通过软组合递归步骤输出,使视觉Transformer随深度增加一致提升性能,参数高效。

04:00
arXiv cs.CV

SpiralFovea: 输入自适应中央凹标记化——资源自适应推理的第三杠杆

无参数输入自适应标记器,基于视觉熵动态生成最多78个螺旋补丁,替换196网格,精度提升1.7-2.1%,计算量减少84%,自监督模型增益最大。

04:00
arXiv cs.CV

DeWorldSG:基于世界模型先验的深度感知三维语义场景图生成

提出DeWorldSG,利用深度引导滤波和世界模型先验生成鲁棒3D语义场景图,三元组召回率提升77.4%。

04:00
arXiv cs.CV

EFlow:面向长视频推理的自适应反思式证据流学习

EFlow提出证据优先框架,分离时间定位与逻辑推理,通过置信度感知反思提升长视频推理性能。

04:00
arXiv cs.CV

重新审视深度学习多标签图像分类:分类法、挑战与展望

综述深度学习多标签图像分类进展,提出六类分类法,总结挑战与未来方向。

04:00
arXiv cs.CV

TrajLoc: 轨迹注意力定位用于多目标运动控制

TrajLoc通过注意力层内每帧高斯热图定位实现多目标独立轨迹控制,视觉保真度+4.3dB PSNR,轨迹误差降低51%。

04:00
arXiv cs.CV

镜像融合注意力:反射感知的自监督表示学习

提出MFASSL框架,用镜像融合注意力模块引入反射先验,在多个数据集上提升性能,仅增2.7%参数。

04:00
arXiv cs.CV

MoVA:学习非对称双投影以实现模块化长视频-文本对齐

MoVA通过非对称双投影,自适应选择帧相关子空间并解缠视觉概念,实现长视频-文本灵活对齐,性能领先现有方法。

04:00
arXiv cs.CV

OmniView-Space: 通过多视角空间映射增强空间推理

OmniView-Space框架通过多视角空间映射与认知地图蒸馏,增强多步空间推理,实现SOTA并减少外部依赖。

04:00
arXiv cs.CV

Beyond Pixel Overlap: A Framework for Decomposing Segmentation Evaluation Metrics

04:00
arXiv cs.CV

几何感知跨高度信道知识图谱预测:无人机辅助通信中的不确定性引导三维感知

本文提出几何感知框架,融合场景先验与稀疏观测预测跨高度信道,FPN-Transformer降低RMSE,不确定性引导传感提升主动重建。

04:00
arXiv cs.CV

MG-RWKV:面向时序伪造定位的多粒度上下文感知RWKV

提出MG-RWKV框架,以线性复杂度实现双向时序建模,通过多粒度专家动态路由和跨粒度一致性精准定位伪造片段,在三个数据集上达最优性能。

04:00
arXiv cs.CV

GaussianEmoTalker:基于音频驱动和混合形状的3D高斯泼溅实时情感说话人头合成

提出GaussianEmoTalker,基于3D高斯泼溅和混合形状,通过中性到情感残差变形及注意力模块,实现实时、高保真、可控情感强度的说话人头合成。

04:00
arXiv cs.CV

肺CT中基础模型与影像组学的基准对比:特征提取器、分类头和分割选择

肺CT基准发现:基础模型与影像组学任务依赖,推荐Curia+肿瘤分割+CatBoost头作为安全默认,任务特定选择更优。

04:00
arXiv cs.CV

隐私保护下的仅深度开放词汇三维语义分割:基于不确定性引导的测试时优化

提出UTTO框架,通过不确定性引导测试时优化,无需额外训练,提升仅深度开放词汇3D语义分割的隐私保护性能。

04:00
arXiv cs.CV

斜率引导的Mamba与角度精炼Transformer用于光场超分辨率

提出SMART混合网络,融合斜率Mamba与角度Transformer,实现几何一致的光场超分辨率,PSNR提升0.42dB达SOTA

04:00
arXiv cs.CV

QCA:面向长视频理解的查询与内容感知关键帧选择

提出无需训练的QCA框架,联合建模查询与内容动态分配关键帧,用128帧超越GPT-4o的256帧,达SOTA。

04:00
arXiv cs.CV

AVSR-Diff:尺度无关扩散先验实现时序一致的任意尺度视频超分辨率

提出解耦框架AVSR-Diff,分离潜在去噪与连续渲染,通过TGFR和SAFR模块实现任意尺度高频细节与时间稳定性,超越现有基线。