11301 条条目 · 106 个活跃源
2026年6月15日
04:00
arXiv cs.CV

通过全局几何感知扩散过程增强水下光场图像

提出GeoDiff-LF扩散框架,利用几何引导增强水下光场成像,有效减轻颜色失真,性能领先。

04:00
arXiv cs.CV

伪装感知中面向测试时自适应的层次一致性学习

提出层次一致性学习框架,通过特征重建、任务亲和引导和原型校准,实现伪装目标检测的测试时自适应,提升鲁棒性。

04:00
arXiv cs.CV

薛定谔的导航器:为零样本物体导航构想未来集合

薛定谔导航器通过推理时想象多种3D未来,聚合想象未来进行鲁棒动作选择,在遮挡场景中提升零样本物体导航性能。

04:00
arXiv cs.CV

面向渲染的稀疏采样用于BRDF获取

提出渲染感知的稀疏自适应采样方法,优化测量位置以提升极稀疏BRDF获取的渲染外观质量。

04:00
arXiv cs.CV

无瓶颈统一多模态模型的表示强制

提出表示强制技术,使统一多模态模型无需VAE瓶颈,通过预测视觉表示中间token,同时提升理解与生成性能。

04:00
arXiv cs.CV

ADAPT:建筑工地自主叉车

一种用于建筑工地的全自动越野叉车ADAPT,集成AI感知与决策控制,实测性能接近人类操作员。

04:00
arXiv cs.CV

通过区域脑专家的多模态融合实现可解释的阿尔茨海默病诊断

提出MREF-AD模型,利用多模态区域专家融合与门控网络,实现可解释的阿尔茨海默病诊断,性能优异。

04:00
arXiv cs.CV

MCR-VQGAN:一种用于阿尔茨海默病成像的可扩展且经济高效的tau PET合成方法

MCR-VQGAN从T1-MRI合成高保真tau PET,性能优于多个模型,诊断特征保留且区域一致性高,是传统PET的可行替代方案。

04:00
arXiv cs.CV

Relational Retrieval: Leveraging Known-Novel Interactions for Generalized Category Discovery

04:00
arXiv cs.CV

SAFformer:通过主动预测滤波改进脉冲Transformer

提出基于主动预测滤波的脉冲Transformer,抑制冗余聚焦显著特征,在CIFAR/ImageNet上实现高效高精度。

04:00
arXiv cs.CV

Stream3D:基于证据记忆的序列多视角三维生成

提出Stream3D,以证据记忆实现无训练流式多视角3D生成,保持时空一致性,优于现有方法。

04:00
arXiv cs.CV

在人工智能辅助的放疗流程中捕获磁共振异常:基于深度学习的无监督图像异常检测与定位

提出无监督框架检测盆腔和脑MRI异常,AUC达0.97和0.81,热图定位准确,可作为放疗自动质量控制层。

04:00
arXiv cs.CV

一个务实的VLA基础模型

LingBot-VLA基于2万小时数据,三平台100任务表现领先,8GPU吞吐261样本/秒,比现有框架快1.5-2.8倍。

04:00
arXiv cs.CV

SMART: 基于Transformer的替代模型实现原始几何体可扩展无网格空气动力学模拟

提出SMART模型,仅用点云几何预测物理量,无需仿真网格,性能优于依赖网格的方法。

04:00
arXiv cs.CV

使用深度神经网络生成最大蛇形多联骨牌

深度扩散模型生成最大蛇形多联骨牌,可泛化至大矩形,但存在分支循环错误。

2026年6月12日
04:00
arXiv cs.CV

VLADriveBench:评估自动驾驶视觉-语言-动作模型中推理与动作的关系

VLADriveBench通过观测指标和干预协议,揭示不同VLA模型中推理与动作的因果关系差异。

04:00
arXiv cs.CV

基于AMD Kria K26 SOM的人体姿态估计立体视觉跌倒预测与检测

提出基于K26 SOM的低功耗立体视觉跌倒检测系统,采用HPE流水线实现隐私保护,准确率75.85%,吞吐量4.5 FPS。

04:00
arXiv cs.CV

分析并改进医学大视觉语言模型中的细粒度偏好优化

采用双向token级KL正则化和视觉对比约束,构建细粒度对齐框架,提升医学LVLMs临床准确性。

04:00
arXiv cs.CV

HairPort:上下文感知的三维发型导入与迁移

HairPort通过分离去除与迁移、3D感知流水线,实现大视角差异下高保真发型迁移。

04:00
arXiv cs.CV

通过教师对齐的端到端蒸馏实现高保真两步图像生成

提出三步设计实现两步图像生成,大幅缩小与八步生成的质量差距。

04:00
arXiv cs.CV

ECA:面向开放式图像到文本生成的高效持续对齐

提出免样本增量学习方法ECA,通过MoQ、FeDEx和DR机制缓解灾难性遗忘,提升图像到文本生成的持续对齐性能。

04:00
arXiv cs.CV

面向自动驾驶中共现目标检测的上下文感知特征融合

提出CCFF框架,融合局部与全局上下文特征,有效提升自动驾驶中共现目标与小目标检测性能。

04:00
arXiv cs.CV

CD-RCM:面向反射共聚焦显微镜的可泛化连续深度新视角合成

提出首个RCM专用新视角合成方法CD-RCM,插值稀疏z-stack实现各向同性体积,支持任意方向切片,亚秒级高保真推理。

04:00
arXiv cs.CV

双状态槽位注意力:解耦外观与身份以实现视频以对象为中心的学习

DSSA分离外观与身份状态,竞争调节聚合抑制弱匹配槽位,提升视频对象分割与时间一致性。

04:00
arXiv cs.CV

SalArt-VQA:诊断视觉语言模型是否理解生成图像中的显著伪影

SalArt-VQA基准揭示VLM对生成图像伪影的细粒度理解缺陷,高检测率不代表真正理解。

04:00
arXiv cs.CV

YOLO-AMC:一种带有注意力机制的改进YOLO架构用于建筑物裂缝检测

提出YOLO-AMC,引入多注意力机制提升裂缝检测精度,[email protected]达0.9917,优于YOLOv11/v8,兼顾速度与效率。

04:00
arXiv cs.CV

GRIP: 面向大型多模态模型的反馈引导式提示检索

GRIP利用大模型反馈对比训练,优选有效示例提升多模态上下文学习,优于相似度检索并支持跨模型迁移。

04:00
arXiv cs.CV

DIMOS:解耦实例级移动对象分割

提出双解耦框架分离外观与运动特征,结合多粒度跨模态对齐,在事件-图像融合中实现小目标移动分割SOTA。

04:00
arXiv cs.CV

打破交错思维中的模态隔离:通过逐步强化监督模态转换

提出模态隔离问题,用MoTiF框架通过转换级监督训练,提升交错推理中图文一致性及任务准确率。

04:00
arXiv cs.CV

语言引导的视觉推理抽象

提出L-VARC框架,用语言引导特权信息分支,通过语义压缩与跨注意力投影提升视觉推理,18M参数性能领先。

04:00
arXiv cs.CV

感知、交互、推理:构建工具增强的视觉智能体以进行空间推理

PERIA工具增强视觉智能体,利用感知与交互工具提升空间推理,性能超同类模型7%-14.8%,媲美大模型。

04:00
arXiv cs.CV

基于贝叶斯条件先验的多标签测试时自适应

提出贝叶斯条件先验(BCP)估计,无需梯度测试时自适应,通过锚定条件贝叶斯更新引入标签依赖,显著提升多标签识别性能。

04:00
arXiv cs.CV

放大关键所在:面向视觉文本理解的注意力引导自适应渲染

VLM视觉文本理解存在“定位而不利用”问题,AGAR利用注意力放大关键文本区域,显著提升多项基准性能。

04:00
arXiv cs.CV

利用密度均衡映射学习任务感知采样与共享显著性

DECNN利用密度均衡映射动态调整卷积采样,聚焦任务相关区域,提升效率并生成显著性图。

04:00
arXiv cs.CV

MAMVI: 通过掩蔽多视角点云实现3D测试时自适应

提出MAMVI,用混合掩蔽策略和单步多视图自适应,在ShapeNet-C等数据集上达SOTA精度,推理速度提升4.9-8.9倍。

04:00
arXiv cs.CV

面向实时个性化工效姿态分析的机器学习框架

提出利用3D点云多角度实时分析工效姿态的框架,用户标注训练个性化分类器,克服固定视角局限。

04:00
arXiv cs.CV

TetherCache:利用门控召回和可信对齐稳定自回归长视频生成

TetherCache通过门控召回与可信对齐的缓存管理,显著降低自回归长视频生成的质量漂移。

04:00
arXiv cs.CV

用于自动驾驶场景预测的扩散Transformer世界动作模型

潜在扩散Transformer模型预测自动驾驶场景,解决失真指标误导,KID比回归优4.8倍,动作可控(ρ=0.81)。

04:00
arXiv cs.CV

基于骨架的人体动作识别中保持质量的不可感知对抗攻击

提出分布法对抗攻击,无噪声扰动保持运动质量,新指标评估自然性,攻击成功且质量优。

04:00
arXiv cs.CV

GeoCFNet:面向机器人辅助内镜黏膜下剥离术的几何感知置信场网络

提出GeoCFNet,融合Token-Differentiated Fusion与几何正则化,实现精准稳定的置信场估计,引导机器人辅助ESD手术。

04:00
arXiv cs.CV

一种结合跨主体伪标签与语义对齐的多模态微手势识别框架

提出跨模态伪标签与语义对齐多模态框架,解决微手势低信噪比和长尾分布,F1达68.13%。

04:00
arXiv cs.CV

SAM-Deep-EIoU:用于多目标跟踪的选择性掩码传播

针对困难帧选择性调用VOS模型修正追踪,无需训练,显著提升多目标跟踪性能。

04:00
arXiv cs.CV

高效、鲁棒且抗共谋的图像扩散模型指纹识别

提出抗合谋扩散模型指纹法,编码于个性化归一化模块,参数变换防御共谋,保真鲁棒,提取准确率>99.5%。

04:00
arXiv cs.CV

面向TUMTraf V2X的合作3D目标检测中的相机与激光雷达BEV融合

融合相机与激光雷达的BEV检测器在TUMTraf V2X合作3D检测中达0.85 mAP,发现测试帧与训练重叠,微调和后处理分别提升至0.89和0.99 mAP。

04:00
arXiv cs.CV

物体先于词语:儿童视角视频中语言接地性的物体优先归纳偏置

提出BabyMind,通过物体优先偏置和跟踪链接物体文件,以多实例对比学习提升稀疏监督下的语言接地准确率。

04:00
arXiv cs.CV

一种可扩展轻量级统一架构用于像素合并图像传感器的去马赛克

本文提出模块化统一架构,可轻量扩展地处理多种像素合传感器去马赛克,并引入无学习CFA识别模块实现即插即用。

04:00
arXiv cs.CV

基于深度感知蒸馏的森林视觉地点识别

深度感知蒸馏框架向DINOv2注入几何线索,提升森林地点识别鲁棒性,证明深度是关键互补模态。

04:00
arXiv cs.CV

全分布式多视角3D实时追踪

MV3DT全分布式框架通过点对点协调实现实时多视角3D追踪,性能媲美集中式,支持大规模零样本部署。

04:00
arXiv cs.CV

SeamEdit:一种黑盒VLM无关的大图像语义编辑流水线

SeamEdit通过五阶段后处理流水线,解决大图像语义编辑中的变形、对齐漂移和接缝伪影问题。

04:00
arXiv cs.CV

皮肤肿瘤皮肤镜图像的级联分类:可控灵敏度与外部临床验证

级联分类提升皮肤肿瘤皮肤镜图像性能,可控灵敏度弥补单阶段不足,但泛化差距需外部验证。