11301 条条目 · 106 个活跃源
2026年6月9日
04:00
arXiv cs.CV

MemoVAD:边缘计算场景下基于动态语义记忆的资源高效视频异常检测

提出边缘-云端协同框架,通过不确定性门控调用云端VLM,动态语义记忆缓存原型,降低通信开销且性能领先。

04:00
arXiv cs.CV

PereStruct:鲁棒历史文档解析的多模态语义组装

PereStruct多模态语义组装,历史报纸解析F1=0.904, BLEU=0.96,超越VLM

04:00
arXiv cs.CV

Struct-Searcher:智能体结构性思维推动多模态深度信息检索

提出Struct-Searcher,基于信念修正理论维护多模态结构图,实现冲突感知,平均准确率提升17.2%。

04:00
arXiv cs.CV

量子增强的偏振材料分类相似性度量

提出量子-经典混合方法,通过SWAP测试估计嵌入保真度,在23种材料上实现竞争性分类精度。

04:00
arXiv cs.CV

视频世界模型潜变量动作相关性的来源:预测胜过重建

动作相关结构主要由时间视频预训练而非像素重建保真度驱动,时间预测是核心因素。

04:00
arXiv cs.CV

跨架构基底:现代视觉编码器的跨域、抗校准几何不变量

发现视觉编码器前16个主方向收敛至同一几何基底,跨领域且抗校准,可应用于无标签迁移等。

04:00
arXiv cs.CV

DALE-CT:用于计算机断层扫描的深度感知基础模型

DALE-CT采用深度感知自监督学习,从零训练2D模型,在CT多异常检测中达到与3D模型相当的0.833 AUROC。

04:00
arXiv cs.CV

DroneDAR:基于单目视觉和边界框特征的远距离无人机距离估计

提出DroneDAR模型,结合卷积骨干和边界框门控机制评估远距离性能,分析失败模式以提升鲁棒性。

04:00
arXiv cs.CV

中文标题:跨视角城市交通数据集:用于单目鸟瞰定位的无人机监督真值

中文摘要:提出跨视角城市交通数据集与基准,含身份匹配和鸟瞰预测,评估可行但具挑战。

04:00
arXiv cs.CV

最后可见像素:探秘视觉-语言模型的精细感知

新基准FineSightBench揭示:VLM感知在12像素饱和,推理在更大尺度仍受限,存在根本缺陷。

04:00
arXiv cs.CV

VisualFLIP:在多模态推理中,预测是否依赖于任务关键的视觉证据?

VisualFLIP通过配对扰动图像评估多模态模型是否依赖关键视觉证据,发现高正确率未必代表证据依赖。

04:00
arXiv cs.CV

同时性运动过度障碍表型分析:基于常规视频、无标记姿态估计和表格基础模型的跨队列儿童迁移研究

视频表型分析框架结合无标记姿态估计与基础模型,成人训练迁移至儿童,校准后准确率提升至83.9%,Jaccard指数63.3%。

04:00
arXiv cs.CV

TBD-VLA:时序块扩散视觉-语言-动作模型

提出TBD-VLA框架,用时序块扩散实现高效、连贯的动作生成,推理快,性能优异。

04:00
arXiv cs.CV

基于匹配学习的改进顶点分布三维口腔建模

通过匈牙利匹配和排斥损失改进损失函数,使三维口腔重建顶点分布更均匀,缓解聚集问题。

04:00
arXiv cs.CV

FMRFusion:面向异质图像融合的频率感知多视图表示学习

提出FMRFusion,利用频率分解与跨视图交互,优化红外与可见光融合,夜间场景表现优异。

04:00
arXiv cs.CV

LEGS:基于拉普拉斯增强和非线性加权损失的高斯泼溅

提出LEGS方法,用二阶拉普拉斯结构引导和非线性权重优化高斯泼溅,PSNR提升达1.68dB,可作通用损失扩展。

04:00
arXiv cs.CV

解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线

提出无需训练的两阶段视频RAG流水线,解耦语义检索与逻辑推理,实现高精度信息检索与人物适配生成。

04:00
arXiv cs.CV

REACT 2026:第四届多恰当面部反应生成挑战赛:个性化MAFRG与恰当脑电图反应预测

REACT 2026挑战赛利用MARS数据集及人格与脑电标签,推动个性化、同步面部反应生成模型发展。

04:00
arXiv cs.CV

DAL-PCQA:为点云质量评估实现失真级别和语言驱动的推理

提出DAL-PCQA数据集,支持失真级和语言驱动的可解释点云质量评估。

04:00
arXiv cs.CV

DisCo:具有离散摄像机运动控制的世界模型

DisCo通过离散动作基元提升动作可分离性,实现可靠动作跟随,同时保持视觉质量。

04:00
arXiv cs.CV

ChronoPhyBench:多模态大语言模型是真正理解世界还是仅仅利用语言先验?

提出ChronoPhyBench基准检验多模态模型物理推理,实验表明开源模型能力不足,存在语言先验依赖。

04:00
arXiv cs.CV

C3VD-DEFCOL:一种具有时间分辨三维真值和真实外观的可变形结肠镜数据集

C3VD-DEFCOL提供110个带蠕动变形和时间分辨3D真值的结肠镜视频,具有真实外观,用于评估可变形重建算法。

04:00
arXiv cs.CV

双稳态图像描述中的视觉-语言不对称性

双稳态图像描述中,视觉塔同时激活两解释,但语言承诺在下游,揭示视觉-语言不对称及“看见/看作为”区别。

04:00
arXiv cs.CV

用于轻量级水下显著性实例分割检测Transformer的水域边界-显著性注意力模块

提出轻量级水下实例分割检测Transformer,基于水域边界-显著性注意力模块,在多个数据集上性能领先,推理延迟4-6毫秒。

04:00
arXiv cs.CV

VideoWeaver:评估与进化智能体长视频生成技能

VideoWeaver是评估与进化长视频生成技能的智能体框架与基准,提出agent-as-judge和技能进化算法,有效提升视频质量。

04:00
arXiv cs.CV

学习语义校准网络用于开放词汇语义分割

提出语义校准网络,通过类消歧与logits融合建模类间关联,增强判别力并保持泛化性,显著提升开放词汇分割性能。

04:00
arXiv cs.CV

Sci-Rho:面向STEM问题的多语言视觉基础符号基准

Sci-Rho基准评估视觉语言模型在STEM问题中的鲁棒性,发现最差与平均准确率存在差距及跨语言性能差异。

04:00
arXiv cs.CV

中文标题:基于CNN的砌体裂缝检测中真实与合成数据的平衡策略

中文摘要:合成数据加20%真实数据训练CNN,F1达76%,mIoU达80%,超越纯真实数据,减少采集成本。

04:00
arXiv cs.CV

DyCo-RL:面向视觉推理的动态跨模态协调

DyCo-RL通过动态跨模态协调优化视觉推理,用Fisher-Rao距离度量注意力对齐,提升多算法在七个基准上的表现。

04:00
arXiv cs.CV

Robust-U1: 多模态大语言模型能否自我修复受损视觉内容以实现鲁棒理解?

提出Robust-U1框架,赋予MLLMs视觉自恢复能力,通过监督微调、强化学习与多模态推理,在损坏场景下实现最优鲁棒理解。

04:00
arXiv cs.CV

GVC-Seg:基于几何视觉对应关系的免训练三维实例分割

提出GVC-Seg,利用几何与视觉对应免训练分割,消除模型偏差,性能最优。

04:00
arXiv cs.CV

IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理

IEA对话式代理通过三阶段多任务训练操作16种可解释工具,实现编辑与意图总结性能超越基线。

04:00
arXiv cs.CV

Trustworthy Visual Predicates for Robust Manipulation Understanding under Degradation

04:00
arXiv cs.CV

重力引导的3D人体运动接触动力学估计

提出GraCE模型,利用人体重心与接触概率预测地面接触力,在两大数据集上超越现有方法。

04:00
arXiv cs.CV

利用卫星图像使前馈式三维重建模型具备度量尺度能力

提出卫星引导框架,以卫星图像为度量参考,解决前馈重建的尺度模糊,实现绝对尺度与姿态估计,在多个数据集上表现优异。

04:00
arXiv cs.CV

以人为中心的驾驶员监控模型基准测试

提出四维评估框架,发现准确率不足以衡量模型部署适应性,聚合排名会掩盖关键维度漏洞。

04:00
arXiv cs.CV

一石三鸟:自适应最优传输用于多视觉语言模型的选择、适应与集成

提出OSTB框架,通过共识传输计划统一实现多VLM的选择、适应和集成,无需训练,显著提升鲁棒性。

04:00
arXiv cs.CV

基于属性信息的扩散模型文本到微结构生成

提出属性引导扩散网络,从文本生成3D微结构,通过双对齐策略确保语义与物理一致性,实现多样化结构合成。

04:00
arXiv cs.CV

视觉Transformer中补丁网格不稳定性的相位边缘化方法

提出后处理相位边缘化方法,采样对齐聚合补丁网格相位,无训练提升ViT稠密预测,K=4性价比最优。

04:00
arXiv cs.CV

IMAGINE:自适应图式意象增强的组合视频检索

IMAGINE网络通过动态多模态原型捕捉隐式语义,自适应增强视觉特征,实现组合视频与图像检索SOTA。

04:00
arXiv cs.CV

RAPID:面向高效视觉Transformer的逐层冗余感知剪枝与重要性驱动令牌合并

RAPID根据网络深度自适应调整令牌缩减策略,在ImageNet-1K上实现精度与压缩的更好平衡,极端压缩下准确率提升4.29%。

04:00
arXiv cs.CV

MRI预处理多少才足够?面向脑MRI基础模型的成本-效用研究

研究显示脑MRI预处理并非越多越好,P2级别性价比最高,更高级别收益有限且部分可被下游补偿。

04:00
arXiv cs.CV

G2G:利用组内几何信息进行组间姿态估计

G2G冻结基础模型,添加轻量模块,仅用相对姿态监督,在四个数据集上达到组间姿态估计SOTA精度。

04:00
arXiv cs.CV

可靠记忆:具有概率保证的时空记忆不确定性量化

提出物体级语义不确定性量化,结合主动视图选择与融合,提高时空记忆可靠性,显著提升问答性能。

04:00
arXiv cs.CV

超越原始信号:未解码的生成潜变量作为特权合成数据

利用未解码生成潜变量作为特权信息,提出DLA和MESSy高效蒸馏,获得对齐物理属性的高精度单模态模型。

04:00
arXiv cs.CV

基于集合的Transformer用于远距离长波红外高光谱成像的大气补偿

提出轻量级集合深度学习框架,从多距离辐射测量联合估计透射率、路径辐射和下行辐射,实现低光谱失真。

04:00
arXiv cs.CV

HACK++: 面向更高效的头部感知键值压缩以提升视觉自回归建模效率

HACK++通过分类上下文头与结构头,自适应分配缓存预算,在1%缓存预算下仍保持近无损生成。

04:00
arXiv cs.CV

SMI:基于互信息启发的依赖优化实现高效自监督学习

提出SMI方法,通过样本级依赖矩阵优化,降低计算复杂度,提升迁移性能与表示多样性。

04:00
arXiv cs.CV

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning

04:00
arXiv cs.CV

SegmentAnyTreeV2:跨传感器、平台和森林的基于Transformer的树木实例分割框架

提出跨传感器平台树木点云实例分割框架,测试集F1达85.0%,零样本泛化强。