11141 条条目 · 106 个活跃源
2026年7月28日
04:00
arXiv cs.CV

Omni-Prune: 面向高效全模态大语言模型的查询感知统一令牌剪枝

无训练查询感知视听令牌剪枝,联合去冗余,加速3.25倍、内存降1.3倍,保持99%性能。

04:00
arXiv cs.CV

鲁棒6自由度物体姿态追踪:遮挡与快速运动下的内置恢复机制

提出结合关键点匹配与优化对齐的6DoF追踪方法,内置失败检测与恢复,在遮挡和快速运动中鲁棒,速度达57.6fps。

04:00
arXiv cs.CV

VIPER:面向物理合理视频生成的视觉上下文物理推理框架

VIPER通过参考视频演示物理过程,利用多模态大模型提取物理线索,指导视频生成器实现物理行为迁移。

04:00
arXiv cs.CV

PlanCraft:灵感源于建筑师的渐进式3D住宅场景生成——草绘、精炼与布置

提出渐进式平面图生成方法,以2D空间契约为基石,实现高质量3D场景,实验指标大幅超越现有最佳方法。

04:00
arXiv cs.CV

擦除还是不擦除:具有保留感知的自适应排序子空间扩展的鲁棒免训练概念擦除

PARSE是一种免训练概念擦除框架,通过动态发现并编辑子空间,实现鲁棒擦除且不牺牲模型效用。

04:00
arXiv cs.CV

MOJITO:模态联合学习实现统一端到端自动驾驶

MOJITO通过模态联合注意力消除级联接口,实现端到端自动驾驶,在NAVSIM上取得新SOTA。

04:00
arXiv cs.CV

基于Token-区域引导的跨注意力融合多模态情感解读

提出跨注意力融合框架,利用视觉-语言模型提取OCR文本,对齐语义与视觉区域,在孟加拉语政治模因检测中达到0.94 Macro-F1。

04:00
arXiv cs.CV

MemVLN: 用于视觉与语言导航的情景记忆与程序记忆

MemVLN结合情景记忆与程序记忆,实现实时高效导航,性能与速度显著提升。

04:00
arXiv cs.CV

Markerless Motion Capture in Routine Clinical Upper Limb Assessments: Validity and Insights Beyond Ordinal Scoring

04:00
arXiv cs.CV

神经形态目标检测:深入研究与未来方向

综述神经形态目标检测:涵盖问题、数据集、评估指标,分析事件表征与时序建模等方法,评估模型并探讨未来方向。

04:00
arXiv cs.CV

SketchMamba:一种轻量级状态空间模型,用于联合渐进式草图分类与笔划自动补全

SketchMamba以单因果序列模型同时实现渐进分类与笔划自动生成,参数量仅1.55M,精度达94.93%,70%笔划时即达90%最终精度。

04:00
arXiv cs.CV

JarvisHub:面向画布原生多模态创意智能体的开放框架

JarvisHub是画布原生创意智能体框架,支持长期多模态创作与可检查编辑的自动化。

04:00
arXiv cs.CV

ConFusion:连续融合空间学习实现细粒度可控红外与可见光图像融合

提出ConFusion框架,通过高斯条件调制学习连续融合空间,实现实例级细粒度可控融合,性能领先。

04:00
arXiv cs.CV

使用主要和次要标签的弱监督实例级格里森模式估计

提出弱监督多实例学习框架,聚合预测建模主要与次要格里森模式,有效估计实例级模式并超越现有方法。

04:00
arXiv cs.CV

几何与语义融合:视觉检测任务中语义驱动边界框优化的分数阶梯度稳定方法

提出分数阶语义IoU损失,融合几何与语义,利用历史状态正则化梯度,稳定优化性能。

04:00
arXiv cs.CV

ATCNet-CIAM用于多会话运动想象脑电图信号分类

提出ATCNet-CIAM模型,集成通道注意力模块,提升多会话运动想象脑电分类准确率与稳定性。

04:00
arXiv cs.CV

GaitFace:用于远距离行人识别的多模态数据集

GaitFace数据集暴露了现有模型在低分辨率和高视角下的缺陷,为远距离行人识别提供严格基准。

04:00
arXiv cs.CV

D3O:面向有序回归的动态分布蒸馏

D3O通过自蒸馏动态演化有序标签分布,结合对比增强和CDF交叉层蒸馏,有效处理模糊噪声,显著提升有序回归性能。

04:00
arXiv cs.CV

PathSelect:全切片病理学的顺序令牌选择

PathSelect以可微顺序令牌选择,平均44.86令牌达74%准确率,实现36.6倍压缩且优于采样方法。

04:00
arXiv cs.CV

WGDnet: 威沙特引导的几何感知深度网络用于PolSAR图像分类

提出WGDNet,融合可学习Wishart统计与几何自适应卷积,提升PolSAR分类精度和边界保真度。

04:00
arXiv cs.CV

DAP-Pose:深度时间对齐与物理感知跨模态传感器融合实现鲁棒姿态估计

提出DAP-Pose,融合视觉/惯性/GNSS,深度时间对齐与物理约束实现鲁棒姿态估计,KITTI上SOTA(误差1.31%/0.46°),抗时间错位。

04:00
arXiv cs.CV

XMatchAD:基于重建的异常检测的跨模态匹配视角

提出XMatchAD框架,通过跨模态匹配增强异常检测与定位,性能超越现有方法。

04:00
arXiv cs.CV

GRAPE:用于铰接式肖像网格估计的渐进路由

GRAPE通过构建躯干-头部运动链与渐进对齐网络,提升肖像网格重建质量及下颌-表情解耦。

04:00
arXiv cs.CV

RRTrack:面向动态场景的鲁棒且可恢复的物体6D姿态跟踪

RRTrack通过2D-6D闭环跟踪与双库模板匹配,在动态场景中实现快速运动及完全遮挡后的鲁棒恢复,性能提升65%以上且实时(55.2 FPS)。

04:00
arXiv cs.CV

基于扰动感知的扩散引导混合分割方法,用于鲁棒且标注高效的植物胁迫表型分析

提出扩散引导混合分割框架,结合骨干网络与扩散模型,在PlantSegV3上达71.83% mIoU,对扰动鲁棒且标注高效。

04:00
arXiv cs.CV

多模态遥感图像生成的对比参数解耦

提出对比参数解耦框架,从文本生成光学/红外/SAR多模态图像,实现语义一致与结构对齐,性能优于现有方法。

04:00
arXiv cs.CV

面向提示驱动手术概念分割的SAM3参数高效适配

提出LoRA适配SAM3进行手术概念分割,仅优化0.98%参数,性能优于基线,支持下游重建模拟。

04:00
arXiv cs.CV

GNM Head:一种生成式人体头部测量模型

提出GNM参数化模型,覆盖头脸颈眼齿舌,基于高分辨率扫描和专家样本,拟合3D人脸达SOTA,已开源。

04:00
arXiv cs.CV

SimBEV2X:面向多任务车联网协同感知的大规模数据集与数据生成工具

基于CARLA的V2X协同感知最大数据集与生成工具,提出CoBEVFusion架构。

04:00
arXiv cs.CV

PathScale-R1:病理图像分析中的跨尺度推理

提出抗捷径的跨尺度病理推理框架,构建PathScale-VQA数据集,优化PathScale-R1模型,实现最佳跨尺度推理性能。

04:00
arXiv cs.CV

RoadVGGT:道路结构感知的前馈式路面重建

无需每场景优化,融合几何模型与网格,重建紧凑高斯路面,提升图像、语义及高程精度。

04:00
arXiv cs.CV

可操控的双人头部虚拟形象

提出STEER,实现双人对话头部虚拟形象的注视、头部节奏和情绪的可控生成,优于现有方法。

04:00
arXiv cs.CV

超越外观:面向移动空地平台的行人关联与跟踪的多线索框架与大规模基准

提出融合多线索的FUSION框架与最大规模视角多变数据集RealMvMoAT,实现移动空地平台行人关联跟踪最优性能。

04:00
arXiv cs.CV

一致证据,鲁棒识别:几何变换下的忠实归因正则化

提出基于子模搜索的无注释归因正则化,通过路径一致性和终止对齐损失提升归因稳定性与鲁棒性,仅微降精度。

04:00
arXiv cs.CV

OmniCache:扩散模型的多维分层特征缓存

提出OmniCache统一分层缓存框架,利用多维特征冗余,无需训练即降低推理延迟达35%,保持视觉保真度。

04:00
arXiv cs.CV

具有动态显式头发的头部数字人

提出DynHair,通过3D高斯溅射和时序网络建模动态头发,从视频重建可动画头部数字人,实现物理逼真头发运动。

04:00
arXiv cs.CV

长尾医学图像分类

长尾分布导致医学图像分类偏向常见病,通过数据增强和深度学习模型有效减少误差,最佳模型表现良好具应用前景。

04:00
arXiv cs.CV

基于嵌入的异常检测用于清洗全球作物类型参考数据集

提出EBA框架,利用预训练嵌入检测异常标签,清洗后提升作物类型模型精度,保守清洗有效。

04:00
arXiv cs.CV

基于互模态信任与轻量重建正则化的细粒度轮胎花纹识别

提出融合互模态信任与轻量重建正则化的方法,建立MTire299数据集,有效提升细粒度轮胎识别性能。

04:00
arXiv cs.CV

TimePLE: 重新思考视频时间定位中的时间表示

TimePLE通过预测时间区间联合分布,将视频时间定位转化为区间原生表示,在四个基准上平均mIoU达58.9,优于端点预测方法。

04:00
arXiv cs.CV

RODR:用于解缠流形表示的黎曼正交解耦正则化

RODR通过解耦法向和切向分量,避免几何梯度干扰,同时保持几何细节与采样均匀性,性能媲美当前最优方法。

04:00
arXiv cs.CV

基于视觉-语言模型的自主车辆GNSS欺骗检测方法

提出首个VLM框架,融合视觉与传感器数据检测GNSS欺骗,三阶段微调后F1达94-95%,计算量减少86%。

04:00
arXiv cs.CV

彩色眼底照相分析:面向多模态AI的数据、预处理与建模的协同演进

综述彩色眼底照相AI中数据集、预处理与建模的协同演进,迈向多模态整合与稳健临床部署。

04:00
arXiv cs.CV

流形约束的噪声优化以实现多样扩散采样

MoNO流形约束噪声优化,提升扩散模型多样性,无需辅助目标,收敛更高效。

04:00
arXiv cs.CV

可以编辑什么?开放式策略发现与情绪可编辑性图谱

EmoScope通过情绪条件化功能推理发现图像特定编辑空间,实现自适应策略,用户偏好率88.1%,并揭示分类器指标盲点。

04:00
arXiv cs.CV

目光到文本生成:超越人类注意的分类解码

提出Gazette框架,将目光扫描路径解码为自然语言目标描述,超越分类解码,实现人机交互新范式。

04:00
arXiv cs.CV

DDVT:用于视觉问答中答案定位的动态双层视觉Transformer融合网络

提出DDVT网络,含问导动态区域和跨模态多尺度聚合模块,精准定位答案,性能超越现有方法。

04:00
arXiv cs.CV

DuoAD:利用[CLS]双重特性实现免训练少样本异常检测

基于[CLS]双重特性(全局语义+注意图)的免训练少样本异常检测框架,实现自动增强与特征重加权,三数据集AUC达97.7%/93.2%/84.5%。