11131 条条目 · 106 个活跃源
2026年7月29日
04:00
arXiv cs.CV

AVE-Compass:面向音视频编辑能力的全面评估

提出AVE-Compass基准,通过145个视频和196个指令全面评估音视频编辑能力。

04:00
arXiv cs.CV

关键点引导的最优传输:模型、算法及应用

提出KPG-RL模型,利用关键点引导最优传输匹配,应用于域适应、单细胞对齐和图像翻译,实验有效。

04:00
arXiv cs.CV

利用语义地图实现城市场景跨视角定位

利用VLM提取语义地标并匹配,通过轻量级匹配器实现城市场景定位,泛化性强。

04:00
arXiv cs.CV

CORF-GS: 基于光学-射频耦合高斯泼溅的实时无线辐射场重建

提出实时无线辐射场重建框架,利用光学-射频联合高斯表示与优化,实现高质量高速度重建。

04:00
arXiv cs.CV

HiFi-UMI:仅从高保真UMI数据学习可部署操作策略

通过高保真UMI数据实现零机器人后训练直接部署,成功率85%,预训练降低误差41%,开源2000小时数据集。

04:00
arXiv cs.CV

A2D2:奥迪自动驾驶数据集

A2D2数据集含图像、点云、语义分割及3D框标注,360度覆盖,助力自动驾驶研究。

04:00
arXiv cs.CV

基于CNN的心电图图像分类中的捷径学习与聪明汉斯效应分析

通过构造六种特征集,发现CNN模型可能依赖非临床伪影而非波形形态,存在捷径学习与聪明汉斯效应。

04:00
arXiv cs.CV

内蕴与三角剖分无关的注意力:一种简单而强大的网格学习方法

本文提出内蕴且三角剖分无关的注意力机制,简单强大,在多网格学习任务上超越现有最优。

04:00
arXiv cs.CV

SAM-MI:一种掩膜注入框架,用于增强基于SAM的开放词汇语义分割

提出SAM-MI框架,通过稀疏点提示加速掩膜生成,浅层聚合缓解过分割,解耦注入提升精度,速度提升1.6倍。

04:00
arXiv cs.CV

Leveraging ChatGPT's Multimodal Vision Capabilities to Rank Satellite Images by Poverty Level: Advancing Tools for Social Science Research

04:00
arXiv cs.CV

FFNet:基于MetaMixer的高效卷积混合器设计

通过FFNification将自注意力转为高效卷积混合器,FFNet仅用简单操作超越复杂方法,验证查询-键-值框架重要性。

04:00
arXiv cs.CV

DopQ-ViT:面向分布友好与异常值感知的视觉Transformer训练后量化方法

提出TanQ和MOSF,解决后Softmax幂律分布不匹配与异常值影响,提升ViT量化性能。

04:00
arXiv cs.CV

COCO-OLAC:面向遮挡全景分割与图像理解的基准数据集

提出COCO-OLAC数据集,评估遮挡影响,用对比学习提升遮挡下全景分割性能。

04:00
arXiv cs.CV

Mondrian:基于压缩打包推理的设备端高性能视频分析

提出Mondrian边缘系统,通过压缩打包推理选择必要像素并最大化并行处理,比基线准确率提高15-19.7%,吞吐量提升6.65倍。

04:00
arXiv cs.CV

针对移动物体的3D高斯泼溅用于高保真街景重建

提出自适应透明度机制消除移动物体,迭代优化高斯点分布,实现高质量动态街景实时重建。

04:00
arXiv cs.CV

HOLODECK 2.0:视觉语言引导的3D世界生成与编辑

视觉语言引导的3D场景生成框架,支持交互式编辑,生成高质量多样化风格场景,语义一致,效果优于基线。

04:00
arXiv cs.CV

SurgSLOT:通过语义长期追踪实现手术视频中的任意目标分割

提出SurgSLOT,基于时序语义与长期记忆实现手术视频任意目标分割,性能超越微调SAM5个百分点,支持零样本迁移。

04:00
arXiv cs.CV

公平的面孔:审视面部表情识别数据集和模型中的偏见

评估FER数据集和模型偏差,提出新指标,发现种族偏差显著,残差CNN偏差最低,Transformer最高,高精度不保证公平。

2026年7月28日
04:00
arXiv cs.CV

MegaSlide-DiT:以内存为中心的适配与可变形局部注意力实现高效视频扩散

提出MegaSlide-DiT,在单GPU上通过主机内存存储权重和3D可变形滑动注意力,高效适配105B视频扩散模型。

04:00
arXiv cs.CV

RMS@CC-MMD 2026: 基于几何交互与多视图共识的多模态厌女检测

提出GeoMVC,用几何交互层和多视图共识检测多模态厌女,在马拉雅拉姆语(0.892)和中文(0.895)分区获第2、3名,揭示本地化转写与文化讽刺挑战。

04:00
arXiv cs.CV

DINOv3-MIL: 基于KiTS23基础模型补丁令牌的肾脏多标签肿瘤与囊肿检测

在KiTS23上,门控注意力MIL取得肿瘤/囊肿检测最高AUROC(0.74/0.80),注意力富集7.5–9.8倍,原型头囊肿检测失效(0.51),揭示可解释性-性能权衡。

04:00
arXiv cs.CV

MIME:多模态交互运动编码器

MIME专为两人交互运动设计,采用流共注意力和课程对比训练,在检索上提升12.8% R@1,并改善生成语义对齐。

04:00
arXiv cs.CV

FogDrive:面向分级雾天感知的多模态合成驾驶数据集

多模态合成雾天数据集,含660场景与多传感器,三种雾度,支持3D融合及2D复原基准,已开源。

04:00
arXiv cs.CV

基于分割辅助诊断Transformer的组织病理谱引导的前列腺分层

提出LSDT模型,用零样本分割提供解剖先验,多模态融合实现前列腺四类分类,准确率0.633。

04:00
arXiv cs.CV

EditCLEVR:面向对象中心表示的组合忠实性的配对场景干预基准

EditCLEVR通过配对场景干预测试对象表示在语义编辑下的正确性,引入SGIA等指标,发现现有模型在组合外分布下存在退化。

04:00
arXiv cs.CV

托卡马克偏滤器中中性粒子发射断层扫描的可见光成像诊断:一种高效的基于Transformer的代理模型

提出Delta-InvFormer,利用视频帧差分自注意力预测等离子体光强分布,在EAST上实现快速高精度重建。

04:00
arXiv cs.CV

LowAux-RDNet:用于单图像反射去除的低通残差监督与场景平衡真实训练

提出低通残差辅助目标与场景平衡真实训练,统一评测基准,在五个数据集上取得最优平均PSNR、SSIM等指标。

04:00
arXiv cs.CV

StepX-Edge: 通过架构-训练-部署协同设计的端侧UI视觉语言模型

0.9B端侧UI视觉语言模型StepX-Edge,三层协同设计平衡精度效率,超越2B模型,量化后在骁龙8Gen5上高效运行。

04:00
arXiv cs.CV

针对嵌入式汽车系统的优化RetinaNet架构实时语义分割

提出Opt-RetinaSeg,通过轻量架构与三阶段优化,在嵌入式平台上实现73.9% mIoU与70.4 FPS,模型缩小4倍,精度损失小于3%。

04:00
arXiv cs.CV

通过分类引导的大型视觉-语言模型进行文档视觉信息提取

提出分类引导LVLM框架,结合上下文学习动态提示,零样本下F1达86.43%,超越监督基线18个百分点,提升文档提取鲁棒性。

04:00
arXiv cs.CV

面向儿童的AIGC视频风险审查:基准与知识支持的迭代推理框架

构建儿童AIGC视频风险审查基准CAVSR及知识增强框架QVRS-E,显著提升风险识别能力。

04:00
arXiv cs.CV

TOM-GS:通过静态3D高斯的时域不透明度调制实现可编辑视频表示

TOM-GS利用静态3D高斯的时域不透明度调制,避免复杂形变,实现高保真可编辑视频表示。

04:00
arXiv cs.CV

视觉令牌压缩增强多模态大语言模型的鲁棒性

通过剪枝偏离语言特征的视觉令牌,防御越狱攻击提升13.29%并缓解幻觉,增强模型鲁棒性。

04:00
arXiv cs.CV

DAMamba-UNet3D:一种参数高效的Mamba状态空间U-Net,具备动态自适应扫描用于3D医学图像分割

DAMamba-UNet3D用动态自适应扫描实现参数高效3D分割,仅5.3M参数即达SegMamba(70M)水平,大模型超越0.5pt。

04:00
arXiv cs.CV

γ-Bridge: 一种视数参数化扩散桥

提出视数参数化扩散桥,通过乘性Gamma噪声连接,实现单视训练、零样本多传感器SAR去斑。

04:00
arXiv cs.CV

面向精神分裂症认知康复的交互式视觉语言平台

提出基于视觉语言模型自动验证精神分裂症患者认知康复动作,通过分析玩具车操作视频实现客观评估。

04:00
arXiv cs.CV

一种新型对抗样本:测量人类与模型差距及其与OOD检测的关系

研究大扰动对抗样本,人类识别率降至49%但模型保持100%,OOD检测存在盲点,防御无效。

04:00
arXiv cs.CV

scMIR: 一种用于单细胞光学显微镜图像表示的视觉-语言基础模型

提出scMIR模型,融合自监督图像重建与文本引导对齐,统一编码形态与语义,在多种任务中优于现有方法。

04:00
arXiv cs.CV

PCA:面向快速视频大语言模型的持久感知压缩与聚合

提出PCA方法,通过动态下采样和运动增强,无训练压缩视频冗余,加速VLLM推理1.8-2.5倍。

04:00
arXiv cs.CV

结构保持主导基于深度学习的激光散斑材料分类中的数据增强

散斑分类中,数据增强效果由结构保持而非扰动幅度决定,需物理感知设计。

04:00
arXiv cs.CV

Cortex:使用冻结视觉特征的紧凑型Quake行为克隆

Cortex使用冻结视觉特征的紧凑行为克隆,在Quake中未完成关卡但能到达关键区域并击杀,视觉token密度提升战斗与生存能力。

04:00
arXiv cs.CV

可信赖的医学分割:临床图像退化下的不确定性感知U-Net评估

在八种临床退化下评估不确定性感知U-Net,发现不确定性跟踪分割错误,可标记失败(AUROC 0.843),作为放射学安全层。

04:00
arXiv cs.CV

CrossSpine:基于解剖先验的多尺度交叉序列注意力自动化Pfirrmann分级

提出CrossSpine框架,交叉序列注意力融合多尺度MRI特征,结合解剖先验,使Pfirrmann分级Macro F1提升超125%。

04:00
arXiv cs.CV

打开模型的"眼睛":视频与上下文感知的多模态后通道预测

提出多模态对齐框架CAMA-BC,利用视频和上下文提升后通道预测,尤其善于识别共情等复杂信号。

04:00
arXiv cs.CV

面向室内环境的免标定三维多相机人物追踪

提出免标定三维多相机追踪框架,利用深度模型推断几何结构,无需标定矩阵,HOTA达53.13%。

04:00
arXiv cs.CV

中文标题:用于EEG运动想象分类的生成增强:一种带循环一致性解码器精炼的类条件VAE

中文摘要:提出类条件VAE生成运动想象EEG增强数据,但分类增益小且依赖分类器。

04:00
arXiv cs.CV

用于30米晴空地表温度无间隙重建的快速傅里叶卷积生成对抗网络

提出快速傅里叶卷积GAN,结合SAR数据重建30米Landsat云污染像元,生成无间隙晴空LST,RMSE稳定在0.8-1.8K。

04:00
arXiv cs.CV

评估领域差异:视频胶囊内窥镜中域偏移下的模型选择不稳定性

胶囊内镜模型选择在域偏移下不稳定,单一数据集排名无法预测其他目标,应关注跨目标排序稳定性而非峰值性能。

04:00
arXiv cs.CV

超越错误-丢弃特性:迈向稳定可靠的人脸图像质量评估

揭示EDC协议局限,提出RCE等新指标,实现更稳定可靠的人脸图像质量评估。

04:00
arXiv cs.CV

凝视锚定社交网络:通过联合建模解码隐性关系

提出ANCHOR范式,联合建模凝视与隐性社会关系,通过关系注意力和优化协同,从静态图像中解码社会层级,性能领先。