11231 条条目 · 106 个活跃源
2026年7月10日
04:00
arXiv cs.CV

基于差分隐私的等变量子聚类:跨异构敏感数据集的参数高效隐私保护分析

提出等变量子聚类(EQC),融合对称感知量子电路与差分隐私,在NSL-KDD上准确率79.3%,成员推理攻击成功率降至38.3%。

04:00
arXiv cs.CV

玩转ZendoWorld:挑战AI智能体的主动视觉概念归纳

ZendoWorld环境挑战AI主动归纳视觉规则,发现高预测精度≠真正理解,VLM实验信息不足,人类存在归纳差距。

04:00
arXiv cs.CV

HoloTetSphere: 面向物理仿真的统一四面体网格重建

提出拓扑自适应端到端四面体网格重建,通过高斯球耦合与联合优化,生成连贯统一网格,提升几何精度并简化物理仿真流程。

04:00
arXiv cs.CV

通过隐式高分辨率先验的特征匹配实现真实世界盲超分辨率

提出FeMaSR,用特征匹配和隐式高分辨率先验实现盲超分辨率,生成更逼真的高分辨率图像。

04:00
arXiv cs.CV

数据炼金术:通过测试时数据校准缓解跨站点模型变异性

提出可解释染色归一化与测试时校准,无需调参消除多站点域差异,显著提升分类性能。

04:00
arXiv cs.CV

AUTOPILOT VQA:以事故为中心的行车记录仪理解的视觉-语言模型基准测试

提出AUTOPILOT-VQA基准,评估视觉语言模型对行车事故的理解,推动安全感知推理。

04:00
arXiv cs.CV

XOV-Action:迈向可泛化的开放词汇动作识别

提出XOV-Action模型,通过多样化精炼表示与场景无关表示,实现跨域开放集动作识别泛化,并构建新基准XOVABench。

04:00
arXiv cs.CV

ARDY: 基于混合表示的自回归扩散用于交互式人体运动生成

提出ARDY框架,实现实时高质量人体运动生成,支持在线文本提示与灵活运动约束,通过混合表示和两阶段自回归去噪提升可控性。

04:00
arXiv cs.CV

原生视频动作预训练实现通用机器人控制

提出LingBot-VA 2.0,采用语义动作分词、因果预训练等四大设计,实现少样本泛化控制。

04:00
arXiv cs.CV

GERD:几何事件响应数据生成

GERD事件视觉模拟器,支持精确几何变换和噪声模型,生成受控事件数据以辅助模型训练与评估。

04:00
arXiv cs.CV

概念即树:一种可控合成数据框架,增强个性化视觉语言模型

提出概念树框架,通过树结构生成可控正负样本,显著提升VLM个性化性能。

04:00
arXiv cs.CV

GSurf:从溅射不透明高斯学习符号距离场实现高质量三维重建

将SDF集成到高斯溅射,利用连续性正则化,填充几何空洞、抑制噪声,实现高效高质量表面重建。

04:00
arXiv cs.CV

BiasBench: 一个可复现的事件相机偏置调优基准

提出事件相机偏置调优基准数据集BiasBench及基于强化学习的在线调整方法。

04:00
arXiv cs.CV

TrackStudio:无标记追踪集成工具包

TrackStudio集成工具包,无需编程即可实现高精度无标记追踪,验证显示帧间相关性>0.98,三角化误差<13.6mm。

04:00
arXiv cs.CV

生成动作评估指标:评估合成视频中的人类运动

融合骨骼与外观特征的新指标评估合成视频动作质量,性能提升68%,更符合人类感知。

04:00
arXiv cs.CV

PhyMAGIC:置信度引导LLM的物理运动感知生成式推理

无需微调,融合扩散模型、LLM置信度引导与可微物理模拟器,从单图生成物理一致运动。

04:00
arXiv cs.CV

MSRNet:一种面向伪装目标检测的多尺度递归网络

提出MSRNet,利用多尺度递归与注意力融合,精准检测小和多个伪装目标,在基准数据集上取得领先结果。

04:00
arXiv cs.CV

DeltaDeno:通过增量去噪归因的零样本异常生成

提出无训练零样本异常生成方法,对比扩散分支定位缺陷并引导潜修复,无需真实样本,生成真实异常并提升检测性能。

04:00
arXiv cs.CV

面向空间推理的视觉-语言记忆

提出VLM²模型,用双记忆模块从2D视频实现3D空间推理,性能达最优。

04:00
arXiv cs.CV

诊断视觉损坏引起的视觉语言模型可靠性故障

提出Bench-C和RAS,发现轻度损坏提升准确率但破坏预测结构,导致可靠性故障

04:00
arXiv cs.CV

TOPO-Bench:一个具有可量化感知混淆的开源拓扑地图评估框架

提出拓扑一致性指标与定位精度替代度量,量化数据集歧义,开源基准揭示感知混淆下方法局限。

04:00
arXiv cs.CV

LlamaSeg:通过自回归掩码生成的图像分割

提出LlamaSeg自回归框架,统一多任务分割,构建2M掩码数据集,引入新指标,性能超越现有生成方法。

04:00
arXiv cs.CV

PRGCN:一种用于3D人体姿态估计中跨序列模式复用的图记忆网络

提出PRGCN,利用图记忆库存储姿态原型,通过注意力检索与解剖约束融合,实现跨序列模式复用,在3D姿态估计上达到SOTA。

04:00
arXiv cs.CV

Elastic3D: 基于引导潜码解码的可控立体视频转换

Elastic3D实现可控、端到端单目转立体视频,避免深度估计伪影,用户可调节视差强度,性能领先。

04:00
arXiv cs.CV

用于高质量基元神经重建的神经谐波纹理

神经谐波纹理通过周期激活将插值特征分解为谐波分量,实现高质量实时新视角合成,桥接基元与神经场方法。

04:00
arXiv cs.CV

面向临床信息与可解释的医学图像理解工具瓶颈框架

提出工具瓶颈框架(TBF),用学习模型组合VLM选择的临床工具,提升医学图像理解的性能与可解释性。

04:00
arXiv cs.CV

从任意对象中借用:一种可泛化的参考引导实例编辑框架

提出GENIE框架,通过解耦参考外观与属性,实现鲁棒实例编辑。

04:00
arXiv cs.CV

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Zoom-IQA采用监督微调与强化学习两阶段训练,基于区域推理实现鲁棒可解释的图像质量评估。

04:00
arXiv cs.CV

HairWeaver:基于仿真到真实引导的视频扩散的少样本逼真头发运动合成

提出HairWeaver,通过两个LoRA模块从单张图片生成逼真动态头发动画,实现精细控制,达到新标杆。

04:00
arXiv cs.CV

SwinIFS:基于地标引导的Swin Transformer用于身份保持的人脸超分辨率

SwinIFS通过地标引导和Swin Transformer实现身份保持的人脸超分辨率,在8倍放大下仍能恢复清晰结构,平衡精度与效率。

04:00
arXiv cs.CV

解剖引导的潜在扩散用于脑MRI进展建模

提出AG-LDM,简化训练并保证解剖一致性,体积误差减少15-20%,协变量敏感性提升3.5-31.5倍。

04:00
arXiv cs.CV

自监督视觉Transformer中类似人类的对象分组

自监督模型(如DINO)通过对象中心表征和Gram矩阵结构,实现类似人类的对象分组,提升感知对齐。

04:00
arXiv cs.CV

更少数据,更快收敛:面向多模态指令调优的目标驱动数据优化

GDO用远少于基线的训练样本,实现更快收敛,在MVBench等视频基准上准确率提升1-3个百分点。

04:00
arXiv cs.CV

纠正注意力分散引起的视觉模糊以减少幻觉:算法与理论

多模态模型幻觉源于注意分散,提出AFIP方法通过跨头注意增强和历史注意强化校正,无需额外训练。

04:00
arXiv cs.CV

LSRM:基于扩展上下文窗口的高保真物体中心重建

LSRM通过扩展上下文窗口和高效稀疏注意力,大幅提升3D重建保真度,PSNR提高2.4dB以上,LPIPS降低超40%。

04:00
arXiv cs.CV

超越注意力分数:基于SVD的视觉令牌剪枝以实现高效视觉-语言模型

提出SVD-Prune方法,利用奇异值分解保留贡献最大全局方差的令牌,在极端剪枝下仍保持强性能。

04:00
arXiv cs.CV

GAP-GDRNet: 基于几何感知的单目航天器6D姿态估计,利用合成几何监督

提出几何感知网络GAP-GDRNet,通过AFR和PGSA改进姿态回归,在自建数据集上超越基线3.88百分点,速度达35.97FPS。

04:00
arXiv cs.CV

OmniOPSD:面向情感计算的基于推理优势的在策略自蒸馏方法

OmniOPSD利用推理特权证据进行在策略自蒸馏,避免直接模仿,在MER-UniBench取得84.19分SOTA性能。

04:00
arXiv cs.CV

Bricker to BRACE: A Bracket Exposure RAW Dataset and Restoration Model for Flicker-Banding

04:00
arXiv cs.CV

视频扩散模型在手部运动重建中的惊人有效性

利用视频扩散模型重建4D双手姿态,无需检测器,显著优于现有方法。

04:00
arXiv cs.CV

面向驾驶舱场景理解的视觉语言模型基于搜索的测试

提出ISU-Test方法,通过搜索优化场景参数,显著提升故障率10倍、覆盖率3.6倍。

04:00
arXiv cs.CV

基于深度精灵的图像模型:一项分析

分析基于精灵的图像分解模型,提出新方法,在无监督分割上达先进水平,可扩展且可解释。

04:00
arXiv cs.CV

LESV:语言嵌入的稀疏体素融合用于开放词汇3D场景理解

LESV采用稀疏体素光栅化替代3DGS,结合深度先验和AM-RADIO模型消除歧义,实现开放词汇3D理解SOTA。

2026年7月9日
04:00
arXiv cs.CV

ProMoE-FL:面向缺失模态的多模态联邦学习的原型条件专家混合

提出基于原型条件专家混合框架,动态合成缺失特征,在公共X光数据集上超越现有方法。

04:00
arXiv cs.CV

LipSSD:用于对抗鲁棒目标检测的Lipschitz约束单次检测

提出LipSSD,通过Lipschitz约束实现鲁棒目标检测,与对抗训练互补,提升检测鲁棒性并保持精度。

04:00
arXiv cs.CV

MiLSD:面向资源受限设备的微型线段检测器

提出MiLSD,在亚兆字节预算下用紧凑网络实现线段检测,1MB内将sAP10从10.6提升到24.1,支持8位量化。

04:00
arXiv cs.CV

NLPCC 2026共享任务1概述:难度感知的多语言多模态医学教学视频理解评估

提出DA-MIVQA任务,按证据难度区分简单与复杂问题,含三个赛道,评估医学教学视频问答系统。

04:00
arXiv cs.CV

反事实公平的图像分类器是否满足群体公平?——一项理论与实证研究

通过新数据集发现反事实公平不保证群体公平,因存在相关但不因果的潜在属性,提出CKD方法可使其满足。

04:00
arXiv cs.CV

SpaR3D-MoE: 自适应稀疏视图三维空间推理与几何归纳混合专家模型

提出SpaR3D-MoE框架,通过自适应时空采样与几何归纳MoE,从稀疏RGB输入实现三维空间推理,在VSI-Bench等任务达SOTA,平均分63.5。

04:00
arXiv cs.CV

动态少步:统一动态计算与少步蒸馏的高效视频生成

提出动态少步加速框架,联合优化去噪步数与模型稀疏,实现30倍加速并保持生成质量。