11031 条条目 · 106 个活跃源
2026年8月14日
04:00
arXiv cs.CV

SCOPE:面向稀疏视频注意力的在线每头Top-K估计子空间聚类

提出SCOPE稀疏注意力框架,结合3D-RoPE子空间聚类与在线每头Top-K估计,提升视频DiT推理效率,加速最高1.99倍。

04:00
arXiv cs.CV

擦除但保留:通过优化语义锚点可控移除版权动画角色

提出用优化语义锚点替换角色嵌入,实现可控擦除并保持图像质量,效果最优。

04:00
arXiv cs.CV

LocusGS:前馈3D高斯泼溅的空间锚定令牌

提出LocusGS,为高斯查询添加锚点,提升空间一致性与渲染质量,形成结构化分布。

04:00
arXiv cs.CV

异构视觉-语言集成与分歧感知重排序的文本行人异常检索

提出异构视觉-语言集成与分歧感知重排序,在行人异常检索基准上达90.92% mAP,验证多模态互补与选择性推理的有效性。

04:00
arXiv cs.CV

结构化局部差分建模用于AI生成图像检测

提出RippleNet框架,通过局部差分信号抑制语义主导、增强低信噪比伪造痕迹,实现AI生成图像高效检测。

04:00
arXiv cs.CV

SPARED:基于推理的AI生成图像检测(利用对抗编辑数据)

提出对抗强化学习框架,攻击者编辑真实图像迷惑检测器,防御者基于推理识别伪造,持续提升泛化与解释质量。

04:00
arXiv cs.CV

面向人机物体交接预测的RGB-D视频生成

提出Hand2Bot数据集与PassGen生成pipeline,弥合仿真差距,提升意图识别与零样本迁移。

04:00
arXiv cs.CV

基于人口统计的监督对比学习缓解人脸识别偏差

提出DeSCon损失,通过人口感知批次与配对,改善尾部行为,超越数据平衡,提升公平性且保持性能。

04:00
arXiv cs.CV

HounsWorld:面向隐藏患者状态读取、重建与模拟的多模态世界模型

该模型通过共享潜在状态统一CT读取、重建与模拟,联合多模态学习提升临床智能。

04:00
arXiv cs.CV

基于深度强化学习的靶向白质纤维追踪框架

提出融合强化学习与监督学习的靶向纤维追踪框架,无需金标准纤维,多策略融合提升鲁棒性和泛化能力。

04:00
arXiv cs.CV

超越视觉证据:揭示并缓解文档多模态大模型中的关系隐私泄露

针对文档MLLM在视觉证据不足时的关系隐私泄露,提出DRUF框架及基准,泄漏抑制提升4.8个百分点,保持KIE性能。

04:00
arXiv cs.CV

TennisVAR:以击球证据为依托的网球视频战术推理多模态大语言模型

提出网球战术推理基准与多模态大模型,以击球证据为依托实现战术推理。

04:00
arXiv cs.CV

面向4D植物建模的结构感知黎曼生长场

提出结构感知黎曼生长场,从稀疏观测重建植物连续生长,联合建模拓扑与几何,性能优于现有方法。

04:00
arXiv cs.CV

EgoPHI:从第一人称视觉估计接触与力

EgoPHI提出从第一人称图像联合估计手物密集接触与3D力分布,借助仿真数据训练,在模拟、分布外和真实场景中均验证有效。

04:00
arXiv cs.CV

PixSDS:为何潜空间SDS产生噪声像素

潜空间SDS因VAE漂移产生噪声像素,PixSDS解码潜变量作为清洁方向,降低伪影。

04:00
arXiv cs.CV

DiCoR:面向高效遥感图像指代分割的解耦指代消歧与轮廓重校准

提出解耦指代消歧与轮廓重校准框架,三个基准上分割精度最佳,指标显著提升且速度快于现有方法。

04:00
arXiv cs.CV

统一视频和图像表示用于视频人脸伪造检测

提出UVIF框架,用统一编码器联合建模视频与图像,通过伪标注和特征对齐增强部分伪造视频检测,性能领先且无额外开销。

04:00
arXiv cs.CV

EgoMonth:面向长期时空记忆的月级别第一人称视频基准

EgoMonth是首个月级别第一人称视频基准,含300小时数据,评估显示最强多模态模型仅达71.8%,远低于人类94.2%,缺乏长期时空记忆。

04:00
arXiv cs.CV

空间锚定的文本到视频生成:推理时无梯度优化

提出一种训练与梯度均无关的视频生成方法,解析求解交叉注意力,实现精准空间位置控制,计算开销极小。

04:00
arXiv cs.CV

P2Fusion:基于双先验蒸馏的提示驱动渐进式红外-可见光图像融合

提出一种基于双内在提示蒸馏的红外可见光融合方法,实现渐进引导,性能领先。

04:00
arXiv cs.CV

UniTraffic-Agent:用于AI城市挑战赛2026赛道3的统一交通视频推理与两项域外评估

提出交通视频推理智能体UniTraffic-Agent用观察推理行动验证流程三项评测分获16 2 4名

04:00
arXiv cs.CV

拓扑统一的二维姿态估计:涵盖完整、残肢与假肢肢体

提出ProPose基准和ProLoss损失,统一完整/残肢/假肢拓扑,使长尾假肢关节分类准确率提升2%-6%,且不损定位精度。

04:00
arXiv cs.CV

RbFT-Net:用于4D雷达-相机深度补全的先校正后融合时间雷达锚点

提出先校正后融合框架,视雷达回波为噪声锚点,校正深度并估计可靠性,抑制不可靠测量。

04:00
arXiv cs.CV

图像间对应关系的在线学习

提出图像序列点对应在线迭代法,基于涅曼卡方散度优化映射,通道向量表示密度,逐帧更新,实时高精度且优于现有方法。

04:00
arXiv cs.CV

迈向物理保真的科学图表生成

提出Princigram与SP-CoT结构化物理思维链,构建四百三十万物理图像及评测基准,提升科学示意图的物理保真性。

04:00
arXiv cs.CV

Paths:用于RGB-事件视频行人重识别的提示感知时空Transformer与层级多模态融合

提出Paths框架,用提示感知时空变换器与层级多模态融合,进行RGB-事件视频行人重识别,有效。

04:00
arXiv cs.CV

快速迭代五点相对位姿估计

提出基于鲍威尔狗腿算法的五点相对位姿迭代法,精度同于尼斯特法但快一倍,可扩展并适于精化。

04:00
arXiv cs.CV

SketchSense:学习解读不完美草图引导的图像修复

提出草图感知框架,同步去噪彩色与结构流,双向注意力融合,提升修复质量与结构保真。

04:00
arXiv cs.CV

用于视觉实例分割的符号距离函数预测

训练网络预测多方向距离图,近似符号距离函数后阈值分割,前景IoU优于YOLACT,但实例映射仍具挑战。

04:00
arXiv cs.CV

少标注,多解释:先验引导的概念瓶颈模型用于可解释癌症影像诊断

提出先验引导混合概念瓶颈模型,用少量标注和分布匹配提升概念识别,保持诊断性能,减少标注负担。

04:00
arXiv cs.CV

QuISE:通过查询无关语义编辑防御针对视觉语言模型的文字攻击

QuISE:无需训练的黑盒防御,用查询无关语义编辑替换干扰文字,按答案一致性输出,恢复率67.9%-75%。

04:00
arXiv cs.CV

MergeOver:面向递归视觉Transformer的训练后Token合并

MergeOver实现递归ViT训练后令牌合并,无重训降内存延迟,精度降1.47%,提供基线。

04:00
arXiv cs.CV

面向自动驾驶的几何基础统一三维感知

提出几何基础统一3D感知GeoUP,结合重建潜表示与射线图编码,多任务训练后在检测、占用、深度估计上达SOTA。

04:00
arXiv cs.CV

有限资源下自监督图像与视频预训练的控制性研究

控制研究显示:有限资源下DINOv2最优;结合VideoMAE提升语义但损害几何,体现语义与几何权衡。

04:00
arXiv cs.CV

锥束CT中基于多色建模的溅射式金属伪影消除

提出泼溅式自校准方法,结合多色模型校正锥束CT金属伪影,无需掩膜,效果优于现有技术。

04:00
arXiv cs.CV

TRAPSBench:视觉语言模型能编码却无法表达认知克制

视觉语言模型能感知不确定性却不会表达弃答;新基准与指标显示最佳得分极低,瓶颈在表达而非感知。

04:00
arXiv cs.CV

保真约束下的黑盒去噪器锚定

提出保真约束锚定,线性混合去噪图与原图,按局部保真指标选最大混合因子,无需重训,平衡去噪与自然度。

04:00
arXiv cs.CV

社交音视频问答的推理:现状如何?

发现基准噪声大、简单微调胜过推理法、纯文本可学习先验,发布新基准与模型。

04:00
arXiv cs.CV

AmalthAI:文化遗产领域的开源计算机视觉平台

AmalthAI开源平台赋能文化遗产专家自主训练和验证模型,支持本地部署保障数据安全。

04:00
arXiv cs.CV

基础模型在纵向MRI疾病进展推理中的表现如何?

提出时间感知多视图MRI基准,评估16个模型发现时间对齐尚可但方向识别和体积量化系统性失败。

04:00
arXiv cs.CV

CoverPrune:基于最优传输的覆盖驱动三维视觉语言模型令牌剪枝

提出覆盖剪枝框架,将推理时令牌剪枝建模为最优传输,用证据覆盖取代多样性,高效保持性能。

04:00
arXiv cs.CV

GeoCache:通过几何增量传输实现多视图纹理扩散的免训练加速

几何增量传输实现免训练多视图纹理扩散加速:旋转锚视图,两倍以上加速且保真度最佳。

04:00
arXiv cs.CV

NARU:日本极长视频中叙事演变与文化细微差别理解的基准

提出NARU基准,含1481问、155视频,评估日本长视频叙事演变与文化理解,揭示多模态模型不足。

04:00
arXiv cs.CV

HPSD:用于文本-图像到视频扩散模型的混合策略自蒸馏

提出混合策略自蒸馏(HPSD),教师以TI2V模式指导T2V学生,显著增强模型基础生成能力。

04:00
arXiv cs.CV

BraTS-GoAT分割的可靠性分析:深度集成不确定性的受控稳健性研究

脑肿瘤分割可靠性研究:深度集成在分布偏移下,成员分歧比单模型置信度更早警示错误,校准更优。

04:00
arXiv cs.CV

UniCon-Former:统一卷积Transformer,手势识别所需的一切

提出统一卷积Transformer融合局部全局,降开销,手势识别中以更少参数计算量达最优。

04:00
arXiv cs.CV

基于损失引导的多专家GAN手语视频合成

提出损失引导多专家GAN合成手语视频,三判别器分工,统一损失稳定训练,低显存高PSNR,可部署于消费级硬件。

04:00
arXiv cs.CV

通过多光谱成像重建历史手稿:对比度在评估图像质量和可读性方面的潜力

对比度指标与专家评分及全参考度量高度相关,优于通用指标,可客观评估手稿重建质量与可读性。

04:00
arXiv cs.CV

SNM-VFI: 对称非线性运动引导的生成式视频帧插值

提出对称非线性运动引导的生成式视频插帧法,无需训练,融合光流与扩散模型,置信图提升细节,性能优异。

04:00
arXiv cs.CV

Edit2TikZ:面向TikZ科学图形编辑的全面且富有挑战性的基准

提出科学图形编辑基准Edit2TikZ,评估多个多模态大模型,发现性能不佳;混合训练显著提升编译成功率至83.4%。