10861 条条目 · 106 个活跃源
2026年9月9日
04:00
arXiv cs.CV

深度学习医学图像配准中的架构与正则化组件:系统性消融研究

消融实验表明:正则化是主要驱动,带来精度提升和几乎全部变形控制,且零推理成本;仿射结构仅小幅补充。

04:00
arXiv cs.CV

DIVA:利用跨步条件传播实现离散扩散视觉语言模型的视觉越狱

针对离散扩散视觉语言模型,发现跨步条件传播漏洞,提出DIVA白盒视觉越狱攻击,显著提升越狱成功率。

04:00
arXiv cs.CV

跨模态多跳问答:面向多模态检索增强生成的基准数据集

现有多模态RAG基准缺乏开放域跨模态多跳推理。提出CrossModalQA,含1863题,需跨图文检索合成证据,平均3.5跳,揭示多模态RAG在完整证据链和图像推理上仍不足。

04:00
arXiv cs.CV

跨多模态扩散模型的对抗攻击与防御综述

综述扩散模型在图像、视频与三维模态的对抗攻防,提出任务中心分类,分析评估,展望挑战。

04:00
arXiv cs.CV

大型视觉-语言模型中的涌现目标导向注意力

现成视觉-语言模型在目标匹配下与人类注视更一致,无需注视监督即可涌现目标导向注意力。

04:00
arXiv cs.CV

基于YOLOv8的统一驾驶感知中频率感知任务加权的探索性研究

探索用损失历史低频能量比加权任务,在统一驾驶感知中可行,但未证实优于基线。

04:00
arXiv cs.CV

基于位置和速度表示的视线轨迹生成扩散模型

扩散模型可无条件生成逼真视线动态,位置空间模型效果更优,但长期特征仍需条件生成改进。

04:00
arXiv cs.CV

基于基础设施的单目3D车辆定位框架及实验验证

提出一阶段框架,由单目路侧图像直接估车辆地面位置、尺寸与朝向,无人机生成标注,实测验证有效。

04:00
arXiv cs.CV

多光照/多焦点显示图像异常检测的对比知识蒸馏

针对多光照多焦点显示屏图像异常检测,提出无配对的对比蒸馏特征拉推方法与融合模块,显著优于现有方法。

04:00
arXiv cs.CV

面向头颈癌PET/CT判读的专用多模态大模型

头颈癌PET/CT判读专用大模型:优于通用模型,肿瘤分类内83%外69%,有临床转化潜力。

04:00
arXiv cs.CV

懂得何时不回答:视觉-语言模型中的弃权与拒绝推理

评估视觉语言模型面对无法从图像回答的医学问题时,是否弃权或受表情误导;提出PARITY基准,发现模型分为拒答型与猜测型,临床护栏可减少有害归因。

04:00
arXiv cs.CV

视觉词典:社交网络抑郁检测中缺失模态填补的视觉词典方法

针对社交帖子缺图问题,提出词典法用词映射平均图像特征补全,零参数达F1 0.9454,效果媲美生成网络。

04:00
arXiv cs.CV

超越裁决:视觉提示注入护栏的证据对齐评估

视觉提示注入护栏评估不能只看判定,须结合证据定位与反事实响应;新基准显示模型定位能力差异可达九倍。

04:00
arXiv cs.CV

SimpleMemVLA:一种简单有效的视觉-语言-动作模型原生视频记忆

无需专用记忆模块,以时间戳视频保留完整历史并输入骨干,子任务隐状态传递历史,四个记忆基准创最佳。

04:00
arXiv cs.CV

三维视觉-语言模型综述

三维视觉-语言模型综述:三维表征、跨模态对齐、多模态框架和三维大语言模型,以及语言引导高斯、形状生成和具身智能。

04:00
arXiv cs.CV

双潜记忆路由用于视觉-语言推理

提出DLMR,为多模态大模型配备视觉与推理双记忆,由路由器动态调用,冻结基座,少量参数提升长程推理。

04:00
arXiv cs.CV

基于近红外视频的主体相对微动作与睡眠动态用于睡眠分期

本研究提出ViNUSS框架,直接利用近红外视频判断睡眠阶段,无需生理代理信号。结合微动作与整夜动态建模,在475夜数据上达80%准确率,证明NIR视频可独立用于睡眠分期。

04:00
arXiv cs.CV

图启发神经表示的视频压缩

提出图启发神经表示编码器,通过消息传递与门控显式利用时间冗余,性能超过现有神经及标准编码器。

04:00
arXiv cs.CV

抑郁面部模式能否跨文化与情境迁移?来自德国RCT和E-DAIC的证据

抑郁面部模式跨语料库迁移由功能情境对齐决定;被动观察情境模型最易迁移,二分类比连续回归更稳健,AUC=0.70。

04:00
arXiv cs.CV

ViT3Flow:用于脊柱侧凸术后X光片合成的测试时训练Transformer均值流

提出测试时训练均值流框架,以单次网络评估由术前X光片生成脊柱侧凸术后X光片,质量与几何精度最优。

04:00
arXiv cs.CV

SceneMosaic:基于混合智能体布局演化的高效多样仿真就绪场景生成

结合图像先验与视觉语言模型,按局部独立演化后组合,高效生成多样且物理有效的场景,提速二十四倍。

04:00
arXiv cs.CV

Srijika:复用OpenType布局的字体风格重塑,面向九种印度文字

该方法复用OpenType布局,重绘模板字形,为九种印度文字生成完整可用字体。

04:00
arXiv cs.CV

时间感知的辅助导航

提出多模态基准,研究辅助导航中MLLM的实时响应时机,发现现成模型不足,简单改进可提升性能,但时序推理等挑战仍存。

04:00
arXiv cs.CV

基于面部年龄估计的国民身份证系统年龄欺诈检测

面向Aadhaar系统,提出SwinAge面部年龄估计模型,辅助识别年龄造假。在283K测试集上MAE达2.94年,1%FAR下各阈值FRR最低0.4%,优于现有模型。

04:00
arXiv cs.CV

无监督迁移聚类缓解主动提示学习冷启动

提出UTC+SQ框架,用无监督迁移聚类替代距离聚类,提升查询代表性,在8个数据集中6个取得更高准确率。

04:00
arXiv cs.CV

整页光学音乐识别:手写单声部乐谱

研究手写单声部全页转录,发现合成预训练益处主要来自学习结构布局,而非视觉相似性。

04:00
arXiv cs.CV

RenderFormer-V2:异构场景基元的神经渲染

统一Transformer神经渲染模型,无需逐场景训练即可处理焦散、体积散射等复杂光传输,支持异构基元与材质编码。

04:00
arXiv cs.CV

更大的文本编码器可能损害CLIP零样本性能

文本编码器过大会损害零样本性能,源于过拟合;按模态调权重衰减可恢复提升,且均匀性与对齐存在权衡。

04:00
arXiv cs.CV

面向海量点云数据的高斯线性函数流形方法

提出高斯线性函数流形法:函数基表示地形,高斯过程模拟散射,奇异值降秩实现线性时间,精度零点九九三三,超四种基线。

04:00
arXiv cs.CV

SeRV:面向美国手语生成的语义对齐残差向量量化

提出语义对齐残差向量量化,用分层模型由粗到细生成三维手语动作,并构建基准,精度最优。

04:00
arXiv cs.CV

映射可能性:面向语言目标空中导航的空间信念场

提出SBFNav框架,用空间信念场保留多个可能目标位置,逐步更新并选最优目标导航,在CityNav基准上显著提升成功率与路径效率。

04:00
arXiv cs.CV

FreeTransformSR:基于自由低秩可学习变换的高效轻量图像超分辨率

提出FreeTransformSR轻量超分网络,用低秩可学习变换与自适应调制,以极少参数和计算量实现高画质,适合资源受限部署。

04:00
arXiv cs.CV

AAMBERS-UAV:面向UAV杂草稻分割的采集感知多模态骨干评估与排序

UAV分割常规划分高估泛化;采集暴露提升性能但模态排名依赖架构,需采用采集感知同测试评估。

04:00
arXiv cs.CV

GeoContext:视觉语言地理定位中的一个上下文阶梯与两种失败模式——盲目依赖用户提供的位置上下文及错误确认位置声明

提出GeoContext基准,含GeoHint与GeoVerify任务,揭示模型过度依赖位置提示、难以准确验证位置声明。

04:00
arXiv cs.CV

FACT:利用编译工具使用轨迹的AI生成图像检测取证智能体

提出FACT,自适应调用取证工具收集证据,经演化-蒸馏-精炼,在多个基准包括未见生成器上性能最佳。

04:00
arXiv cs.CV

UniFusion: 基于统一时空深度对齐的稀疏视角4D重建

提出统一时空深度对齐框架,无需前景分割,联合解决跨视角与时间不一致,提升动态高斯泼溅的4D重建质量。

04:00
arXiv cs.CV

面向域泛化分割的分层提示注入器

提出空间分层提示与分层提示注入器为每类添加区域级几何锚点并自适应注入以提升域泛化分割

04:00
arXiv cs.CV

MolParser-Mobile:面向大规模化学文献挖掘的超快速OCSR系统

提出AutoML优化的轻量级OCSR系统,仅9.98M参数,吞吐每秒1520分子,精度相当或更优。

04:00
arXiv cs.CV

GenPuzzle:图像生成模型的视觉推理基准测试

GenPuzzle要求图像模型保持状态并逻辑求解,含2005道视觉推理题;最强模型仅达40.57%,暴露逻辑与几何缺陷。

04:00
arXiv cs.CV

CoRe-SAM3:面向SAM3裂缝分割的条件语义-视觉调和

基于语义与视觉差异,以语义为主、视觉生成条件残差校正分割,仅1.9万参数使交并比达70.5%、线相似度达89.2%。

04:00
arXiv cs.CV

利用高斯过程校正特征缓存加速扩散Transformer

提出高斯过程回归校正框架,利用残差零均值高斯特性与不确定性自适应策略,减少计算且提质。

04:00
arXiv cs.CV

PAI-Actor:动态场景中的电影级多角色替换

提出电影级多角色动画框架,在真实视频中替换动态角色,保持场景一致性与画质,实现高效长视频生成。