11101 条条目 · 106 个活跃源
2026年8月5日
04:00
arXiv cs.CV

Qwen-3D:面向空间理解的全能3D视觉语言模型

Qwen-3D用3D几何压缩视觉,在场景推理,用查询分割解码器统一语言与几何,超越3D LMM及2D模型。

04:00
arXiv cs.CV

GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝

提出GSTEP全局时空密度剪枝,平衡信息密度与覆盖,剪75%令牌保持性能并加速。

04:00
arXiv cs.CV

PDD-RRG:面向检查级放射学报告生成的后验诊断决策

提出后验诊断决策框架,整合多视角报告,利用贝叶斯后验概率和阈值聚合诊断,无需重训练提升临床效果。

04:00
arXiv cs.CV

基于VLM的3D室内场景生成的全局图验证优化

提出图验证与混合搜索方法,实现开放词汇3D室内布局的全局语义一致与物理可行,达到最优性能。

04:00
arXiv cs.CV

AIDE:基于蒸馏专家知识的自动化指令,用于无参考动作技能辅导

AIDE通过蒸馏专家知识,仅靠学习者姿态生成教练反馈,性能优于无参考基线,媲美需专家示范的方法。

04:00
arXiv cs.CV

RIDGE:基于内部动态引导的重新加噪图像编辑

RIDGE免反演免训练,用内部动态引导重新加噪近似目标,提升源保留、目标对齐和感知质量。

04:00
arXiv cs.CV

TASQ:扩散模型的时间自适应位稀疏量化

提出TASQ,共享最大精度权重并用时空掩码减少不敏感阶段计算。质量与静态量化相当,周期降25%-50%。

04:00
arXiv cs.CV

CorePath:乳腺专科病理基础模型,用于穿刺活检诊断与风险受控报告生成

乳腺专科病理基础模型CorePath提升活检分型准确率,非乳腺幻觉由30.1%降至2.8%,风险控制实现零幻觉报告生成。

04:00
arXiv cs.CV

DiverseDiT++:扩散Transformer中表征多样性的量化、分析与促进

提出加权多样性分数(WDS)衡量扩散Transformer块间表征差异,发现其与生成质量强相关,据此提出DiverseDiT++促进多样化表征学习,提升性能。

04:00
arXiv cs.CV

CAPE-T2V:面向文生视频生成中双侧条件对齐的标注器锚定提示增强

CAPE-T2V方法:两阶段微调提示增强器与扩散模型,缩小推理与训练描述差异,提升文生视频生成质量。

04:00
arXiv cs.CV

LDU-Bench:布局变化电路背景下的光刻缺陷理解多模态大语言模型评估基准

提出LDU-Bench,多任务评估光刻缺陷理解,分四任务。现有MLLM仅缺陷分流可靠,后续形态、定位、归因薄弱,揭示跨层结构化理解不足。

04:00
arXiv cs.CV

先矫正后扩散:在去噪轨迹展开前解耦概念

提出RTD框架,在去噪前矫正初始概念分配,解决多概念生成中遗漏或错误合并问题,显著提升组合保真度并加速。

04:00
arXiv cs.CV

基于自适应样本生成的通道动态知识蒸馏用于动作识别

提出ASCD蒸馏法,借自适应样本生成与通道动态分配,提升动作识别压缩性能,多基准达SOTA。

04:00
arXiv cs.CV

加强防御:无需重训练即可强化深度感知哈希对抗逃避攻击

提出DualShield插件防御,结合匹配时随机平滑与发布时加固,无需重训练即可提升深度感知哈希鲁棒性,显著降低攻击成功率。

04:00
arXiv cs.CV

SUV:将未来场景理解作为视频生成,用于端到端驾驶

提出SUV框架,将未来场景理解视为视频生成,统一预测多模态流并用于轨迹规划,性能SOTA。

04:00
arXiv cs.CV

FaithIR:从感知锐度到任务相关保真度,重新思考红外图像超分辨率

提出FaithIR,用全局条件与像素重建保持红外结构,提升检测分割性能,优于追求感知锐度。

04:00
arXiv cs.CV

正交线扫描图像融合的统一分辨率条件化框架

提出统一分辨率条件化融合框架,特征调制适配狭缝宽度,自适应增强恢复近各向同性分辨率,信噪比达34-40分贝。

04:00
arXiv cs.CV

视频-语言模型高效推理的自适应两阶段视觉标记剪枝

提出两阶段自适应视频标记剪枝:先剪冗余帧,再按内容自适应剪标记。免训练,保留10%标记精度+7%,算力降95%

04:00
arXiv cs.CV

SeCo-SBIR:零样本草图图像检索的语义一致提示学习

针对CLIP提示学习在零样本草图检索中的过拟合难题,提出文本引导多模态提示与扰动一致性约束,注入可迁移语义,在三个基准上达到最优。

04:00
arXiv cs.CV

基于透射多光谱成像的牛乳尿素掺假无损定量检测

采用透射多光谱成像结合回归模型,实现牛乳尿素掺假无损定量,验证R²达0.9773。

04:00
arXiv cs.CV

集成3D骨架提取与语言分析的多模态植物根系表型分析

提出多模态机器人框架,融合三维骨架与语言分析,用无监督骨架网络及大语言模型,实现可解释根系表型分析。

04:00
arXiv cs.CV

CROSS:面向遥感指代分割的级联蒸馏与双约束对齐

针对遥感指代分割的架构弱耦合与目标语义偏差,提出CROSS,通过级联蒸馏注入结构先验、对比学习打破语义捷径,实现精准定位,达到最优性能。

04:00
arXiv cs.CV

多对象与关节人体-对象交互生成的表面关键点表示

提出表面关键点轨迹表示对象运动,结合时空接触距离场,三阶段生成多对象及关节交互,性能优于现有方法。

04:00
arXiv cs.CV

Frozen High-Resolution Inference for Cross-City Object Detection: An AI City Challenge 2026 Study

04:00
arXiv cs.CV

从路线到步骤:在视觉-语言导航中分离语义进度与局部执行

提出Route2Step,分离语义进度与动作生成,R2R-CE上SR和SPL分别达55.3%和48.2%。

04:00
arXiv cs.CV

CRIL-U-Net: Compact Ratio-Interaction Learning for Focal Cortical Dysplasia Segmentation from T1w and FLAIR MRI

04:00
arXiv cs.CV

通过可微物理渲染弥合在线与离线手写

提出可微物理笔刷模型与渲染器,统一在线轨迹与离线图像生成,实现结构真实与视觉保真。

04:00
arXiv cs.CV

EditFlow3D:轨迹保持的3D资产自动局部编辑

EditFlow3D:免训练局部3D编辑,VLM生成掩码与引导,保留非目标区并精准编辑,引入新基准。

04:00
arXiv cs.CV

DRIFT:利用对抗性补丁攻击使流匹配VLA的去噪轨迹偏离

流匹配VLA看似抗扰动,实为忽略多步去噪。DRIFT补丁攻击首步即可破坏任务,优于基线。

04:00
arXiv cs.CV

用于EEG-fNIRS想象手写解码的频率去相关时间集成

FRED用多尺度时间网络集成三种EEG频率视图结合伪标签与协议解码取得整体准确率0.7952排名第四

04:00
arXiv cs.CV

CrossScope:面向联合双内窥镜手术视频预测的角色非对称世界模型

提出角色非对称双流世界模型,通过几何引导残差交互选择性传递跨视图证据,完成双内窥镜手术视频预测,优于基线。

2026年8月3日
04:00
arXiv cs.CV

医学基础模型能否泛化于非洲大脑?

评估基础模型在非洲脑MRI的表现:分类增益有限,分割提升明显;性能差异源于数据规模而非来源,非洲影像数据稀缺是主要障碍。

04:00
arXiv cs.CV

基于分组监督与焦点-骰子损失的长尾室内语义占用预测

提出分组监督与统一焦点-骰子损失,提升长尾室内语义占用预测,相对基线提高11.38%。

04:00
arXiv cs.CV

基于磁共振成像的多任务三维脑肿瘤分割深度学习模型统一基准

提出统一基准,同条件下比较三类深度学习模型在三维脑肿瘤分割中的精度与效率。

04:00
arXiv cs.CV

物理对齐的自监督学习用于科学成像

提出物理对齐的自监督增强设计流程,以测量一致对称性和采集扰动构建增强集,在电子显微及4D-STEM上显著提升下游性能与鲁棒性。

04:00
arXiv cs.CV

FocusGS:用于已训练3D高斯资产局部修复与确定性编辑的空间增量层

FocusGS将局部修复与确定性编辑统一为空间增量,修复纯加法,编辑用擦除-插入分解,提升区域PSNR,轻量可验证的3DGS维护算子。

04:00
arXiv cs.CV

ReLoop-UME:面向通用多模态嵌入的可学习检索寄存器循环深度

提出ReLoop-UME,循环复用参数共享检索块,用可学习检索寄存器积累证据,提升多模态检索性能且速度大幅提升。

04:00
arXiv cs.CV

SCMA:结构条件化与金属感知的流匹配用于CT金属伪影减少

提出结构条件与金属感知的流匹配框架,结合投影一致性校正,有效抑制CT金属伪影并保留解剖结构。

04:00
arXiv cs.CV

不确定性感知的多视角结构学习深度伪造检测

提出不确定性感知框架,融合视觉、语义与结构三流证据,以分支间分歧校准不确定性,跨数据集实现最优泛化与校准。

04:00
arXiv cs.CV

等待信号:简单的频率感知流匹配

提出小波感知变换器WaiT,高频带等待粗结构出现后联合细化,ImageNet 512上FID 1.43,计算减半。

04:00
arXiv cs.CV

合成数据能否克服基于AI的豇豆花荚检测在育种基因型和环境间的泛化局限?

合成数据能克服AI花荚检测泛化极限,但需测量优化域差距;HDR合成数据加5张真实图像即可不逊于真实基线。

04:00
arXiv cs.CV

针对各向异性体数据的2D/3D混合CNN胸部CT COVID-19病例自动分类方法

提出2D/3D混合CNN,从三垂直面提取特征自动分类胸部CT以辅助诊断COVID-19,准确率83.3%。

04:00
arXiv cs.CV

LegoQ:高光谱分类的谱-空状态转移密度矩阵表示学习

提出密度矩阵表示学习框架,通过谱-空状态转移与原型保真度分类,有效处理混合像元,提升高光谱分类精度与可解释性。

04:00
arXiv cs.CV

DiffAttack:基于潜在扩散模型的人脸识别规避攻击

提出DiffAttack,用潜在扩散模型生成对抗人脸,成功率84.86%,迁移性超越现有方法。

04:00
arXiv cs.CV

CAER:面向多模态大语言模型的冲突感知证据路由与双前缀专家

提出CAER,用跨度证据路由和双前缀专家实现视觉-语言冲突检测与生成,不更新骨干参数,提升可靠性。

04:00
arXiv cs.CV

检索驱动的免训练AI生成视频溯源

提出免训练检索式AI视频溯源,利用生成指纹聚合跨帧伪影,性能超越现有方法。

04:00
arXiv cs.CV

SafeNexus:发现并调控多模态大语言模型中的模态通用安全神经元

提出SafeNexus,定位调控模态通用安全神经元,经激活放大或微调校准增强多模态安全,保持效用。

04:00
arXiv cs.CV

RAID:利用位反转图像实现鲁棒的AI生成图像检测

提出基于位平面的位反转图像检测AI生成图,理论验证有效,跨生成器/数据集和零样本性能优,速度快近100倍。

04:00
arXiv cs.CV

面向高效提示微调的视觉分布锚定

提出VDA:用类级视觉原型增强冻结分类器,免训练适配,提升多种提示微调方法3.2-3.4点

04:00
arXiv cs.CV

基于3D CNN和3D MLP-Mixer混合模型的胸部CT体数据COVID-19病例分类

提出3DCNN与3DMLP-Mixer混合模型分类COVID-19胸部CT1205例准确率79.5%