Qwen-3D:面向空间理解的全能3D视觉语言模型
Qwen-3D用3D几何压缩视觉,在场景推理,用查询分割解码器统一语言与几何,超越3D LMM及2D模型。
GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝
提出GSTEP全局时空密度剪枝,平衡信息密度与覆盖,剪75%令牌保持性能并加速。
PDD-RRG:面向检查级放射学报告生成的后验诊断决策
提出后验诊断决策框架,整合多视角报告,利用贝叶斯后验概率和阈值聚合诊断,无需重训练提升临床效果。
基于VLM的3D室内场景生成的全局图验证优化
提出图验证与混合搜索方法,实现开放词汇3D室内布局的全局语义一致与物理可行,达到最优性能。
AIDE:基于蒸馏专家知识的自动化指令,用于无参考动作技能辅导
AIDE通过蒸馏专家知识,仅靠学习者姿态生成教练反馈,性能优于无参考基线,媲美需专家示范的方法。
RIDGE:基于内部动态引导的重新加噪图像编辑
RIDGE免反演免训练,用内部动态引导重新加噪近似目标,提升源保留、目标对齐和感知质量。
TASQ:扩散模型的时间自适应位稀疏量化
提出TASQ,共享最大精度权重并用时空掩码减少不敏感阶段计算。质量与静态量化相当,周期降25%-50%。
CorePath:乳腺专科病理基础模型,用于穿刺活检诊断与风险受控报告生成
乳腺专科病理基础模型CorePath提升活检分型准确率,非乳腺幻觉由30.1%降至2.8%,风险控制实现零幻觉报告生成。
DiverseDiT++:扩散Transformer中表征多样性的量化、分析与促进
提出加权多样性分数(WDS)衡量扩散Transformer块间表征差异,发现其与生成质量强相关,据此提出DiverseDiT++促进多样化表征学习,提升性能。
CAPE-T2V:面向文生视频生成中双侧条件对齐的标注器锚定提示增强
CAPE-T2V方法:两阶段微调提示增强器与扩散模型,缩小推理与训练描述差异,提升文生视频生成质量。
LDU-Bench:布局变化电路背景下的光刻缺陷理解多模态大语言模型评估基准
提出LDU-Bench,多任务评估光刻缺陷理解,分四任务。现有MLLM仅缺陷分流可靠,后续形态、定位、归因薄弱,揭示跨层结构化理解不足。
先矫正后扩散:在去噪轨迹展开前解耦概念
提出RTD框架,在去噪前矫正初始概念分配,解决多概念生成中遗漏或错误合并问题,显著提升组合保真度并加速。
基于自适应样本生成的通道动态知识蒸馏用于动作识别
提出ASCD蒸馏法,借自适应样本生成与通道动态分配,提升动作识别压缩性能,多基准达SOTA。
加强防御:无需重训练即可强化深度感知哈希对抗逃避攻击
提出DualShield插件防御,结合匹配时随机平滑与发布时加固,无需重训练即可提升深度感知哈希鲁棒性,显著降低攻击成功率。
SUV:将未来场景理解作为视频生成,用于端到端驾驶
提出SUV框架,将未来场景理解视为视频生成,统一预测多模态流并用于轨迹规划,性能SOTA。
FaithIR:从感知锐度到任务相关保真度,重新思考红外图像超分辨率
提出FaithIR,用全局条件与像素重建保持红外结构,提升检测分割性能,优于追求感知锐度。
正交线扫描图像融合的统一分辨率条件化框架
提出统一分辨率条件化融合框架,特征调制适配狭缝宽度,自适应增强恢复近各向同性分辨率,信噪比达34-40分贝。
视频-语言模型高效推理的自适应两阶段视觉标记剪枝
提出两阶段自适应视频标记剪枝:先剪冗余帧,再按内容自适应剪标记。免训练,保留10%标记精度+7%,算力降95%
SeCo-SBIR:零样本草图图像检索的语义一致提示学习
针对CLIP提示学习在零样本草图检索中的过拟合难题,提出文本引导多模态提示与扰动一致性约束,注入可迁移语义,在三个基准上达到最优。
基于透射多光谱成像的牛乳尿素掺假无损定量检测
采用透射多光谱成像结合回归模型,实现牛乳尿素掺假无损定量,验证R²达0.9773。
集成3D骨架提取与语言分析的多模态植物根系表型分析
提出多模态机器人框架,融合三维骨架与语言分析,用无监督骨架网络及大语言模型,实现可解释根系表型分析。
CROSS:面向遥感指代分割的级联蒸馏与双约束对齐
针对遥感指代分割的架构弱耦合与目标语义偏差,提出CROSS,通过级联蒸馏注入结构先验、对比学习打破语义捷径,实现精准定位,达到最优性能。
多对象与关节人体-对象交互生成的表面关键点表示
提出表面关键点轨迹表示对象运动,结合时空接触距离场,三阶段生成多对象及关节交互,性能优于现有方法。
Frozen High-Resolution Inference for Cross-City Object Detection: An AI City Challenge 2026 Study
从路线到步骤:在视觉-语言导航中分离语义进度与局部执行
提出Route2Step,分离语义进度与动作生成,R2R-CE上SR和SPL分别达55.3%和48.2%。
CRIL-U-Net: Compact Ratio-Interaction Learning for Focal Cortical Dysplasia Segmentation from T1w and FLAIR MRI
通过可微物理渲染弥合在线与离线手写
提出可微物理笔刷模型与渲染器,统一在线轨迹与离线图像生成,实现结构真实与视觉保真。
EditFlow3D:轨迹保持的3D资产自动局部编辑
EditFlow3D:免训练局部3D编辑,VLM生成掩码与引导,保留非目标区并精准编辑,引入新基准。
DRIFT:利用对抗性补丁攻击使流匹配VLA的去噪轨迹偏离
流匹配VLA看似抗扰动,实为忽略多步去噪。DRIFT补丁攻击首步即可破坏任务,优于基线。
用于EEG-fNIRS想象手写解码的频率去相关时间集成
FRED用多尺度时间网络集成三种EEG频率视图结合伪标签与协议解码取得整体准确率0.7952排名第四
CrossScope:面向联合双内窥镜手术视频预测的角色非对称世界模型
提出角色非对称双流世界模型,通过几何引导残差交互选择性传递跨视图证据,完成双内窥镜手术视频预测,优于基线。
医学基础模型能否泛化于非洲大脑?
评估基础模型在非洲脑MRI的表现:分类增益有限,分割提升明显;性能差异源于数据规模而非来源,非洲影像数据稀缺是主要障碍。
基于分组监督与焦点-骰子损失的长尾室内语义占用预测
提出分组监督与统一焦点-骰子损失,提升长尾室内语义占用预测,相对基线提高11.38%。
基于磁共振成像的多任务三维脑肿瘤分割深度学习模型统一基准
提出统一基准,同条件下比较三类深度学习模型在三维脑肿瘤分割中的精度与效率。
物理对齐的自监督学习用于科学成像
提出物理对齐的自监督增强设计流程,以测量一致对称性和采集扰动构建增强集,在电子显微及4D-STEM上显著提升下游性能与鲁棒性。
FocusGS:用于已训练3D高斯资产局部修复与确定性编辑的空间增量层
FocusGS将局部修复与确定性编辑统一为空间增量,修复纯加法,编辑用擦除-插入分解,提升区域PSNR,轻量可验证的3DGS维护算子。
ReLoop-UME:面向通用多模态嵌入的可学习检索寄存器循环深度
提出ReLoop-UME,循环复用参数共享检索块,用可学习检索寄存器积累证据,提升多模态检索性能且速度大幅提升。
SCMA:结构条件化与金属感知的流匹配用于CT金属伪影减少
提出结构条件与金属感知的流匹配框架,结合投影一致性校正,有效抑制CT金属伪影并保留解剖结构。
不确定性感知的多视角结构学习深度伪造检测
提出不确定性感知框架,融合视觉、语义与结构三流证据,以分支间分歧校准不确定性,跨数据集实现最优泛化与校准。
等待信号:简单的频率感知流匹配
提出小波感知变换器WaiT,高频带等待粗结构出现后联合细化,ImageNet 512上FID 1.43,计算减半。
合成数据能否克服基于AI的豇豆花荚检测在育种基因型和环境间的泛化局限?
合成数据能克服AI花荚检测泛化极限,但需测量优化域差距;HDR合成数据加5张真实图像即可不逊于真实基线。
针对各向异性体数据的2D/3D混合CNN胸部CT COVID-19病例自动分类方法
提出2D/3D混合CNN,从三垂直面提取特征自动分类胸部CT以辅助诊断COVID-19,准确率83.3%。
LegoQ:高光谱分类的谱-空状态转移密度矩阵表示学习
提出密度矩阵表示学习框架,通过谱-空状态转移与原型保真度分类,有效处理混合像元,提升高光谱分类精度与可解释性。
DiffAttack:基于潜在扩散模型的人脸识别规避攻击
提出DiffAttack,用潜在扩散模型生成对抗人脸,成功率84.86%,迁移性超越现有方法。
CAER:面向多模态大语言模型的冲突感知证据路由与双前缀专家
提出CAER,用跨度证据路由和双前缀专家实现视觉-语言冲突检测与生成,不更新骨干参数,提升可靠性。
检索驱动的免训练AI生成视频溯源
提出免训练检索式AI视频溯源,利用生成指纹聚合跨帧伪影,性能超越现有方法。
SafeNexus:发现并调控多模态大语言模型中的模态通用安全神经元
提出SafeNexus,定位调控模态通用安全神经元,经激活放大或微调校准增强多模态安全,保持效用。
RAID:利用位反转图像实现鲁棒的AI生成图像检测
提出基于位平面的位反转图像检测AI生成图,理论验证有效,跨生成器/数据集和零样本性能优,速度快近100倍。
面向高效提示微调的视觉分布锚定
提出VDA:用类级视觉原型增强冻结分类器,免训练适配,提升多种提示微调方法3.2-3.4点
基于3D CNN和3D MLP-Mixer混合模型的胸部CT体数据COVID-19病例分类
提出3DCNN与3DMLP-Mixer混合模型分类COVID-19胸部CT1205例准确率79.5%