VQ-VAD:面向人体中心视频异常检测的向量量化运动表征学习
提出VQ-VAD,用向量量化GAN学习离散运动表征,通过重构误差检测异常,跨域泛化强。
超越重投影误差:基于3D目标的相机标定
基于场景射线的标定框架,新指标显示广义畸变模型更准,二十面体目标误差降40%。
HelloWorld:让视频世界模型中的角色具备社交互动能力
提出HelloWorld视频世界模型,一键触发角色社交响应,用自蒸馏与免训练模块提升互动质量,并建立评测基准。
用于肺腺癌生长模式空间映射的视觉词袋方法
提出弱监督视觉词袋法,用基础模型嵌入构建词汇并生成可解释的肺腺癌生长模式图谱,分级任务优于监督基线。
基于冻结自蒸馏特征的CT病灶检测:SALT,一种空间自适应标签引导温度
SALT在预训练中利用弱框标签,于病灶区域锐化蒸馏温度并加权损失,冻结编码器,显著提升CT病灶检测。
物体作为视听模态声场
提出视听模态声场,用多视图图像和少量冲击声重建物体声场,渲染效果领先,并支持接触定位与声音编辑。
面向隐私感知课堂事件识别的鲁棒高效运动推理
提出混合基准与轻量运动推理框架,以十分之一成本超越大型基线,实现隐私感知课堂事件识别。
IRIS:一种受视觉皮层启发的框架,用于分析视觉Transformer中的方向选择性
提出受视觉皮层启发的指标,发现训练范式决定ViT方向选择性,浅中层增强、深层减弱,并可用于指导层解冻。
HexMIL:分层注意力多实例学习用于AI篡改CT体数据的前置可解释检测
该模型仅用体级标签,经分层注意力定位篡改区域,实现事前可解释的跨生成器CT深伪检测,性能优于基线。
使用MT-GNN预测脑形态测量:基于图的度量张量嵌入的连续时间网格演化
MT-GNN用连续时间度量张量预测皮层下结构形态演化,在ADNI 14个结构上各预测时点均最优,优于基准方法。
SmartMage:面向3D场景理解的动态模态编排
提出SmartMage,动态按需选择相关模态,减少噪声、优化推理,3D场景理解达SOTA。
OPD-V:基于模态平衡的视觉在策略自蒸馏
提出OPD-V,利用正负教师构造模态平衡信任区域,选择令牌自蒸馏,提升多模态大模型推理并降低训练成本。
题目难度预测中视觉证据的表示:视觉文本化与图像原生建模
比较文本、视觉文本化与图像原生建模预测题目难度,两者视觉接口误差最低,图像原生建模是可行替代。
SAFECAST:基于对比集训练与校准的VLA策略鲁棒故障检测
SAFECAST利用对比集扰动改进隐状态探测训练与校准,显著提升故障检测ROC-AUC,优于基线。
CoCo-IR:上下文组合图像检索
提出CoCo-IR任务:多轮上下文图像检索,用LMM生成可变形嵌入,并自建数据引擎,刷新SOTA。
MOAT:模型无关的随机变换防御,防止ViTs效率退化攻击
提出MOAT预处理防御,用输入变换保护ViT令牌剪枝机制,抵御效率攻击,将GFLOPs退化控制在3.4%以内。
工业合成分割预训练
提出实例核心合成预训练数据集,基于公式驱动,无需真实图像标注,在五个工业领域分割性能媲美真实图像预训练。
LiveXiv——基于arXiv论文内容的多模态实时基准
LiveXiv:基于arXiv论文自动生成VQA的多模态实时基准,防污染,高效评测,差异<2.5%。
用于善意的对抗攻击:视觉内容生命周期中的主动保护综述
综述将对抗攻击用于善意防护,覆盖视觉内容生命周期五个方向,指出评估不足与开放问题。
面向全自动铁路运营的GitOps驱动标注目录
面向全自动铁路运营,提出基于GitOps、数据即代码与静态站点生成的标注目录,确保可追溯合规。
ZoomV:时间聚焦实现高效长视频理解
提出时间聚焦框架ZoomV,面向查询三阶段筛选事件,显著提升长视频理解,LVBench准确率提高9.7%
PixelUp:面向细粒度视觉任务的零样本语义特征上采样
提出零样本通用上采样器PixelUp,用窗口交叉注意力融合多尺度语义,分割和深度估计任务上平均提升+1.2 mIoU和+0.25 δ1。
CURV:通过课程式视觉基础推理增强图表理解
CURV课程学习框架通过多步视觉基础推理提升图表理解,显著优于基线,泛化性强。
更好、更强、更快、更广:面向MLLM分割的结构化全掩码预测
提出结构化全掩码预测方法,一次预测多目标,兼顾高性能分割、对话能力和快速推理,解决三难问题。
SAGE:计算病理学中基于注意力的生存模型的语义可解释性
SAGE用病理视觉语言模型和概念词典,从注意力生存模型提取全局语义解释,量化概念与预后风险。
DeepLesion检测、分割与简短报告生成的统一2D框架
提出统一2D框架,融合LLM,实现病灶检测、分割与报告生成,分割Dice较nnUNet提升28.5%
世界建模,何去何从?
提出以智能体为中心的交互式世界代理,从物理预测转向可用反馈,六种代理、三级赋能,助力智能体持续进化。
视觉-语言模型中的上下文崩塌及其缓解方法?
部分视觉语言模型多示例学习会致上下文崩塌,源于视觉-语言整合失败,可用轻量可迁移干预缓解。
季节性先验用于选择性野生动物标注与分类
研究红鹿识别,发现季节性影响标注与分类,双模态可改善标注,不确定性弃权将准确率提至98.9%。
视觉语言模型脑核磁审计:自信但校准差,高置信错误占三至四成,医疗适配不改善可靠性,需报告置信度、幻觉、弃答。
视觉语言模型脑核磁审计:自信但校准差,高置信错误占三至四成,医疗适配不改善可靠性,需报告置信度、幻觉、弃答。
混元3D-Buffalo 1.0:面向可扩展3D生成、理解与编辑的统一多模态模型
提出统一多模态框架混元3D-Buffalo,用8700万样本实现3D生成、理解、编辑领先。
定位而非美化:面向整容手术预览的图像编辑API客户端控制
客户端仅用掩膜合成即可将编辑限制在目标区域,无需模型内部权限,定位改善中位数0.446。
用于透镜胶片色彩重建的人机协同深度学习框架
提出人机协同深度学习框架,通过可编辑边界交互优化,结合原始亮度,实现透镜胶片高质量色彩重建。
独立DINOv3实现遥感免训练开放词汇语义分割
提出免训练分割框架,利用模型视觉-文本对比能力,设计拉普拉斯传播和高斯溅射上采样模块,遥感大图分割性能领先。
科学实验场景建模:数据集与模型
提出首个物理实验场景图数据集PhysScene及跨模态双路径模型CM-DPG,缓解长尾分布与图文语义差距,表现优异。
提出驾驶世界模型,借渐进真实自举与场景保真强化学习,实现逼真且结构保持的天气转换。
提出驾驶世界模型,借渐进真实自举与场景保真强化学习,实现逼真且结构保持的天气转换。
腹腔镜手术中点云配准的测试时自适应方法
腹腔镜点云配准域偏移,测试时自适应可改善;分析改进三种方法,输入自适应低延迟且误差稳定下降,最有前景。
V-FIND:揭示视频伪造检测器中编码的内在伪造知识
新框架发现视频伪造检测器中稀疏功能神经元,冻结主干仅训练轻量分类器即可检测,揭示可提取复用的内在伪造知识。
面向文化遗产数字孪生热成像异常检测的材质分割逐像素发射率校正
免训练逐像素发射率校正,SAM分割,基准误差1.97K→0.91K;遗产表面校正小,仅低发射率异常。
临床驱动的分层分类实现一致的胸部X线解读
CHASE:模拟放射科医生粗到细推理,联合多层监督与层级一致性,提升胸部X线解读准确性与一致性。
Qwen-3D:面向空间理解的全能3D视觉语言模型
Qwen-3D用3D几何压缩视觉,在场景推理,用查询分割解码器统一语言与几何,超越3D LMM及2D模型。
GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝
提出GSTEP全局时空密度剪枝,平衡信息密度与覆盖,剪75%令牌保持性能并加速。
PDD-RRG:面向检查级放射学报告生成的后验诊断决策
提出后验诊断决策框架,整合多视角报告,利用贝叶斯后验概率和阈值聚合诊断,无需重训练提升临床效果。
基于VLM的3D室内场景生成的全局图验证优化
提出图验证与混合搜索方法,实现开放词汇3D室内布局的全局语义一致与物理可行,达到最优性能。
AIDE:基于蒸馏专家知识的自动化指令,用于无参考动作技能辅导
AIDE通过蒸馏专家知识,仅靠学习者姿态生成教练反馈,性能优于无参考基线,媲美需专家示范的方法。
RIDGE:基于内部动态引导的重新加噪图像编辑
RIDGE免反演免训练,用内部动态引导重新加噪近似目标,提升源保留、目标对齐和感知质量。
TASQ:扩散模型的时间自适应位稀疏量化
提出TASQ,共享最大精度权重并用时空掩码减少不敏感阶段计算。质量与静态量化相当,周期降25%-50%。
CorePath:乳腺专科病理基础模型,用于穿刺活检诊断与风险受控报告生成
乳腺专科病理基础模型CorePath提升活检分型准确率,非乳腺幻觉由30.1%降至2.8%,风险控制实现零幻觉报告生成。
DiverseDiT++:扩散Transformer中表征多样性的量化、分析与促进
提出加权多样性分数(WDS)衡量扩散Transformer块间表征差异,发现其与生成质量强相关,据此提出DiverseDiT++促进多样化表征学习,提升性能。
CAPE-T2V:面向文生视频生成中双侧条件对齐的标注器锚定提示增强
CAPE-T2V方法:两阶段微调提示增强器与扩散模型,缩小推理与训练描述差异,提升文生视频生成质量。