仲裁式图像描述:严格零样本图像描述的多智能体对齐评分与共识蒸馏束搜索仲裁
提出多智能体验证与共识蒸馏的零样本图像描述法,COCO的CIDEr达117.6,较基线提升9.6。
MHRGait:基于动量人体骨骼姿态的步态识别
提出动量人体骨骼姿态表示步态,仅用2.76M参数实现高效识别,优于模型方法,并能与轮廓融合提升性能。
SULAND v2:面向无人机/无人车地表地雷检测的精细化RGB数据集与域偏移下深度学习检测基准
修正标注与类别约定后,YOLOv8性能提升显著;YOLOv12室内最优,RF-DETR鲁棒性最佳,揭示高精度不等于实战可用性。
面向一致多参考图像编辑的评估-验证奖励
提出多维评估-验证奖励,用验证者依据视觉证据判断MLLM假设,实现多参考图像编辑的强化学习,提升一致性与和谐度。
SAM+D:通过深度路由LoRA与深度偏移实现SAM系列模型的参数高效维度提升
提出SAM+D,用DRLoRA和深度偏移模块以极低参数量将SAM系列提升至3D/4D分割,性能优异。
GO-PRE:基于预测渲染熵的面向目标的最优下一视角选择用于主动三维重建
提出面向目标的最优视角选择,通过最小化预测熵实现高效主动三维重建,性能优于现有方法。
重新思考检测校准:坐标与方向的视角
提出ReDC框架,从坐标与方向校准目标检测置信度,比盒级方法更精确,并可聚合为盒级结果。
基于情感异构图推理与多任务联合学习的自适应情感视频描述
提出SAGML框架,用软情感异构图替代硬先验,联合字幕生成与情感分布监督,实现鲁棒多情感视频描述。
从逆境中学习:通过对抗扰动实现语义感知的掩码细化
Phoenix框架利用对抗与对比学习,生成语义噪声模拟真实分割误差,实现掩码细化,显著提升多种分割模型性能。
ReMoE:报告引导的混合专家模型用于多模态OCT/OCTA异常检测
提出报告引导混合专家模型将正常报告语义提炼为多模态先验通过专家路由调制特征在OCT/OCTA异常检测上达最优性能
脉冲点云模型的参数高效微调
提出SpikePEFT,用内在动力学调节与静默态消歧,仅更新5%参数,高效微调脉冲点云模型,保持高精度与能效。
UltraSAM3:面向通用超声图像分割的概念驱动基础模型
提出概念驱动超声基础模型UltraSAM3,支持文本指定目标,跨37数据集训练,性能优于现有模型。
Forwardrobe:基于单图像的服装感知高斯化身
提出Forwardrobe,单图重建服装感知高斯化身,分离衣物与身体,改善宽松衣物动画,支持服装编辑与虚拟试穿。
论自监督点云编码器在高效3D大语言模型中的效能研究
自监督编码器可替代昂贵多模态;随机初始化训练接近预训练;架构与目标交互影响性能,闭集分类仍弱。
首项深度学习在微创腹部手术中术中纱布分割研究
本研究首次用深度学习分割微创手术中的纱布,验证多种模型,发现自动跟踪标注可提升性能,助力手术安全。
冻结的像素空间扩散模型可利用自身样本进行自我引导
冻结的像素扩散模型用自身样本即可自我引导:中间层与最终层预测差异作引导,合成样本训练适配器,大幅降低FID。
SciFigPlag-Bench:面向溯源感知的科学图表抄袭检测基准
构建科学图表抄袭检测基准,区分素材复用与抽象复用,含近五千正负样本,支持检测、溯源、分类、定位四任务并建立基线。
面向开放式 AI 生成图像伪造定位的渐进式决策方法
提出渐进式决策更新定位,以证据引导Mamba感知不确定性与边界,稳健定位AI生成伪造,且泛化至未见类型。
MoRAE:面向文本到动作生成的流友好自监督潜在表示
MoRAE用紧凑瓶颈与运动耦合训练解决JEPA特征谱问题,实现文本到动作生成SOTA。
用于少样本遥感场景分类的局部一致性直推信息最大化
提出LC-TIM,通过局部一致性正则化提升少样本遥感场景分类精度,多源融合达最优,低样本增益最大。
我见过你吗?基于嵌入行为信号的合成人脸数据集成员推断
成员推断可100%识别合成训练集,54.5%识别生成器真实来源,证明合成数据仍泄露训练隐私。
多模态目标重识别:双语义引导与全局-局部相互调制
提出双语义引导与全局-局部相互调制的多模态重识别框架,含文本语义注入、掩码调制和分层融合,提升特征对齐与鲁棒性。
MLLM时代,显著目标检测复兴之时已至?
MLLM定位强于分割,新框架FOCUS无训练提升多类SOD性能,引领从任务专用监督到零样本前景组织复兴。
CorrelationFlow:基于几何的免训练LiDAR场景流估计方法
提出免训练几何法CorrelationFlow,用连通分量相关最大化估计场景流,挑战赛第二、长距离最稳,证明经典视觉可部分解决问题。
当模型先验与视觉证据冲突:通过选择性先验校准缓解常识驱动幻觉
常识先验掩盖反常视觉证据导致幻觉;提出选择性先验校准,按实例削弱先验偏好,仅在强烈支持时改判,提升反事实图准确率且不损常识图。
OsteoCAD:一种用于骨肿瘤分割的人机协同云边框架
OsteoCAD模块化框架让临床便捷使用深度学习,连接远程GPU,墨西哥骨肿瘤分割案例验证其可行性。
基于平流细化的遥感图像免训练实体级小样本分割
提出免训练实体级小样本遥感分割框架,结合SAM3先验与平流细化,抑制噪声、增强连续性,无需训练即提升跨域性能。
CALM-AH:用于视频级矛盾与犹豫识别的ABAW11校准多模态集成与可靠性门控多专家共识
提出CALM-AH多模态集成,硬投票加门控多专家共识,ABAW11上Macro-F1达0.7771。
无源域适应中的基于域划分的渐进式学习
提出DPL方法,按难度划分目标域为易难子域,结合不确定性自训练与一致性学习,渐进挖掘数据特性,性能优于现有方法。
FillGS:通过视角-时间选择与生成式细化填补4D高斯溅射中的观测空洞
提出基于渲染敏感度和运动感知密度的虚拟视角选择,生成增强后仅用可靠区域微调4DGS,减少伪影。
TAVI-TEC:基于人工智能的经导管主动脉瓣植入术规划工具
TAVI-TEC基于AI分析CTA,约2-6分钟完成测量,瓣膜尺寸预测准确率82%,减少操作者差异。
利用类特定解码器的迁移学习用于腹腔镜分割
跨域迁移学习结合类特定解码器使腹腔镜分割精度最高且收敛快,但类别不平衡仍难解决。
VFAD:融合变分语义提示与频率自适应表示学习的零样本异常检测
提出融合变分语义提示与频率自适应表示学习的框架,改善零样本异常检测与定位,在13个基准上优于现有方法。
SatEdit:通过VLM引导的分割标注实现掩码条件图像编辑
用分割模型和视觉语言模型自动生成掩码标签,人工验证后微调,实现高精度卫星图像编辑,语义对齐领先。
OSEF:跨视频场景流程规划中的一步证据融合
提出跨视频场景流程规划任务与一步证据融合方法,评测排名第一,优于强基线2.9-10.7点。
注意力头中的角色断裂:理解与检测VLM中的幻觉
提出注意力头“角色断裂”现象,构建轻量线性检测器,无需微调,平均AUROC达93.23。
面向隐式神经表示分类的权重空间混合专家
提出层次混合专家模型处理隐式神经表示权重,经元学习塑造参数,实现最优精度并揭示类别结构。
面向红外视觉语言模型定向语义攻击的QR结构热触发器
提出QR-STT,黑盒无训练,优化QR热模块与渲染参数,定向操控红外VLM语义,可跨任务迁移。
条件潜在传输实现密集时间对比合成
条件潜在传输单次前向合成对比增强磁共振,分割Dice提升22.4%,70%支持临床决策。
DualDiT:面向OCT图像与分割掩膜联合生成的条件双输出扩散Transformer
提出DualDiT,联合生成OCT图像与分割掩膜,优于DDPM/LDM基线,有效增强下游分割。
轻量级神经网络用于可供性分割:解码器模块的增强
面向穿戴机器人可供性分割,分析解码器在泛化与计算成本间的权衡,所得轻量模型超越现代基线,满足低算力要求。
OSAGEN:用于工业异常生成的对象感知掩码先验与多阶段解耦扩散
提出OSAGEN,用对象感知掩码先验与多阶段解耦扩散提升工业异常生成,在MVTec/VisA领先。
FlexComposer:从图像到动态素材的统一视频合成,具备灵活轨迹控制
统一视频合成框架,轨迹引导条件生成,融合静态与动态素材,解耦运动与位移,无需3D重建,实现高保真。
基于双曲残差编码的多源多视图图域自适应用于rs-fMRI跨站点MDD识别
提出多源多视图图域自适应结合双曲残差编码,联合建模FC视图,跨七目标域达73.60%准确率。
K空间签名:面向医学深度伪造检测的频域表示学习
提出频域取证框架KSS,用于医学深度伪造检测,准确率超0.99,并能零样本泛化至未知设备。
DynoDINO:利用DINO特征中的动态潜在信息进行多期医学图像分割
DynoDINO利用DINO动态潜信息,经切片对齐与多期融合(混合注意力、自适应门控),在标准/位移/缺失相下提升分割边界与结构保真。
MoRoute:上下文内多模态视频生成的动态路由
MoRoute动态路由连接VLM与DiT,按需选层,上下文融合多模态条件,统一视频生成编辑,性能领先。
解释AI图像检测:热力图实际展示什么
检测器最强PR-AUC 0.9999,但重编码后降至0.7254;归因图需通过因果控制检验,无图优于随机。
CoDe-SSM:面向高效超高清图像恢复的上下文-细节解耦状态空间模型
提出上下文-细节解耦状态空间模型,分离处理聚合上下文与聚类残差,在UHD图像恢复中兼顾效率与质量,取得显著增益。
TOOD:面向持续学习者的任务感知分布外分数校准
提出任务感知校准方法,利用回放统计逐任务重校准分数,缓解持续学习中分布外遗忘与置信间隙,提升检测性能。