从飞行中通过稳健3D化身放置学习理解身体语言
提出无人机人体语言数据集,将化身精确置入航拍场景,显著提升动作意图识别准确率。
现在,我给予了健康的关注:用于脑部MRI修复的U-DiT
提出U-DiT修复脑MRI,限制注意力仅关注健康组织并加入对侧对称先验,在BraTS-2026取得SSIM 0.864。
DECODE:应对持续AI生成图像检测中的表征与决策退化
提出DECODE框架,联合缓解表征与决策退化,19个生成域精度99.36%,遗忘仅0.39%。
一块补丁足矣:面向MLLM场景文本识别的强化优化视觉标记定位
提出SPaTS,用单锚点视觉标记实现场景文本定位,结合强化学习与方向对齐、增强解码,性能超越前沿模型。
ARD-REFSM:非对称去噪与旋转等变增强反射对称检测
提出非对称去噪与旋转等变匹配模块,抑制干扰、提升旋转一致性,新基准GMSYM上达最优性能。
统一视觉-语言模型中的对抗鲁棒模型专家
提出CARE协作微调框架,统一多个对抗鲁棒专家,嵌入对齐融合知识,得单一鲁棒模型,优于个体。
FiRE:通过细粒度上下文学习增强多模态大语言模型的复杂图像检索能力
提出自动构建细粒度多模态五元组数据集及两阶段微调策略,提升MLLM在复杂图像检索中的性能。
LAST:末查询令牌引导视觉令牌剪枝,用于边缘-云协同多模态大语言模型推理
LAST利用最后查询令牌注意力剪枝视觉令牌,边缘-云协同推理仅留12.5%令牌即95.4%精度。
FootprintNet:状态转移引导的多时相遥感变化检测动态足迹学习
提出城市建筑动态检测与足迹网络,用状态转移约束建模变化轨迹,引入新指标评价时序邻近性,优于现有方法。
CoRE-UIR:先验引导的共性与残差专家用于高效全能遥感图像恢复
提出CoRE-UIR,共性+低秩残差,PSNR升1.05dB,快11.83倍,省显存85.3%。
基于深度学习的相机陷阱图像昆虫分层分类
针对昆虫监测数据稀缺与类别失衡,提出五级34类分层分类模型,利用生物分类层级特征,按置信度阈值预测,准确率达80-99%。
ViP-Rig:基于视觉提示的可控绑定
视觉提示控制骨骼与蒙皮预测,冻结预训练模型,实现显式局部控制。
mmRadarTwin:面向室内毫米波雷达的测量校准信号级数字孪生平台
提出mmRadarTwin测量校准信号级数字孪生平台,融合实测与UE仿真,实现路径归因,有效区域召回70.8%。
超越分类:病理学基础模型作为有丝分裂象的检测编码器
病理基础模型可直接用于有丝分裂象检测,H-optimus-0与Virchow性能有竞争力,且对域外数据更鲁棒。
分裂与驱动:实时高斯头部虚拟人的双轴解耦
提出单图实时高斯头部虚拟人,双轴解耦免外部追踪,三分支建模,速度最快。
ENCORE:事件辅助的互补运动细化用于学习型视频压缩
提出事件辅助互补运动细化框架,利用事件相机补充帧间运动,仅细化光流,事件为辅助,显著提升压缩性能。
带诱导度量的地标形状空间
统一Kendall形状空间与Sobolev度量,新空间防碰撞、消刚体运动、固定尺度,可解匹配与测地线。
TongueReenact:几何锚定的面部重演舌头合成
提出首个跨身份舌头动态迁移框架,用空间约束掩码扩散模型合成舌头,指标超基线两倍,并用VLM协议验证优越性。
源于推出误差的时间聚焦:文本到视频扩散的隐式偏好优化
提出cIPO框架:以去噪重建误差为隐式偏好,集中优化高误差时间片段,提升视频真实感与时间一致性。
BladeYOLO:有限标注与弱显著性感知下的风机叶片缺陷检测
提出BladeYOLO,融合自监督预训练与Mamba增强,解决叶片缺陷弱显著性和标注有限问题,在多个数据集上检测性能领先。
深度学习为何在中医舌诊中有效?一项全面消融研究
系统消融20余模型发现:ConvNeXt-Tiny最优,BCE损失提升2.7%,数据扩增需克制,弱集成提升2.1%,数据规模增益20.6%,标签扩维致崩溃。
FaithEyes:通过多智能体过程图像验证实现忠实工具使用
提出多智能体自评判框架,判断过程图像是否有用,调整工具奖励并注入推理,提升工具忠实度和准确性。
OPLD:多模态推理的在线策略潜在蒸馏
提出在线策略潜在蒸馏法,将多模态思维链推理蒸馏至潜在表征,超越现有方法。
基于凸特征嵌入学习的人脸与语音跨模态关联
提出凸特征嵌入学习人脸-语音跨模态关联,利用跨模态注意力减少误判,在VoxCeleb上超越现有方法。
面向人脸超分辨率和稳健重识别的协同特征聚合
提出协同特征聚合,融合多视角/序列人脸特征,级联超分恢复高分辨率,提升超分与重识别性能。
面向医学影像无监督域适应的实用算法选择
提出无标签准则联合选择UDA算法与超参数构建参考预测选一致性最高模型在脑MRI和胸X光上更优
结合图像外信息:时空信息增益驱动的农田分割智能体
现有农田分割仅看当前图像易混淆,提出FarmSeeker按需查询时空信息增益,构建全球基准,分割更稳定。
基于卷积神经着色的多视图图像高质量三维重建
提出卷积神经着色法,用神经着色器与位移网络从多视图重建3D形状,暗部及边界细节显著优于现有方法。
扩展视觉语言模型不足以缓解偏见
研究194个视觉语言模型发现,规模对缓解多属性偏见作用微弱,数据质量更关键,精选数据提升25%
S-Avatar:扩散引导的单图像高斯头部化身
提出S-Avatar:扩散引导生成三维高斯并绑定FLAME模型,从单图实时重建动态头部化身,兼顾一致性与真实感。
EgoGenesis:基于在线锚定投影记忆与Action-3D RoPE的自我中心世界-动作建模
提出自我中心世界动作模拟器,通过两类几何感知机制合成高质量操纵视频,将真实机器人成功率提升至84%(单臂)和70%(双臂)。
AdaAnchor4D:面向单目无人机4D重建的锚定条件时空特征聚合
提出自适应锚定变形框架,通过锚定条件特征聚合等模块,提升无人机动态场景重建质量,兼顾实时性能。
MSCM-net:一种基于多尺度卷积与Mamba的高光谱图像分类方法
提出MSCM-net,多尺度卷积与Mamba结合,加SENet与双分支聚合,高效提取光谱空间特征,降低复杂度。
TARS:时间步感知数据缩放用于免3D视频重拍摄
提出TARS:时间步感知数据缩放,免3D先验与配对视频,实现文本驱动的视频重拍摄。
Space2Ground 2.0:融合街景与卫星影像的多源农业监测数据集与框架
提出多源框架,融合卫星与街景图像,自动生成4.6万标注图,关联8581地块,提升作物分类精度。
使用RGB-D相机在嵌入式设备上填充可供性分割的帕累托最优前沿
提出结合深度信息的搜索与微调方法,在嵌入式设备上实现可供性分割,平衡精度与硬件效率,达到实时低能耗。
Theia:面向无数据蒸馏的Incidents1M数据集大规模多模态描述与自动验证
面向灾害响应,构建经大语言模型自动验证的大规模多模态描述数据集,高精度低召回,支持无数据蒸馏。
超越视觉模糊:通过详细长描述引导挑战性场景中的鲁棒单目深度估计
提出CapDepth框架,用详细长描述引导单目深度估计,非朗伯表面误差降25%,恶劣天气降22%。
MonoVoc:解耦几何与语义的轻量级单目开放词汇三维高斯
无需训练,从单目视频解耦几何与语义,生成对象级语义高斯图,内存较最先进方法降低一个数量级
ObjectStream:潜在对象作为流式视频理解的记忆锚点
以潜在对象为记忆锚点,免训练优化流式视频理解,降低显存与延迟。
相同的分支,不同的树:用于冠状动脉分割与FFR-CT决策一致性的分叉连通性指标
提出分叉连通性评分(BCS),弥补Dice等指标忽视连通性的缺陷,提升FFR-CT决策一致性,建议同时报告分支恢复与连通性指标。
视觉语言模型能否推理图像中的AI编辑?
用强化学习训练视觉语言模型推理图像AI编辑,无需显式监督,性能媲美现有检测器,并提出新指标。
ShadowDancer:从视频及其影子学习统一动态表示,教视频世界模型任意动作
提出ShadowDancer,用影子对和跨影子预测从视频演示学习统一动作表示,实现任意动态精确控制与迁移,无需标签或微调。
大基础模型时代的手-物体交互:重建、生成与具身迁移
系统综述基础模型在手物交互中的应用,梳理六任务八类先验,分析几何/语义/视觉先验,并探讨机器人学习与未来方向。
捕捉令牌趋势:多模态大语言模型的免训练令牌剪枝
提出趋势感知剪枝,捕捉注意力流动量,动态恢复被低估的晚期重要令牌,以近八成令牌削减保持性能。
基于自动提取的概念激活向量解释图像相似性
提出基于稀疏自编码器概念向量的图像相似性解释方法,支持成对与群体分析及示例检索,实验验证其忠实性。
面向业务制图与影响分析的大规模跨区域遥感洪水监测框架
提出融合SAR、光学与DEM的洪水监测框架,比较监督与自监督模型,成功评估2019年图伦洪水影响,结果贴近官方。
阴性对照揭示影像组学与影像基础模型特征中的体积驱动混杂
提出体积保留阴性对照框架,检验影像组学与基础模型特征,发现多种模型在结构破坏后仍保性能,提示体积混杂。
ViewMind3D:模块化视图感知推理实现免训练3D问答
免训练模块化3D问答框架,视图推理分解四步,在ScanQA等数据集表现优异,空间问题尤佳。
视觉路由器:基于查询的视觉采样用于长视频理解
提出视觉路由器,无需训练,按查询类型自适应采样,兼顾相关性与时间覆盖,提升长视频理解。