GALA:面向跨具身视觉-语言-动作模型预训练的几何感知隐动作建模
提出GALA框架与统一末端执行器运动表示,融合视觉与几何隐动作,实现跨具身VLA预训练,RoboCasa-GR1成功率达68.3%。
ProTracer:本体感觉引导的机器人操作故障诊断
ProTracer免训练,融合本体感觉与视觉语言模型,实现机器人故障检测、分类、解释及故障起始定位。
基于后验采样的面向分类的自适应感知
利用类条件高斯混合后验协方差分解类内与类间不确定性,从扩散后验样本估计并选取判别性感知方向,改善分类与测量的权衡。
CASE:面向类别敏感解释的对比激活
提出类别敏感性诊断,发现常用显著性方法多不区分类别;提出CASE,生成更忠实、类别特异的解释。
利用线特征与消失点的鲁棒无结构单目视觉惯性初始化
提出SLIM-init:利用线特征与消失点约束,实现无结构单目视觉惯性初始化,提升退化运动下精度与鲁棒性。
Uni-PrevPredMap:将PrevPredMap扩展为面向在线矢量化高精地图构建的先验信息建模统一框架
统一框架融合时序预测与地图先验,三模式训练,兼顾无/有/不完美先验鲁棒性,达SOTA。
ALINA:先进线条识别与标注算法
提出ALINA自动标注滑行道数据集,结合CIRCLEDAT识别标线像素,已标注60,249帧,检测率98.45%。
需要多少后验样本?自适应感知的校准停止
后验样本投票决定停止;阈值非置信保证,校准规则控误报;序贯最省样本,MNIST截断省62%。
DNNs隐私泄露:模型反转攻击与防御综述
模型反转攻击可从训练模型重构隐私数据,威胁严重;本文系统综述DNN攻击与防御,提出新分类并探讨未来方向。
通过神经渲染优化自动驾驶数据集中的真值位姿
提出基于NeRF的MOISST++,联合精化传感器外参与连续自车轨迹,无需真值验证,在多个数据集显著提升并开源。
RAVE:重新分配大型多模态模型中的视觉注意力
提出RAVE轻量成对门控,为视觉键加查询-键偏置重分配注意力,不改架构,基准平均提升3分。
什么仍属正常?干净图像遗漏了对异常检测有用的近缺陷正常图像块
干净图像漏掉近缺陷正常块;合成缺陷改变上下文、排除变化像素,仅学保留邻域,可稳定提升异常检测。
概率流蒸馏:参数空间中的分布匹配
提出概率流蒸馏PFD:仅解前向PF-ODE即可匹配参数分布,并分析SDS/SDI,文本到3D实验验证。
EventGeM:面向基于事件的视觉位置识别的全局到局部特征匹配
提出EventGeM,融合全局与局部特征及区域GeM池化,实现事件相机视角鲁棒位置识别,Recall@1提升7–43个百分点。
ECG-Mamba-V2:多标签12导联心电图分类双向状态空间模型的架构改进
三项微调(类别标记后置、取消1/2缩放、统一dropout)以更少参数、更高吞吐提升多标签ECG分类精度。
面向医学报告生成的图增强拓扑内化与双流分类器
提出GDMRG,融合图拓扑内化、双流分类与诊断引导注意力,提升医学报告生成诊断效能与泛化性。
诊断引导的纵向建模用于视网膜萎缩进展预测
诊断表明纵向变化多由采集变异而非疾病进展驱动,因而采用确定性TRU在视网膜图像预测中优于随机模型。
LiteMedCoT-VL:面向医学视觉问答的参数高效适配
以LoRA将235B教师思维链蒸馏至2B医学VQA模型,无需图像描述,PMC-VQA达64.9%,超4B基线11个百分点。
GeoSelect:面向免训练参考遥感图像分割的空间程序执行
将指代解析为类型化空间程序并确定性执行,免训练实现遥感指代分割,RRSIS-D mIoU 58.86。
SP-MoMamba:面向高效图像超分辨率的超像素驱动状态空间专家混合
提出SP-MoMamba,以超像素驱动状态空间专家混合,进行区域级多尺度稀疏建模与局部细节调制,实现高效图像超分辨率。
缺失的时间环节:面向脚本驱动音视频生成的时间上下文路由
提出时间上下文路由TCR,将脚本时序映射至共享时间轴,镜头边界误差降96%,对话准确率升至84.1%
ULTRA:面向自主人形机器人全身移动操作的多模态统一控制
ULTRA统一框架:物理驱动神经重定向与多模态控制器,实现人形自主全身移动操作,真机验证。
跨排行榜的自动驾驶规划器基准测试:基于CARLA的统一评估
以CARLA排行榜v2.1统一评估CARLA、nuPlan、Waymo的八种规划方法分析优劣与趋势
基于纳米光子波前编码的物理基础单目深度
以超透镜纳米光子波前编码度量深度线索,桥接深度基础模型,并通过仿真缩小虚实差距,提升单目度量深度。
VideoPulse:基于非接触视频的新生儿心率与外周毛细血管血氧饱和度(SpO2)估计
发布VideoPulse新生儿数据集及端到端流程,无接触估计心率和SpO2,助力低成本无创监护。
基于动态多模态检索的因果音频驱动面部运动个性化
提出因果流式框架,用多分辨率运动分词器与多模态检索器,从任意视频提取风格先验,实现高保真个性化。
迈向视觉-声音-语言-动作范式:面向声音中心操控的 HEAR 框架
提出VSLA连续控制范式与HEAR框架,用流式音频历史和音频世界模型实现声音中心机器人实时操控。
DexPIE:基于真实世界经验的稳定灵巧操作策略改进
提出后训练框架DexPIE,利用真实部署经验与多阶段数据收集提升灵巧策略,真实任务成功率较演示基线提高37.3%。
LinePilot Digitizer:结合手动与自动校准的线图数据恢复
提出LinePilot数字化工具,支持三种校准模式,并构建首个线图数字化基准。
高效统一多模态理解(EUMU):第八届LSVOS挑战赛MUMU赛道冠军方案
EUMU用共享多模态模型统一图像标注、开放词汇检测与图像描述,以跨任务线索精炼,夺得MUMU赛道冠军。
面向异构场景实现鲁棒分割与临床测量的开放超声基础模型
开放超声基础模型SonoBase,基于45.7万张标注图像预训练,跨设备与人群的分割及临床测量优于SAM2,少样本可迁移。
视觉语言模型能评判奥运跳水吗?——从零样本动作质量评估中的推理到打分
评估开源VLM零样本评判奥运跳水,集成回归框架融合语义推理,斯皮尔曼相关由0.32提至0.67。
RAUL:用于技能评估的参考辅助输尿管镜定位
参考辅助框架RAUL仅用输尿管镜视频重建轨迹,定位覆盖率86%,可无额外追踪评估导航技能。
WZPlanner:面向施工区自动驾驶的安全端到端路径规划
发布施工区多模态数据集与BF++模型,联合预测车道线、施工区边界与轨迹,驾驶得分领先且模型更轻量。
基于可提示分割的开放词汇3D目标检测
免训练开放词汇3D目标检测:SAM3文本提示分割环视图像,几何生成3D框,零标注达0.298 mAP。
视觉Transformer与状态空间模型的黎曼-洛伦兹融合
提出RLPF,对齐ViT与SSM参数,做黎曼-洛伦兹测地重心与门控,精度超父模型,但需微调。
RGS:面向反射物体、通过几何连续性学习实现的反射感知高斯泼溅
提出RGS反射感知高斯泼溅,用3D基础模型先验与跨视角约束反射区几何,并以反射感知稠密化提升渲染质量。
从正常中看见异常:正常肾脏形态表征中的肾小球异常
提出NoRDeC,仅用正常肾小球拟合检测器,可检测并表征多种肾小球异常,AUROC达0.926。
迈向主动跨视角物体地理定位
提出主动跨视角物体地理定位任务及ActiveMoPT三阶段框架,仅需1.45个查询视角即达SOTA,零样本性能显著提升。
VGGT-GS SLAM:基于前馈先验的未标定单目高斯泼溅SLAM
未标定单目高斯泼溅SLAM,用VGGT前馈先验联合优化位姿、内参与畸变,以高斯原生对齐提升全局一致性。
面向番茄病害叶片理解的多模态生成模型
提出SOLAR多模态生成模型,将番茄病害叶片分析建模为生成式VQA,支持六类问答并优于现有模型。
面向机器人采摘的选择性棉铃定位:田间条件下深度学习视觉模型的评估
评估多种深度学习模型用于田间棉铃检测分割,YOLOv12-m-seg兼顾精度与速度,适合机器人实时采摘。
基于自适应区域划分与空间监督对比学习的城市建筑实例分割与细粒度分类
提出自适应区域划分与空间监督对比学习,实现城市建筑点云实例分割与细粒度分类,性能优于现有方法。
SCOUT:基于冻结视频特征嵌入空间预测的仿真到真实文本行人检索
冻结编码器跨模态检索:训练预测器将冻结视频特征映射到冻结文本嵌入空间,免微调即可与精调模型竞争。
AMB3R-SLAM:基于分层后端的千米级SLAM
单卡实时单目SLAM,可重建千米级万帧轨迹;分层后端保障一致性,可处理动态场景,轨迹误差降超70%。
PerSeM:用于长时程开放词汇无人机建图的持久语义记忆
提出免训练持久语义记忆PerSeM,通过3D体素聚合与保守细化,提升开放词汇无人机建图的语义精度和时间稳定性。
基于多模态检索增强生成的科学图像质量评估
提出多模态检索增强生成框架评估科学图像质量,融合文本语义与视觉特征,在SIQA挑战赛理解赛道夺冠。
ParticleSplat:自监督、以对象为中心的潜在粒子泼溅
自监督物体中心法,以前馈3D高斯泼溅将场景分解为潜在粒子,无监督学习对象掩码,支持3D编辑并提升机器人操作。
VideoResearcher:面向长视频理解的自改进工具设计
提出免训练多智能体框架VideoResearcher,自主设计、测试、迭代长视频理解工具,在自改进智能体中达最优并逼近人工设计上限。
GAPrompt++:面向3D视觉模型的多粒度几何感知点云提示
提出GAPrompt++多粒度几何感知提示,以不足2%可训练参数提升3D点云适配,性能超越全量微调。