INSPECT:从助手使用中学习机器人视角选择
机器人从智能眼镜助手记录中学习视角选择,用于装配检查,提升可验证性与决策正确率。
CoRef-GS:面向多智能体场景理解的协同指代高斯泼溅
提出协同指代高斯泼溅框架,跨智能体对齐语义高斯地图,实现视角条件下的指代与关系推理。
飞行中VLN:面向空中机器人的机载视觉语言导航栈
提出机载VLN栈,分离接地、规划与控制;15次飞行13次成功,误差5.72厘米,GPU占用39.3%,杂乱6次无碰撞。
DexTouch-WM:从人类触觉中学习动作条件触觉世界模型,用于灵巧机器人操作
用可扩展的人类触觉数据构建动作条件世界模型,联合预测视觉与触觉动态,显著提升机器人灵巧操作的预测与策略学习。
LapaTrack-3D:用于腹腔镜手术的6自由度术前形状追踪
提出LapaTrack-3D,基于ORB-SLAM2实现单目腹腔镜实时6自由度术前形状追踪,可对齐术中视频与CT,体内外验证鲁棒,达13Hz。
利用增强现实将非关键驾驶场景转化为安全关键场景的LLM引导方法
结合计算机视觉、大模型与AR的自动化流程,将安全驾驶场景转化为安全关键场景,安全分类准确率达97.52%。
面向3D扩散策略的无需显式轨迹前瞻学习
提出运动趋势引导,无需显式轨迹即可赋予3D扩散策略前瞻能力,仅增3.52%参数,多基准显著提升。
Navi-Agent:无需定位的单目导航智能体
零样本VLN-CE智能体无需定位与坐标,凭视觉-运动拓扑实现自定位、进度验证与回访恢复。
医学图像分析中的差分隐私表示几何
提出DP-RGMI,将差分隐私视为表示空间变换,分解性能损失为编码器几何与任务头利用,揭示隐私致效下降与表示各向异性重塑。
DisasterInsight:面向功能感知与有据可依灾害评估的多模态基准
基于xBD,融合OSM建筑功能标签,含13.4万指令、15类任务,测评显示VLM功能理解等仍存差距。
多视图基础模型
提出多视图基础模型,为DINO/SAM/CLIP加3D感知注意力,统一跨视角特征,提升匹配与分割。
探索点级弱监督时序动作定位中的时序一致性
面向点监督时序动作定位,提出多任务框架,以动作补全、顺序与规律理解自监督任务挖掘时序一致性,提升定位。
RoofSeg:面向端到端屋顶平面分割的边缘感知Transformer网络
提出边缘感知Transformer网络RoofSeg,端到端分割LiDAR屋顶平面,并用边缘掩膜与几何损失提升精度。
BiCLIP:面向鲁棒医学图像分割的双向且一致的语言—图像处理
BiCLIP双向一致语言-图像处理框架,提升医学图像分割鲁棒性,少量标注与图像退化下优于基线。
CineScale:无需微调的高分辨率视频生成
CineScale 是首个免微调推理框架,让预训练视频扩散模型直接生成清晰连贯的4K视频。
Exo2EgoSyn:解锁基础视频生成模型,实现第三人称到第一人称视频合成
基于WAN 2.2,融合视角对齐、多视角条件与姿态注入,实现无需重训的高保真第一人称视频生成。
利用高斯泼溅解锁半稠密图像匹配的零样本潜力
提出MatchGS,利用精炼3DGS生成精确标签并融合2D-3D表征,提升半稠密匹配零样本性能。
通过归一化流增强低分辨率图像表示
提出LR2Flow,融合小波紧框架与归一化流学习低分辨率表示,在重缩放、压缩、去噪上有效。
互惠致危:生成-理解耦合如何削弱统一多模态模型的安全性
该研究揭示统一多模态模型中生成-理解耦合会放大安全风险,提出RICE双向攻击,两路径均高成功率。
LaGSplat:利用潜在拉格朗日高斯泼溅从单目视频推断物理支配的交互式仿真
LaGSplat将低维隐状态同时作为拉格朗日广义坐标与高斯泼溅解码条件,使外力映射为广义力,实现实时交互式物理仿真。
RefGlitch-Bench:基于参考帧与视觉语言模型的游戏画面故障检测基准
提出参考帧对比的游戏故障检测基准,含合成数据与基线,自动参考可提升真实数据检测效果。
GRADE:图像编辑中学科知识驱动推理的基准测试
提出首个学科知识驱动的图像编辑基准GRADE,涵盖10领域520样本,多维评测20个模型并揭示不足。
极粗粒度学习目标使AI视觉模型产生与人类对齐的表征
仅用8个粗类别训练,AI视觉模型即可形成与人类大脑和感知高度对齐的表征,媲美千类监督与大模型。
HyCal:一种用于跨学科少样本类增量学习的免训练原型校准方法
免训练HyCal融合余弦与马氏距离校准原型,缓解跨学科少样本类增量学习的域重力与不平衡。
面向快速高保真虚拟试穿的结构-细节解耦自回归生成
提出STAR-VTON两阶段自回归框架,解耦潜空间结构合成与像素空间细节恢复,兼顾速度与保真度。
RAM-H1200:面向类风湿关节炎手部X线片的统一评估与数据集
RAM-H1200:1200张手部X线,标注全手骨分割、像素级骨侵蚀与SvdH评分,首个RA基准。
面向低时延边缘视觉系统的图神经网络辅助Actor-Critic
提出图卷积网络辅助A2C强化学习,仅传可疑目标像素相关子区域,降低无人机视频传输时延与误检率。
ProcFunc:Python 中面向函数的程序化 3D 生成抽象
ProcFunc:Python/Blender程序化3D生成库,简化组合编辑,支持VLM与室内合成。
Spheriverse:面向野外球面观测的3D场景理解
Spheriverse数据集含64,400组球面图像-激光雷达对,建立三项基准,并提出SphereOcc占据预测框架。
相同答案,不同表征:视觉语言模型中隐藏的不稳定性
提出表征与频率感知评估框架,揭示VLM答案不变却内部表征漂移、鲁棒性不随规模提升等失效模式。
KaiNinja:将原生3D生成器扩展至部件级
双体积表示KaiNinja将TRELLIS.2扩展至部件级,无需分割,保持速度质量并提升保真度。
G-ray:相机异构条件下多视图视觉Transformer中的射线级相对几何位置编码
提出射线级相对位置编码G-ray,用相机局部射线角参数化相位,实现跨投影不变,提升3D重建与新视角合成
基于深度学习的3D超声先天性子宫畸形智能诊断
提出CUA-Net,基于3D ResNet-18实现子宫畸形自动分类,无需冠状面重建,内外测试准确率达93.88%和91.52%,优于初级超声医师。
一种面向南非包装食品R214钠筛查的保守型OCR工作流
提出保守型OCR流程筛查南非包装食品R214钠含量;自动与视觉模型类别一致率约94%,不确定归复核。
CodecSight:利用视频编解码信号实现高效流式VLM推理
CodecSight借编解码信号优化流式VLM推理,剪枝视觉块并选择性刷新KV,提升并发与首字时延。
米级地表天气的部分恢复
融合稀疏站点、高分对地观测与粗尺度大气动力,30米分辨率部分恢复美国近地表天气,误差降11–28%。
HumanEgo:从数分钟人类第一视角视频中实现零样本机器人学习
HumanEgo无需机器人数据,将人类第一视角视频转为手物交互表示,30分钟数据即实现零样本人机迁移。
剪刀效应:基于缩放的输入多样性何时有助于或损害迁移攻击
输入多样性DI对迁移攻击效果因代理模型而异,呈剪刀效应:标准代理受益,对抗训练代理反受损。
DenseFace:基于密度感知概率匹配的人脸识别偏见缓解
DenseFace通过密度感知概率匹配,无需重训即可降低人脸识别种族偏见并保持精度。
ProtoLIP:从句子级到对象级证据解耦
提出轻量原型证据层,按文本语义族路由视觉原型,无需空间标注或重训主干,实现对象级证据解耦与匹配可分解。
面向空间转录组学的蕴含式双曲对比学习
提出HyCLoST,用双曲对比与基因-图像蕴含损失建模层次关系,提升空间转录组基因表达预测。
SceneBench:面向3D场景视觉语言理解的分层基准
SceneBench:966个真实感3D场景的分层语义基准,设三类空间推理评测,暴露模型组合推理短板。
MechReason:面向机械工程的多图像多跳推理基准评测
提出面向机械工程的多图像多跳推理基准MechReason,覆盖8类任务,最强模型准确率仅62.89%。
婆罗多舞中的序列识别
提出婆罗多舞Adavu序列识别法,用CNN/SVM识别关键姿势与动作,编辑距离匹配,准确率达98%。
用于循证孤独症谱系障碍筛查的多模态大语言模型
ASDchat多模态模型以视频音频对话为输入,输出筛查概率与循证证据,AUC0.953,识别六亚型。
光流集成下的体积竞速
提出流式4D高斯泼溅FastFlowGS与F1基准Monaco4D,重建高速运动主体,精度效率超基线。
用图像生成进行推理
提出ReImaGin,用图像生成模型实现灵活的视觉推理,六项视觉推理任务均超越纯文本与专用工具基线。
面向组织病理学图像分类的去中心化Gossip学习与联邦平均
研究比较FedAvg、去中心化Gossip与混合Gossip-FedAvg用于乳腺IDC病理图像分类;混合与FedAvg精度相当,FedAvg最稳。
MDN-Control:掩码-深度-噪声引导的多主体视频编辑区域控制
MDN-Control免训练框架融合掩码、深度与噪声先验,缓解多主体视频编辑的属性泄漏与遮挡歧义。
基于术前多模态数据的精准全面脑肿瘤诊断视觉-语言基础模型
BrainVLM基于术前多模态MRI,可分类12种WHO脑肿瘤、量化不确定性并生成报告,经多中心及前瞻性验证。