EgoAfford:基于第一视角指代分割的任务导向可供性定位
构建EgoAfford基准与EgoLens模型,实现多步桌面任务的下一动作规划与部件级功能区域分割。
FocusMem:解耦潜在界面记忆中的内容、读出与信任
解耦潜在界面记忆的内容、读出与信任,用角色感知内容基础、状态条件读出和信任门,五个基准上超越基线。
MetaVideoAgent:面向长视频理解的自动化视频智能体进化
提出MetaVideoAgent自动进化视频智能体,将长视频理解宏平均准确率从38.44%提至51.47%,超越最强基线6.39个百分点,成本低。
克服动作可控世界模型中的统计偏差
提出反事实一致性框架,减少统计捷径依赖以增强动作可控性,在视觉规划与预测任务中超越现有方法。
COSMO:面向无源域适应的共识驱动偏移调制
提出COSMO方法,通过锚定共享共识进行样本级可靠性分配,平衡源模型与视觉语言模型证据,在四个基准上实现最优性能。
HiSC:高效3D场景理解的分层空间聚类令牌压缩
无需训练,通过分层空间聚类压缩3D视觉语言模型令牌,减少90%以上开销且性能几乎无损。
DAC-Pose:用于姿态引导人体生成的双智能体协作框架
DAC-Pose双智能体框架结合语义推理与视觉编码,显著提升大视角变化下人体生成的纹理对齐与身份一致性。
TRCoRSurg:手术视频三元组识别的时间-关系协同推理
提出时空关系协同框架,经标签关联与双向注意力提升手术视频三元组识别,TCER指标验证优势。
扩散中的视觉锚定:多模态零样本骨骼动作识别
新方法TDSM-MM以RGB为视觉锚定,用扩散生成范式统一多模态评分,无需测试时适应即取得最佳骨骼动作识别精度。
YOLO-PVC:面向MRI肝脏肿瘤体积定位的切片检测2D到3D整合方法
提出YOLO-PVC轻量框架,整合二维切片检测为三维,提升MRI肝脏肿瘤定位,平均IoU达0.71。
DisMix:通过解耦序数与非序数特征实现医学影像的顺序感知混合
提出一种顺序感知混合方法:解耦序数与外观特征,分别插值和变化,以保留序数结构,在四个医学影像数据集上表现最佳。
EgoVis 2026首届EgoCross挑战赛:跨领域第一人称视频问答
跨域第一人称视频问答,覆盖手术、装配、极限运动、动物视角四域,双赛道千余提交,检验多模态大模型泛化。
SurgNarrator:用于手术视频理解的生成式检索框架
提出手术视频生成式检索框架,构建专用词汇与判别表征,分层检索提速增效,零样本性能超SOTA,延迟降两个数量级。
CSGen:一种基于层次化多模态扩散的多域曲线结构生成模型
提出CSGen层次化多模态扩散,结合多域数据、渐进控制与稀疏感知损失,生成高保真曲线结构,提升分割性能。
MobileWAM:借助预见链桥接世界动作模型与移动操作
提出移动世界模型,融合视频生成与动作专家,利用预见链监督,实现移动操作,超越最先进方法。
教会多模态大模型说不:基于拒绝校准GRPO的广义指代表达理解
提出RC-GRPO,增强MLLM对不存在目标的拒识能力,同时保持正样本定位精度,实现准确性与可靠性的平衡。
基于稀疏直接飞行时间传感器的稠密公制深度补全
提出深度引导双分支ViT框架,从稀疏dToF传感器完成稠密公制深度补全,合成训练,零样本泛化至多数据集/设备。
可证明一阶抗相机标定误差的差分六自由度位姿估计
提出差分六自由度位姿估计法,直接由帧间位移恢复平台运动,避免绝对位姿估计;平移外参误差精确抵消,旋转误差有界。
YOLOv14:面向跨域实时目标检测的自适应多视角表示统一框架
YOLOv14统一框架,经四项创新应对鱼眼、游戏、航拍、全景等场景,COCO达49.1 mAP,耗时2.91ms。
面向轨道车辆运行环境监测的多传感器数据集
德国DSD项目发布多传感器数据集,含超700万标注,支撑轨道车辆运行环境AI监测,可申请获取。
UniWorld-View:基于视频扩散模型的大基线视图合成
该框架集成3D引导与视频扩散,实现大基线新视图合成,具备精确相机控制和几何一致性,高保真生成。
动态高斯的多视角面部与手势动画
提出MVFGA多视角管线,分别建模脸部与手部并融合,利用动态高斯生成逼真上半身虚拟人。
重新审视稀疏视图重建下基于Splat的CT姿态敏感性
研究发现,稀疏视图CT中Splat重建的条纹伪影主要源于采集几何姿态误差,而非视图稀疏本身;提出轻量级联合优化框架,显著提升重建精度。
文生图模型中的明喻理解:评估框架
提出明喻理解评估框架,用受控数据集、目标检测指标和扩散透镜分析,揭示模型字面化误读。
通过区间去噪器重新思考像素均值流
提出区间去噪器,实现无潜变量图像生成,精确映射轨迹,避免梯度偏差,配合残差裁剪与时间采样课程,ImageNet上一步FID4.55,两步3.98。
基于VLM的联邦学习在遥感中的自适应策略有效性研究
比较四种VLM适配策略在联邦遥感图像分类中的泛化、通信和计算权衡,并给出选择指南。
FUSEP:早孕期胎儿超声筛查多中心多任务基准
提出FUSEP基准:多中心4017张早孕超声图,标注14个解剖结构,支持检测与域适应等任务。
面向标签高效腰椎退变分级的分割预训练
分割预训练利用自动生成的伪标签,减少腰椎退变分级的人工标注;仅需两成标注即接近全监督效果。
静态SegFormer:基于静态结构化剪枝的高效高性能语义分割
提出静态结构化剪枝方法,在SegFormer上降低FLOPs并提升帧率最高34%,且不损失mIoU,适用于小编码器和大图像。
基于溅射的锥束CT金属伪影抑制:紧凑衰减建模
提出溅射式紧凑衰减模型,锥束CT,高斯表征联合优化几何与材料,无需掩膜,抑制金属伪影保留细节,收敛快。
将大语言模型嵌入流程控制:面向自适应与可信自动烹饪的智能体框架
提出智能体框架,将个性化烹饪需求分解为可验证控制程序,多代理协同实现可靠执行、透明逻辑与异常处理,验证实用性。
追踪、验证与纠正:多模态大语言模型空间推理的免训练框架
提出免训练框架,建空间证据图验证视觉证据、纠正错误推理,准确率68.94%,超基线8.55个百分点。
利用扩散模型进行腰椎MRI分割以增强腰痛评估
提出SpineSegDiff扩散模型分割腰椎MRI,性能媲美nnUnet,改善椎间盘退变识别,不确定性图辅助临床。
RegisterBridgeMM:以寄存器为中心的RGB-红外目标检测框架
提出寄存器中介融合框架,三阶段生命周期避免密集交互,冻结骨干在四个基准上达到最高精度。
卫星图像篡改与深度伪造定位基准数据集
构建包含60幅真实与篡改卫星图像的基准数据集,提供像素级真值掩码和元数据,支持篡改检测与定位评估。
烹饪超越帧:厨房中的立体事件相机数据集
提出EventKitchen,大规模厨房烹饪立体事件相机数据集,含5.5小时录制与标注,用于动作识别、检测和深度估计。
全局注意力融合的图像裁剪:注意力引导与全局对齐的裁剪评估器
提出全局注意力融合裁剪,结合注意力引导特征融合与全局对齐评估器,获得精准稳定裁剪,优于现有方法且不修改像素。
当扩散模型忘记你是谁:大遮挡下面部修复中的身份保持
提出ReSem-Face级联扩散框架用多参考身份语义先验在大遮挡下保持人脸身份并提升文本编辑质量
评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性
视觉-语言模型在脑MRI诊断中,序列与标签扰动致预测翻转率高达67.8%,高精度掩盖临床不可靠性。
STEP-OPD:重新思考扩散模型在线策略蒸馏中的输出目标与内部动态
提出STEP-OPD,将学习目标扩展至教师之外并约束内部表征演化,超越标准OPD及单任务教师,提升扩散模型蒸馏性能。
面向令牌高效视频语言模型的持久对象叙事
提出SlotNarrative,将视频建模为持久对象叙事,仅用固定144个视觉令牌,实现精度与令牌效率的良好平衡。
视觉表示至关重要:利用视频到音频生成中的时间差异
提出TD-V2A,利用帧间时间差增强视频到音频生成,显著提升质量,优于视听预训练等方法。
可提示的跨物种动物姿态追踪
提出两种基于基础模型的动物姿态追踪方法,有监督与无监督结合,用少量标注实现跨物种高精度追踪。
ContextMaster:通过固定预算稀疏上下文路由的交互式多镜头视频创作
提出ContextMaster统一模型,用稀疏路由和蒸馏实现多镜头交互创作,提升任务一致性与速度。
基于主动学习的单目视觉流实时深度感知框架
提出在线主动学习,以弹性权重巩固调控选择性可塑性,使轻量网络实时适应,算力降75%且精度不变。
面向多模态预训练的物理机制:知识流动、模态协同、早期统一与配方
系统探索多模态预训练,发现知识流动、模态协同、早期统一等规律,并提出高效配方,仅用5%计算量实现强生成性能。
OmniEdit-Bench:指令式视频编辑综合基准
针对指令视频编辑评估不足,提出涵盖时空音频等多维度的综合基准,引入精度感知惩罚机制,防止错误编辑获高分,评测显示现有模型仍不理想。
面向有效B-Rep生成:无需训练的线框异常检测与修复
提出免训练方法WDR,在线框阶段检测并修复几何拓扑异常,提升B-Rep有效性。
UG-UMRE:不确定性引导的模态增强与分布校准的统一多模态关系抽取
提出UG-UMRE,通过不确定性引导的模态增强与联合对齐,过滤噪声并校准分布,在三个基准上取得最优性能。
释放视觉-语言模型在可泛化AI生成图像检测中的潜力
提出语义原型校准(SPC),用于感知编码器,在跨生成器、后处理和真实场景基准上超越现有方法,达到最新最优。