CLIP引导的无标签判别性区域评分用于细粒度分类
提出CLIP引导的无标签区域评分框架,发现Soft Negative Margin最优,随机裁剪比SAM更有效。
MultiAnimate:可控多角色动画的统一框架
提出MultiAnimate框架,实现多角色同时动画,保持身份一致与空间关系,适用于复杂交互场景。
FM$^2$:面向异质多模态医学影像的统一联邦基础模型
提出FM^2框架,通过双专家模块和异质模态对齐正则化,实现跨模态统一联邦学习,在分类和VQA任务上超越现有方法。
共生启发的增量目标检测知识蒸馏
提出SIKD,通过空间与语义共生蒸馏保留旧知识,缓解灾难性遗忘。
ScanFocus:一种从粗到细的时空视频定位框架
提出ScanFocus粗到细框架,全局扫描+局部聚焦,SGTA模块显式建模短时交互,实现精确时空视频定位。
DreamSat-Pose: 基于单视图三维重建与学习型2D-3D特征匹配的航天器姿态估计
提出单张图像重建航天器3D模型并估计姿态的框架,通过2D-3D对应学习实现,误差仅0.157度。
GeoAnchor:基于潜在分解的协作推理实现3D空间理解
GeoAnchor分解位置、方向、几何三种潜在信息,实现动态可解释的3D空间推理,性能超越现有方法。
用于Transformer场景文本识别的二维旋转位置编码
提出2D-RoPE-STR,通过各向异性旋转编码和交叉注意力扩展,零参数提升弯曲、旋转等不规则文本识别精度。
GPOcc++:融合视觉几何先验的统一稀疏高斯占用预测
将视觉几何先验转换为稀疏高斯表示,统一处理多视角与时序,高效实现室内外场景占用预测。
TRACE-PCa:在主动监测期间利用纵向MRI预测前列腺癌进展
提出无需病灶分割的时序多模态模型,融合MRI与临床数据预测癌症进展,减少不必要活检。
HIVE-3D:用于高质量3D场景生成的分层体素增强
提出由粗到细分层增强框架,从单张图像生成高质量3D场景,性能达最优。
LPM:工业级生成式视频修复
行业首个工业级生成式视频修复模型LPM,部署于快手,降低码率20%,节省数亿年带宽成本。
Bring Music The Horizon: 音乐驱动的360度视频生成
提出情感感知管道,根据音乐情感轨迹生成体现情绪动态的360度沉浸视频。
CASA-SDF:基于课程感知的空间适应与曲率引导密度的神经隐式表面重建
提出CASA-SDF,通过课程感知空间适应和曲率引导密度变换,平衡室内场景的平面平滑与细节重建。
高效视觉语言模型的无注意力轻量级令牌缩减
提出无注意力轻量级令牌缩减框架,用熵选重要令牌、一致性信号保多样性,实现高效压缩。
M2P-AD:基于记忆到原型学习与边界感知分数精化的三维异常检测
提出M2P-AD模型,通过记忆-原型学习与边界感知分数精化,抑制正常区域过响应和边界假阳性,实现高精度三维异常定位。
DP-BOA:基于狄利克雷过程的“出生或分配”方法用于在线类别发现
利用狄利克雷过程先验比较后验证据,在线决策样本归属现有类或新类,提升新类发现且保持已知类精度。
从地表预测到可观测性预测:面向云感知地球观测的潜在世界模型
提出可观测性预测问题,用潜在世界模型预测云遮挡下的地球观测可用性,准确率显著优于基线。
GHR-VLM:通过锚定混合推理实现零样本公交视频分析的可操作性
提出GHR-VLM框架,利用边缘-云协同和视觉锚定,将长视频转为乘客证据,实现零样本支付分析。
Human4K:面向全身三维人体重建的大规模4K多视角动捕数据集
提出含600万4K图像的Human4K数据集,多视角高精度全身标注,显著提升全身3D重建,尤其手、脚和深度模糊肢体。
VGIF-Score:视频生成中时空指令遵循的可解释性诊断评估
提出VGIF-Score框架,通过ST-DAG和AutoRubric实现视频生成指令遵循的自动化可解释评估,实验证明可靠且诊断有用。
DriveFace:面向移动车辆边境管控的跨谱段穿玻璃人脸数据集
提出跨谱段穿玻璃人脸数据集,含车辆近红外视频与手机预注册数据,揭示现实条件下人脸识别性能受限,亟需专用方法。
ThinkBLOX:渐进式推理的3D室内场景生成
ThinkBLOX提出基于VLM的渐进式推理框架,结合数据集与强化学习,实现高效可交互的3D场景生成。
UniPhysGen:面向仿真就绪3D资产的统一物理基础
提出UniPhysGen,自动将3D资产转化为统一物理语义的仿真就绪模型,联合推理关节与物理属性,性能最优。
Nexus:原生网格扩散生成
提出Nexus扩散法,解耦顶点与拓扑生成,顶点经八叉树粗到细生成,拓扑用连续嵌入全局恢复,性能优于自回归与两阶段方法。
超越颜色几何:评估视觉模型中类人颜色表示
使用86级模糊感知模型评估视觉模型颜色,类别结果相似,MAE在分级对齐上最强。
OvisOCR2技术报告
0.8B参数端到端文档解析模型,经多阶段训练在多项基准上获SOTA性能。
FreeLit: 基于物理引导扩散的无配对室内重照明
FreeLit提出无配对数据的物理引导扩散框架,结合光照先验与内在稳定策略,实现可控、鲁棒的室内重照明。
探索性、交互性、可部署:面向开放世界移动操作的视觉驱动具身智能体
提出REAL框架,开放世界移动操作,物理机器人零样本迁移成功率78.3%。
基于自标注区域对齐的细粒度CLIP微调
提出SFF-CLIP,通过运行时区域-短语对齐,仅用图像-文本对提升CLIP细粒度能力,同时保持全局一致性。
巴纳马拉:基准饱和下的参数高效手写天城文识别
紧凑网络(1.11M参数)在天城文基准达99.73%饱和点,鲁棒性远超大型模型。
超越语言与模态约束的说话人身份学习:POLY-SIM 2026挑战的启示
POLY-SIM 2026挑战聚焦多模态缺失与多语言场景下的说话人识别,提供标准化评估方案。
迈向野外空间超感知
提出野外长期视频基准VSI-Super-Wild,发现模型无法统一跟踪代理、对象和环境状态,存在四种失败模式。
WAVE-Stereo:用于立体匹配的扭曲对齐体积编码
提出融合相关体积与特征扭曲的WAVE-Stereo,通过GeoWarp编码和周期全局传播,实现高精度实时立体匹配,在多个基准上表现优异。
稀疏视图CT中辐射高斯泼溅的校准闭式不确定性
提出辐射高斯泼溅的闭式变分后验,实现可校准不确定性,在稀疏CT重建中优于启发式方法。
DNA:双阶段原生归因的生成图像溯源
DNA双阶段原生归因无需训练,利用VAE和骨干层分层信号,开放集溯源准确率89.11%,超基线33.81%。
T3HG-Editor:基于SMPL-X人体先验的文本驱动三维人体服装编辑
T3HG-Editor:利用SMPL-X的人体先验,三阶段实现高保真、一致的文本驱动3D服装编辑
第二届国际StepUP生物特征足迹识别竞赛:从步态到步幅
该竞赛利用大规模足迹数据集,聚焦跨域鲁棒性与步幅验证,最佳等错误率8.00%,个人鞋履识别仍是挑战。
解剖学忠实但时间盲目:超声心动图左室射血分数估计的归因审计
深度模型解剖学归因准确,但时间归因与随机无异,模型实际忽略临床关键帧。
AspectCLIP:通过方面引导的一致性正则化优化CLIP表示空间
AspectCLIP通过方面引导聚类与循环一致性正则化,解决图文信息不对称,优化表示空间,显著提升下游任务性能。
EgoProceVQA:一种基于自我技能探索智能体的自我中心程序理解新任务
提出自我中心程序理解任务EgoProceVQA及自技能探索框架EgoProceAgent,在多个任务上达到开源模型最佳性能。
RainDancer: 面向雨滴的脉冲动态的RGB-事件视频去雨方法
RainDancer提出先分解再交互框架,分离雨和背景,用脉冲神经网络捕捉雨运动,实现高性能视频去雨。
面向增强医学多模态大语言模型中的3D空间推理
提出逐片合成及思维链数据集,微调2D MLLM增强3D空间推理,无需3D预训练即媲美原生3D架构。
基于深度学习对胰腺癌可切除性的多模态评估
提出多模态深度学习框架,融合CT和临床信息,实现胰腺癌NCCN三分类可切除性评估。
烘焙至成:超快速空间纹理图集溅射法
将高频纹理烘焙至纹理图集,稀疏优化后速度提升5倍,实现实时4K 60fps渲染。
基于器官条件模式标记的CT理解细粒度视觉-语言预训练
提出OCP-CT框架,通过器官条件模式令牌对齐实现细粒度预训练,在CT基准上AUROC达84.5%和69.9%,分别提升6.7和0.8个百分点。
释放多模态大语言模型,实现野外无需训练的HOI检测
AgentHOI无需训练,利用上下文感知多轮推理与多面定位,在真实HOI检测中达最优。
面向多任务情感行为分析的任务特定特征融合方法
针对多任务情感分析,提出任务自适应融合冻结视觉特征策略,有效提升性能。
Cyclone:基于循环一致性从非配对驾驶数据中进行天气编辑的扩散模型
提出Cyclone框架,基于潜在扩散与循环一致性,无需配对数据即可生成逼真天气,显著提升自动驾驶感知鲁棒性。
SIVA-RL:多模态强化学习的敏感性-不变性视觉对齐
SIVA-RL利用样本级干预与奖励下降路由,实现敏感性与不变性对齐,显著提升多模态推理性能。