HilDA: 基于扩散的分层蒸馏技术推进自监督激光雷达预训练
提出HilDA框架,融合分层蒸馏与扩散,实现自监督LiDAR预训练,在3D检测等任务上达最优。
一次蒸馏,终身适应:探索数据集蒸馏在持续测试时适应中的应用
提出DO-ALL框架,用数据集蒸馏生成合成锚点,通过源回放等实现稳定持续适应,无需原始源数据。
使用角色-环境和谐视频生成模型的电影级合成
提出三掩码引导视频扩散框架,联合建模角色与环境双向交互,实现电影级动态视频合成。
DeepForestVisionV2:生态驱动分类扩展用于非洲热带森林相机陷阱监测
DeepForestVisionV2将分类从35类扩展到64类,适应垂直分层、开放场景等,准确率0.86,误报大幅减少,显著提升野外实用性。
PRISM:视频扩散模型中间状态中的偏好表示
PRISM利用视频扩散模型中间隐变量解码偏好,实现高准确度与鲁棒性,支持早期过滤提升效率。
BAFIS:评估现代文本到图像模型中职业偏见与人类偏好的数据集与框架
研究开发BAFIS平台评估五个主流模型,发现系统性偏见,强调人类偏好对公平模型的重要性。
单阶段分层纠正用于弱监督组织病理学分割
提出单阶段分层纠正框架,主动过滤浅层异常,直接生成高保真激活图,训练时间减少2-5倍,性能更优。
SPOT-E:面向冻结视觉语言模型的测试时熵塑形与视觉聚光灯方法
SPOT-E通过GRPO优化视觉聚光灯进行测试时熵塑形,增强冻结VLM的证据接地,提升性能与鲁棒性。
U²Mamba:一种用于显著性目标检测的双层嵌套U型结构Mamba
提出U²Mamba,采用双层嵌套U结构及分层训练监督,显著提升显著性目标检测性能。
CUPID:重建UV纹理图以实现可解释的重点人物深度伪造检测
CUPID利用UV纹理图与掩码自编码器重建,无需深度伪造样本,实现可解释且鲁棒高效的重点人物深度伪造检测。
GEN-Guard:纠正联邦手术AI部署中的泛化失败
提出GEN-Guard框架,通过CBE与DAD检测并修复性能泄漏,显著提升跨机构与零样本泛化能力。
CMDS-AD:跨模态双流解耦用于小样本异常检测
提出跨模态双流解耦框架,利用扩散模型低通滤波提取低频正常表征,1-shot下MVTec 3D-AD提升5.7%I-AUROC和2.0%AUPRO,达SOTA。
InfantFace:新生儿临床环境中的婴儿面部检测
提出YOLOv11m婴儿面部检测模型,域适应后AP50达0.96,但新生儿数据集匮乏制约进展。
HumanScale:自我中心人类视频在具身预训练中超越真实机器人数据
自我中心人类视频经精心处理后,在具身预训练中优于真实机器人数据,损失降24%,成功率提52.5%-90%。
无训练AI生成图像检测器有多脆弱?——分数方向、预处理与压缩的受控审计
审计发现无训练检测器:实现细节冒充方法差异,分数方向由超参数决定,数据集格式偏差夸大鲁棒性。
S-Agent: 空间工具使用激发空间智能推理
S-Agent通过时空证据积累与工具记忆机制,无训练提升VLM空间推理,微调后媲美顶尖模型。
FreeStyle: 从社区LoRA挖掘实现风格-内容双参照生成的自由控制
FreeStyle框架基于社区LoRA挖掘构建三元组数据,采用两阶段课程解耦机制,平衡风格对齐、内容保持与泄漏抑制。
基于几何感知的超像素图变换器结合元数据的皮肤病变分类
提出图学习框架,将病变建模为超像素图,融合几何与元数据,用边缘感知图变换器实现高精度分类。
面向冻结姿态流视频异常检测的可靠性感知原型校准
RPC后处理校准法利用原型偏差与可靠性门控,在八组数据集上平均提升AUROC 2.03个百分点。
PCFootprint:用于从机载LiDAR点云中提取矢量化建筑足迹的大规模数据集与基准
PCFootprint是首个大规模机载LiDAR建筑足迹数据集(33000瓦片),含跨域测试集与基准,揭示复杂环境挑战。
FlowBender:面向自纠正条件流的反馈感知训练
FlowBender利用推理时反馈误差训练自纠正策略,同时提升约束忠实度与生成合理性。
谱QK乘积权重引导用于无训练VLM幻觉缓解
提出QK乘积引导,抑制中间层主导奇异模式,无训练零代价降低VLM物体幻觉,CHAIRs降4%。
SARLO-80:全球斜距SAR语言光学数据集80厘米
构建了含119,566个三元组的高分辨率SAR-光学-文本数据集,覆盖72国,支持多模态对齐。
VisDom: 基于可见域约束的稀疏新视角合成
VisDom通过最小可见域约束,无需学习参数即改进稀疏新视角合成,实现高质量对象中心重建。
CalTennis:大规模多视角网球视频数据集与单目转3D姿态估计基准
CalTennis超1100万帧,为大10倍的多视角运动视频基准,发现深度与脚部接触估计不足,提出步法、稳定性新指标。
框式思维:让真实图像的3D编辑变得简单
利用3D框作为结构化规范,提供精确控制,通过深度对齐平面和两阶段训练,实现真实图像中大型3D编辑的突破。
SSD:空间投机解码加速自回归图像生成
利用2D空间相关性同时预测相邻与下方Token,加速自回归图像生成最高13.3倍,保持高保真度。
FID抽奖:量化生成模型评估中的隐藏随机性
实验发现重新训练比重新采样引起更大FID变化,建议报告多训练种子误差条,低于1.3%变异系数差距无定论。
当前世界模型缺少持久状态内核
现有世界模型在被观察时场景连续,但未被观察时事件停滞,缺乏内部状态持续演化能力,需将状态稳定性作为设计目标。
JanusMesh:通过跨空间去噪实现快速且零样本的3D视觉幻觉生成
提出跨空间去噪与视图条件纹理合成框架,3-5分钟生成高质量双语义3D幻觉,性能优于现有方法。
TimeProVe:先提出假设后验证——面向日常生活活动的长视频高效时序推理
提出TimeProVe框架,先轻量生成动作证据假设,再调用VLM验证,性能提升7.3%,成本降低93%。
UNIEGO:代理作为中介的统一第一人称视频表示学习
层次化多教师蒸馏框架UNIEGO,利用代理模型融合多视角多模态知识,选择性蒸馏实现第一人称视频表示最优。
3D场景图:开放挑战与未来方向
综述3D场景图的统一定义、建模、构建与应用评估,聚焦开放挑战与未来方向。
高效连接真实场景与合成数据生成:面向基于AI的认知机器人与计算机视觉应用
探讨AI视觉模型在认知机器人中的挑战,通过训练数据生成弥合模拟与现实的差距。
SAFE-Cascade:面向图表问答的成本自适应视觉-语言路由
SAFE-Cascade通过成本自适应路由,减少26.9%VLM调用和9.3%成本,准确率与全VLM基线持平。
面向端到端驾驶的自对弈规模扩展
提出大规模自对弈训练端到端驾驶模型,通过高吞吐量模拟器Gigapixel结合特权教师蒸馏实现像素级策略,适应真实世界数据达领先性能。
FrequencyFormer:面向频域视觉Transformer推理的传感器-处理器协同设计流水线
FrequencyFormer通过频域令牌化实现128倍压缩,通信能耗降230倍,总能耗降2.22倍,兼容ViT预训练模型。
世界引擎:迈向自动驾驶后训练时代
后训练合成高风险交互,可显著提升自动驾驶安全性并减少故障。
轮廓约束可变形配准用于头颈外科手术引导的特征参数分析
轮廓约束可变形配准将头颈手术标本配准误差降低49.41%,并揭示轮廓权重对横向变形组织主导作用。
全自我诊断(FSD):基于物理的视觉生物标志物推断——通过逆问题与算子学习从智能手机视频中实现
FSD框架从9秒手机人脸视频推断生理状态,集成物理模型与算子学习,实验MARD 29.86%,97.57%安全。
MMD-SLAM: 结构增强的多元高斯分布引导的视觉SLAM
MMD-SLAM利用Atlanta世界假设与多元高斯表示,通过点线融合与结构先验,实现跟踪与建图性能最佳,ATE降低48.56%,PSNR提高5.71%。
Tri-Info:基于信息理论的VLA模型可泛化可解释失败预测
Tri-Info基于信息论,可泛化可解释地检测VLA失败,跨域迁移无需重训,真实任务准确率83%
面向自主导航中注视引导的主动感知的快速人类注意力预测
提出GazeLNN模型,仅需0.61 GFLOPs,计算成本降99.40%,推理加速6倍,在无人机导航中实现人类注视引导的感知。
令牌是群元素:论矩阵李群上的李代数注意力
提出李代数注意力,令牌为矩阵李群元素,用相对位姿代数范数为分数,无需表示论,在仿射群上高效且参数更少。
CoMo:从互联网视频中学习连续潜运动以实现可扩展的机器人学习
CoMo从网络视频学习连续潜运动,运用早期时间差分和时序对比学习增强运动线索,生成伪动作标签,零样本泛化以提升机器人策略。
用于低光照场景下光场目标跟踪的角度-时间交互网络
提出对极平面结构图像表示与自监督角度-时间交互网络,在低光照光场目标跟踪中取得最优性能。
LaTtE-Flow: 逐层时间步专家流式Transformer
提出LaTtE-Flow,基于预训练VLM,采用逐层时间步专家流式架构,图像生成速度提升约6倍,同时保持强理解性能。
组合对象检索:通过组合表达式实现的对象级检索
提出对象级组合检索任务及数据集COR125K和端到端模型CORE,实现细粒度目标检索与定位。
多视图融合的层次互蒸馏:从所有可能的视图组合中学习
提出HMDMV方法,利用所有视图组合进行层次互蒸馏与不确定性加权融合,实现高精度分类,且推理灵活。
面向高质量3D生成的协同多模态编码
TriMM模型通过协同多模态编码和扩散模型,从少量多模态数据生成高质量3D内容,性能媲美大规模训练模型。