FailSAE:基于稀疏自编码器的视觉语言模型可解释故障预测
提出用稀疏自编码器预测视觉语言模型故障,三阶段训练提升可解释性与准确性,发现故障时概念从类别转向模糊特征。
AdaptVPR:基于路线感知硬正样本生成的鲁棒视觉地点识别
提出AdaptVPR路线感知增强框架,按场景属性和风险生成全局遮挡等硬正样本,经几何验证提升VPR鲁棒性,R@1最高提升9.2%。
当看见压过知道:视觉主导性与基于延迟的VLM个性化安全方法
多模态模型因视觉主导忽略文本风险,致个性化安全差;棱镜监测器预测延迟需求,AUC0.978且帕累托最优。
物体概念从运动中涌现
提出从运动边界生成伪实例掩码,以度量学习训练单图编码器,无需标注,在几何与实例任务上超越预训练基线。
以退为进:反思感知的视觉生成偏好优化
反思感知偏好优化:反向修正扩散轨迹,反事实蒸馏,无推理开销对齐偏好,缓解奖励黑客,泛化更强。
外观失效,几何识别:无需 CAD 的三维形状先验,补充视觉基础模型
扫描所得三维几何先验可替代设计模型,融合视觉基础模型;对低纹理相似零件增益稳定,遮挡下更有效。
基于样本引导分布匹配的视频生成联合对齐与蒸馏
提出统一单阶段分布匹配框架,利用样本引导梯度方向,免去强化学习,提升视频生成的对齐与蒸馏质量,优于两阶段方法。
什么在运动?面向组合场景控制的局部运动表征
可查询局部运动表征:整段视频按掩膜区域编码,保留全局上下文,实现物体级运动迁移与局部动作分类,优于裁剪/掩码。
DART:面向手术视觉基础模型的深度目标预训练
提出以深度图为目标的自监督预训练,利用伪深度提升手术视觉模型性能,推理时无需深度输入。
双部分多侧分支网络用于心血管导管造影多类分割
提出双部分多侧分支网络,实现心血管造影多类分割,精准区分导丝、导管、血管和背景。
隐于凝视:目光表示作为XR中效用与重识别风险的隐私控制
目光表示方式显著影响隐私与效用的平衡。工程化眼动特征保留约85%动作识别精度,同时将用户重识别风险降低约一个数量级。
ICM-Bench:多模态智能体长期记忆中的个体身份推理
提出ICM-Bench,首个评估多模态智能体长视频中身份记忆推理的基准;现有系统对长期身份关联问题准确率低,最优仅60.3%。
重要性感知的低秩蒸馏用于扩散Transformer
发现扩散Transformer的截断SVD压缩可平滑降级,提出SVDtrunc两阶段块级压缩与蒸馏,在40-90%压缩率下优于现有方法,68%参数近满性能。
场景中人物多视角图像生成的评估框架
提出HSRD指标,解耦相机运动与头部姿态,评估人物场景多视角生成的三维视差,以构建高质量多视角数据集。
ReaDiT引导:利用扩散Transformer特征控制图像与视频生成
提出DiT读出引导,用单块DiT特征按深度姿态等控制图像与视频生成,并扩展至相机与运动控制,参数少效果好。
示踪组织学中纤维束分割的拓扑感知训练与空间诊断
比较多种拓扑感知损失用于示踪组织学纤维束分割,发现检测指标不足以评估分割质量,提出Excess32空间诊断。
基于四维卷积核与稀疏标注学习的四维血流MRI主动脉分割
提出四维卷积U型网络,以稀疏标注分割主动脉血流磁共振影像,优于三维网络和半自动法,多中心验证良好。
VISTA:基于视觉语言模型的密集多标签课堂编码
VISTA将课堂观察协议转为密集多标签视频基准,结合视觉语言模型,化学课达80.1%优于零样本74.9%。
超越实例计数:群体-个体对象计数基准
提出群体-个体计数任务与基准,利用包含关系正则化,兼顾群体与个体精度。
LookThere!基于强化选择的稀疏视觉
该框架用强化学习联合训练选择器与提取器,只选任务相关输入,极稀疏下仍保精度,超越现有方法。
LUMIN:面向异常检测的轻量级通用制造检测网络
PSP采样零前向、341倍提速;推理优化延迟降95%、提速20倍;精度保持SOTA
HiSfM:通过脚手架锚定分层重建实现运动恢复结构消歧
提出分层粗细结合的运动恢复结构,用脚手架锚定骨架,先建社区并验证连接,消除重复对称歧义,降低耗时,提升完整性。
通过多特征编码与注意力融合增强多模态情感识别
提出多特征编码与注意力融合的多模态情感识别框架,显著优于基线,尤其提升不平衡数据下的性能。
SeamFlow:面向艺术家级UV展开的基于边缘概率的结构感知流匹配
提出生成框架,将三维曲面切割离散问题转为边缘概率连续流匹配,增强拓扑感知,达成语义连贯与低参数化失真。
结合大语言模型报告的阿尔茨海默病视网膜OCTA表型分析
提出可解释视网膜血管成像分析流程,集成分割、生物标志提取、无标签聚类与大模型报告,识别出低密度低分形维度表型。
看哪里很重要:为基于VLM的3D视觉定位学习关键视角
针对零样本3D视觉定位,提出学习关键视角选择的方法,以推理模型反馈训练,替代启发式规则,提升准确率。
AngelFingerprint:面向文本引导图像编辑的可追踪、可解释、白盒隐蔽水印
提出AngelFingerprint,将编辑提示嵌入模型权重,实现可追踪、可解释且白盒隐蔽的水印。
桥接模态与任务:面向SAR到光学转换与语义分割的统一分层ViT
提出统一分层视觉变换器,结合门控局部注意力与条件注入,联合优化SAR到光学转换和语义分割,性能优异。
具身智能体中用于高效长时空间记忆的语言轨迹编码
提出语言轨迹编码,以自然语言和空间锚压缩动态物体运动史,实现语义轨迹与长时目标检索,性能显著超越基线。
SimFuse3D:面向跨平台3D目标检测的源引导目标模拟与置信度引导多阶段定位重加权
SimFuse3D用源几何修复跨平台雷达伪目标箱点不一致,仅适配时生效,不改变架构,性能领先。
CoMLP:协同门控多层感知机用于医学图像分割中的细粒度跨模态信息融合
提出协同门控多层感知机,以区域与膨胀交互做细粒度跨模态融合,免密集注意力,五个医学分割基准最优。
PAPT++:面向单域泛化的风险感知对抗调优与生成
提出PAPT++,利用扩散模型生成分类器难分的语义一致样本,风险感知对抗迭代训练,提升单域泛化。
LetOccVote:通过一致性学习弱监督3D占用预测
提出LetOccVote,利用跨帧投票优化2D伪标签的几何与语义监督,无需3D标注,在Occ3D-nuScenes上取得SOTA性能。
天气条件化深度估计模型
DA-W框架解耦内容与天气风格,注入适配器实现恶劣天气下的鲁棒深度估计,AbsRel改善3.7%,同时保持常规状态性能。
CLON:面向零样本6D姿态前端的多语言对象注册标定
CLON无需任务训练,用语言记忆引导SAM 3产生高召回提案,并预计算提示权重,在7个数据集上检测AP提升8.1点,6D姿态AR最高提升4.1点。
用于部分相关视频检索的CLIP内在时间自适应
提出内在时间自适应框架,通过骨干内部时间注意和亲和加权梯度传播,实现部分相关视频检索的领先性能。
注意力引导的病灶聚焦图像分类全局与局部融合框架
提出注意力引导的三分支融合框架,结合全局与局部特征并自适应加权,在病灶图像分类中优于单一分支。
缓解跨域三维类增量学习中的性能差异
跨域三维类增量学习有性能差异,提出无范例法,隐式建模特征分布高阶统计量,增强跨域鲁棒性,缓解差异并提升性能。
基于声音的多人3D姿态估计
首个仅凭声音估计多人三维姿态的方法,提出新框架,效果优于基线。
交互歌唱:三维二重唱动画中的显式交互动态及其拓展
提出InterSing框架,用交互logits建模歌手间动态协调,生成逼真3D二重唱头部动画,优于现有方法。
MINT:基于可扩展第一视角管线监督的相机与手部世界空间运动估计统一模型
提出首个直接联合估计世界空间相机与双手轨迹的统一模型,用可扩展流程生成标注,实现高精度和零样本泛化。
基于非正射影像的星载甲烷探测
提出UnorthoDOS直接训练非正射高光谱影像,U-Net接近正射精度(IoU 16.9% vs 18.5%),远超基线(4.8%),支持FP16星载部署。
基于生成先验蒸馏的无配对监督三维编辑学习
提出无配对监督的三维编辑法,用生成先验蒸馏融合视觉语义先验与三维分布匹配正则,实现高保真跨视图一致编辑。
TourPhysics:将物理引入世界模型,实现基于单张图像的探索与操作
提出单图初始化的在线世界模型,融合物理仿真与视频生成,用于长期探索与操作,保持物理一致,减少外观漂移。
一个扩散模型的双重角色:闭环仿真中的引导轨迹规划与安全关键场景生成
单一扩散模型既可规划轨迹,又能生成安全关键场景,用于闭环评估,暴露规划器缺陷。
VICAL:面向长尾视觉识别的邻近一致性对齐
提出邻近一致性对齐框架,通过自一致学习与深度集成蒸馏降低预测方差而非追求多样性,缓解长尾过拟合,性能最佳。
LensStyle:面向可控风格化镜头效果渲染的光学美学学习
LensStyle学习光学美学,双路径解耦连续/离散控制,可控渲染散景星芒等风格效果,优于现有方法。
MCPO:面向多模态思维链压缩的模态对比偏好优化
MCPO用<900样本两步压缩:剪视觉无关步+偏好对齐,CoT降69.5%,提速3.34倍,精度不变
VoxelFix:已完成3D体素地图的事后语义修正
提出图模型VoxelFix,基于局部几何与邻域语义修正已完成体素标签,mIoU提升4.23–5.00个百分点,可迁移至新场景。
RefDiT:基于参考图像生成中的局部属性引导
RefDiT提出局部属性引导框架,通过分解标识符令牌和上下文调整,实现复杂场景中多物体局部属性的精细控制。