用于具身动作条件世界模型的因果去偏潜在动作模型
提出因果去偏框架CD-LAM,通过三种微调目标消除动作无关偏差,提升潜在动作可控性,仅需6k微调步骤,适配效率提升12倍以上。
Glob3R:基于3D基础模型的全局运动结构恢复
提出Glob3R,结合3D基础模型与全局优化,通过密集匹配和滑动窗口实现鲁棒准确的SfM重建。
多少像素才足够?SEAMS:基于MSE保持软掩码的充分性显著性
提出SEAMS方法,通过优化软掩码保留模型输出,生成紧凑可解释的充分性显著性图,无需辅助数据集。
YeTI: 仅需两张含噪图像即可生成真实世界sRGB噪声
YeTI用两张含噪图像即可生成逼真sRGB噪声,无需干净图像或元数据,有效提升去噪性能。
AnythingReality: 面向开放词汇VR场景探索的鲁棒在线高斯泼溅SLAM
提出在线高斯泼溅SLAM,结合ORB-SLAM3与VR,支持语音VLM交互,性能显著提升,物体识别率达88%。
动态逆渲染增强材质-光照分解
利用刚性运动物体的光-面交互观测,可显著提高逆渲染中材质与光照的解耦准确性。
面向动物重识别的参数高效视觉-语言适应与连续元数据条件化
提出连续元数据条件化CLIP框架,实现参数高效动物重识别,提升长期外观和时间偏移鲁棒性,测试无需元数据。
Simon-SR:用于文本增强超分辨率的多空间自适应调制与视觉提示适应
Simon-SR通过可学习提示实现文本-图像融合超分辨率,结合对比提示学习与空间自适应精炼,性能超越当前最优。
CtrlVTON: 基于视觉实例提示分割的可控虚拟试穿
提出VIP-SAM实现实例级分割,引入CtrlVTON框架通过像素级控制实现可控虚拟试穿,效果优于现有系统。
SVF-CR: 同步视觉-面部交叉优化用于多模态矛盾与犹豫识别
提出同步视觉-面部交叉优化框架,通过跨模态互优化与证据融合,在BAH数据集上macro-F1达0.7156。
面向自动驾驶的多模态场景相似性搜索
融合视觉与轨迹的多模态检索框架,证实外观与运动互补,实现最佳场景相似性搜索。
Rethinking Monocular Depth Embedding for Generalized Stereo Matching
REMIND:用于室内导航的基于记忆的重识别
提出REMIND在线跟踪器,融合特征记忆与空间上下文实现室内物体长期重识别,IDF1达90.35%,大幅超越现有方法。
从分类到定位与临床验证:泰国胸部X光片疾病检测深度学习系统的大规模开发
基于87万张泰国胸片开发,实现多病种分类与病灶定位,准确率高,跨13家医院泛化,获放射科医生高度信任。
TextileNet:面向手稿的零样本文本风格分割
提出仅用合成数据训练的TextileNet,实现手稿零样本文本风格分割,建立人类基线,发现笔迹性别识别需谨慎。
Robustifying Vision-Language Models via Test-Time Prompt Adaptation
Hydra++:实时分层三维场景图构建与对象级形状估计
Hydra++集成学习型形状估计与重投影一致性检查,实现实时分层3D场景图构建,提升对象和场景重建质量。
计数存在但错位:理解与纠正视觉语言模型中的计数失败
VLMs内部编码正确计数但输出错误,检测引导自纠正方法提升计数准确率15.6%
解耦语言引导与骨干网络用于文本引导医学分割
BTHA框架通过适配器和分层监督解耦语言引导与骨干,泛化多种编码器,提升分割性能。
注视引导的动态标记选择用于鲁棒且高效的视觉Transformer
受人类视觉启发,FDT模型通过注视引导动态标记选择,在降低34.57%计算量的同时实现81.9%准确率,超越DeiT-S。
SigLIP-HD:通过由细到粗的监督
提出SigLIP-HD,用由细到粗监督让中分辨率图像模仿高分辨率特征,相同推理预算下提升视觉token质量,OCR任务效果显著。
VGGT对重叠的了解:探测几何基础模型中的共视性
发现VGGT隐式编码共视性,层L17为负锚点;Co-VGGT冻结骨干训练轻量MoE头,性能超越基线超25%。
DGSfM:深度引导的尺度感知全局运动恢复结构
提出深度引导全局SfM,利用单目深度图解决尺度模糊,显著提升位姿精度。
视觉免费,言语有偿:揭示边缘VLM推理的真正能耗瓶颈
输出tokens数量是能耗关键,解码时长比输入高11-39倍,控制输出长度可节省97%能耗。
ALICE:从视觉、视觉-语言和全切片级别专家中学习通用病理学基础模型
ALICE通过多阶段聚合蒸馏整合多种专家模型,在96项下游任务中取得最佳平均排名。
PanoWorld:真实世界全景生成
利用旋转等变性质,提出PanoWorld,通过DPRC和GMA实现全景世界模型的长程记忆,大幅超越现有方法。
Wan-Dancer:一种用于分钟级连贯音乐到舞蹈生成的层次化框架
提出层次化框架,通过全局关键帧规划和局部时间细化,突破时长限制,生成超一分钟稳定高清舞蹈视频。
TCLA:面向医学视觉语言模型的无训练类别级逻辑适配
TCLA通过少量样本无训练校正推理logits,提升医学视觉语言模型在域外数据上的性能,优于现有基于训练的方法。
可提示概念分割(自上而下视角):评估SAM 3在遥感中的零样本与单样本能力
SAM 3遥感零样本/单样本评估:视觉提示有效,文本提示干扰;避免过拟合但受限于亚像素分辨率与语义盲点。
合成数据与标签分布对油菜分枝计数的影响
合成数据与真实图像比例1:7及高斯平滑标签分布,使油菜分枝计数平均绝对差降低14.7%。
4DR360:面向4D雷达-相机全场景感知的联合3D检测与占据预测的状态推理
提出4DR360框架,将语义占据作为持续状态,通过跨模态状态推理实现雷达-相机360°联合检测与占据预测。
OpenLongTail:长尾驾驶数据的生成式扩展
OpenLongTail通过生成式视图合成将异构长尾数据转为一致多视图,提升自动驾驶处理长尾事件的鲁棒性。
面向语言智能的可扩展视觉预训练
挑战纯文本预训练假设,视觉预训练在同语料上表现更优,是实现可扩展语言智能的有效途径。
使用Kolmogorov-Arnold网络重新审视欧拉角回归
提出范围感知欧拉建模与KAN框架,利用其加性结构,有效提升欧拉角回归的精度与效率。
SplatCtrl:基于高斯场景表示与反应式机器人控制的感知-动作耦合
基于3D高斯泼溅的实时场景重建与反应式运动生成框架,实现动态环境中的无碰撞机器人控制。
聚焦局部:以对象为中心的视觉Transformer作为高效分割的基础模型
FLIP通过生物启发的选择性采样,用0.51M参数达79.9%mIoU,超越SAM2-L,速度快2倍。
GReFEM:多模态大语言模型作为物理引导的3D网格细化的零样本语义助手
本文提出GReFEM框架,利用多模态大语言模型零样本实现物理引导的3D网格细化,实验证明其高精度。
联合嵌入预测架构用于太阳能光伏板故障分类
提出JEFFNet,融合自监督语义与监督卷积特征,高效实现光伏热红外故障分类,参数减47.2%,F1达93%以上。
ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes
基于背景融合的原型少样本医学图像语义分割
提出背景融合原型法,通过特征校准与层级注意力融合背景,提升医学图像少样本分割性能。
基于多模态基础模型与几何的零样本三维通用障碍物检测
零样本3D障碍检测,融合多模态基础模型与几何,时序LiDAR聚合,定位100米内,召回率提升10-25%。
人眼视觉约束的超分辨率
受人类视觉启发,动态指导超分辨率,降低计算复杂度,减少FLOPS而不损失感知质量。
论视觉位置识别中的运动模糊与去模糊
针对VPR中运动模糊影响研究不足,提出新基准评估运动模糊与去模糊,并给出自适应策略。
VerteNet——一种多上下文混合CNN Transformer,用于侧位脊柱DXA图像中精确的椎骨标志点定位
提出VerteNet混合模型,利用双分辨率注意力捕获局部与全局信息,实现高精度椎骨标志点定位,归一化均值误差4.92。
白色聚合与恢复:面向小样本3D点云语义分割
提出WARM模块,用白化和着色变换生成确定性原型,解决注意力分布差距,在S3DIS上达到最优。
AffordanceSAM:在功能可供性定位中再分割一切
提出AffordanceSAM,通过适应模块和三阶段训练扩展SAM到功能可供性定位,实现SOTA性能。
基于监督式跨模态特征匹配的单帧点-像素配准
提出无检测器框架实现单帧LiDAR与图像直接点-像素匹配,利用可重复性评分抑制不可靠匹配,在多个基准上达SOTA。
面向真实世界错位观测的鲁棒自监督跨模态超分辨率
RobSelf自监督模型联合优化翻译器和滤波器,实现错位对齐与高保真超分,速度提升15.3倍。
Memory-SAM: 基于检索生成提示的无需人工提示舌体分割
Memory-SAM通过检索历史病例自动生成提示,引导SAM2实现高精度舌体分割,无需人工标注,mIoU达0.9863。
AV-Master:双路径综合感知提升音视频问答性能
AV-Master以动态聚焦与模态偏好策略,增强跨模态协作,在复杂音视频问答中表现优异。