PLSR:通过局部化潜在体素扩散实现三维物体的渐进式局部超分辨率
提出渐进局部超分框架:分解全局任务为局部子任务,经低成本微调与分块去噪,高效生成高细节三维物体。
AGSA-Net:丰度引导的自注意力网络用于光谱解混感知的高光谱遥感图像分类
提出AGSA-Net,融合丰度引导与自注意力,嵌入光谱解混先验,提升异构城市场景高光谱图像分类性能。
NOVA:面向免训练零样本视频异常检测的正常侧建模
新方法NOVA从语言和视觉强化正常侧,基于正常提示与视觉锚,免训练零样本视频异常检测达到最优。
面向长格式多镜头视频生成的多网格后训练
MovieGrid将长视频分块置于空间网格联合建模,同预算下镜头数提升6倍,镜头内外一致性均最优。
从多视图图像将3D生成先验扩展到大规模场景网格
提出无需训练框架,从多视图图像生成大规模纹理网格,通过局部上下文平铺与全局对齐,提高几何与外观保真度。
将能力与置信度分离:面向GRPO训练医学视觉语言模型的接地双态校准
提出DualRead,将能力学习与置信度估计分离,结合解答前可解性与解答后视觉支持评估,优于言语化置信度,并引入CCG-AUC衡量视觉接地。
DualPathOcc:用于3D占用预测的双分辨率BEV编码器
提出DualPathOcc:空间增强器结合SENet双路径BEV编码器建模局部-全局上下文,采用高度感知加权交叉熵,无深度损失,在Occ3D-nuScenes上mIoU达37.37。
面向动作级显微吻合训练与表现反馈的集成视频AI平台
动作分割、器械追踪及大模型问答的智能视频平台提供显微吻合训练评估反馈;两中心实验验证可行,支持可扩展培训。
Diffuse2Seg:扩散模型可在无监督下分割万物
扩散模型自动生成多粒度掩码,五域上超SOTA 4.3-7.1点,提升无检测器分割7.4-7.7点。
大规模预训练改进基于深度学习的弥散加权成像几何畸变校正
大规模预训练提升单相位编码弥散加权成像畸变校正效果,优于非预训练,但跨域应用存在挑战。
一种高效零样本导航框架,每步只需一次大模型调用,利用空间感知路径点与快速行进规划,性能超越现有方法。
提出O2C-Nav零样本导航框架,每步仅调用一次大模型,利用空间感知路径点投影和FMM规划,性能超现有零样本方法。
用摄像思考:通过动态视角控制实现监控视频理解中的主动视觉推理
提出CamVLM,动态控制视角主动获取证据,构建数据集,用强化学习优化视角策略,监控视频理解领先。
CAM:基于连续提取与自适应查询的实体中心视频问答
该方法用知识图连续提取高层语义,自适应查询细节,三个基准上超越现有最优,最高提升二十三个百分点。
基于云的混合模型,利用YOLO Tiny与Haar Cascade对BRTA标准车牌进行实时检测
提出混合检测模型,融合深度学习与经典分类器,动态重训练提升精度,实时识别孟加拉车牌,适应复杂环境,高效低耗。
OracleZoom:受在策略自蒸馏启发的参考约束递归图像超分辨率
OracleZoom以自蒸馏和参考约束训练递归超分,直接与跨尺度监督加无参考目标,七数据集达SOTA并显著减少幻觉。
3DHarnessBench:探测前沿视觉语言模型的智能体式三维转代码能力
提出三维几何转代码基准,测试多模态模型经交互探索将其转为代码的能力,发现各模型表现不均。
面向应用流的GUI智能体持续学习的选择性知识控制
提出激活条件选择性知识控制按神经元激活状态截断或正交投影梯度保留旧知识并适应新应用有效缓解灾难性遗忘
学习运用想象:面向世界动作模型的进度条件化未来利用
提出进度条件化世界动作模型,以执行进度自适应利用想象未来,双组件编码与调节,优于强基线。
GeoCo-SAVi:用于可显式编辑物体表示的几何一致槽注意力
提出几何一致槽注意力,使位置与尺度可编辑控制,显著降低几何误差和外观干扰,提升重建与分组。
解读解码器轨迹:面向小目标检测的免训练反事实查询-轨迹可靠性
免训练CQTR通过反事实尺度干预激活冻结检测器潜在小目标知识,据解码器轨迹评估候选可靠性以提升检测精度。
TransNormal-2:几何锚定的整流流与边缘感知解码实现精确法线估计
提出单步整流流框架,以几何感知损失和边缘感知解码修正VAE法线退化,仅1.4%标注媲美MoGe-2,透明物体误差大降。
MARR:面向一体化医学图像复原的策略、执行与校准解耦
MARR将多模态自适应解耦为策略路由、残差执行与输出校准,一体化复原PET/CT/MRI性能最优。
VidaForge:面向视频预训练数据配方的开放研究基础设施
VidaForge将视频数据配方化为五阶段可执行流程,揭示配方选择对预训练性能的影响,并发布314万片段数据集。
笑声何时开始?时间维度笑声定位中标注者分歧的结构性
笑声标注分歧具结构性:尾部分歧为开头1.73倍,轻笑远多于大笑;单一标注评估不可靠,提出共形校准容差带评估。
FSAN:面向气动预测的流态注意力网络
提出流态注意力网络FSAN,实现几何与流条件细粒度交互,两大基准误差较最强基线降超10%。
GAN-Blot:面向蛋白质印迹取证的可控结构-风格合成基准
提出可控蛋白质印迹合成框架GAN-Blot,解耦结构与风格,生成高保真图像并可骗过专家与检测器,助力取证。
面向图像编辑的多历史步SDE反演,具备卓越区域感知能力
免训练图像编辑框架MIEdit:多历史步SDE反演,自动语义掩码提升区域感知,少步高质量超SOTA
面向移动机器人的物理-地理空间锚定场景解释
融合VLM、OSM与时空位姿,LLM生成物理-地理空间锚定场景描述,校园试验F1达0.83/0.64。
基于注意力增强深度特征与异构集成学习的青光眼检测
融合CBAM注意力增强深度特征与异构集成学习检测青光眼,缓解类不平衡,两数据集上性能最优且具可解释性。
第一人称视角下的陪伴式问答辅助
提出第一人称流视频陪伴式问答基准BuddyVQA(2.16万问答),并以多模态思维链助手MyBuddy显著提升模型表现。
面向跨域OOD检测的统一多层子空间建模
提出PRISM:融合多层特征建统一子空间,结合类条件马氏距离与正交残差,免调层,跨域OOD检测领先且低开销。
RoLA:用于高效扩散Transformer的旋转位置低秩线性注意力
RoLA:旋转位置低秩线性注意力,解决DiT中RoPE与低秩全局分支不兼容,实现2.63倍推理加速。
智能体视觉生成:从生成模型到智能体控制
视觉生成正从单次调用的生成模型迈向智能体控制,本文提出L0—L4控制层级框架,按控制器可干预范围梳理图像、视频、编辑、3D等领域。
ADELE——面向高保真网格原生重建的自适应 Delaunay 网格
提出自适应Delaunay网格优化与可微深度偏移渲染,融合体渲染和网格渲染,实现高保真网格原生重建。
Uni-Light:基于不确定性感知知识蒸馏的超轻量级脑肿瘤分割框架
提出超轻量框架Uni-Light,融合不确定性感知知识蒸馏与边界损失,参数降97.56%,Dice平均超SOTA 1.47%。
LASSNet:面向MRI模态缺失脑肿瘤分割的层级感知与可用性条件化空间-语义融合
提出LASSNet,按模态可用性与特征层级融合空间-语义信息,提升MRI缺失模态脑肿瘤分割性能。
回归特征:基于密集局部特征的零样本6DoF位姿估计
零样本6DoF位姿估计法B2TFPose,仅用冻结DINOv3密集特征免训练,BOP上AR达56.4。
用于衡量视觉语言模型中思维链忠实性的反事实测试
将反事实测试扩展至视觉输入,评测八个视觉语言模型,发现思维链难忠实反映视觉证据,并发布两个图像对数据集。
FAVE:面向高效细粒度视觉理解的中央凹自适应视觉编码
提出FAVE可变分辨率ViT,对选定区域高精度编码,在低算力下提升小物体、文本等细粒度理解。
显微镜即面具:冷冻电镜断层扫描前向模型带来的特权视图与标签
用模拟数据及前向模型增广,以位置身份为特权信息训练,无需微调即在真实冷冻电镜断层图上超越现有模型。
FailSAE:基于稀疏自编码器的视觉语言模型可解释故障预测
提出用稀疏自编码器预测视觉语言模型故障,三阶段训练提升可解释性与准确性,发现故障时概念从类别转向模糊特征。
AdaptVPR:基于路线感知硬正样本生成的鲁棒视觉地点识别
提出AdaptVPR路线感知增强框架,按场景属性和风险生成全局遮挡等硬正样本,经几何验证提升VPR鲁棒性,R@1最高提升9.2%。
当看见压过知道:视觉主导性与基于延迟的VLM个性化安全方法
多模态模型因视觉主导忽略文本风险,致个性化安全差;棱镜监测器预测延迟需求,AUC0.978且帕累托最优。
物体概念从运动中涌现
提出从运动边界生成伪实例掩码,以度量学习训练单图编码器,无需标注,在几何与实例任务上超越预训练基线。
以退为进:反思感知的视觉生成偏好优化
反思感知偏好优化:反向修正扩散轨迹,反事实蒸馏,无推理开销对齐偏好,缓解奖励黑客,泛化更强。
外观失效,几何识别:无需 CAD 的三维形状先验,补充视觉基础模型
扫描所得三维几何先验可替代设计模型,融合视觉基础模型;对低纹理相似零件增益稳定,遮挡下更有效。
基于样本引导分布匹配的视频生成联合对齐与蒸馏
提出统一单阶段分布匹配框架,利用样本引导梯度方向,免去强化学习,提升视频生成的对齐与蒸馏质量,优于两阶段方法。
什么在运动?面向组合场景控制的局部运动表征
可查询局部运动表征:整段视频按掩膜区域编码,保留全局上下文,实现物体级运动迁移与局部动作分类,优于裁剪/掩码。
DART:面向手术视觉基础模型的深度目标预训练
提出以深度图为目标的自监督预训练,利用伪深度提升手术视觉模型性能,推理时无需深度输入。
双部分多侧分支网络用于心血管导管造影多类分割
提出双部分多侧分支网络,实现心血管造影多类分割,精准区分导丝、导管、血管和背景。