CleanVideo:面向文本到视频扩散模型的自适应概念擦除
CleanVideo通过三模态门控的低维子空间干预,自适应擦除文本到视频扩散模型中的目标概念,保持视觉保真与时序连贯。
MTF-Net:面向行人意图预测的多模态时序特征融合网络
提出MTF-Net,融合运动、姿态、上下文与场景四模态,经门控时序融合预测行人过街意图,PIE/JAAD上AUC达0.95/0.94且实时高效。
MoSSGate:面向皮肤病变分割的记忆调制状态空间门控
提出即插即用模块MoSSGate,融合边界感知门控、记忆调制与并行二维状态空间建模,在ISIC基准上高效取得最优皮肤病变分割精度。
类原型距离:面向目标检测的主动学习
提出类原型距离评分信号,单次前向传播即可筛选样本,降低标注成本,性能优于后验概率方法。
面向弱监督白内障眼底图像增强的两阶段多尺度注意力网络
提出两阶段多尺度注意力网络,弱监督增强白内障眼底图像,合成配对图像并提升细节,性能优于现有方法。
SAGE-Yoga:面向瑜伽姿势分类与关节级矫正的多线索学习
SAGE-Yoga统一框架融合多视觉集成与几何校验,实现瑜伽姿势分类与关节级矫正,Top-1达90.7%。
AI还是真实:资源受限环境下的部分篡改视频检测
以知识蒸馏构建轻量全帧检测器,专为边缘部署识别部分篡改AI视频,兼顾时域误报与阈值校准。
生成式验证:重新思考目标检测主动学习中的不确定性信号
生成式验证:独立生成模型复核预测框标签,分歧作采集信号;扩散验证器建模标签分布,超越基线,增益最大。
TouchSight:通过生成式视觉增强从第一人称视频中实现裸手触觉预测
TouchSight用生成式视觉增强,仅凭第一人称视频预测全手密集接触力,无需触觉设备。
TinyCNN:用于端侧植物病害检测的193K参数网络及跨数据集鲁棒性诊断
TinyCNN仅19.3万参数,端侧植物病害识别准确率达98.88%,跨数据集鲁棒性仍存明显差距。
基于潜在桥匹配的快速跨场强多对比度脑MRI转换
基于条件潜在桥匹配的统一模型,单步推理即可快速完成跨场强多对比度脑MRI合成。
并非所有层都同等重要:面向可靠 CLIP 分布外检测的动态层路由
将层选择视为可学习问题,学习轻量路由器为CLIP分布外检测选择稀疏专家层,Voyager更准且高效。
FreqDINO++:面向通用超声分析的频率引导多任务路由视觉基础模型
提出多任务路由视觉基础模型,结合频率感知增强与协作解码,在27类超声任务上领先,泛化性良好。
MM-Future: Multi-Mode Joint World-Action Modeling for Autonomous Driving
AgriScope:面向农业图像的像素级多模态理解
AgriScope:农业图像像素级多模态理解框架,支持图像、区域与像素级任务,发布大规模农业数据集。
EliGSiR:有限算力下基于高斯泼溅的持续RGB-D建图
EliGSiR通过视图调度、负载自适应保真度与定向几何增长,在有限算力下持续高效完成高斯泼溅建图。
呈现攻击工具偏移与环境退化下的虹膜呈现攻击检测紧凑视觉模型
紧凑模型在未知攻击工具和环境退化下虹膜呈现攻击检测误差显著上升,最佳模型仍难部署。
查询所知超乎我们想象:揭示分割模型中的潜在知识
冻结分割器已计算的候选中潜藏更优掩码;HYDRA仅用缓存输出校准选择,显著提升多模型。
PhGS:单视图前馈三维高斯重建的事后剪枝与精炼
冻结基础模型,用重要性剪枝与轻量循环精炼对单视图前馈3DGS事后压缩,保真省显存,保留率可调。
WeVisDoc:从覆盖到能力,实现稳健的端到端文档解析
两阶段数据框架:先扩覆盖,再诊断残差并定向优化,显著提升端到端文档解析鲁棒性,多基准领先。
基于语言的解释何时有用?面向农场监测的可解释绵羊面部疼痛图瓶颈
羊面部疼痛自动识别中,语言解释不可靠;图概念瓶颈牺牲少量κ,换取可验证SPFES概念并建立基准。
SenseFuse:面向开放词汇三维实例分割的图像与形状编码器无标签融合
提出无标签融合2D图像与3D形状编码器的三维实例分割标注方法,自适应选权重提升精度。
面向边缘洪水分割的跨架构基础模型蒸馏
3亿参数洪水教师蒸馏为70万参数边缘学生,伪标签扩增,INT8部署5.57ms、14MB内存。
面向超低场儿科神经影像的层级伪影先验建模双流调控重建与分割网络
提出双流3D U-Net统一框架:先增强重建再分割,伪影图预测评分,配准传播标签,兼顾三项任务。
DocAttriBench:文档视觉问答中答案溯源基准测试
提出MAPPET,构建元素级溯源基准DAB,含23.7万文档、29.6万问答对;模型定位支撑元素仍失败。
直播视频中的产品定位理解
提出GPUB直播产品理解基准(3000实例、3.1万商品),并发布UniPro模型提升GPrU性能。
银器金匠印记自动检索
提出银器金匠印记检索,融合定位与度量学习;最佳mAP62.63%、Top-1 73.74%,自监督与定位最关键。
RawSLAM:基于线性辐射的在线HDR高斯SLAM
首个在线HDR高斯SLAM,直接基于16位线性辐射图像跟踪建图,优于MonoGS并可迁移。
FunArt:从生成式3D潜变量中解码功能结构与关节运动
FunArt利用生成式3D潜变量,从单次静态RGB-D观测构建铰接功能场景图,分割可动/功能部件并估计运动学,性能领先。
ERCPMP-Gx:用于结直肠息肉病形态学、组织病理学与基因组学表征的内镜图像与视频数据集
结直肠息肉病内镜图像视频数据集ERCPMP-Gx:含160张图像,八成病例为遗传性息肉病综合征,附病理与基因信息,支持AI分类。
SplashSplat:从真实世界多视角视频重建飞溅液体
提出20场景真实多视角飞溅液体基准与SplashSplat,优于动态高斯泼溅,支持插值与风格迁移。
PROVIA:面向第一人称视频在线错误检测的流程状态跟踪
PROVIA 用事实状态与已接受进度双记录跟踪流程状态,将逐帧错误概率转为告警,在完整试验中实现第一人称视频在线错误检测,性能领先。
该病例是否应适配?预测碎片化控制测试时自适应
预测碎片化无需标签或梯度即可预测有害适配,病例级路由显著降低有害编辑并跨域可移植。
FlowSGS:利用随机插值改进逆成像的流匹配先验
提出FlowSGS,用随机插值与分裂吉布斯采样做流匹配后验采样,提升逆成像性能,并首次处理非线性相位恢复。
地表免疫系统:面向未知异常的快速监测
ESIA借鉴生物免疫机制,无需预设类别即可快速定位并识别未知地表异常,助力实时灾害响应与环境监测。
Paint-Anything:面向图像生成与编辑的统一任意颜色控制
提出Paint-Anything,用十六进制提示统一对象级任意颜色控制,提升生成与编辑色准。
FAMOS:基于稀疏观测的前馈式三维铰接建模
FAMOS 从稀疏点云前馈预测可动部件分割与关节参数,聚合多视角线索、程序化合成数据,性能超越基线。
精修本身即可编辑:基于生成式精修网络的免训练提示到提示图像编辑
免训练提示到提示编辑框架,用生成式精修网络细化二值图像码,在多类编辑上背景保持与CLIP得分领先。
跨越之前先感知地形:面向越野导航的世界模型
首个融合本体感知的越野导航世界模型Feel-WM,预测未来本体状态与失败风险,无需标注,轮式足式平台均优于纯视觉方法。
面向自动驾驶的4D雷达感知算法:综述
综述4D毫米波雷达感知算法,梳理从目标检测到动态场景理解的任务演进、多模态融合范式、数据集与未来挑战。
4D基础模型能记住吗?
提出PersistBench,以360°视频为全知真值,评估物体恒存、运动连续与外观保持,发现模型物体离开视野后记忆骤降。
VABench:通过视觉演示、主动感知与度量控制衡量具身空间智能
VA-Bench衡量具身空间智能:模型须从RGB演示主动选视角并发度量指令,最佳成功率仅53.9%。
压缩有害,汇聚有益:B型超声瑞利尺度估计中的信息损失
B超对数压缩致瑞利尺度估计信息严重损失,多窗口合并可降方差,但仍需大量窗口,限制定量超声应用。
乳腺X线摄影基础模型用于机会性预测主要不良心血管事件
乳腺X线基础模型无需心血管监督,仅凭筛查图像预测5年MACE,AUROC 0.823,优于年龄模型。
HyperAMS-Net:用于脑部疾病分类的自适应多尺度空间超图网络
提出HyperAMS-Net,融合自适应多尺度卷积、超图注意力与空间-通道注意力,在三个脑疾病数据集上取得最优分类性能。
MiX:面向端到端低位视觉语言模型加速的微型翻转缩放
MiX以共享尾数替代共享指数,配双格式框架与定制加速器,4.5比特VLM精度媲美NVFP4。
分割天花板:为何显式左心室掩膜无法提升学习式射血分数回归
提出分割天花板:掩膜每帧面积误差需低于约10%才可能提升射血分数回归;泛化与校准不确定性更关键。
打印欠定之物:将具象绘画中的多解性物质化
将具象绘画三维配置的多解性显性化,经多视角生成、高斯泼溅重建与实体打印,使多重解读可检验。
OmniMimic:面向多风格全向四足运动的动力学补全动作增强
OmniMimic 通过动力学补全与方向反射扩充有限的动物演示,训练多步态全向四足运动策略,大幅降低足位与速度跟踪误差。
迈向以合成数据扩展海洋感知
扩展OceanSim模拟器,构建水下合成数据生成管线,自动产出逼真标注数据集,并在海胆检测任务上验证仿真到现实迁移。