DiverAge:基于跨年龄身份关系引导的可靠多元人脸老化
提出DiverAge框架,通过扩散自编码与跨年龄身份关系调节器,实现可靠多元人脸老化,提升序列序数可靠性。
HD-DinoMoE:一种用于复杂采集场景下巩膜异常分割的类别感知层次化双混合专家网络
提出HD-DinoMoE网络,实现复杂场景下巩膜异常分割,在ML-SASD-Mix上达平均Dice 72.11%、IoU 58.44%。
几何感知蒸馏用于提示调优生物医学视觉语言模型
提出OGKD框架,通过几何感知蒸馏损失注入类间关系,在11个医学数据集上平均提升1.7%-2.8%准确率。
BreastGPT:面向乳腺癌临床全程的多模态大语言模型
基于工作流对齐语料BreastStage,BreastGPT在乳腺癌全程多模态推理中性能领先。
多摄像头增强现实手术器械操作与组装引导系统:工作负荷与效率研究
多摄像头AR引导系统通过合成数据训练,显著降低手术护士工作负荷,任务时间减少21.3%,尤其有益于不熟悉器械者。
以场景为中心的无监督视频全景分割
提出首个无监督视频全景分割方法VideoCUPS,利用深度、运动和视觉线索生成伪标签,训练获得高性能模型。
规划、观察、恢复:面向主动式程序性辅助的基准与架构
提出主动辅助基准与解耦架构,通过大规模数据集和跨模型训练,显著提升任务干预与计划外恢复质量。
Food-R1:一种基于强化学习的统一多任务食品视觉-语言模型
提出CalorieBench-80K基准,Food-R1模型通过多任务学习与GRPO强化微调,在食品分析任务上表现优异。
MetaPoint:解锁代理视觉生成中的精确空间控制
MetaPoint用单一特殊token表示连续2D坐标,实现像素级物体位置控制,无需修改架构,可组合并支持代理规划。
M$^3$Eval: 基于认知心理学的视频任务多模态记忆评估
提出多模态记忆评估基准M$^3$Eval,发现模型在并行视频流与干扰下记忆脆弱,需加强记忆机制。
CIPER:跨视角图像检索与姿态估计的统一框架
CIPER统一框架联合实现检索与姿态估计,用共享编码器和双向交叉注意力,提升精度与范围。
瑞士全民倡议中签名列表的手写提取与分析
瑞士签名列表自动化分析:OCR对非词汇手写错误率高(29.6%),手写作者检索更有效(50.6%),可辅助检测重复提交。
Anchor3R:基于瞬态锚点的流式三维重建用于长时视觉地图构建
Anchor3R框架以瞬态锚点实现流式三维重建,将重建视为局部测量预测,消除漂移,提升长时位姿精度与稠密重建质量。
ZipSplat:更少高斯,更优Splat
ZipSplat基于令牌聚类解码高斯,以更少的高斯实现SOTA,无姿态监督。
基于3D轨迹和文本的可控动态三维形状生成
T2Mo框架结合3D轨迹与文本,实现精准、高表现力的可控动态3D形状生成。
MaCo-GAN:用于单图像超分辨率的流形对比对抗学习
提出流形对比对抗框架,用监督对比目标替代对抗损失,动态合成假样本,提升感知-失真权衡。
UniCAD:多模态多任务CAD的统一基准与通用模型
提出UniCAD多模态CAD基准及通用大语言模型UniCAD-MLLM,端到端实现多任务并达到最优性能。
中文标题:通过儿童自我中心输入的持续视觉与语言学习
中文摘要:提出BabyCL框架,从儿童自我中心视频流单次连续学习,效果接近离线训练,表明可在更接近真实经验条件下学习单词-指代映射。
谁需要标签?利用已有的元数据适配视觉基础模型
FINO利用元数据自监督适配视觉基础模型,无需标签,在多个科学领域超越监督方法且保持泛化性。
GeM-NR:基于几何感知的多视图编辑实现非刚性场景变化
GeM-NR无需训练,通过深度对齐与投影细化实现多视图一致的非刚性编辑,处理几何外观大幅变化,性能领先。
一个使用Vision Transformers进行细粒度车辆分类的开源两阶段计算机视觉流水线
开源两阶段流水线结合RT-DETR和ViT,对车辆进行六类细粒度分类,置信度低于0.6时放弃预测,分布内准确率0.94,域迁移0.89。
即时修图:高效高保真的双边空间指令引导图像修图
提出基于双边空间的高效高保真修图方法,通过预测低分辨率网格和扩散模型蒸馏,避免内容漂移,提升速度与质量。
UniFine:一种统一且细粒度的零样本视觉语言理解方法
提出UniFine统一框架,利用图像文本细粒度信息,在零样本视觉语言任务上超越以往方法。
PointAction:将3D点作为机器人控制的通用动作表示
PointAction利用4D点动力学作为动作接口,将视频预测转化为机器人动作,实现跨本体泛化,性能领先。
PureLight:基于光线追踪的复杂灯具学习
提出神经方法,用光追和归一化流估计复杂灯具外观,蒸馏为轻量MLP,实现低样本高效渲染。
TGSD:拓扑引导的状态空间扩散用于脑电图空间超分辨率
TGSD框架融合拓扑先验与条件状态空间扩散,实现脑电图空间超分辨率,提升穿戴式低密度传感性能。
面向多域与长尾量化的特征对齐与缩放方法
提出EmaQ和EmaQ-LT,通过特征对齐与缩放解决多域和长尾量化问题,在多个基准上实现强低比特性能。
漂移增强评分:基于文本的噪声鲁棒零样本音频语言分类
提出DAS方法,利用文本推导的类奖励提升噪声下零样本分类性能,在UrbanSound8K和FSD50K上分别提升最多5.75个精度点和1.74个mAP点。
Echo-Infinity:学习演化记忆实现实时无限视频生成
提出可学习演化记忆,以恒定成本压缩任意历史,结合统一相对RoPE,首次实现24小时实时无限视频生成。
几何高斯:在高斯泼溅中解耦外观与几何
添加几何不透明度参数,解耦外观与几何,提升渲染与几何精度,尤其改善透明物体场景。
从罗马RAPID管道中快速识别珍宝
提出机器学习模型RuBR,用于从Roman望远镜RAPID管道中区分真实与虚假瞬变,实验证明其有效性。
通过不可学习的方位对齐算子实现旋转不变卷积
提出基于不可学习算子的旋转不变卷积,参数和计算与标准卷积相同,在多个任务中显著提升准确率,尤其数据有限时。
高质量实体分割与定位
提出ESG管道和EntitySeg数据集,实现高质量实体分割与定位,在五个任务上有效,且GELLA模块灵活通用。
视觉语言模型能预测未来状态吗?从逆动力学自举世界模型
视觉语言模型难做正向预测,但逆动力学易学,可自举正向预测,性能达最优模型水平。
面向事件分类的可扩展事件云网络
提出SECNet,创新集成极性并利用傅里叶变换提取频域特征,在十个数据集上验证了可扩展性与高效性。
评估视觉状态空间模型的鲁棒性
全面评估VSSM在多种扰动下的鲁棒性,揭示其与CNN、Transformer的差异及优缺点。
CounterFace:用于人脸识别系统细粒度反事实评估的合成人脸数据集
提出含20种面部属性和8种人口因素的合成反事实数据集,自动化生成,揭示六种人脸识别系统在160种组合下的性能缺陷。
LaVIDE:通过地图-图像对齐的语言提示卫星变化检测
LaVIDE利用语言提示弥合地图与图像语义鸿沟,显著提升卫星变化检测精度,多类任务IoU提升18.4%。
用于组织病理学中鲁棒视觉模型的分层自监督对抗训练
提出HSAT利用层次结构进行自监督对抗训练,显著提升组织病理学模型鲁棒性,白盒提升54%,黑盒性能降幅仅3-4%。
地理空间基础模型助力可持续发展目标进展
SustainFM基准评估显示,地理空间基础模型优于传统方法,需注重能效与泛化,主张转向影响驱动部署。
Robust-LLaVA:大型鲁棒图像编码器对于多模态大语言模型有效性的研究
利用大规模对抗预训练编码器,无需额外训练即可提升MLLM鲁棒性,VQA和描述任务鲁棒性提升2倍/1.5倍,越狱攻击改进超10%。
AVTrack:面向复杂场景中以人为中心的视听跟踪
AVTrack是面向复杂动态场景的以人为中心视听实例分割数据集,挑战现有方法,成为鲁棒场景理解基准。
基于报告自动生成的肿瘤学VQA基准:评估3D医学影像视觉语言模型
提出自动化流水线,从报告及3D影像生成隐私VQA基准,评估六种视觉语言模型,发现视觉依赖因数据集而异。
COD10K-C:自然图像退化下伪装目标检测的鲁棒性基准测试
提出COD10K-C基准,发现运动模糊使SINet-v2下降18.5 Dice;RobustCODLite利用增广与频域先验,保留92.3%干净得分。
一致但错误:空间视觉-语言模型中的证据不敏感性
空间VLM常产生一致但错误的预测,揭示其对视觉证据不敏感,新协议ViewDiag可用于评估。
MetaWorld:从单视角视频数据扩展多智能体视频世界模型
提出MetaWorld框架,从单视角视频扩展多智能体视频世界模型,实现跨视图一致性与身份保真。
从局部训练到大规模制图:机器学习与深度学习在可迁移卫星测深中的比较评估
比较随机森林与CNN,发现保持空间连续性和SWF损失提升精度,深度学习跨区域迁移更稳健,多时相影像降低噪声。
GeoDrive-Bench:自动驾驶区域特定多模态推理基准
提出GeoDrive-Bench基准,含5053道跨6国驾驶题目,评估VLM区域推理能力,并设计蒸馏算法提升其地域文化理解。
Plan2Map: 从规划记录中进行基于文档的地理空间边界重建的多模态基准
Plan2Map是208案例的多模态基准,用于规划记录地理边界重建。GeoPlanAgent平均IoU 0.736,67.8%≥0.8,远优于直接VLM。
Cosmos 3:面向物理AI的全模态世界模型
Cosmos 3全模态世界模型,统一处理语言、图像、视频、音频和动作,为物理AI提供通用骨干,多项任务达新SOTA。