利用度量深度改进相对深度预测
利用大规模预训练模型的零样本度量深度能力,有效提升足球场景相对深度预测精度,取得2.68e-3评分。
ManiSplat: 基于解耦3D高斯泼溅的单目视频操控轨迹合成
提出ManiSplat框架,从单目视频重建解耦3D高斯数字孪生,实现高保真可控动态场景,支持机器人任务。
Envision4D:通过前馈4D高斯泼溅展望自动驾驶中的视觉未来
Envision4D提出全自监督前馈框架,通过预测未来姿态和条件运动提升,实现自动驾驶中无位姿的未来外推,性能领先。
ZODS-RS:面向遥感的零训练检测与分割
提出无需训练的遥感水平框检测与实例分割统一闭式流水线,有效处理旋转/尺度变化,提升小目标和拥挤场景性能。
向量地图作为语言:迈向统一的遥感矢量制图
提出VecLang范式,将多类矢量制图转化为结构化文本生成,实现跨类别统一表示与泛化。
别浪费SAM
微调SAM提升垃圾分割IoU达30+,接近最优性能,说明不应浪费其基础模型潜力。
使用YOLOv12模型验证生产线网络线缆(跳线)中线芯正确颜色顺序
基于YOLOv12模型检测网络线缆线芯颜色顺序,精度达98%,实时自动验证,减少人工错误,提升效率。
STEDiff: 在扩散模型中强化文本嵌入以提升文本到图像对齐
提出无训练方法STEDiff,通过增强[EOT]词元语义和空间约束损失,提升复杂提示下的语义一致性。
基于深度学习分析骨髓涂片的急性髓系白血病患者层面诊断
提出深度学习流程,利用16类细胞及CBLC分类实现急性髓系白血病诊断,外部验证F1达0.91。
DD-INR: 动态驱动隐式神经表示加速全脑功能性MRI重建
DD-INR通过分离静态背景与动态成分,聚焦动态变化的隐式神经表示,加速fMRI重建并提升激活模式恢复质量。
分析无训练的目标检测数据集损坏检测
免训练特征空间方法能可靠检测目标检测数据集的语义错误,但位置错误难以检测。
FadeMem:面向自回归视频扩散的距离感知记忆巩固
FadeMem通过距离感知机制分层缓存KV,近密远疏,固定预算下提升长视频连贯性与稳定性。
推进菲律宾木材识别技术:利用Xylorix平台高效开发与部署五种关键树种的AI模型
利用Xylorix平台,非编程专家成功开发五种菲律宾硬木AI识别模型,AUC最高1.000,四物种达AA级,适用于供应链检查点现场部署。
深度学习在回声测深数据中的应用
深度学习处理水下声学数据效果有限,需针对声学特性定制方法,且缺乏标准数据集与格式。
空间选择性自训练用于无监督建筑变化检测
提出SST-CD框架,用时空差异作伪标签,仅在可靠像素训练检测器,三数据集F1达83-92%,优于现有无监督方法。
第一人称手部检测的多模态RGB事件数据集
提出RGB合成事件数据方法,生成第一人称多模态手部检测集,性能近SOTA。
从瓦片到患者:数字病理学中图块到全切片性能可迁移性的研究
图块级线性探针可高效预测切片级性能,二者高度相关,能筛选候选模型,但最终仍需切片级验证。
SCAIL-2:通过端到端上下文条件统一受控角色动画
提出端到端角色动画框架,直接拼接驱动视频,构建MotionPair-60K数据集,用上下文掩码和偏好优化,显著优于现有方法。
HarmoView:协调多视角约束以实现身份一致视频生成
提出HarmoView框架,通过多级特征注入、代理令牌和跳转RoPE,结合渐进视角课程,实现高性能身份一致视频生成。
LIBERO-Occ:通过视角想象评估和改善场景遮挡下的视觉-语言-动作模型
提出LIBERO-Occ遮挡基准和视角想象(VIM)方法,生成互补视角提升VLA模型鲁棒性,无需额外摄像头。
基于施密特分解的高效量子图像编码方法
施密特分解低秩近似使FRQI编码电路深度减少97%,MSE约0.27,实现高效量子图像编码。
地球-全视觉:扩展遥感多模态大语言模型以支持更多传感器模态和任务
Earth-OneVision是2B参数的遥感多模态大模型,统一6类传感器与9类任务,通过三种机制实现跨模态融合,性能超越更大参数模型。
通过定制化概念嵌入改进前景条件外画的文本-实例对齐
提出CCE-Diffusion框架,定制概念嵌入并引入实例感知损失,有效减少前景条件外画中的伪影,提升图像质量。
听、看、学:通过SAM-Audio实现无遗忘学习
利用SAM-Audio视听先验,通过引导注意力和双层蒸馏缓解遗忘,在类增量学习中性能超越现有方法。
IPSM-Bench:锌基可吸收生物材料微观结构图像中的新型中间相分割基准
构建最大锌合金中间相分割数据集IPSM-Bench,提出融合空间上下文先验的SCoP-SAM方法,达SOTA并泛化良好。
PENet+:面向高效图像隐写分析的轻量级残差Transformer框架
PENet+通过分类器精简、激活感知HPF和MobileNetV2骨干,在几乎不损失精度下减少45.5%参数和97%FLOPs,实现高效隐写分析。
Pose-ICL:面向姿态可控主体定制的3D感知上下文学习
提出Pose-ICL免调优框架,融入3D感知上下文学习,通过表面锚定位置嵌入提升主体定制的姿态准确性与身份一致性。
首届PortraitCraft挑战赛:CVPR 2026研讨会肖像构成理解与生成竞赛
该挑战赛聚焦肖像构成理解与生成,设两个互补赛道,发布5万张带标注肖像数据集,推动美学分析与可控图像生成研究。
超越模型规模:通过训练微型模型探究视觉上下文学习中的差距
训练百万参数微型模型挑战大规模VICL,揭示任务编码、预训练及度量选择上的评估缺陷,亟需创新。
视觉上下文学习何去何从?跨领域和任务的统一基准
构建VIBE基准,评估6模型在14数据集12任务上的适应性,揭示局限与方向。
普及相机陷阱AI:面向英国哺乳动物检测的开源模型
发布开源YOLO26x模型,检测31类英国哺乳动物和鸟类,mAP达0.984,假阴性率0.17%,非商业许可面向生态学家。
AnimaSpark:一种用于驱动任意3D对象动画的前馈方法
提出AnimaSpark管线,利用2D子空间建模关节变换,从渲染图像生成视频并跟踪关键点,提升为3D动画。
数据记者智能体:将数据转化为可验证的多模态故事
Data2Story多智能体框架实现端到端数据新闻,通过证据锚定和多模态工具产出可验证的多媒体故事。
自适应放疗中剂量累积的不确定性估计框架:应用于宫颈癌CBCT引导放疗
提出IMPACT-DoseAcc框架,通过传播配准不确定性量化宫颈癌自适应放疗累积剂量变异。
世界奥林匹克:你的世界模型能否通过三项全能赛?
WorldOlympiad基准从物理、几何、交互三维度评估世界模型,揭示模型在物理推理、3D一致性及长程交互上的显著不足。
UniPET:一种面向不同剂量降低因子的高质量PET图像去噪通用网络
UniPET通过域泛化的风格对齐和区域感知学习,实现跨不同剂量因子的高质量PET去噪。
MOFA-VTON:虚拟试穿中的细粒度适应带来更多时尚可能性
提出MOFA-VTON,通过用户草图实现衣服细粒度调整,生成多样时尚试穿效果,超越现有方法。
均值流蒸馏:面向流匹配模型的鲁棒稳定蒸馏方法
提出均值流蒸馏框架,抑制高频优化噪声,保证轨迹一致性,实现高维流匹配模型高保真单步生成。
P3D-Bench:用于参数化3D生成与结构推理的多模态大语言模型基准测试
P3D-Bench评估MLLM参数化3D生成,发现装配最难,模型全局形状可但参数精度和部件建模不足。
IDEAL: 深度对齐实现离散表示自编码器
通过深浅层VFM特征联合对齐,提升离散视觉token保真度与语义,ImageNet重建rFID 0.61,生成gFID 1.89创SOTA。
U-TTT:通过测试时训练实现泛化性PET图像去噪
U-TTT利用测试时训练和双域自适应机制,动态调整参数,提升PET去噪在分布偏移下的泛化能力。
FADA: 通过选择性蒸馏的统一视觉-语言模型实现可及的胎儿超声解读与标注
FADA统一视觉-语言模型,通过选择性蒸馏实现胎儿超声解读、检测与分割,无需外部标签,可在消费GPU和手机部署,提升资源有限地区诊断可及性。
ARM:一种统一离散表示的自回归大型多模态模型
ARM通过离散语义分词器和强化学习,统一了图像理解、生成与编辑,实现跨任务协同提升。
连续神经重参数化作为鲁棒固定图表UV修复的深度几何先验
提出连续神经重参数化框架,结合多种几何先验,实现固定图表UV展开零翻转,鲁棒性优于传统方法。
Next Forcing:基于多块预测的因果世界建模
提出多块预测框架,加速训练收敛、提升高帧率精度,实现2倍推理加速,刷新多项基准。
论扩散编辑中的可控性与保真度前沿
研究扩散编辑中控制与保真度的权衡,提出理论界与算法,实验揭示身份漂移等失败模式,讨论伦理安全。
草图到布局:一种面向人的约束感知模块化光生物反应器计算合成代理
提出模块化光生物反应器立面系统,用草图驱动布局合成(约束满足)结合弱监督健康监测,实现近实时制造就绪配置。
SPARX:面向边缘RISC-V SoC的安全与隐私感知近似CNN加速
SPARX集成RISC-V指令扩展与近似CNN加速,ILM乘法器面积降51.7%、功耗降81.5%、吞吐提2.13倍,精度降2.82%,FPGA能效58.4 GOPS/W。
MinhwaNet:韩国民俗画中忠实但不足的对象定位
韩国民俗画中,对象定位虽忠实但不足以预测题材,题材由符号排列而非出现决定。
GHOST: 用于机器人操作泛化的分层子目标策略
GHOST通过分层子目标策略和空间接口,提升机器人操作泛化性,并利用人类演示快速适应新任务。