CoinVE-200K:面向组合式指令引导视频编辑的大规模高质量数据集
提出大规模高质量组合指令视频编辑数据集含1080p配对2-5种原子操作并配套基准与22B模型
SpurCon:加权监督对比学习缓解医学影像中的虚假线索
提出SpurCon,基于元数据与预测伪标签加权对比学习,重塑表征以减轻虚假相关,在多个医学数据集上提升最差组与整体准确率。
PathoArgus:在千兆像素全切片与多切片病例情境中推进基于证据的长上下文视觉推理
提出病理推理基准与证据四元组,揭示高准确率不等于证据可靠;仅靠更多上下文不足,须转向证据导向评估。
RetiWave-Mamba:基于多尺度上下文与频率自适应Mamba投影器的双流视网膜疾病检测网络
提出RetiWave-Mamba双流网络,利用小波分解与Mamba投影抑制噪声、精准定位病灶,OCT-C8准确率达98.25%。
用于流匹配模型快速视频生成的幅度-方向解耦方法
提出幅度-方向解耦法:轻量模型校准方向替代原模型,复用幅度信息加速视频生成,高达2.95倍加速且保质量。
MaLViL:用于医学图像分割的多轴低秩视觉LSTM
提出MaLViL,将视觉LSTM扩展到解码器各分辨率,采用低秩子空间与跨方向混合,内存降83倍,医学分割达先进水平。
超越光栅化速度的可微分沃罗诺伊光线追踪
可微分沃罗诺伊光线追踪以超越光栅化速度实时渲染,支持多种相机效果。
去噪方差剪枝与最优脑偏置补偿
去噪方差剪枝与最优脑偏置补偿,用随机矩阵滤除协方差噪声,闭式更新权重免训练,半剪枝保留九成以上精度。
Haar 足够吗?探索 Symlets 与 Coiflets 用于小波卷积层
小波卷积中,Coiflet 基以更长滤波器减少分解层数,用更浅层匹配 Haar 深层精度,节省约 32% 参数和 33% 计算量。
环境不变子空间学习用于可泛化深度伪造检测
提出环境不变子空间学习(EISL),解耦伪造特征与环境干扰,提升深度伪造检测跨域泛化能力。
基于卫星图像时间序列监测牧场恢复:警示与机遇
首次将牧场恢复建模为二分类,用卫星时间序列达0.88精度,强调需控制时间混杂偏差。
DistillPath:一种高效的2200万参数蒸馏病理编码器,性能逼近大型基础模型
DistillPath-KS16以2200万参数蒸馏大模型,在EVA等基准上逼近顶尖,速度快25倍。
基于概率检出理论的钢桥AI视觉裂缝检测评估
提出基于概率检出曲线的统计评估框架,量化裂缝检测性能与不确定性,验证AI方法在钢桥检测中的稳健性与实用价值。
DynaForcing:克服流式虚拟人生成中自强制蒸馏的动态坍缩
提出DynaForcing,解决自强制蒸馏动态坍缩,采用混合强制、动态奖励与参考扰动,恢复动态并提升口型同步质量,降低GPU开销。
模拟仪表读数的视觉语言模型:专化、迁移与可靠性的实证研究
微调视觉语言模型直读模拟仪表,误差最低2.39%;但迁移性能下降,模糊干扰最强,高置信错误仍可能出现。
利用合成数据训练热成像无人机检测
提出合成优先训练策略,结合真实微调,少量真实数据即可缩小域差距,语义对齐比模型规模更关键。
尺度至关重要:跨物种三维植物器官分割的自适应粒度选择
提出AGS-PlantSeg,用冻结基础模型与自适应粒度选择,动态选优,跨物种3D分割平均mIoU达88.9%,超固定粒度2.5点,少样本媲美全监督。
TINA+:通过扩散一致的无文本反演探测被遗忘扩散模型中的残留视觉知识
基于扩散一致无文本反演,TINA+揭示现有擦除法仅切断文本-图像链接,而非消除残留视觉知识。
GenRec:知晓何处重建与何处生成
GenRec用观测掩码区分可见与不可见区域,明确重建与生成分工,提升稀疏视图合成质量。
双协同训练:极端数据稀缺下的跨数据集超声舌体分割
源免域适应框架,精炼伪标签与合成增强,显著提升超声舌体分割精度。
PerFact:基于感知派生事实提示的3D脑MRI报告生成
3D脑MRI报告生成中,模型规模非关键,感知派生事实提示(PerFact)决定质量,无需真值即可超越检索方法。
超越器械运动:面向手术技能评估的组织张力识别
提出组织张力识别任务与SurgTension数据集,轻量TensionTRAC框架高效建模,推动手术技能客观评估。
基于标签条件能量幅度正则化的机器遗忘跨域泛化
提出标签条件能量正则化实现机器遗忘,跨域遗忘效果显著,CIFAR-10上完全遗忘且其余类保留98.5%精度。
SFMformer:用于轻量级图像超分辨率的空间-频率调制Transformer
空间频率调制Transformer,分离稀疏注意选择与聚合,空间增强加小波调制,增益叠加,轻量高效。
LinCa:通过可学习分解特征缓存加速扩散模型
提出LinCa,用可学习可逆网络分解特征缓存并差异化预测,以极低参数开销实现5-7倍加速,质量近无损。
利用生成式监督改进复杂摩尔纹去除
提出生成式监督数据引擎,构建含6.8K对的WildMoiré数据集,有效提升复杂摩尔纹去除效果。
自动目标检测与识别中开箱即用技术的比较研究
比较YOLO与DETR军事目标检测,微调空中视角数据提升小目标性能,但领域内训练仍关键。
CFB-GBM v2.0:用于多模态胶质母细胞瘤分割、影像组学和RANO进展追踪的增强纵向数据集
新发布多模态GBM纵向数据集,GTV勾画完成率97%,含RANO分类及影像组学特征。
AppendiGrade:一种XAI增强的深度学习框架,结合高斯模糊与Grad-CAM对超声阑尾炎进行分级
用超声图像自动分级阑尾炎,优化后准确率95.58%,Grad-CAM可视化解释诊断区域。
GS-Voxel:面向大规模3DGS生成的无拟合结构化潜变量
提出GS-Voxel免拟合框架,将预优化3DGS转为稀疏体素潜变量,支持大规模航拍三维场景生成。
AViTS:用于高效动态分辨率生成的自适应时空令牌选择
AViTS融合潜在文本与跨步时间重要性,选择性上采样关键令牌,最高降9倍计算量,可叠加蒸馏等技术。
记忆树引导的关键帧查询用于高效三维问答
提出记忆树引导的关键帧选择范式,利用可复用的三维场景表示实现高效问答,提升GPT-4o精度17.4%,优于视觉搜索方法。
基于流形覆盖和稀疏特征覆盖的LLM后训练分层数据选择
提出分层覆盖法:稠密自编码器粗分组,稀疏自编码器做质量感知细覆盖,少量数据即可媲美甚至超越全量训练。
基于3D深度学习的ACL止点自动识别
3D深度学习可直接从MRI识别ACL股骨止点,图像法误差2.1mm优于模型法,临床可行,提升重建精度。
深度学术综述:面向学术综述自动化的有状态智能体闭环范式
提出DAS,一个有状态智能体框架用于生成学术综述,配套基准与评估,性能优于现有系统。
重新审视免初始化光束法平差:一项受控实验研究
免初始化BA:低目标函数值不等于有效度量重建,存在优化-重建鸿沟,关键在于获得可稳定度量升级的射影重建。
面向端到端自动驾驶的即插即用交通要素感知
首次系统研究交通要素感知,即插即用集成多种端到端架构,一致提升驾驶性能,并在NAVSIM-v2创SOTA。
EDITBRIDGE:迈向忠实且高效的超高分辨率图像编辑
提出编辑桥扩散框架,以原图引导稀疏注意力,将低分辨率编辑转为高分辨率,实现4K忠实高效编辑,速度提升3.6-8.4倍。
从语料库到协同演进能力:面向通用图像生成的能力中心数据设计
提出能力驱动数据基础设施:三引擎构建互补监督,多阶段课程协同演化,训练扩散模型实现通用图像生成与能力迁移。
Teach and Grow:面向通用机器人学习的智能体中心架构
提出智能体中心架构TGL,将示范转化为可复用技能块,无需重训练即可习得新任务,在LIBERO上达到领先性能。
ETHEREAL:面向边缘高分辨率视觉的25.6微秒/推理低延迟事件驱动图神经网络处理器
首款事件驱动图神经网络处理器,用邻居并行样条卷积与分体存储,实现25.6微秒延迟和1.6微焦/推理。
3D高斯加速光线追踪:基于粒子的反向传播实现快速训练
3DGART以图元为中心反向传播,消除原子竞争,加速3-3.5倍,使光线追踪高斯训练实用化。
平滑亲和矩阵如何影响t-SNE中的邻域保持
研究t-SNE亲和矩阵锐化/平滑对邻域保持的影响,提出行向幂变换,发现锐化改善最近邻,平滑改善中局部邻域保持。
RADmesh:重网格感知的网格变形
提出重网格增强的网格变形方法,抗视觉噪声,支持大变形与局部细节,提升三角网格质量与效率。
MagViT:面向乳腺组织病理学的可解释多倍率Transformer与患者级模型选择
MagViT:可解释多倍率Transformer,尺度门控融合与患者级模型选择,乳腺病理分类精度高、泛化强。
aDSL:智能体与程序协同设计的智能体3D创作
提出智能体专用语言aDSL与多智能体系统,协同设计提升3D程序生成的鲁棒性和可控性,优于现有基线。
ORViT-DR:面向低分辨率糖尿病视网膜病变分级的序数鲁棒混合视觉Transformer
低分辨率视网膜分级中,混合CNN-Transformer模型准确率57%,验证其处理有序分级任务有效
利用仅幅度与复数测量结合学习先验改进动态MRI重建
提出C+Mag,利用k空间幅度辅助动态MRI重建,ADMM展开解决幅度约束,改善伪影、清晰度与相位保留。
淋巴瘤PET/CT影像深度学习检测与量化评估综合框架:临床洞察、陷阱及观察者一致性分析
提出淋巴瘤分割评估框架,测试四网络,发现小病灶难检测,与专家表现相近,提升临床适用性。
CKAA:跨子空间知识对齐与聚合实现稳健持续学习
提出CKAA框架,通过对齐子空间特征与自适应聚合任务知识,增强持续学习对误导任务ID的鲁棒性,性能优于现有方法。