ETHEREAL:面向边缘高分辨率视觉的25.6微秒/推理低延迟事件驱动图神经网络处理器
首款事件驱动图神经网络处理器,用邻居并行样条卷积与分体存储,实现25.6微秒延迟和1.6微焦/推理。
3D高斯加速光线追踪:基于粒子的反向传播实现快速训练
3DGART以图元为中心反向传播,消除原子竞争,加速3-3.5倍,使光线追踪高斯训练实用化。
平滑亲和矩阵如何影响t-SNE中的邻域保持
研究t-SNE亲和矩阵锐化/平滑对邻域保持的影响,提出行向幂变换,发现锐化改善最近邻,平滑改善中局部邻域保持。
RADmesh:重网格感知的网格变形
提出重网格增强的网格变形方法,抗视觉噪声,支持大变形与局部细节,提升三角网格质量与效率。
MagViT:面向乳腺组织病理学的可解释多倍率Transformer与患者级模型选择
MagViT:可解释多倍率Transformer,尺度门控融合与患者级模型选择,乳腺病理分类精度高、泛化强。
aDSL:智能体与程序协同设计的智能体3D创作
提出智能体专用语言aDSL与多智能体系统,协同设计提升3D程序生成的鲁棒性和可控性,优于现有基线。
ORViT-DR:面向低分辨率糖尿病视网膜病变分级的序数鲁棒混合视觉Transformer
低分辨率视网膜分级中,混合CNN-Transformer模型准确率57%,验证其处理有序分级任务有效
利用仅幅度与复数测量结合学习先验改进动态MRI重建
提出C+Mag,利用k空间幅度辅助动态MRI重建,ADMM展开解决幅度约束,改善伪影、清晰度与相位保留。
淋巴瘤PET/CT影像深度学习检测与量化评估综合框架:临床洞察、陷阱及观察者一致性分析
提出淋巴瘤分割评估框架,测试四网络,发现小病灶难检测,与专家表现相近,提升临床适用性。
CKAA:跨子空间知识对齐与聚合实现稳健持续学习
提出CKAA框架,通过对齐子空间特征与自适应聚合任务知识,增强持续学习对误导任务ID的鲁棒性,性能优于现有方法。
通过动作单元的时间分析探索抑郁症检测的面部生物标志物
研究面部动作单元与情绪,发现抑郁组悲伤/快乐强度差异显著,支持面部分析用于抑郁评估。
优化你的采样:基于贝叶斯优化的扩散采样调优
提出OYS,用贝叶斯优化直接优化采样时间步,无需训练,5步可达50步约90%质量,推理成本降10倍。
无监督动态对比增强MRI重建的基元表示学习
提出多维基元框架,分离解剖、动态增强与运动为时间基函数,实现无监督重建,性能媲美传统方法。
级联多尺度注意力用于低分辨率图像增强的多尺度特征提取与交互
提出级联多尺度注意力(CMSA),集成于CNN-ViT架构,无需下采样即可提取融合多尺度特征,低分辨率下姿态估计性能提升且参数更少。
接缝裁剪作为CNN中的特征池化
用接缝裁剪替代最大池化作特征池化,在鸟类数据集上性能更优,保留更多结构信息,并讨论局限与未来方向。
基于量热计图像的端到端夸克-胶子喷注分类视觉Transformer
系统评估视觉Transformer及混合模型,在CMS开放数据上分类夸克-胶子喷注,性能优于CNN基线。
CoSeP:基于类可分性聚类的互补可分离性剪枝
提出基于类可分性聚类的互补剪枝方法,自动确定剪枝比例,提升精度并大幅降低计算量。
基于多尺度光谱注意力模块的自动驾驶场景高光谱分割
提出MSAM模块用于UNet跳跃连接,自动驾驶高光谱分割mIoU+2.32%,mF1+2.88%
探索遥感中的高效开放词汇分割
建立统一基准,提出RSKT-Seg,融合多方向成本图与知识迁移,mIoU提升3.8,推理快2倍。
用于卒中诊断的低剂量CT:便携式神经影像的双通道深度学习框架
低剂量CT卒中分类:直接分类优于先降噪,最高AUC0.937;重建质量提升未改善分类。
UrbanWorld2.0:面向城市尺度真实感三维生成的多模态智能体框架
提出UrbanWorld2.0多模态智能体框架,利用多种基础工具生成高保真城市级3D世界,通过迭代自反思减少误差,感知质量胜率达86%以上。
文字中的细胞构筑:人类脑显微图像的弱监督视觉-语言建模
提出检索-增强监督弱监督法,无需图文对,耦合脑细胞构筑视觉模型与语言模型,生成描述并预测脑区。
无监督深度生成模型用于神经影像异常检测:系统范围综述
综述33项研究,评估无监督生成模型在脑MRI/CT异常检测中的潜力与挑战,指出异质性及验证不足等问题。
面向驾驶场景生成的风险可控多视图扩散
提出风险可控多视图扩散方法,结合物理风险建模,生成驾驶场景,显著提升3D检测精度与视觉质量。
从扩散到流:MotionGPT3中的高效运动生成
MotionGPT3中整流流比扩散收敛快、采样少、质量更优。
Know3D:利用视觉-语言模型知识引导3D生成
提出Know3D框架,注入多模态大模型隐状态,传递语义知识至3D生成模型,实现背面视图的可控生成。
视觉语言增强的半监督医学图像分割基础模型
提出视觉语言增强的半监督分割助手,以模板引导伪标签,在极低标注下提升精度,超越现有方法。
世界基准:通过隔离物理概念评测世界模型的物理理解
世界基准通过隔离物理概念的视频测试,逐项评估物理理解,发现现有模型在具体物理概念上缺乏一致性。
眼周软生物特征:综述及其在多媒体取证与虚假信息检测中的应用
综述眼周软生物特征的人口统计属性估计,涵盖数据集、方法、应用与挑战。
DeCo-MIL:面向长尾全切片图像分析的去偏反事实推理
提出DeCo-MIL,通过频率去偏反事实推理联合缓解内外双层长尾,提升罕见类识别与整体分类性能。
Xemo-Talker:音频驱动说话人肖像合成的显式情感解锁
提出Xemo-Talker,基于次主成分监督与三元损失,实现显式情感控制,兼顾唇形同步和最优情感分类精度。
平衡强迫:无需噪声条件化的自适应视频生成
平衡强迫(EqF)无需噪声条件,解耦去噪学习与采样,闭环自适应推理,提升视频生成质量与一致性。
深度学习图像分类器超参数优化中的交叉验证研究
小样本医学图像分类中5折交叉验证比固定或重排留出法更可靠其超参数优化估计误差更低推荐使用
深度模拟:基于参考条件三维查找表的开放集胶片仿真
提出基于参考条件三维查找表的开放集胶片仿真:以残差预测单表规避门控崩溃,自监督训练,高效实时。
Local Gains and Fixed-Assignment Set Losses in Shared Set Decoders
PE-CSNet:基于可学习补丁稀疏表示的等变网络架构
提出PE-CSNet,以可学习补丁稀疏表示和等变展开网络重构信号,经块坐标下降求解,随机等变训练省数据,CS-MRI等任务精度领先。
Path2ST:基于层次化细胞-组织的空间转录组跨模态翻译
Path2ST以层次细胞-组织条件与尺度自适应生成,实现H&E到空间转录组精准翻译。
VideoGAIA:面向通用AI助手的智能体视频理解基准
VideoGAIA是智能体视频理解基准,要求多轮调用工具整合证据,当前最强模型准确率不足六成,推动视频理解迈向智能体化。
从密集预测到视觉编辑:统一图像与视频生成的结构化监督
将深度与法向预测作为结构化监督,统一图像视频生成,提升编辑局部性与保真度。
用于多视角视网膜眼底成像中风检测的编织视觉变换器
提出编织视觉变换器(BViT),用于多视角视网膜眼底成像的中风检测,捕获跨眼关系,AUC达0.75。
Low Cost Two-Stage Fabric Defect Detection at the Edge
隐私保护的吉隆坡城市交通数据集构建:基于空间车辆上下文过滤的视觉-语言检测
提出自动匿名化框架,结合Grounding DINO与车辆区域过滤,在吉隆坡复杂交通中实现95%隐私遮蔽成功率,保留场景上下文。
AeroGround:空地协同推理的综合基准
空地协同推理基准:2.9万组数据、2250问答,最佳准确率54.4%,人类93.3%,揭示模型局限。
视觉生成式人工智能时代的知识产权保护:综述
本文综述视觉生成式AI的知识产权保护,提出二维分类法,涵盖控制逻辑与资产维度,并探讨挑战。
CNN是否在内部以不同方式表征真实与虚假图像?隐藏层分析
研究发现CNN隐藏层对真实与虚假图像的激活模式存在差异,且非仅由图像退化导致,或可助力虚假图像检测。
面向因果充分可解释性的空间注意力噪声掩膜
提出空间注意力噪声掩膜法,动态掩膜输入图像,生成因果特征归因图,提供充分特征解释,性能接近基线且稳健
迁移学习用于阿尔茨海默病特异性识别的前瞻性方法综述
综述迁移学习在阿尔茨海默病诊断中的应用,结合可解释AI,强调其提升小样本下的准确性。
一种基于视觉Transformer的多中心心电图左心室收缩功能障碍检测方法
视觉变换器基于12导联心电图检测左室射血分数降低,外部验证AUROC 0.88,可作为常规分诊工具。
人工智能作为打击童工的工具:用于儿童检测与年龄估计的实时边缘视觉流水线
实时视觉流水线可监测童工,检测儿童并估计年龄,性能优于基线,但需数据保护与人工复核。
超越边界噪声:聚合偶然不确定性无法捕获3D肺结节分割中的存在性模糊
熵基偶然不确定性仅反映边界噪声,无法捕捉病变存在性模糊;监督头优于熵聚合,提示勿用作临床模糊代理。