鲁棒人脸超分辨率与识别:扩散模型中的多特征聚合
提出FASR++扩散模型超分辨率算法,利用多特征聚合减少身份失真,显著提升人脸识别性能,达到最优效果。
场景图思维:强化多模态大语言模型的结构化视觉推理
提出场景图思维范式,通过场景图表示与两阶段对齐训练,显著增强多模态大语言模型的细粒度结构化视觉推理。
DeSeG:解耦语义意图与几何约束以实现物理合理的人-场景交互
DeSeG框架解耦语义与几何约束,残差语义规划器与物理正则化扩散执行器协同,减少穿透47%,提升语义对齐29%。
图像分类与血管分割在基于AI的肯尼亚早产儿队列早产儿视网膜病变Plus疾病筛查中的互补作用
肯尼亚早产儿ROP Plus检测中,图像分类与血管分割互补,分类敏感但过度转诊,分割提高特异性,组合方法平衡性能最佳。
LEGATO 2:迈向多模态乐谱识别与理解
新型乐谱识别流水线,首推按行处理的OMR模型,生成含文本的符号转录,显著提升精度与理解。
Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective
ARMS: 锚定-关系运动流,实现无缝的独处-社交运动转换
提出ARMS框架,通过因果扩散模型统一独处与交互运动生成,实现长时序下平滑且社交一致的状态转换。
SAMPLe:基于SAM的视觉语言模型提示学习优化器
SAMPLe采用锐度感知最小化,动态平衡探索与利用,减少过拟合,提升提示学习泛化性。
回答前先分割:用于多模态大模型视觉推理的像素级定位
提出SegAnswer方法,用像素级分割掩码代替边界框,精准隔离目标区域,提升多模态大模型视觉推理性能。
通用视频编码中的优化自适应环路滤波器
提出ALF优化框架,实现并行设计及单次CCALF,减少缓冲区访问并节省25%时间。
Image2Sim:通过生成式神经模拟器扩展具身导航
Image2Sim从RGB-D图像构建大规模交互场景,训练导航模型实现零样本迁移真实世界。
TRIG:轨迹-刚体解耦的度量几何学习
TRIG将相机位姿分解为轨迹与刚体,分别建模自我运动和静态拓扑,稀疏时空注意力降低成本,在多项基准上达最优。
基于横截面块自一致性的解耦单掩膜标注噪声检测
提出解耦框架,利用横截面块自一致性检测单掩膜标注噪声,生成可解释证据,验证了冠状动脉CT数据中的系统偏差。
真实感复合透镜散焦模糊合成
提出合成真实感散焦模糊数据的管道,生成CLDefocus数据集,训练模型跨设备泛化性更优。
Few-Medoids:一种用于小样本知识蒸馏的极其简单的核心集选择方法
提出Few-Medoids方法,通过选取每类最接近质心的样本,在小样本知识蒸馏中持续超越随机基线,简单有效。
AVA-VLM:面向野外施工现场监测的自适应视觉注意力-视觉语言模型
提出AVA-VLM模拟人类先粗后细推理,低分辨率全局推理后选择性裁剪高分辨局部,提升可靠性并降低计算。
通过生成性随机化和跨变体自监督学习打破虚假相关性
提出两阶段框架:生成上下文偏移变体,利用跨变体自监督学习对齐对象表示,抑制背景虚假相关,提升分布偏移下最差组性能(Waterbirds 92.5%)。
Harrison.Rad 1.5技术报告:一种能够根据图像、既往资料和临床背景起草报告的放射学基础模型
HR1.5放射学基础模型,唯一通过模拟FRCR标准,在X光报告和临床问答中准确率最高,并具备可解释性。
GaussFusion:迈向多模态三维高斯预训练
提出多模态3D高斯预训练框架,融合图像与文本监督,通过显著性引导掩码提升表示迁移性,超越现有方法。
PolicyShiftGuard:策略自适应图像护栏的基准测试与改进
提出PolicyShiftBench和PolicyShiftGuard,两阶段训练提升策略自适应,7B模型达SOTA,平均F1 76.9、PSS 72.1。
逐步推理与原始修正的组合零样本学习
提出PRPC框架,通过逐步推理和双向修正建模属性-对象依赖,实现组合零样本学习最优性能。
NegROI: 基于点击中心不确定性引导与场景条件负提示的鲁棒交互式3D分割
提出NegROI框架,以点击为中心多分辨率细化结合场景条件负提示,减少假阳性,提升跨数据集鲁棒性。
中文标题:不可学习的面孔:抵御提取管道的隐私保护
中文摘要:提出LPID方法,将提取过程融入不可学习目标,在裁剪缩放提取下保持保护效果,攻击者准确率低于10%。
SpecTrack:光谱提示引导的自适应专家多光谱目标跟踪
SpecTrack提出光谱自适应专家混合模块,根据搜索区域复杂度动态分配容量,实现高效精准的多光谱目标跟踪。
使用聚类、分类和大语言模型从房地产文档中提取结构化数据
提出端到端管道,结合聚类、分类和DeepSeek R1模型,从3965份文档中成功提取35个属性,生成2766条记录,验证了可行性与可靠性。
OBBSeg:有向边界框标注下的不规则病变分割
OBBSeg利用有向边界框进行中间监督,通过损失函数与提示模块,实现媲美全监督的弱监督分割。
KOAL:知识驱动的序数感知前列腺癌分级
提出KOAL框架,融合临床变量和LLM专家知识,通过序数感知学习实现前列腺癌分级,性能最优。
提出与关注:基于多标记局部注意力的免训练多模态大语言模型定位置信度
提出MTLA,通过测量预测标记对声称区域的注意力强度,显著减少幻觉并提升定位置信度,零样本检测AP近乎翻倍。
为什么深度学习能改进视觉SLAM?
深度学习提升视觉SLAM的关键在于学习到的2D数据关联与不确定性,而非循环架构。
SparseCtrl-HOI: 面向人-物交互视频生成的稀疏时间控制
提出稀疏时间控制框架,仅需关键帧和运动先验,降低标注成本,生成高质量交互视频。
PVCap:通过PseudoCap和VoxelCapNet实现精确的3D密集字幕描述
提出PVCap,用PseudoCap数据增强与VoxelCapNet体素网络,提升3D密集字幕描述性能,超越现有方法。
MSA-DCNN:一种数据高效的多尺度可变形CNN用于医学图像分类
提出MSA-DCNN框架,通过自适应多尺度采样与自蒸馏,在少量标注下高效分类医学图像,性能领先。
从检测器条件可达性视角重新审视场景图生成
从检测器条件可达性分析预测行为差异,提出双查询融合机制以利用互补线索。
RoME:针对多种对抗扰动的鲁棒低秩专家混合模型
RoME提出低秩专家混合模型,利用双尺度门控和威胁引导多样化,解决多扰动对抗训练中的鲁棒性权衡,提升联合鲁棒性与自然准确率。
EcoVision:基于AI的无人机成像用于盐沼植被监测与优势度制图
利用Transformer分割和ConvNeXt分类,无人机RGB图像实现盐沼植物高精度识别与优势度制图,误差<8%。
WebRetriever:面向高效Web代理评估的大规模综合基准
WebRetriever涵盖800网站、1550任务,提出NavEval评估框架与三协议,全面诊断Web代理能力。
免调参潜在扩散模型实现超高分辨率图像编辑
UltraDiffEdit免调参将扩散模型扩展至8K编辑,多尺度渐进融合确保细节与一致性。
RFHNet:面向大规模细粒度食品图像检索的关系与频率感知哈希网络
提出RFHNet,通过关系建模、多频融合和层次协同,生成判别哈希码,在食品检索中mAP提升4.44%-17.20%。
AEGIS: 一种机制引导的防御方法,用于抵御文本到图像模型中的视觉同义词越狱攻击
提出AEGIS防御框架,通过识别并引导脆弱注意力头,有效抵御视觉同义词攻击,兼顾安全与保真度。
利用全局蓝图引导和布局控制的高分辨率艺术画作外延生成
提出全局蓝图引导的两阶段扩散框架,实现布局可控高分辨率画作外延,并行合成降耗时。
通过迁移学习增强建筑自动化焊接机器人的焊缝分割:解决双边分割网络的局限性
基于迁移学习的焊缝分割框架提升反射鲁棒性,Joint IoU提高22.36%,恢复96.33%零IoU失败,适用于轻量实时焊接机器人。
MobileWan:弥合移动视频扩散的质量差距
MobileWan首个将5B参数视频扩散模型部署至手机,通过循环蒸馏和压缩实现高质量、低延迟视频生成,VBench得分83.79创纪录。
Visual graphs for image classification: does the structure affect performance?
用于细粒度图像识别的视觉-语言模型中的结构化压缩提示调优
提出结构化压缩提示调优,通过语义关系编码与压缩损失增强语义对齐,在细粒度识别中取得最优性能。
PhyMRI-SR:迈向物理感知的MRI图像超分辨率
提出物理感知超分辨率法,动态处理分辨率,结合先验与物理约束,实现最优MRI重建。
VendorBench-100:深度伪造图像检测的统一跨范式基准
提出VendorBench-100基准,评估36个模型,发现商业API最优,但指标分歧(MCC与AUC)是核心发现。
MAC-XA:基于X射线血管造影的冠状动脉狭窄报告的多视角解剖对应融合
提出对齐约束多视角融合方法,利用合成数据学习解剖对应,提升狭窄报告一致性与评估质量。
不完全多视图聚类的直路径流匹配
提出直路径流匹配替代扩散模型,结合视图补全与聚类对齐,实现不完全多视图聚类新SOTA。
AlayaWorld:长时序且可玩的视频世界生成
提出AlayaWorld全栈开源框架,支持实时交互与多样动作,统一生成世界开发流程,奠定基础。
EeveeDark:面向低光视频增强的事件引导传感器级融合二值神经网络框架
EeveeDark融合RAW与事件流,用二值神经网络实现低光视频增强,性能优于先前BNN方法且兼顾效率。