PatchDenoiser:面向低剂量CT成像的参数高效多尺度补丁学习与融合降噪器
轻量多尺度补丁降噪,用极少参数与能耗,保留细节并超越CNN/GAN,提升低剂量CT图像质量。
RA-Det:基于鲁棒性不对称性的AI生成图像通用检测
发现鲁棒性不对称:自然图像对扰动稳定,生成图像漂移大;提出RA-Det,跨模型通用,平均性能提升7.81%
Context-measure:面向伪装的情境化度量
提出情境度量基于概率相关框架增强真值上下文关联解决维度与范围缺陷更合人类感知全面超越现有伪装分割指标
Calibri:通过参数高效校准增强扩散变换器
扩散变换器加一个缩放参数即可提升性能;Calibri用进化算法优化约百参数,增强文生图并减少推理步。
深度专家注入:以领域知识锚定视网膜视觉语言模型
提出深度专家注入,锚定视觉证据,弥合感知与推理差距,眼科问答超越专有系统,达到最先进精度。
临床图介导蒸馏用于非配对MRI-CFI高血压预测
临床图介导蒸馏:构建跨队列kNN图,将MRI高血压知识迁移至眼底模型,提升非配对预测。
LiDARDraft:从多种输入生成激光雷达点云
提出新方法,以三维布局为桥梁,统一文本、图像和点云,生成可控激光雷达点云,实现从零仿真。
SMSP:多模态大模型感知视觉错觉的即插即用多尺度感知策略
提出SMSP即插即用策略,抑制高频背景干扰,提升多模态大模型视觉错觉感知,准确率13%→84%
情境中的动觉挖掘:通过文本到运动蒸馏实现少样本动作合成
提出上下文动觉挖掘框架,利用文本嵌入实现少样本动作合成,使识别准确率提升二十三点一个百分点。
穿行画作:基于互联网先验的自我中心世界模型
提出自我中心世界模型,利用互联网先验将视频扩散转为可控预测,结构一致性提升六成五,泛化至画作内导航操作。
无轨道泄露留出自验证用于摄影测量重建:协议、灵敏度与极限
提出无轨道泄露留出协议衡量内部几何一致性,而非绝对精度,无法替代控制点评估或通用粗差检测。
MorphUNet:基于扩散的人脸变形攻击的Alpha控制生物特征传输
MorphUNet首创扩散变形框架,通过α控制双交叉注意力分离双亲特征,实现高攻击潜力和难检测性。
基于梯度的潜在分解揭示弱监督乳腺摄影中特征退化机制
弱监督模型粗特征保留而细粒度退化,因仅4.4%潜在变量对齐监督信号,病理依赖脆弱残差子空间。
伤害并非普遍存在:社区特异性毒性检测亟需
通用毒性检测对边缘化社区无效,亟需社区特异性检测;零样本F1低于随机,改进后仍远不及通用水平。
Mage-VL:高效的编解码器原生流式多模态基础模型
采用运动向量和残差能量选择性编码,减少75%视觉token,双系统架构实现高效流式多模态感知与推理。
DisasterTD: 利用多模态大语言模型与跨视角地理定位的灾难地名消歧
DisasterTD整合MLLM与跨视角匹配消歧模糊地名,灾害定位精度达71.62%(1000米内),误差降至11.33km。
PerceptionBench:评估多模态大语言模型中的原子视觉感知能力
新基准PerceptionBench揭示多模态大模型原子视觉感知准确率均低于60%,感知错误为最弱能力。
实现轻量级检测Transformer的全整数推理
首个全整数轻量级DETR,三大组件实现整数推理,模型大小减3.6倍,计算成本降一个数量级。
统一主动学习与半监督学习用于医学图像分割
提出RegAL统一主动半监督框架,以拓扑感知帕累托优化选择边缘注释并超声增强,少标注下超越现有方法。
Diff-ID:基于扩散模型的保持身份一致的人脸图像生成与形变
Diff-ID用双交叉注意力适配器和伪判别器损失,在保持身份一致的同时生成高保真人脸,FID和FIQ权衡优于现有方法。
OPERA:离线策略引导的专家路由与自适应通用生物医学图像分析
OPERA通过离线策略学习专家路由与测试时自适应,无需重训练即可提升多模态生物医学图像分析的性能与校准质量。
IMPRINT:面向长尾物体目标导航的图像条件化查询增强
用互联网图像增强查询,零样本提升长尾物体定位与导航,无需训练,增益受下游检测质量制约。
CD-RMOT-Bench:跨域指代多目标跟踪基准
构建跨域指代多目标跟踪基准,揭示域移严重破坏语言引导的时域关联与目标选择,并给出QCA强基线。
FIDAC:一个从视频中提取和解释人际距离的易用流水线
FIDAC是开源库,融合多种面部检测模型,从视频提取并分析人际距离,含跟踪优化与深度校正工具。
LENS:长视频中关键帧采样的自适应时空缩放
动态分配帧预算,自适应切换空间细节与时间上下文,将Video-MME准确率提升7.4个百分点。
OpenPVMapper:法国屋顶光伏系统多源全国数据库
法国多源屋顶光伏数据库OpenPVMapper,聚合深度学习与开放数据,含113万安装点,精度约75%,开源发布。
LGFNet:CTC引导的局部-全局融合框架用于单通道睡眠分期
提出LGFNet框架,融合局部全局特征与CTC引导训练解码,跨数据集表现优异,显著提升N1分期准确率。
OrganLens:面向CT基础模型的器官特异性表示学习
OrganLens通过自监督学习,无需外部掩码即可生成11个器官特异性表示,显著提升心脏肿大和肺癌死亡率预测等任务性能。
WHTMix:基于沃尔什-哈达玛令牌混合的高效立体深度估计
用沃尔什-哈达玛令牌混合替代自注意力,在保持精度的同时大幅降低计算与延迟,适合高分辨率立体匹配。
ObliCity:屋顶到地面投影位移校正的基准与基线
ObliCity数据集及DragRoof方法显式提取屋顶-足迹偏移矢量,实现SOTA几何校正。
FORGE:长视频理解中的相关性几何框架正交性
FORGE无需训练,通过引导嵌入空间查询条件几何,统一相关性与多样性,选出最大信息帧集,显著提升长视频理解准确率。
平衡软混合专家模型用于青光眼检测
提出平衡软混合专家模型,采用三专家与负载均衡损失,在青光眼检测AUC上超越现有模型,并可推广至其他疾病。
医疗世界模型:可信赖临床转化的基础、应用与挑战
本文综述医疗世界模型的概念与四大能力,当前研究多为回顾性,临床转化需克服因果识别、不确定性及前瞻验证等挑战。
ScaleResfusion:基于残差向量场的残差整流流
提出ScaleResfusion,利用残差整流流适配预训练扩散模型,从带噪低质图像高效恢复高质量图像,达SOTA。
MEDit-Bench:用于评估消息驱动叙事视频编辑的数据集
提出MEDit-Bench数据集,评估消息驱动视频编辑,发现模型在严格阈值下显著落后于人类专业编辑。
FunnelAL:面向单类发现的检索后排序主动学习
FunnelAL采用检索-排序-探索级联架构,高效实现单类发现,取得最佳F1与标注效率,且抗噪声能力强。
用眼睛感知:广告中的感觉生成与理解
首次提出感官广告数据集、分类与评估指标,以及多智能体生成框架,奠定视觉感官说服基础。
CLBench-V:评估从情境基础到知识获取的多模态情境学习
CLBench-V基准评估多模态情境学习,涵盖情境基础、新信息应用与新知识学习三个维度,最优模型得分仅0.2847,表明该领域远未饱和。
用于无人机高光谱PFM-1地雷检测的人在回路特征自举方法
采用人在回路特征自举,仅需9次候选检查即可确认所有目标区域,远优于需数千次检查的SAM变体。
超越背景偏见:基于显著性的原型对齐用于数据集蒸馏
提出显著蒸馏框架,用Grad-CAM构建类别判别原型并细化,提升蒸馏数据集质量与泛化性。
HOME:面向结构化与无纹理视频的鲁棒霍夫空间匹配方法
提出超轻量免训练霍夫空间极值匹配框架,实现结构化场景高效鲁棒配准,速度远超线特征方法。
用于少样本涂鸦标注的医学图像分割的双层协作学习
提出双层协作学习框架,通过上下层双向交互与结构先验生成伪标签,显著提升少样本涂鸦监督分割精度。
高光谱图像内在分解:非朗伯场景下反射率与光度成分的联合恢复
提出双尺度分解方法,实现非朗伯场景高光谱反射率与光度成分的完整盲分解,并构建首个真实数据集CITE。
高效剪切-扭曲可视化的高斯体积表示
提出高斯体积表示,用稀疏监督实现高效剪切-扭曲可视化,达43.86 FPS和11.31:1压缩比。
土堤砂沸分割中基于逐架构校准的无泄漏交叉验证堆叠
提出无泄漏堆叠框架消除数据泄露,砂沸分割IoU达0.718,但堆叠未优于单模型,并引入零成本掩膜合成。
RDVSv2:大规模RGB-D视频显著目标检测基准
提出含249序列的RGB-D视频显著目标检测基准RDVSv2,基于SAM2建立强基线,更具挑战性且达最优。
无噪声一步LoRA:利用扩散先验的任务驱动图像恢复
提出无噪声一步LoRA结合扩散先验实现任务驱动图像恢复,超越多步方法;引入任务保持GAN提升质量。
PanoLess:从局部反射视角重建环境环境
PanoLess从反射表面单侧图像重建环境光照,利用高斯泼溅和神经立方体贴图,实现局部视角下一致光照估计,效果更优。
迈向可靠的染色转移:基于多模态专家引导评估的迭代数据-模型协同优化框架
提出DMCoStain框架,迭代优化数据模型,结合多模态专家引导评估,实现染色转移SOTA准确性,兼具评估功能。
ANFI:重新审视行人重识别中的邻居特征交互
ANFI方法通过建模亲和与差异关系自适应加权,抗噪声邻居,提升行人重识别鲁棒性。