深度网络中的灵活池化与简单辅助分类器
提出FlexPooling自适应池化,通过加权平均整合简单辅助分类器,在图像分类中准确率提升1-3%。
面向鲁棒卫星视频检测器的时间一致性学习
提出TCL框架,利用时序上下文检测定向细粒度目标,SAT-MTB上达47.7% mAP,提升4.8%。
文本驱动的红外与可见光图像融合:在双曲空间实现图像场景自适应
提出文本驱动的双曲空间融合方法,利用文本提示对齐视觉属性,实现自适应场景融合,性能领先。
空间弱目标检测与分割的多视图特征高阶融合
提出多视图特征高阶融合方法,增强弱目标表示能力,即插即用提升检测分割性能。
物理驱动的零样本MRI重建与非局部图像先验
提出物理驱动零样本MRI框架,结合非局部先验与物理一致性,实现高加速因子下最优性能。
RefGC-SR$^2$:参考引导的生成内容超分辨率与细化
提出RefGC-SR$^2$任务,利用原始高分辨率参考图同时恢复细节、去除伪影并放大输出,频率感知扩散模型实现高质量结果。
EyeMVP: 基于配对CFP-OCT预训练的OCT引导眼底表征学习
EyeMVP通过配对CFP-OCT预训练和跨模态重建学习OCT增强的眼底表征,在16项任务上优于现有模型,对黄斑水肿诊断AUROC达0.948,超越初中级医生。
少思早动:视觉-语言-动作模型中带早退的强化潜在推理
提出AVA-VLA,以潜在推理替代思维链,用强化学习去噪+早退,达6倍加速和98.3%成功率。
超越标量距离:来自冻结多模态大语言模型的语义属性梯度用于视觉嵌入
SAGA框架利用GRPO从冻结MLLM提取语义属性梯度训练视觉编码器,零样本检索Recall@1提升3-6点。
MotionVLA:面向人形运动的视觉-语言-动作模型
提出双流频率分词器DSFT和MotionVLA模型,有效分离低频姿态与高频物理信号,实现更逼真的运动生成。
HiRo:一种紧凑型四方向分层储层令牌混合器,用于高效图像分类
HiRo模型以低于1M参数,通过四方向分层储层混合器,在MNIST、CIFAR-10/100上分别达99.46%、85.57%、59.10%准确率。
Enabling Real-Time Point-of-Care Ultrasound Segmentation: A GPU-Free Deployment in Resource-Limited Settings
展示信号,隐藏噪声:像素空间扩散的频谱强制
提出无参时变2D-DCT低通算子Spectral Forcing,分离信号与噪声,提升像素空间扩散模型容量效率及生成质量。
DLWM:用于高效多模态推理的多样化潜在世界模型
DLWM构建多样化潜在世界假设,结合强化学习自适应分配计算,多模态推理准确率提升2-5%,内存减少24%。
GeoStream:迈向精确摄像头控制的流式视频生成
GeoStream通过自刷新3D缓存和全策略蒸馏,实现精确摄像头控制的流式视频生成,有效缓解漂移和反馈循环。
基于小波U-Net的变分网络在欠采样K空间加速MRI重建中的应用
提出小波U-Net变分网络,通过无损下采样保留高频细节,在单/多线圈加速MRI重建中提升质量。
基于标签偏移感知的自适应方法用于CLIP在线零样本学习
针对CLIP在线零样本学习中标签分布偏移,提出LSA方法进行域适应和校正,性能优于现有方法。
基于早期步骤潜在验证的自适应推理时缩放用于图像编辑
提出VeriLatent框架,通过早期潜在验证和自适应搜索,在减少计算量的同时提升图像编辑质量。
牢记于心:以用户为中心的自我中心视频流持续空间智能推理
提出UCS-Bench数据集和DirectMe框架,显著提升多模态大模型在自我中心视频中的动态空间推理与长期记忆能力。
城市景观在望:基于众包的框架从房地产图像中解锁城市尺度窗户景观感知
利用众包和混合神经网络预测窗户景观感知,发现楼层与景观组成(天空、树木、低层建筑)的非线性影响,为城市规划提供依据。
安全相关环境中人类注视与视觉语言模型注意力的比较
研究比较人类与视觉语言模型在安全场景中的注意力,模型能大致识别人类注视区域,无需训练数据。
基于特征级与决策级融合的可信多视图深度学习胎儿先天性心脏病分类
利用五视图超声图像,结合特征级与决策级融合及不确定性处理,实现高精度胎儿CHD分类。
CoMNeT:用于体积脑肿瘤分割的MedNeXt-CorrDiff框架
CoMNeT结合MedNeXt与CorrDiff,实现脑肿瘤精准分割,平均Dice达0.7798,优于基线模型。
聚焦、对齐与维持:对抗增量目标检测中的梯度稀释
提出FAS框架,通过聚焦、对齐和维持梯度流,解决增量检测中梯度稀释导致的性能下降,提升AP超5.0。
SPARK:面向知识蒸馏的空间策略驱动自适应强化学习
SPARK框架用强化学习策略自适应分配蒸馏努力,生成空间权重图调节量化训练损失,提升图像恢复网络性能。
MamBOA:用于视频识别的状态空间架构
MamBOA通过交错扫描结构将状态空间递归用作运动合成器,实现骨干无关心的高效视频动作识别,仅增2.1GFLOPs,Diving48准确率达86.24%。
基于隐式神经形状函数的膝关节X光片无标记点下肢力线对齐评估
提出隐式神经形状函数,无需标志点,直接从膝X光片评估下肢力线,性能媲美传统方法且灵活可扩展。
利用混合深度学习框架增强精准农业中的多类植物病害分类与可解释性
提出ResNet+ViT混合框架,多类植物病害分类精度达98.58%,结合可解释性技术助力精准农业。
G2IA:几何引导的实例感知检索与精化用于跨模态地点识别
提出G2IA框架,通过几何引导的实例感知检索与精化,对齐模态差异,显著提升跨模态地点识别性能。
HemExp: Clinically-Guided Latent Diffusion for Modeling Hematoma Expansion
面向运动红外小目标检测的解耦运动表示学习
提出解耦运动表示学习,显式建模全局相干运动、隐式捕捉局部异常,抑制假警报,提升动态场景检测性能。
面向高效多任务航天器感知的基于分割的检测方法
轻量级MobileNetV3+U-Net通过分割掩码推导检测,SPARK挑战赛总分0.9482、排名第二,验证了星载多任务视觉可行性。
长视频中的条件多事件时间定位
提出长视频条件多事件时间定位基准CoMET-Bench及评估协议,CoMET-Agent框架结构化推理提升[email protected]达6.1%,揭示三大开放方向。
PPDM:面向速度和内存高效的三维医学图像翻译的像素拼图扩散模型
PPDM提出可逆像素拼图算子降低内存,桥扩散从条件输入出发,拼图损失保持连贯,高效实现高保真3D医学图像翻译。
SGFormer++:用于增量式三维场景图生成的语义图Transformer
提出SGFormer++,用Transformer实现3D场景图生成,引入图嵌入与语义注入,增量场景下通过空间适配与级联预测头缓解遗忘,取得SOTA。
DYNA-PRUNER:面向高效可扩展时空媒体预测的输入自适应数据-模型联合剪枝
提出Dyna-Pruner框架,通过数据与模型联合剪枝减少70%计算量,实现2.5倍加速且精度损失<1%。
基于VQ-VAE嵌入的低功耗设备可持续人脸识别
基于VQ-VAE与知识蒸馏,在低功耗设备上实现高准确度人脸识别,降低能耗与网络开销。
面向服务系统的面部情感分析:进展、挑战与未来展望
面部情感分析正从独立任务演变为面向服务系统的可重用感知能力,本文通过系统工程需求审视进展,提出服务组件路线图。
MNet++:面向各向异性医学图像分割的扩展2D/3D网络
复现MNet并提出融合门控与VMamba模块,提升分割性能并保持各向异性鲁棒性,Dice最高达95.8%。
扩散反演中的时间步重调度
基于偏差与时间步的抛物线关系,提出非均匀调度器(全局缩放+局部DP),最小化反演误差,提升重构与编辑性能。
CausalDrive:用于自动驾驶的实时因果世界模型
CausalDrive提出实时因果世界模型,文本控制驾驶社交,12FPS交互,支持闭环评估、RL训练和实时模拟,提升真实交互能力。
视频对象中心学习的选择性协同学习策略
SSync选择性协同学习,线性复杂度伪标签,避免错误传播,提升分解质量与鲁棒性。
迈向全貌:面向小面积移动传感器的累积指纹映射与重建
提出累积指纹映射重建法,整合局部触控为统一指纹,实现单次匹配,提升小面积移动识别效率。
从帧到时间图:基于视觉语言模型的上下文第一人称动作识别
将视频转为时间动作图,利用VLM进行符号推理,少样本和零样本下提升第一人称动作识别,无需微调。
利用稀疏自编码器分析飞机视觉表征
稀疏自编码器可分解视觉模型中间表征,发现与飞机识别相关的部分可解释特征,但存在多义性和定位局限。
Lesion-DDPM:用于多发性硬化MRI合成的病灶增强3D扩散模型
提出病灶加权3D扩散模型,实现脑部FLAIR合成,病灶重建误差最低,分割Dice达0.685。
ST-DiffEye:基于扩散的连续注视生成——联合扫描路径与轨迹建模
提出ST-DiffEye联合扩散框架,利用轨迹与扫描路径互补信息生成注视,引入CRPS评估,实现SOTA性能。
EcoBin:一种两阶段深度卷积神经网络,用于感知污染物的垃圾分类
EcoBin两阶段CNN:先分类后检测污染物,纠正回收错误,性能显著提升。
RaLMPH:全切片图像分类中面向多病理学家协调的可靠性感知学习
RaLMPH通过可靠性场和自适应门控协调多病理学家标注不一致,提升图像分类性能。
Track2View: 通过配对3D点轨迹实现4D一致的相机控制视频生成
Track2View用配对3D点轨迹条件生成4D一致新视角视频,旋转误差降30-65%,平移误差降61-72%,达SOTA。