基于伪标签差异的无标签基础模型选择:面向分布偏移下的医学影像分类
提出无标签选择指标AURCC,利用伪标签差异评估基础模型在跨医院分布偏移下的性能,无需目标域标注,排序准确率与真实排名高度一致。
DEFUSE:基于生成先验的自监督编码器通用后门防御
提出DEFUSE,将后门检测重构为条件扩散模型的似然估计,适用于视觉与视觉语言编码器,减少先验依赖。
InteractGesture:面向连续流式共语手势控制的渐进式分块引导
提出模型无关的推理时空间可控手势生成法,借助可微分解码器与渐进分块引导跨块回传梯度,提升多关节控制精度。
MIMONet:多尺度输入与多尺度输出的显著目标检测网络
提出多尺度输入输出网络,分支交换特征,结合多尺度感知模块与联合损失,提升显著目标检测。
引导采样而非卷积核网格:用于体积分割的几何引导采样算子
提出几何引导采样算子,通过局部方向采样而非变形卷积核,提升体分割边界精度,参数减少。
FlowMoDL:基于模型的深度学习结合共轭梯度数据一致性用于高度加速的4D血流MRI重建
FlowMoDL用展开网络和共轭梯度数据一致性,支持10-50倍加速4D血流MRI重建,优于基线。
社会化检测器学习:异构目标检测器的轨迹引导与互惠蒸馏
提出轨迹引导与互惠蒸馏,沿轨迹渐进整合异构检测器知识并回传,COCO上超出同步聚合2.6 AP,实现类别扩展。
THA-Flow生成模型:基于术前CT的假体几何预测
提出THA-Flow条件流匹配模型,从术前CT生成三维假体几何,为首个生成式AI用于全髋关节置换规划。
TDFNet:面向全景显著目标检测的三投影可变形融合网络
提出首个三投影可变形融合网络,用跨投影可变形注意与纬度引导融合缓解几何失真,提升全景显著目标检测。
超越更多视角:冗余感知的自我-外部融合用于熟练度估计
提出冗余感知融合(AdaMVS+VIB-GB),解决多视角冗余与过拟合,达成熟练度估计新最优。
基于基础模型条件扩散的降水降尺度
研究三种扩散模型条件策略用于降水降尺度,交叉注意力优于简单拼接,基础模型在数据有限时更有效。
LUTSeg:用于溃疡组织分割的纵向多专家数据集
提出纵向溃疡数据集LUTSeg及半监督框架TiSage,低标注下优于基线。
视觉通用智能:白皮书
本文从视觉中心视角探讨智能,研究视觉经验与学习能否通往AGI,提出视觉通用智能(VGI)概念,并讨论其原则、模态、基准与学习范式。
4DGS-WAM:基于4D高斯溅射的物体中心世界动作模型,桥接过去与未来
提出四维高斯溅射物体中心模型,区分动静态物体,复用背景,仅预测动态,高效未来预测。
代码世界模型:编码智能体作为世界大脑
提出代码世界模型:编码智能体为世界大脑,代码维持持久演化,视频模型实现视觉生成。
当组合不成立:人类识别AI生成图像中的缺陷
构建CO-AID数据集,主观标注复杂组合提示下生成图像的缺陷位置与类型,可用于预测及优化生成。
将NDRE轨迹嵌入对比学习,用于无标签、生理感知的作物胁迫分期与DSS输出
EigenCL将NDRE轨迹嵌入对比学习,实现无标签生理感知胁迫分期,跨区迁移且优于基线。
可审计CT表型分析:基于报告衍生放射学观察
CT表型预测准确但可能依赖捷径,ACT模型通过放射学报告识别并修正无效证据,准确率不降。
晚学习,早引导:时间步解耦的语义引导实现公平人脸生成
提出语义边界预测器,推理时一次性干预实现公平人脸生成,无需重训,显著降低人口统计偏差。
TAU-Agent:面向交通异常理解的智能体检索增强框架
提出智能体检索增强框架,整合视频描述与追踪工具,经视觉语言模型推理,实现交通异常理解。
少轮廓勾画,更高精度:病灶引导ROI深度学习用于卵巢超声分类
病灶引导ROI深度学习平衡性能与标注效率,卵巢超声分类准确率达93.10%和97.56%
VBVR-Pro:面向原生视觉推理的可扩展可验证套件
该套件含300个程序化任务、可验证奖励及30余生成器,证实视频生成最利于原生视觉推理。
StreamPI:面向视觉-语言-动作模型的流式多模态时间建模
StreamPI零参数增强单帧VLA时间推理,真机和LIBERO超越pi0.5。
不确定性引导的潜在扩散模型用于忠实超分辨率
提出UGDiff,用重建不确定性引导扩散,选择性恢复高频细节并保持保真度,更好平衡感知与失真。
FRAME:区分医学影像公平性中的抽样变异与表征成因
FRAME区分抽样变异与表征原因;公平参考解释41%种族/22%年龄差异;干预不改变余差,应先审计再干预。
PANDA——用于部分未配对多模态学习的原型锚定对齐,及其在阿尔茨海默病MRI与TCGA病理中的应用
PANDA两阶段方法用类原型对齐传递辅助信息支持任意配对率推理无需辅助输入提升MRI与病理预测
面向多模态无监督持续后训练的视觉依赖性感知框架
提出视觉依赖性感知框架,利用结构失真与异质性,通过最优传输和调制适应,平衡旧任务稳定与新任务可塑性。
UltraPIPS:利用基础模型提升B型超声中的模型感知
超声专用基础模型的LPIPS更贴近下游性能,重建时平衡质量与真实性。
MyoMechanix:基于生物力学的组合式技能活动理解与指导
提出最大多模态AQA基准,融合肌电与动作,通过知识图谱与组合推理实现精细反馈。
RefVideo-6M:面向指令式视频编辑的可靠参考数据集
含五百万视频、一百万图像及六百万视觉参考的数据集,以无伪影真实视频为目标,提升编辑质量、可控性与一致性。
VisDocAgentBench:视觉丰富文档检索的智能体基准测试
提出VisDocAgentBench基准,发现视觉检索器跨证据检索弱,智能体可弥补,但规划器与视觉表示仍是关键。
CVE-SAI:反事实视觉证据引导的选择性属性索引用于风险控制的电商搜索
CVE-SAI通过反事实视觉证据引导选择性属性索引,分离推理与收录,提升检索性能并控制风险。
模态贡献评分:量化阿尔茨海默病中结构MRI与淀粉样PET对个体患者相对诊断贡献的框架
提出MCNet与MCS评分,量化患者个体从结构萎缩到淀粉样/代谢的模态转变,可解释且验证良好。
Super Star:面向数字人的流式实时交互智能体
提出流式实时交互框架,用因果多模态自回归模型生成同步手势,融合数据合成与用户反馈,低延迟高同步。
GaussVLA:面向视觉-语言-动作模型的几何感知空间推理
提出GaussVLA,用3D高斯令牌和深度感知推理,在LIBERO达93.5%成功率,仅200M参数。
学习低正则性空间变化正则化参数以用于图像重建
综述变分图像重建中空间自适应正则化权重的正则性,指出学习到的权重低正则性,能提升边缘细节保持并适应噪声。
改进跨站点全心分割
提出基于模态路由的3D全心分割流程,结合外观增强,在CT和MRI上提升Dice并降低HD95。
基于预训练视觉Transformer的面向令牌语义通信
面向令牌语义通信框架,联合预训练ViT与图像压缩,按令牌相关性传输潜变量,达更优率-精度权衡。
多模态ILD诊断的分层MoE模型
提出分层多模态专家混合模型,融合影像与EHR,两阶段门控,AUC达0.8750,优于其他方法。
基于内容的图像检索进展:相关反馈技术综合综述
综述基于内容的图像检索与相关反馈技术,探讨语义鸿沟、反馈学习及深度学习提升检索性能。
深度神经网络中遗漏变量偏误的控制
提出基于广义加性模型的控制变量法,用交叉拟合岭正则化正交化并边缘化协变量效应,纠正深度学习遗漏变量偏差,获得无偏可解释预测。
ICON分解:面向模型审计的深度表示多元概念级解释
ICON分解量化每个概念在控制其他概念和结果后对层方差的解释度,比七种基线更准确地识别捷径特征,并在皮肤病变和脑影像模型中验证了其实用性。
面向可靠无人机感知的模型无关开放集空对空视觉目标检测
提出模型无关开放集检测,熵建模与谱归一化抗损坏拒未知,AUROC提升10%,背景拒绝增强鲁棒。
视觉语言模型在形状的情感品质上是否一致?面向生成式设计界面的跨模型审计
视觉语言模型对形状情感品质的判断部分一致:优于随机但低于几何基准,且因类别而异;据此开发UI原型。
SEG-SAM:语义引导的SAM用于统一医学图像分割
提出SEG-SAM,融合语义知识与大语言模型,实现统一医学图像分割,性能优于现有方法。
MObyGaze:专家密集标注的多模态客体化电影数据集
提出电影中多模态客体化分析任务,构建专家密集标注的MObyGaze数据集(20部电影、6072个片段),并基准测试模型。
Zero-WAM:基于人类视频的上下文世界-动作建模,实现开放式任务泛化
Zero-WAM用人类视频作上下文指导,零样本泛化至未见操作任务,仿真成功率47.0%。
3DGAA:面向自动驾驶的逼真且鲁棒的基于3D高斯的对抗攻击
提出3DGAA,利用3D高斯泼溅优化车辆贴膜,保持几何不变,实现跨视角物理对抗攻击,显著降低检测性能。
循环与Transformer相遇:通用多模态检索
ReT-2循环Transformer融合图文,统一多模态检索,M2KR/M-BEIR最优,快且省内存
面向细粒度文本到三维质量评估:一个基准与两阶段排序学习指标
提出T23D-CompBench基准与Rank2Score指标,经大规模人工评测,超越现有度量,并可作奖励函数优化生成模型。