成本所在:循环一致对抗网络稳定性增强的部署感知采用顺序
稳定性增强按成本分布决定采用顺序;自注意力增加部署内存应延后,其余仅影响训练;集成实验验证并报告指标。
NARRATE:面向自动驾驶中以人为中心解释的多模态真实世界澳大利亚驾驶数据集
NARRATE是澳大利亚真实驾驶数据集,含35名司机2050个事件,多模态同步并带解释与情境意识标注;基准显示可学习,但细粒度识别和生成仍有挑战。
不确定性识别跨方法的困难样本:异质性皮肤病变数据集上的多任务研究
研究表明,困难样本的识别跨方法高度一致,深度集成在校准和不确定性分解上最优,基于不确定性的选择性转诊可有效减少错误。
PolyComp:多模态模型中基于多立方体的组合式三维空间推理基准
提出PolyComp基准:120道多立方体组合题,测试多模态模型的组合式三维空间推理。最强模型GPT-5.6仅50%准确率,Gemini近随机水平。
MegaParts:通过令牌高效自回归建模实现多达300个部件的部件感知3D对象生成
新框架MegaParts用令牌高效自回归建模,将部件感知3D生成扩展至300个部件,压缩离散令牌提升可扩展性与几何质量。
AMPLIFAI:用于肝脏病变LI-RADS评估临床推理基准测试的多期CT数据集
首个公开的多期CT数据集,含LI-RADS标注及三大特征分割,促进肝癌AI诊断研究。
高频微超声前列腺分割的医学视觉基础模型零样本适配
零样本流程:MedSAM定位+增强平滑,边界误差降45%,Dice 0.865,免训练。
Qwen-Video-Edit:通过复用图像编辑模型实现指令式视频编辑
复用图像编辑模型处理视频潜变量,平铺拼接并微调即可实现指令视频编辑,表明逐帧视频潜变量接近图像域。
FZ-VLM:一种两阶段Florence-Zephyr视觉语言模型框架,用于肺结节表征与临床决策
提出FZ-VLM两阶段视觉语言模型,Florence-2提取结节属性,Zephyr生成描述建议,优于GPT-4和人类基线。
基于光束的统计背景减除用于静态路侧激光雷达:跨传感器基准研究
针对静态路侧激光雷达,提出光束级统计背景减除基准,跨传感器验证,新数据集提升精度与实时性。
Zero-MELO:利用多模态大语言模型在测试时校准证据实现零样本微手势识别
提出零样本微手势识别框架,通过树搜索获取局部证据并校准分数偏差,在iMiGUE和MA-52上显著超越基线。
SpIn-ViT:设计机制可解释的稀疏诱导视觉Transformer
SpIn-ViT联合训练ViT与SAE,实现稀疏可解释特征与分类对齐,精度、可解释性远超现有方法,规则集更小。
OvDSGG: 端到端开放词汇动态场景图生成
首个端到端开放词汇动态场景图生成框架,零样本召回率提升10-20.4个百分点,闭集性能持平。
眼见未必为实:众包航空灾害评估中不同影像来源的标注与审核表现
首次实证多源遥感灾损标注中,影像分辨率越低修订率越高(卫星达36.95%),单轮审核后仍有20.86%分歧,建议按分辨率分配审核资源。
面向通信高效的自动驾驶:风险自适应边缘-云视觉推理
风险自适应边缘-云架构:车载评估触发云端推理,云请求减54.1%,紧急制动更少,实验验证有效。
PaSTel:通过多尺度分层生物先验对比预训练将组织学锚定于空间转录组学
提出多尺度分层生物先验对比预训练框架PaSTel,有效提升空间转录组学表征。
前沿文生图模型图像描述提示基准评测
四款前沿文生图模型测评:Gemini 3 Pro Image最佳(84.8),FLUX.2次之(82.3);主要短板为物体计数、几何与文本乱码。
基于置换不变Gram矩阵原理的免配准RGB高光谱重建
提出置换不变Gram矩阵原则,免配准、免已知响应函数,由RGB重建高光谱,精度媲美需严格假设的方法。
MOSS-VL技术报告
MOSS-VL是开放视觉语言模型,通过门控交叉注意力实现边看边说,流式基准三项第一,参数11.3B,实时交互领先。
利用GAN生成合成指照片
利用生成对抗网络合成指照片,评估其真实感、隐私性与多样性,应对非接触指纹数据不足及隐私风险。
SA-GEM:面向高效遥感大视觉语言模型的尺度自适应与地理空间证据调制令牌剪枝
提出尺度自适应与地理空间证据调制的令牌剪枝,在足够粒度下质量重于数量,精度和效率均提升,推理加速2.4倍。
MEDR:基于多信号事件建模与动态重评分的查询无关帧选择
MEDR以多信号事件建模和动态重评分实现查询无关帧选择,无需训练,可复用固定帧集,提升视频问答准确率。
面向遥感图像语义分割的频率与边缘引导分割一切模型
针对遥感语义分割,提出频率与边缘引导的分割模型,用频率适配器与边缘细化器解决特征与边界问题,性能最优。
几何校准的闭式收缩SAR去斑
几何校准闭式收缩去斑:解析参数、免训练,性能领先。
EgoTac:基于第一人称视觉的真实场景触觉预测
从第一人称视频预测触觉,基于570万图像-触觉对,误差低、泛化强,支持零样本预测,助力触觉感知机器人学习。
视觉定位解码器需要前馈网络吗?基于冻结视觉-语言特征的控制性研究
前馈网络并非视觉定位解码器必需;仅注意力解码器性能相当或更优,且参数更少、延迟降低。
DualMiT-Net:乳腺钼靶感兴趣区域肿块分割的局部-全局Transformer-卷积融合网络
提出双分支网络DualMiT-Net,融合局部肿块与全局乳腺上下文,在CBIS-DDSM上Dice达0.9375,优于六种基线。
MetaReason:通过编辑元信息实现精确交错多模态推理以解决几何问题
提出MetaReason,利用元信息编辑合成视觉状态,结合数据集与强化学习,提升几何多模态推理,超越开源。
CETalk:面向音频驱动3D说话头生成的连续效价-唤醒控制
提出CETalk,用连续效价-唤醒控制音频驱动3D说话头,多尺度解耦口型与情绪,效果优于现有方法。
面向工业异常检测的无分布误报校准与机会校正空间评估
结合无分布容差阈值与配对-交叉空间检验,实现误报校准及机会校正评估,并给出样本量规划。
MODAL:基于模型驱动的稀疏解耦与文本-图像差分滤波的多模态目标重识别
提出多模态目标重识别框架,采用模型驱动稀疏解耦和文本-图像差分滤波,缓解模态缺失,四个数据集达最优。
视角不变攻击:增强对抗样本的可迁移性
提出视角不变攻击(PIA),通过多自由度顶点采样生成几何多样输入,减少过拟合,提升对抗样本可迁移性,优于现有攻击方法。
ProjFormer:基于几何投影Transformer与跨模态语义约束的点云补全
提出基于显式投影与自适应路由的跨模态补全框架,几何一致,性能优且结构完整。
快速测试时细化用于鲁棒学习图像压缩
发现非对称对抗轨迹:对抗样本仅需1-2步即可恢复;据此提出快速测试时细化(FTTR),实现高效鲁棒学习图像压缩。
HOIMask:面向人-物交互生成的生成式掩码建模
提出首个生成式掩码框架HOIMask,在离散空间建模人-物交互运动,引入接触感知重构引导,优于扩散方法。
统一主干-专家框架与关系令牌及残差分类器接口的自动调制识别
提出统一主干-专家框架,用关系令牌补偿短序列,残差模块与分类器协作处理长序列,在两大数据集上取得高精度。
超越自然图像基础模型:面向眼科图像分析的卫星预训练基准测试
卫星预训练优于自然图像预训练,在眼科富血管模态上媲美医学专用模型,且无需医学数据。
从“假设”到“现实”:反事实思维启发的视觉脑解码语义对齐
提出反事实语义对齐框架,对齐真实描述并区分近似干扰,提升视觉脑解码的重建与语义判别。
VGGT-Align:桥接局部重建与全局一致性的长序列三维重建
提出尺度一致性增强框架,利用场景几何不变锚定消除尺度漂移,结合测试时自适应,轨迹误差降32%。
TERRA:面向高分辨率AI地球建模的分层并行训练与内存编排框架
提出TERRA分层并行训练与内存编排框架,支持高分辨率地球模型,显存节省达51.8%,强扩展效率65%。
UC-VLM:基于视觉-语言大模型与一致性驱动的AI生成图像检测
提出UC-VLM统一多阶段框架,仅用二元标签监督,自动优化指令,复用标签增强视觉与文本输出,显著提升AI生成图像检测准确率。
基于共轭梯度的全局-局部正则化网络用于稀疏视图CT重建
提出CG-GLORE,二阶启发展开网络,结合共轭梯度与全局-局部正则化,实现稀疏视图CT高质量重建。
DCA-MoE:空间自适应跨层融合与密度路由专家的人群计数方法
提出DCA-MoE,用空间自适应层融合和密度路由专家计数,在NWPU-Crowd上MAE达31.7。
Robust structure from motion for aerial-ground images via detector-free feature matching and multi-view track refinement
基于运动感知扩散的无人机视频去模糊:通向稳健目标检测之路
提出运动感知扩散的无人机视频去模糊方法,通过自适应潜尺度和多帧门控,有效恢复细节并提升目标检测精度。
面向铁路图像质量评估的自监督拓扑不变流形学习
自监督拓扑不变流形学习免标注建质量参考经单调滤波与稳健融合在基准及铁路上验证零样本迁移与鲁棒性
锚点正则化自适应:基于DINOv3的泛化AI生成图像检测
提出ARA:LoRA捕像素伪影,冻结锚点保表征,混合数据提升泛化,9基准SOTA。
PersonaDrive:基于多维驾驶人格的可控轨迹预测
提出双轴(时间紧迫性、乘坐舒适性)九种人格数据集及语言驱动轨迹预测框架,实现多维可控预测,性能超基线。
边界对齐贡献路由用于鲁棒光学-SAR目标检测
针对光学-SAR融合中的负迁移,提出边界对齐路由机制,仅用检测监督调控模态贡献,显著提升全输入与缺失模态检测精度。
SAGE-OR:手术室的半监督自适应场景图生成
提出特征中心半监督框架,消除定位标注,用提示驱动实体增强,以轻量图变压器实现高效关系推理,性能接近全监督。