FLaRA:预测未来潜在表示用于事故预判
FLaRA预测未来潜在表示用于事故预警,联合特征重建与分类损失训练,在多个数据集达SOTA并具早期预警能力。
HPSv3++:面向扩散模型全能力谱的奖励模型扩展
HPSv3++通过新数据集和两阶段训练,提升奖励模型对扩散模型全能力谱的偏好预测,取得SOTA。
基于生成式AI的工业计算机视觉数据生成与增强方法定性综述
综述GenAI数据增广用于工业视觉,发现可自动提升数据但存领域不匹配。
一种基于基准标记的轻量级离体肿瘤切除术标本3D高光谱成像流程
提出全自动无校准流程,结合消费级RGB与单次HSI,生成3D高光谱点云,精度<1mm、耗时<4分钟,支持术中切缘评估。
StereoGeo:一种端到端立体相机标定方法
提出端到端立体相机标定方法StereoGeo,联合估计焦距、重力方向及相对外参,性能优于单目方法。
S$^2$COPE: 基于偏好学习的自监督概念发现
提出无标签框架S$^2$COPE,利用VLLM自监督偏好学习自主发现结构化概念,显著提升下游分类精度。
重新思考全局平均池化:你的分类器其实是一个多实例学习器
标准分类器因全局平均池化线性结构具备多实例学习能力,可提取空间证据,但均值聚合有局限。
基于多视角Deformable-DETR的再制造白色家电视觉质量评分
提出多视角Deformable-DETR框架,自监督预训练+微调,实现再制造家电质量自动评分,减少人工标注。
SED:基于蒸馏的事件数据轻量级显著性预测
提出轻量级网络SED,通过知识蒸馏将模型大小从180MB压缩至0.32MB,性能不变且泛化强。
NEST3D:群居织巢鸟树巢的高分辨率多模态数据集
首个高分辨率多模态3D织巢鸟巢数据集,PT-v3分割达86.35% mIoU,支撑生态应用与算法基准。
用深度学习薛定谔桥改进月球地形图
薛定谔桥扩散模型结合光学图像,实现月球地形超分辨率并给出不确定性。
μ₀:一种可扩展的3D交互迹世界模型
μ₀预测交互点3D轨迹,无需动作标签,性能优于基线,支持跨实体操作。
HumP-KD: 一种混合不确定性感知的多阶段渐进式知识蒸馏框架,用于高效火灾分类
提出HumP-KD框架,通过多阶段蒸馏将大模型知识传入轻量学生模型,F1达0.9876,参数量仅4.94M,适合实时部署。
棉花叶片视觉:一种可解释且稳健的深度学习框架用于棉花叶病分类
利用DenseNet201达到98%准确率,结合Grad-CAM、对抗训练增强可解释性与鲁棒性。
RepFusion:利用多模态先验在表示空间中去噪
RepFusion用多模态大模型编码噪声表示,作为扩散变换器条件,在相同推理预算下优于基线。
Instruct-Particulate:利用运动学控制扩展前馈3D物体关节化
提出Instruct-Particulate模型,结合运动学规格预测3D物体关节结构,利用大规模异构数据集训练,实现跨类别泛化。
RATS!补丁通过寄存器对话:寄存器注意力Transformer中的涌现部件
RATS通过寄存器注意力分解分类标记,自发形成语义部件,在分割任务中平均提升12 mIoU。
OmniVideo-100K: 通过结构化脚本和证据链进行音视频推理的数据集
提出结构化脚本与证据链驱动的自动数据引擎,构建OmniVideo-100K指令数据集,微调后音视频推理性能最高提升20.59%。
让AI头疼:针对计算机视觉应用的声学对抗攻击
可听频率声波攻击使相机运动,误导AI视觉模型,为防御策略提供参考。
C-MambaPose:一种物理信息驱动的复杂Mamba框架,用于跨环境WiFi人体姿态估计
提出C-MambaPose,利用复数Mamba和物理信息实现跨环境WiFi 3D姿态估计,性能领先且参数量减少超80%。
Memento:为一致的长视频生成而重构记忆
Memento通过主体重建与双查询记忆机制,实现长视频中主体一致性与镜头连贯性,达到SOTA性能。
利用视觉Transformer融合泛在射频数据与空间图像以增强智慧城市地图构建
提出视觉Transformer融合RF与地图的方法,提升制图精度,宏IoU达65.3%。
多智能体具身自动驾驶:从V2X信息交换到共享世界模型
自动驾驶转向多智能体具身系统,通过共享世界模型协同感知与规划,但缺乏实时安全保证,需突破状态对齐与鲁棒协调。
PhysVLA:迈向物理基础的VLA用于具身机器人操作
PhysVLA即插即用框架无需训练,提升VLA机器人操作成功率最多17%、稳定性最多19%,真实硬件成功率提升最多50%。
基于可逆神经变换和隐式条件的高保真视频压缩
InnVC利用可逆变换和隐式条件实现高保真压缩,高质量下PSNR BD-rate降低21.66%,涵盖宽质量范围。
FoleyGenEx:统一视频到音频生成,具备多模态控制、时间对齐与语义精度
FoleyGenEx统一视频转音频框架,整合多模态控制、帧级时间对齐与细粒度语义,实现同步多样化音频生成。
朴素视觉记忆不足:GUI代理的失效模式研究
全图像记忆加剧操作失误,提出基于动作的视觉记忆(AGMem),使任务成功率提升33.3%。
基于多光谱图像的频谱感知光照估计
提出空谱特征与光谱注意力框架,利用光照先验及跨传感器域变换,在真实多光谱数据上实现高精度光照估计。
通过体积对比学习实现三模态胶质瘤表征对齐
GLORIA框架整合组织病理、基因表达和MRI三种模态,用Gramian对比损失对齐,提升胶质瘤分级和生存预测。
消失深度:用正弦深度预处理训练通用深度适配器,扩展预训练RGB编码器
提出正弦深度预处理训练通用深度适配器,无需微调即提升RGBD下游任务性能。
正弦激活函数族的隐式神经表示统一理论
提出STAF可训练正弦激活理论,在隐式神经表示任务中PSNR/SSIM优异且参数高效,缓解但未消除谱偏差。
MVAD:面向多模态AI生成视频-音频检测的基准数据集
首个多模态AI生成视频-音频检测基准数据集,含三种伪造模式、高质量样本及广泛多样性。
对齐但刻板?系统提示如何塑造基于LLM的文本到图像模型中的群体偏见
LLM文本到图像系统在提示扩展中引入隐性人口统计偏见,FairPro框架无需训练即可自适应减少偏见。
FBSDiff++:改进的扩散特征频带替换方法,实现高效可控文本驱动图像翻译
通过动态频带替换,FBSDiff++实现高效、灵活、高度可控的图像翻译,速度提升8.9倍,支持任意分辨率和本地化编辑。
双交叉注意力孪生Transformer用于观察等待内镜中直肠肿瘤再生长评估
提出SSDCA模型,结合纵向内镜图像区分临床完全缓解与局部再生长,平衡准确率81.76%,敏感性90.07%,鲁棒性佳。
通过优化文本嵌入缓解大型视觉语言模型中的幻觉
通过优化文本嵌入平衡注意力,促使模型学习视觉信息文本嵌入,显著减少LVLM幻觉,提升多模态推理。
特征空间平面搜索器:一个面向可解释性和计算效率的通用领域自适应框架
基于特征空间几何模式,冻结编码器优化决策边界,实现高效可解释的领域自适应,性能领先。
MMRINet:基于高效Mamba的双路径细化低资源MRI分割网络
轻量级MMRINet采用Mamba模型与双路径细化,仅2.5M参数,在低资源MRI分割中Dice达0.752,优于现有方法。
优化秩以实现高保真隐式神经表示
发现MLP低频偏差源于训练中秩退化,优化秩(如Muon)可提升隐式神经表示保真度达9dB。
HULFSynth:基于隐式神经表示和对比因子估计的超分辨率与超低场MRI合成
提出无监督MRI合成方法,利用对比因子估计和隐式神经网络实现高低场图像双向转换与超分辨率,白质-灰质对比度提升52%。
RAMEN:用于地球观测的分辨率可调多模态编码器
提出分辨率可调多模态编码器RAMEN,统一表示多源地球观测数据,用户可权衡精度与计算成本。
Pix2Fact: 当视觉不足时——真实世界高分辨率场景中基于网络验证的细粒度VQA基准测试
Pix2Fact基准测试显示,顶尖视觉语言模型在细粒度问答中准确率仅51.7%,暴露视觉接地与知识搜索瓶颈。
高效在线三维多相机多目标跟踪与姿态估计
仅用2D检测,高效贝叶斯滤波实现快速3D多目标跟踪与姿态估计,鲁棒应对相机断连。
快速自回归视频扩散与世界模型:时序缓存压缩与稀疏注意力
提出FAST-AR框架,通过时序缓存压缩和近似匹配稀疏化注意力,实现自回归视频扩散5-10倍加速且内存稳定。
3D-RFT:基于视频的3D场景理解的强化微调
3D-RFT首次将可验证奖励强化学习用于视频3D场景理解,直接优化评估指标,4B模型超越8B模型达SOTA。
SinGeo: 释放单模型潜力以实现鲁棒跨视图地理定位
SinGeo通过双判别学习与课程学习,使单模型实现鲁棒跨视图定位,达SOTA并具迁移性。
数字孪生驱动的自动分拣系统中的纺织品分类与异物识别
数字孪生机器人分拣系统集成VLM,Qwen准确率87.9%,轻量模型Gemma3适合边缘部署。
面向物理可实现的SAR目标检测对抗衰减补丁
提出对抗衰减补丁方法,平衡攻击效果与隐蔽性,具备物理实现潜力,有效降检测性能且可迁移。
QualiaNet:一种体验先于推理的网络
模拟人类立体视觉两阶段,仅凭视差梯度即可恢复距离,无需绝对深度信息。
以边界为中心的片段预算主动学习用于时间动作分割
提出B-ACT框架,以边界为中心,通过两阶段循环选取关键边界帧标注,显著提升标签效率,优于基线方法。