AERIAL:精度保持的低精度脑电解码器鲁棒性的对抗评估
BCI实验中,精度保持压缩不提升脑电解码器直接鲁棒性,但剪枝显著降低对抗迁移效率,三者相互独立。
Ego-Exo4D 人体网格数据集:面向自我—他人视角采集的4D人体运动重建
Ego-Exo4D仅有稀疏3D姿态,本文提出大规模4D人体运动重建数据集Ego-Exo4D-HM及配套重建流程。
基于免训练轨迹路由的视频扩散加速
TRACK通过校准比较大小模型的预测差异,将低差异步骤路由至小模型,无需训练即可加速视频扩散推理,最高提速2.7倍。
OmniFabric:面向三维服装重建的连贯UV空间纹理合成
OmniFabric在缝纫图案空间合成全局连贯纹理,用扩散Transformer在UV域精炼去伪影,生成可重光照的逼真3D服装。
WanPE:面向现代文本到视频生成的电影级提示增强
WanPE以397B参数、105万视频训练,实现电影级镜头规划,30秒视频人类偏好提升50.86分。
TrackEverything:通过去重三维场景表示实现长时程稠密跟踪
提出TrackEverything,将视频表示为持久三维场景轨迹并去重,实现超千帧全点稠密三维跟踪,性能领先。
多模态大语言模型中的对齐幻觉
逐层视觉-文本相似度并非内容级对齐;受控干预揭示标量指标可被权重诱导,提出主角度间隙诊断,需任务证据校准。
基于智能手机的自动化测速执法方法
设计并测试智能手机自动测速与车辆识别流程,辅助交通执法;识别准确率有限,并探讨法律、技术与实践问题。
BiCC:用于实例感知分割的双向连通分量损失
提出BiCC,联合标注与预测连通分量,按预测实例惩罚假阳性,平衡病灶精确率-召回率,提升分割F1。
冻结超球面特征能否指导伪掩码选择?
用冻结自监督超球特征评分排序候选伪掩码,八池中六池平均分割精度超基线1.7至9.3个百分点并助训练。
迈向实用的3D高斯泼溅压缩
COSA-GS通过锚点因果分解构建上下文,简化架构并实现跨平台一致的熵解码,达到先进压缩性能。
基于DCGAN的合成增强能改善脑肿瘤MRI分类吗?一项实证研究
DCGAN合成增强未提升脑肿瘤MRI分类,准确率与F1不变、AUC略降,需评估其分布保真度与任务效用。
最小二乘相位解缠的自适应分块:运行时间与精度
自适应分块虽减少块数,但构造与求解开销超过边界节省,仍慢于优化网格,精度也可能下降。
衡量人行道社会生活的视觉语言框架
提出视觉语言框架,从街景提取人行道社交指标,生成社交驻留指数;纽约10万侧视图显示人流量与其仅弱相关。
Free-Init:面向多普勒激光雷达-惯性系统的免扫描、免运动、免对应初始化
提出Free-Init,融合多普勒激光雷达与惯性测量,无需扫描去畸变、激励运动或地图对应,实现鲁棒高频初始化。
融合局部细节与全局上下文:一种面向骨肿瘤诊断的双输入多任务学习框架
双输入多任务框架,双向跨模态注意力融合局部与全局,联合骨肿瘤分割分型,骨肉瘤AUC 0.999。
DAWN:基于深度去噪世界模型的噪声鲁棒四足机器人跑酷
DAWN以噪声深度为输入、干净深度为重建目标并对齐潜状态,无需滤波调参,实现四足机器人零样本跑酷。
表示世界模型:在表示空间中学习状态、转移与可执行规划
提出RWM在表示空间学习状态、转移与可执行规划,推理时直接构造潜路径并用逆动力学恢复动作,无需搜索。
EgoSpeedUp:将人类操作节奏迁移至机器人策略
EgoSpeedUp用人类操作节奏重定时机器人示范,行为克隆后成功率升25个百分点、耗时降36.5%。
FMCW-LIO:一种多普勒激光雷达-惯性里程计
FMCW-LIO利用多普勒激光雷达速度辅助状态估计并剔除动态点,在结构退化环境实现精准鲁棒定位建图。
维度入场,裁决退场:评分细则分解的视觉语言美学评判模型融合
让VLM按五维评分细则逐项打分再融合,比整体评分评审团更可靠,稳定超越最佳单模型,代价是额外标注与API开销。
使用开源 PACS-AI 平台部署影像 AI 的经验教训
六院部署开源PACS-AI影像AI:瓶颈在路由、展示、反馈与审计等基础设施而非模型精度;公开模型就绪度本身即治理。
基于3D姿态的板球击球分类与自动化生物力学分析集成框架
用YOLO与MeTRAbs提取3D骨骼姿态,集成模型分类四种板球击球,准确率97.68%,并输出生物力学反馈。
AgroBench:一个可复现的多模态基准,用于基于县级统计与像素观测的弱监督作物产量学习。
AgroBench 将县级产量统计转为弱监督像素级多模态时间序列,覆盖5种作物8个生长季,并提供可复现基准与评估协议。
基于组织病理学与CT的跨模态对比学习用于肾细胞癌自动分级
以病理-CT对比学习提升无创CT肾癌分级,推理仅需CT,AUC0.601优于CT基线,仍需外部验证。
解剖感知的基于平扫图像的乳腺增强MRI合成
构建解剖感知深度学习框架,由平扫图像合成增强乳腺MRI,重点监督肿瘤与背景实质强化区域,质量优于多种基线。
去标识化系统中的对抗攻击与身份泄露:一项实证研究
研究对抗攻击致去标识化系统身份泄露,提出微调与低通滤波缓解策略。
nnFoundation:面向放射学的3D基础模型
提出nnFoundation:基于210万CT/MRI/PET的3D放射基础模型,108任务领先。
HYDRO:面向不可逆人脸去标识的高保真混合扩散与目标导向方法
提出HYDRO,融合目标导向去标识与扩散加噪恢复,引入眼部相似判别器,保真且抗重建,攻击成功率降85.7%。
Pro-Bench:跨真实异构环境的提示鲁棒开放词汇视觉定位
真实异构环境开放词汇视觉定位基准,含1.3万帧、7.45万标注,评测16种模型,提示鲁棒性依赖架构。
从温室气候到单叶:一种器官分辨的生菜生长模型
构建器官分辨生菜生长模型,逐叶模拟光合与三维结构互作,干重预测误差9.5%,支撑温室数字孪生决策。
面向成本高效空间转录组学的主动位点选择基准测试
空间转录组主动选点基准显示:小预算下主动策略未稳定优于随机采样,且排序依赖评价指标。
记忆抹除:人脸识别模型嵌入空间中的对抗性选择性身份遗忘
提出开放集对抗遗忘,用三种损失微调人脸识别嵌入空间,使选定身份不可链接且不影响其余人群。
MINER:面向冻结双编码器的稀有物体检索多裁剪推理增强
免训练MINER用区域嵌入与相似度重打分增强冻结双编码器,提升杂乱场景稀有物体检索并发布ROCS基准。
基于自适应分层集成学习与不确定性估计的太阳磁图超分辨率
以图像复杂度分层训练专家网络集成,配轻量路由与不确定性估计,实现MDI到HMI磁图超分辨。
PEARL:面向实时、匿名与异构协同感知的轻量级提示式特征解释器框架
提出PEARL轻量提示式框架,以双多尺度解释器实现匿名、实时异构协同感知,免共享配置,提精度降通信。
面向手术的层次感知视频-语言模型评估与双曲基线
提出层次感知评测基准与双曲基线模型,揭示同准确率下错误严重度差异,双曲几何可提升预测的层次一致性。
设计即多样:面向原型可解释性的架构约束
提出DAPL,以一对一注意力映射的架构约束强制原型多样性,结合前景感知训练与覆盖度、多样性量化指标。
面向高速公路交通监测的路侧基础设施雷达系统系统性评估
发布DRaT数据集,评估路侧雷达:检测精度受限,跟踪可靠,速度估计准,密度流量低估23%。
面向遥感变化检测的时序有序区域Token Mamba与Logit空间扩散
提出BMD-CD,融合时序有序Mamba与Logit空间扩散,实现高精度、强边界、高效的遥感变化检测。
视觉语言模型看似的能力极限,实为读出极限
视觉语言模型评测中答案格式并非中性;看似能力不足常是读出限制,甚至会改变模型排名。
学习关节运动约束下的单目视频手术运动学
提出单目视频手术器械运动学重建网络,估计位置、姿态与钳口角,Open-H上降低路径误差并提升运动分割精度。
学习频谱分配:面向自适应体数据分割的分数阶扩散框架
提出FHEAT分数阶扩散,优化自动分配各阶段频谱混合;算子退化为恒等,FLOPs降79%,半监督分割领先。
从单曝光RAW序列重建高动态范围视频
提出RawHDRV端到端框架,利用Bayer线性响应与通道特性实现单曝光RAW视频HDR重建,并构建大规模数据集,性能达最优。
用于有向船舶检测的条带卷积与方向感知排除损失
提出条带卷积模块与类别-方向感知排除损失,兼顾长船体特征提取与重复预测抑制,仅2.91M参数。
打破天气-内容耦合:面向一体化红外复原的类型-严重度引导渐进解耦
提出TSGPD-IR,按天气类型与区域严重度渐进解耦,一体化红外复原,抑制伪影并保留热结构。
视觉语言模型能否分析以人为中心的视频?模型能力与人机协作工作流图谱
构建15项视频标注基准并比较人机流程:VLM独立接近人类,人验证VLM准确率最高且显著省时省钱。
几何条件化的自然环境视觉地点识别
提出深度感知蒸馏,把几何基础模型推断的几何注入视觉基础模型,无需深度传感器,提升视觉地点识别。
GaussPDE:面向3D高斯泼溅的基于图的偏微分方程驱动渲染
提出GaussPDE,无需网格、体素或重训练,向3D高斯注入PDE动力学,实现稳定可控、空间连贯渲染
超越均值对照:审计冻结CLIP区域解释中的最差对照特异性
冻结CLIP区域解释:区域通过重叠与均值对比后,多数仍不敌最强竞争类;替代修复有限,受容忍度制约。