真的有伪装目标吗?走向现实的伪装目标检测
现有伪装检测假设每图必有目标,忽略纯背景等现实情况。提出OPC16K基准与OPCNet网络,联合检测与分割,减少误报。
学习高斯结构:面向前馈驾驶重建的干预引导密度控制
提出高斯结构学习框架,用干预引导密度控制及跨时查询提升重建精度,优于现有方法。
AlbumentationsX:图像及相关标注的统一增强管道
AlbumentationsX统一增强管道,随机变换同步作用于图像与标注,防错位,可复现,可扩展。
PRMU:面向多模态大语言模型中人物中心知识遗忘的无语料基准
提出PRMU基准,评估无语料条件下多模态人物知识遗忘,并给出SGPE基线方法。
VidForensics-M1:面向AI生成视频取证的可验证时间定位元检测强化学习
首次将元检测引入AI视频检测,利用可验证时间证据,通过证据引导奖励再分配,提升泛化性与伪造定位能力。
Rescene: 带限随机强迫将冻结的神经天气预报算子转变为气候模拟器
用带限随机扰动包裹冻结天气算子,实现百年稳定气候模拟,恢复日变率与阻塞频率。
SpecF2M:基于频谱感知的多任务网络,利用儿童眼底照片估算眼轴长度与屈光不正
提出频谱感知多任务网络,用儿童眼底照片估算眼轴及屈光,MAE0.535mm/0.706D,优于基线。
CausalSplat:面向3D高斯泼溅的全面层级推理
提出CausalSplat,融合VLM与3D场景图,解耦显式感知与隐式推理,实现3DGS因果推理SOTA。
捕捉足球中人体运动的不确定性用于表征学习
提出自监督框架,用未来运动预测学习足球人体运动表征,建模多模态不确定性,提升预测精度并泛化到多任务。
AdvFD:通过对抗弗雷歇距离损失提升视觉生成
提出对抗弗雷歇距离(AdvFD),用可学习对抗表示补充静态特征,避免弗雷歇破解,提升生成质量。
视网膜图像的算法统计学
用归一化压缩距离度量学习分析3D视网膜OCT图像,误差0.5dB,优于深度学习,提出NCV特征集并模拟非度量嵌入失真。
APCReg:解剖先验引导的CBCT-IOS粗到精配准——多视角投影与可靠性控制残差校正
提出解剖先验引导的多视角粗到精配准方法,结合可靠性控制残差校正,实现口内扫描与锥形束CT亚毫米级配准。
基于系列DCE-MRI的纵向三维基础建模用于新辅助乳腺癌治疗反应预测
融合纵向三维成像与临床数据,预测新辅助化疗完全缓解,曲线下面积零点七三六,证实成像互补价值。
大型语言模型在结直肠息肉光学诊断中的表现
多模态大模型对息肉分型有一定准确性,但未达ESGE标准,需前瞻性试验与人机协同后再临床应用。
PragyaDoc:面向低资源场景的多语种医疗文档理解通用文档智能框架
PragyaDoc四层框架处理印度22种语言医疗文档,破解英文壁垒,惠及农村患者及基层工作者。
在领域特定语言动作空间中学习室内布局策略
提出基于领域特定语言动作空间的布局策略学习方法,显著提升空间合理性与设计逻辑性。
NeuroPilot:一种智能体驱动的神经影像处理、质量控制与管理流水线
NeuroPilot智能体系统自动化神经影像处理与质控,部署17队列超12万被试,将数月流程压缩至一周。
Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation
P2Voxel:用于3D网格令牌化的金字塔枢轴体素化
P2Voxel通过金字塔枢轴体素化,将网格转化为紧凑可学习的令牌,实现高效重建。
审计胸部X光片上的医学视觉-语言模型:跨机构估计参考一致性
评估三模型在胸部X光片的六发现,参考一致性不跨站点迁移,须按站点和接口重新评估。
数据集组成对紧凑YOLO模型嵌入式实时无人机野火检测的影响
实验表明,真实未增强数据集在无人机野火检测中平衡最佳,合成数据混合与增强未能提升最终部署效果。
XEns-CKD:一种基于可解释集成方法的慢性肾脏病分期检测方案
提出XEns-CKD集成视觉Transformer模型,用超声图像分类慢性肾脏病五期及正常,准确率86.36%,结合可解释技术识别病变区域,较现有方法提升4%。
MVMD:一种增强镜面检测的多视角方法
多视角镜面检测方法MVMD,通过跨视图与自注意力建模镜内外关联,提升精度和IoU,增强三维重建效果。
基于fNIRS的自闭症分类中的时间泛化:跨时间窗口迁移基准
fNIRS自闭症分类存在时间分布偏移,跨窗口零样本准确率仅54-69%,微调可恢复至90%以上,域对抗与自监督方法无需目标数据可达78-90%。
下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议
提出三阶段框架,用多目标强化学习与视觉验证器提升对话系统图像编辑建议,显著降低视觉不一致并提升点击率等指标。
COMEX: 一个基于构图的可解释美学图像裁剪基准与学习框架
提出COMEX基准和两阶段SFT+GRPO框架,联合学习裁剪、构图理解与解释生成,全面提升可解释美学裁剪性能。
几何胜过估计深度:Sim2Real下仅RGB多相机3D跟踪
几何一致性主导Sim2Real多相机3D跟踪:几何优先HOTA 13.0,伪激光雷达仅0.12;检测质量与定位一致性为各自瓶颈。
基于视觉的无人机交通监测车辆检测综述:实验洞察与未来方向
综述无人机车辆检测,指出兼容性、实时、鲁棒三大挑战,未来聚焦模型优化、边缘计算与自适应控制。
潜频有效性:利用筛选的视频VAE迁移算子实现快速频谱编辑
提出潜频有效性(LFV),仅部署保真提升且不加剧漂移的算子;423个中146需通道混合,速度比像素滤波重编码快3倍。
BRACE:用重心有理预测驯服尖锐不规则性,加速扩散Transformer推理
提出BRACE,用重心有理预测代替多项式外推,缓存稀疏特征,稳定加速扩散Transformer,质量效率最优。
超越各向同性假设:面向纳米级GBM分析的连续性约束分割与GPU形态测量
无需密集标注的GPU框架,以连续性约束分割各向异性图像,精准量化GBM厚度及病变增厚。
开放世界层次化感知:基于类别无关提议的分类学抽象,实现词汇表外道路物体的安全处理
对类别无关提议做分类学抽象,未知物体零自信误分类,94%安全处理(26%正确,69%保守未知)。
多模态皮肤病变分类:Swin Transformer与临床元数据融合
SwinTransformer融合临床元数据,皮肤病变分类准确率92.55%,且提升校准与可解释性。
基于VSWIR成像光谱的亚像元野火温度实时物理反演
提出VSWIR野火温度反演框架,用GPU加速非线性最小二乘,实现飞行内实时估计,误差约42K,并验证了空间分辨率泛化能力。
MAGIC-SSCIL:面向半监督类增量学习的流形锚定与几何增量校准
提出无样例存储的MAGIC框架,用软加权几何校准与结构对齐稳定特征空间,防遗忘,提升半监督类增量学习精度。
复杂度世界:在可验证视觉决策上基准测试视觉语言模型
提出视觉决策基准ComplexityWorld,390个任务。直接推理通过率低,GPT-5.6-Sol达75.6%,揭示视觉到决策瓶颈。
LAVE:面向视频工具使用智能体的潜在视觉证据增强规划
提出LAVE训练-free框架,复用工具调用的潜在视觉证据,突破文本观察瓶颈,提升视频智能体规划性能,在多个基准上显著领先。
多模态大语言模型的多分支策略优化
提出多分支策略优化(MBPO),以分支相对优势与时间重放缓冲改进多模态强化学习信用分配,提升优化效率。
牛顿GS:面向高斯场景动画的物理结构化对象级神经牛顿动力学
牛顿GS以22维物体状态和神经残差模拟动力学,用仿射变换驱动高斯场景动画,误差更低。
HSMLA:用于高效视觉Transformer的分层Softmax多尺度线性注意力
提出HSMLA,融合线性注意力与软max精修及多尺度卷积,在密集预测中实现高达4.2倍加速与高精度。
FlowErase-OPD:流匹配模型中基于锚定在线策略蒸馏的多概念擦除
提出基于在线策略蒸馏的多概念擦除框架,改善擦除与保留的平衡,性能领先。
利用热成像与传感器融合的深度学习进行网络硬件故障预测
热成像与功率数据融合的深度学习模型,经区域提取预处理,准确率达94%,有效预测网络硬件早期故障。
HeatCast:美国124个城市街区尺度地表温度预测基准
HeatCast是美国124城市30米月度地表温度预测基准,含数据评估,最优模型误差7.74K。
大道至简:面向超长视频理解的多键情景记忆检索
提出多键情景记忆检索框架,推理时邻域过滤与时间扩展,避免全局建模,三个长视频基准最优。
高速公路数据采集:一种几何、类别无关的嵌入式车辆计数方法
提出几何类无关计数法,用背景减除和虚拟线圈,无需预训练检测器,树莓派超实时,精度83%-100%。
基于多任务一致性的对抗攻击检测
利用多任务输出不一致性检测对抗攻击,无需额外开销,基准数据集上对投影梯度攻击检测AUC达99.9%。
CosmosAlign:面向生成式交通视频预测的世界基础模型适配
CosmosAlign以两阶段LoRA适配世界模型,推理时增强,获AI City Challenge 2026赛道5第一,得分76.49。
SpikeWorld:冻结脉冲世界模型的快速状态自适应
提出SpikeWorld:145万参数的稀疏脉冲世界模型,部署时全部冻结,仅经外部残差路径无标签自适应,显著提升预测与奖励。
视觉与WiFi融合:基于物理的体机械属性估计
提出视觉与射频融合框架,用材料槽估计体机械属性,提升精度与物理一致性。
超复数神经网络中的鬼特征与诡异迁移学习
利用超复数额外虚部生成鬼特征,并通过诡异迁移学习整合,提升神经网络效率。