世界模型记住,行为者遗忘:持续基于模型的强化学习中的梦境排练
DreamerV3遗忘源于行为者,非世界模型;梦境排练(监督自我模仿)可恢复技能,实现任务无标签持续学习。
无时域依赖的强化学习渐近最优遗憾
针对齐次MDP提出新算法,实现无时域依赖渐近最优遗憾,上界~O(√(SAK)+S^8A^3),匹配下界,利用单调性与投影去除logH因子。
对抗前沿:面向鲁棒性评估的最小范数攻击集成
提出最小范数攻击集成框架,定义攻击/防御前沿,在可控查询预算下逼近,实现曲线式鲁棒性评估,超越AutoAttack。
RIS辅助无线联邦学习中的收敛-延迟感知自适应调制与资源分配
针对RIS辅助无线联邦学习,提出收敛-延迟感知的自适应调制与资源分配,实现更快收敛和更高精度。
基于广义卡尔曼滤波的时间差分强化学习
提出基于条件期望的广义TD框架,递归估计值函数及其不确定性,扩展卡尔曼TD至非线性非高斯系统。
用于光电容积描记信号机器学习模型的不确定性量化良好实践指南
QUMPHY项目为PPG信号机器学习模型的不确定性量化提供指南,涵盖模型选择、方法实现与验证及基准数据集。
CURED:错误创建、理解与修复演示器
基于ML的表格数据错误检测与清理演示器,支持数据扰动、ML清洗和错误理解。
评估与缓解基于机器学习的招聘中预训练嵌入的性别偏见
评估预训练嵌入性别偏见,发现性别擦除不能完全消除泄漏,对抗学习可提高公平性但非替代。
零样本心率变异性预测:使用时间序列基础模型从消费级可穿戴设备预测
研究评估三种时间序列基础模型在真实可穿戴HRV数据上无需微调即优于传统基线,平均MASE为0.81-0.87,为临床部署提供基线。
基于神经坍缩不稳定性的DNN测试用例优先级排序
提出NCIP框架,利用跨检查点预测变化性优先测试边界样本,实现高效故障发现,性能提升显著。
利用先进AI/ML模型的时间序列网络利用率KPI预测
研究评估多种模型预测带宽利用率,揭示准确性与计算效率的权衡,助力选择最优模型。
时间序列基础模型的后训练:一个统一框架
提出TSFM后训练五类干预方法及统一框架,弥合预训练与可靠部署的差距。
通过动态评分表协同进化的大语言模型评估器与策略
DynamicRubric实现评估器与策略协同进化,通过响应集条件生成加权评分项,解决分数差距瓶颈,提升策略监督。
基于共识推理的Tsetlin机集成自主协作学习
提出去中心化Tsetlin机协作学习范式,垂直特征分割,共识推理集成,无需数据交换,精度媲美集中式模型。
关于二阶认证遗忘的优化复杂度
从优化角度研究机器遗忘的算法复杂度,提出二阶遗忘算法,证明其对线性模型具有更优收敛性。
主动推理作为凸马尔可夫决策过程
主动推理将自适应行为表示为凸马尔可夫决策过程,通过最小化预期自由能实现,并推导出镜像下降算法,与强化学习兼容。
PIER:物理引导的环境检索用于时间序列建模
PIER框架通过物理感知检索与自适应权重平衡,提升环境时间序列建模的准确性,实验验证有效。
Receptron单元的自组织架构:面向边缘智能的硬件感知框架
提出Receptron单单元架构,在资源受限MCU上实现非线性分类与在线适应,性能媲美标准方法。
基于实例硬度的不平衡回归相关性
提出基于实例硬度与学习难度的InHaR函数,识别稀有实例,改进不平衡回归预测性能。
OLEDLM:用于OLED分子设计的统一语言模型
提出基于因果语言模型的OLED分子逆设计框架,多阶段策略生成满足光电性能要求的新候选分子。
ELSAA: 用于训练Transformer的高效低秩与稀疏注意力近似
ELSAA通过稀疏和低秩分支分别捕获局部高相似与全局交互,引入分母感知融合,无需完整矩阵即可高效近似注意力,支持长上下文训练。
四边形损失:将可加性视为稠密神经网络的可度量行为
提出四边形损失,通过二阶混合差惩罚特征交互,将可加性转化为可调节行为,兼顾可解释性与准确性。
量化神经网络的局部稳定性与高斯平滑
研究高斯平均作为量化神经网络平滑替代,导出局部稳定性界并给出ReLU和符号激活闭式解,应用于推理与训练平滑梯度。
基于可解释状态空间模型的用户中心交易序列建模
结合对比学习和状态空间模型,实现高效可解释的用户交易序列建模,收敛快2-3倍。
Ex-Fuzzy库的可解释模糊规则回归扩展
提出Mamdani模糊回归扩展,基于Fuzzy C-Means目标感知初始化,平均R²约0.86,生成10-15条可读规则。
PhaseAware:可解释的人机协同康复评分与边界监测
PhaseAware框架实现可解释康复评分,通过相位感知设计降低误差88.9%,生成结构线索支持人机协同监测与边界审查。
利用二维累积分布函数突破遗憾最小化的$T^{3/4}$障碍
新算法实现遗憾$O(T^{7/10})$,突破$T^{3/4}$界限,部分缓解维度诅咒,并应用于双边贸易利润最大化。
对撞机实验中实时异常检测的量子自编码器的经典硬件加速
利用FPGA加速量子自编码器实现对撞机实时异常检测,性能媲美经典方法,满足未来触发器资源与时序约束。
使用配对采样的方差缩减域适应
提出PSDA配对采样技术,降低梯度方差,提升无监督域适应准确性。
区间和模糊物理增强神经网络(iPANN和fPANN)用于本构建模中的不确定性量化与传播
提出iPANN/fPANN,通过能量上下界包围噪声应力,实现本构建模中无分布偶然不确定性量化与传播。
PG-KINN: 一种基于物理信息的Petrov-Galerkin Kolmogorov-Arnold网络,用于求解正问题和反问题偏微分方程
PG-KINN用Petrov-Galerkin耦合KAN和多项式检验空间,降阶求解正反PDE,性能优于现有方法。
流数据领域自适应的在线方差缩减
提出首个在线方差缩减算法ARROW,通过移动平均和自适应重加权,与离线算法性能相当。
Isaac Sim-to-Real:基于强化学习的四足机器人运动控制
利用Isaac Sim和Isaac Lab训练,实现四足机器人零样本sim-to-real运动控制,在Go1上达到线速度2.0m/s、角速度1.8rad/s,扰动恢复能力强。
用于纳米孔阻塞实验信号分类的多模态Transformer
针对纳米孔信号,多模态变换器联合时域、小波域和特征向量,在四十二肽基准上提升超十个百分点,跨数据集近完美
高斯过程建模中内置输入降维的贝叶斯框架
提出贝叶斯框架整合降维与高斯过程,使用黎曼流形HMC进行后验推断,扩展至深度高斯过程,提升预测与不确定性量化,但计算成本高。
Refnd:防止关系数据集中的数据泄漏
提出Refnd算法,基于关系生成过程与HNSW邻近图,防止信息泄漏,获得更真实的评估性能。
面向扭矩驱动的四足运动强化学习
提出扭矩控制RL框架用于重型四足机器人,无需速度估计即可穿越崎岖地形并跟踪速度,B1模拟达3.5m/s且能上下楼梯。
在Intel TDX环境下对NVIDIA H100进行机密GPU推理基准测试
机密推理下TTFT增加21.8%-27.8%,吞吐量下降17.7%-21.1%,大模型饱和更早。
混合LSTM-图神经框架实现稳健金融欺诈检测与对抗弹性
提出混合LSTM与图拓扑特征的FraudShield AI,结合Focal Loss和动态阈值,显著提升微小交易欺诈检测。
Stochastic Primal-Dual Decoding for Multiobjective Generative Recommender Systems
趋势强度预测生成式基础模型何时胜出:一项功率控制基准、一种机制及一个可操作的选择规则
趋势强度可预测生成式模型胜出:低趋势序列胜率78%,高趋势仅44%,优势源于趋势收缩效应。
模拟乌托邦:基于结果、表演性与动态重新审视长期公平
构建表演性马尔可夫决策过程与模拟器Eutopia,研究AI贷款长期公平,发现动态与公平意识效用提升效率与公平。
使单细胞数据蒸馏可审计:通过离散最小-最大选择实现可追溯的真实细胞核心集
Minmax-CF通过离散最小-最大选择生成可追溯单细胞核心集,性能接近完整数据且可审计。
可靠性感知硬-软物理信息神经网络:挑战性偏微分方程的鲁棒学习
提出RA-HSPINN,通过可学习可靠性场调制内部表示,配合损失平衡与正则化,显著提升挑战性PDE求解精度,尤其适用于局部、不可靠数据和多模态问题。
均衡因果博弈:分离、识别与循环潜状态的可识别性
ECG框架联合博弈与循环因果模型,揭示均衡数据下因果识别的条件与局限,需实验确定部分结论。
用于野火易发性制图的张量网络机器学习:从顿悟动力学到类别表示的量子混合度
张量网络模型揭示野火分类的顿悟动力学,用量子混合度量化类别可分离性。
因果字典学习揭示并验证基因组语言模型中的转录因子结合特征
提出因果字典学习框架,提取并因果验证基因组语言模型的转录因子结合特征,消除混淆,提供可解释性标准。
用于可靠量子纠错的机器学习综合征后选择
提出无需解码器的机器学习综合征后选择方法,提升量子纠错可靠性,实验验证有效。
基于解耦退火流的玻尔兹曼期望分子设计
以系综统计为目标,用解耦退火流优化分子图,无需重训练,可扩展至方差和偏度优化。
RELTA-SGLD:面向非凸随机梯度朗之万学习的相对增长局部驯服方法
RELTA-SGLD通过相对增长局部驯服稳定超线性梯度,提升非凸朗之万学习的稳定性与精度,改进现有界限。