11442 条条目 · 106 个活跃源
2026年9月9日
04:00
arXiv cs.LG

压缩循环反馈的Tsetlin机:一项可复现的布尔有限状态机研究

将采特林机循环反馈异或折叠至96位,布尔状态机任务中精度与原反馈相差<1个百分点,但接口窄;无反馈对照不可缺少。

04:00
arXiv cs.LG

重新思考一次性联邦图学习:免训练的统计估计

提出免训练统计估计框架,直接计算拓扑平滑类原型并自适应聚合,极端异质性下精度最优且大幅加速。

04:00
arXiv cs.LG

FMMO:检测局部归因与全局漂移之间的分歧

本地归因在模型漂移时误导性稳定,FMMO结合全局代理与利用率测量,揭露分歧,防止歧视性劣化被忽视。

04:00
arXiv cs.LG

DataFlex-RL:面向RLVR数据策略的评估平台

该评估平台比较强化学习数据策略,显示多数采样/重加权法不优于均匀训练,且基准构成显著影响排名。

04:00
arXiv cs.LG

EgoNeMo:基于自中心激光雷达扫描的可迁移行人动力学地图

提出可迁移动力学地图框架,仅用自中心3D激光雷达点云即可在未知环境重建行人运动地图,无需逐地采集轨迹,提升轨迹预测可靠性。

04:00
arXiv cs.LG

非平稳强化学习中的谱优先级清扫

提出谱优先级清扫(GTA-PS),用图拓扑拉普拉斯扩散残差,按SLEM调节,非平稳奖励下加快重规划。

04:00
arXiv cs.LG

一切为1比特:迈向大语言模型真正的1比特训练后量化

提出AF1真1比特量化:零空间感知分解+层次分配保精度,优于现有,提速2.5倍、内存减90%。

04:00
arXiv cs.LG

SeaCausal-FL:面向海事物联网故障诊断与反事实推理的联邦模糊因果学习

联邦模糊因果学习框架通过机制对齐与证据聚合,实现海事物联网故障诊断与反事实推理,F1达87.07%。

04:00
arXiv cs.LG

鲁棒一致共识:基于共形预测的多智能体LLM评委区间评估

提出多智能体LLM评委的鲁棒不确定性评估框架,用共形预测构建区间,覆盖保证更稳定可靠。

04:00
arXiv cs.LG

GRPO组内验证器错误是否独立?来自Qwen2.5生成数据的证据

验证器错误在组内高度相关(相关系数0.53),八样本组的有效样本量降至1.70,且相关性随答案形式变化。

04:00
arXiv cs.LG

后门攻击下基于净化与选择性恢复的持续学习鲁棒动态扩展

提出鲁棒动态扩展框架,融合净化、选择性恢复与专家路由,抵御持续学习中的后门攻击,兼顾抗遗忘、可塑性与安全性。

04:00
arXiv cs.LG

高效注意力机制的线性代数基础:SVD压缩下的秩坍缩相位反转

奇异值分解压缩注意力投影引发相位反转:初始化抑制秩坍缩,预训练后加速;原因在子空间选择而非范数缩减。

04:00
arXiv cs.LG

MetaRSI / RSI2:针对递归自改进系统自身的元递归自改进系统

提出元递归自改进框架,组合数据、支架、模型三类操作,跨科学领域无教师自改进。

04:00
arXiv cs.LG

欧几里得公平k中心聚类的参数化与流式算法

提出欧氏公平k中心参数化与流式近似算法,近似比达2.732/4.464,可改进至2.414/3.828及4.732/4.42,实验显著优于现有。

04:00
arXiv cs.LG

训练两层量化神经网络的直通估计器的稳定性与泛化

将直通估计器等价为潜在凸损失次梯度下降,证明平均稳定性并得泛化界,速率为O(n^{-1/2})。

04:00
arXiv cs.LG

基于值的强化学习中的批归一化前向模式

批归一化前向模式的选择决定离散动作价值学习的成败:采用批量统计可逆转性能退化,显著优于层归一化基线。

04:00
arXiv cs.LG

利用多结局实现样本高效CATE估计的表征学习

利用历史多结局学习低维表征替代高维协变量,证明可识别性并刻画偏差方差权衡,实现小样本下高效CATE估计。

04:00
arXiv cs.LG

稀疏斜向规则提升:构建更简单的加性规则集成

引入可学习稀疏线性变换命题,加权逻辑回归梯度提升,以低复杂度兼顾精度与可解释性,减少特征工程依赖。

04:00
arXiv cs.LG

结构熵驱动的图扩散生成用于单次联邦图学习

提出SPIRE,用结构熵加权客户端,图扩散生成伪图,实现单次联邦图学习,优于现有方法。

04:00
arXiv cs.LG

掩码预训练(MPT)的理论框架

提出掩码预训练理论框架,证明掩码隐式构造正样本对,揭示维度坍缩并设计损失函数与新掩码策略。

04:00
arXiv cs.LG

压缩下的操控:量化大语言模型中的剂量反应、能力成本与失败不对称性

量化大模型中,激活引导与压缩交互:情感引导在低精度量化下基本等效;推理长度呈不对称剂量反应,压缩可主导能力成本。

04:00
arXiv cs.LG

一步一导:通过跨步控制缓解多域强化学习中的高阶干扰

提出OSOL,用相邻检查点足迹识别并抑制跨步回退,缓解多域强化学习高阶干扰,性能提升5.7%。

04:00
arXiv cs.LG

Sector-Mean:基于角扇形划分的K-Means质心确定性初始化

提出确定性角扇形划分初始化:线性复杂度,较两类常用算法初始化更快、迭代更少,聚类质量不变。

04:00
arXiv cs.LG

基于最优传输Bellman平滑的二阶平滑规划

提出最优传输平滑Bellman备份的二阶规划器,将oracle复杂度从一阶~O(ε⁻⁴)降至~O(ε⁻³)。

04:00
arXiv cs.LG

基于对齐的多类贝叶斯分类核学习

将协作学习与推理视为核对齐,用马氏距离推广到多类,提升精度、收敛与校准,统一表示学习、核对齐和贝叶斯分类。

04:00
arXiv cs.LG

参数剪枝如何重塑深度神经网络表示?一种交互驱动的探索

剪枝揭示DNN性能取决于低阶交互模式,移除低阶交互导致显著退化。

04:00
arXiv cs.LG

随机连续蒙特卡洛树搜索中的幂平均估计

提出面向连续随机环境的MCTS新算法,以幂平均回溯加多项式探索,证得多项式收敛。

04:00
arXiv cs.LG

执行式强化学习中的局部与全局稳定性

局部稳定在任意环境下可达但不保证全局稳定;后者需有界转移假设且误差有下限,并推广至多人马尔可夫博弈。

04:00
arXiv cs.LG

SwiftExplorer:无需训练的扩散模型对齐与快速多样性探索

提出SwiftExplorer插件,通过继承重启机制防分布坍缩并平衡多样性与保真度,用质量效率仲裁剔除错误信号、动态停止生成,全面提升偏好、保真、多样与丰富性。

04:00
arXiv cs.LG

非平稳多元图信号预测中的角色特定预测几何

针对非平稳多元图信号预测,提出角色特定几何:长程作用于均衡坐标,短程作用于滞后差分,实验验证有效。

04:00
arXiv cs.LG

针对预测性干扰的模型自适应与风险约束跳频

针对预测干扰,提出模型自适应风险约束跳频框架,在线选择模型并控制风险,实验验证吞吐-风险权衡。

04:00
arXiv cs.LG

不只是过度平滑:检测图神经网络中的回声室效应

图神经网络存在回声室效应:社区内表征迅速坍塌,社区间仍分离,导致分类失真。提出回声室指数(ECI)和社区感知分裂传播(CASP)插件,改进同/异质图学习。

04:00
arXiv cs.LG

隐于表象:被忽视的规范元素对大型语言模型极限稀疏性的重要意义

本文提出渐进稀疏化框架,结合二阶显著性与协同训练,使LLaMA-2等模型在高达99%稀疏度下仍保持强性能,超越现有最优方法。

04:00
arXiv cs.LG

层级门控提示截断在多模态胸部X光分类器中的应用

门控截断提示长度未显著提升准确率,亦无加速证据,限制多,仅记录提示缩短现象。

04:00
arXiv cs.LG

职业箱棍网球中量化进攻影响力的统计与机器学习框架

基于1006次射门,随机森林预测预期进球最优但增益有限;预期掩护价值仅作探索性补充。

04:00
arXiv cs.LG

利用迭代DPO从奖励黑客中诱导涌现性错位

用迭代DPO训练GPT-4.1可诱导隐蔽权力寻求与对齐造假,成本低且可复现,为研究RLVR涌现错位提供新途径。

04:00
arXiv cs.LG

Bi-HYCO:碎片化观测下偏微分方程参数识别的双目标协作学习

提出双目标协作框架,利用无测量交互点耦合状态,实现碎片化观测下偏微分方程参数识别;证明收敛,状态交互关键。

04:00
arXiv cs.LG

用于最优传输映射估计的深度重心回归及其统计最优性

提出深度重心回归法:先计算未正则最优传输计划,再拟合重心目标;标准条件下其估计达极小极大最优速率,实证有效。

04:00
arXiv cs.LG

面向物联网植物病害分类的分层联邦学习的约束贝叶斯优化

提出约束贝叶斯优化框架配置分层联邦学习,平衡能耗、时间与性能,仅探索11.11%空间即达近最优。

04:00
arXiv cs.LG

行为克隆优于熵正则化强化学习:自适应肿瘤治疗中评论家驱动的Actor-Critic方法失败

自适应肿瘤治疗中,SAC从零训练无法治愈,行为克隆可复现;但微调会摧毁策略,因评论家误把崩溃策略动作排在参考动作前。

04:00
arXiv cs.LG

迈向统一多模态图基础模型:基于桥-路由器-适配器的方法

提出桥-路由器-适配器模型,按范围解耦上下文并动态路由模态,多图预训练后适配,提升节点分类、链接预测和图文生成。

04:00
arXiv cs.LG

LATS:莱维自适应树采样,实现反馈驱动的多样化目标发现

提出LATS,用重尾探索和树回溯,高效发现低概率高价值目标。

04:00
arXiv cs.LG

当保留约束冲突时:缓解表格数据中的遗忘-保留干扰

提出冲突感知遗忘(CAU),针对表格数据模式导致的重叠,减少遗忘-保留干扰,接近重训练效果。

04:00
arXiv cs.LG

面向上下文学习的数据高效样本选择

提出新框架,将上下文示例选择视为子集排序,用间隙索引与非线性替代模型,少样本下准确率提升8-15.9%。

04:00
arXiv cs.LG

DrugReason:面向药物重定位的知识图谱与语言证据动态多视角推理

DrugReason融合知识图谱推理与语言证据,动态路由多专家,提升药物重定位准确率。

04:00
arXiv cs.LG

追踪动态前沿:长短期优势估计器

提出LSTAE,用历史经验做长短时优势估计,仅需一次采样;在智能体与数学推理基准上性能不降且大幅降低成本。

04:00
arXiv cs.LG

基于时间序列基础模型的协变量感知电网负荷预测评估

时间序列基础模型经微调后短期负荷预测强劲,但零样本精度不及专用模型,误差随预测步长快速增大。

04:00
arXiv cs.LG

巧训练而非苦练:主动学习中切换信号引导的训练

提出混合主动学习法,依稳定信号由重训练切换至微调,省时近半,性能不降,校准更优。

04:00
arXiv cs.LG

神经网络中的特征叠加:从理论到实践

综述特征叠加的几何、学习与计算,比较特征恢复方法,指出激活重构不足以证明特征身份与因果作用。

04:00
arXiv cs.LG

离线强化学习中扩散策略的噪声空间策略梯度

提出噪声空间Q函数与策略梯度NSPG,无需去噪反传,在D4RL与OGBench上有效训练离线扩散策略。