11492 条条目 · 106 个活跃源
2026年9月1日
04:00
arXiv cs.LG

PathBridger:离线目标条件强化学习的子目标桥接

路径桥接器通过构建子目标桥并解码为动作块,衔接子目标选择与执行,提升离线长视野及多目标操作性能。

04:00
arXiv cs.LG

推理模型中隐藏指令的选择性披露:行为不对称与引导

推理模型思维链中更易泄露恶意隐藏指令(ICG),不对称性源于共享隐藏方向,可被激活加性向量诱导或抑制。

04:00
arXiv cs.LG

入口锁死、内部开放:RLVR 如何收窄解空间

RLVR 提升单次准确率但收窄解空间,损失集中在推理起点而非执行中,入口干预可恢复多样性。

04:00
arXiv cs.LG

使用蒙特卡洛树搜索(MCTS)与Gemini大语言模型框架的自主AI编程智能体开发

基于MCTS与Gemini的自主编码智能体,通过自评与回溯优化,复杂逻辑任务成功率高达92%,超越零样本模型。

04:00
arXiv cs.LG

HalluPrism:多模态不确定性应诊断而非决策

提出HalluPrism诊断法,用视觉扰动等探针区分失败类型,联合特征显著提升失败归因准确率,强调先诊断再决策。

04:00
arXiv cs.LG

可解释机器学习用于宽带接入差异:普查区级预测与SHAP因素剖析

可解释机器学习剖析8.3万普查区宽带差异,定位收入教育等因子,聚类三类,较收入法提升2.8个百分点

04:00
arXiv cs.LG

PathGuide:基于同策略传输对齐的动态无分类器引导

提出PathGuide,将无分类器引导尺度选择重构为在线策略传输问题,导出闭式二次目标,支持在线/离线调度,提升路径对齐与保真度。

04:00
arXiv cs.LG

归纳失效之处:描述长度难度与整数序列基准中的记忆鸿沟

MDL分析显示OEIS基准主要测量记忆,归纳在长序列失效,模型自信错误集中在易层。

04:00
arXiv cs.LG

面向浅层决策树归纳的自适应多分支方法

提出自适应多分支决策树MBNDT,端到端学习多路分裂,提升浅层树精度,21个基准上排名最佳,但叶子更多。

04:00
arXiv cs.LG

MEL:坐标保持的脑电标记化用于fMRI转换

提出MEL,通过坐标保持的脑电标记化对齐延迟-通道-频率,提升EEG到fMRI翻译预测,超越强基线。

04:00
arXiv cs.LG

更大批量何时有助于扩展大语言模型强化学习?

大批量可降梯度方差,但需权衡吞吐与样本效率;调优学习率后,GRPO训练时间最多缩短29%。

04:00
arXiv cs.LG

基于信息的专家乘积高斯过程模型不确定性量化校准

提出GP-pro-c校准专家乘积GP模型方差,利用信息增益单调子模性,NLL降2.3%,ENCE降12%,缓解过估并保持精度。

04:00
arXiv cs.LG

基于子图虚拟边重建的时空图反学习

提出时空图反学习框架,用虚拟边重建子图并集成元图,高效删除节点数据,精度接近最优模型。

04:00
arXiv cs.LG

基于空间熵划分的时空图反学习

提出空间熵划分方法,仅重训受影响子图,实现精确反学习,精度达94%,时间降一个数量级。

04:00
arXiv cs.LG

RL-FAT:用于公平对抗训练的强化学习

提出RL-FAT框架,采用策略梯度反馈,结合类别价值与公平强调损失,减轻类别间鲁棒性差异,同时提升鲁棒精度。

04:00
arXiv cs.LG

多机器人布置中无需乘子共识的全分布式广义纳什均衡算法

提出无乘子交换的全分布式连续时间算法,收敛至任意广义纳什均衡,降低通信开销并提升隐私,用于多机器人布置。

04:00
arXiv cs.LG

截断刘维尔谱中耗散率恢复的谱可辨识阈值

截断谱恢复耗散率需保留2^n模式;布居模式无退相干信息。最小二乘误差1e-9优于表格法但扰动削弱优势

04:00
arXiv cs.LG

面向非侵入式身体成分估计的目标感知状态自适应p-狄利克雷图神经网络回归

提出目标感知状态自适应p-狄利克雷图神经回归,基于非侵入测量估计体脂率、骨密度、瘦体重,相关加权模型误差最低,优于现有方法。

04:00
arXiv cs.LG

SS-ESOAP:物理信息学习中的自缩放自适应预条件

提出SS-ESOAP优化器,改进SOAP预条件,在8个PDE基准中6个取得最低残差,高效实现高精度训练。

04:00
arXiv cs.LG

单一能力还是多种能力?前沿AI评估经济效度检验

经济基准未构成独立能力,主要反映时间趋势,但能补充预测经济得分,领导榜差距需按日期调整。

04:00
arXiv cs.LG

基于CPRD的可扩展临床数据基础设施与老年多病共存患者住院风险预测的机器学习比较评估

CPRD上比较ML模型预测老年多病者住院风险:LASSO区分度略低但校准最佳,最适合临床部署。

04:00
arXiv cs.LG

行为潜伏期作为EEG反应时解码的弱事件时间监督

将EEG反应时解码转为事件时间后验建模,以行为潜伏期为弱监督,超标量回归,提供可解释概率框架。

04:00
arXiv cs.LG

潜在规划能否在点云中幸存?基于几何观测的动作条件JEPA世界模型

将三类JEPA世界模型用于点云均能规划不崩溃;动作敏感模型最优,可由目标直接构建隐状态。

04:00
arXiv cs.LG

定位与解锁模型生物中沙袋效应的因果模型

提出沙袋效应因果模型:早期层写入意图轴,后期层读取;单层嫁接恢复能力,上下文嫁接全面解锁。

04:00
arXiv cs.LG

从24小时腕部运动学习人类健康与疾病

自监督模型Sensori从24小时腕部运动原始数据学习健康表征,在12万人中验证,可显著提升52种疾病分类和26种疾病风险预测,尤其对神经精神疾病效果最佳。

04:00
arXiv cs.LG

参考嫁接在引出示弱能力上与微调相当

参考嫁接无需权重更新即可从示弱模型恢复隐藏能力,媲美微调;少量样本即可,但电路中断令固定编辑失效。

04:00
arXiv cs.LG

教师误设下的知识蒸馏:教师模仿与任务性能之间差距的序参量分析

教师误设不改变蒸馏误差,但真实误差及差距随误设增大并被真实教师复杂度放大;勿仅用模仿指标评估蒸馏。

04:00
arXiv cs.LG

预测不可预测:基于LLM的短时观测下长期混沌时间序列预测

提出PAC-LLM框架,融合相空间特征与文本信息,在短时观测下实现长期混沌预测,效果优于现有基线。

04:00
arXiv cs.LG

BEACON:通过三模态对比学习对AlphaEarth嵌入进行行为与语义增强

三模态对比学习融合文本与行为信号,增强地理基础模型对人类中心任务的预测,保持图像表示不变。

04:00
arXiv cs.LG

异步计算延迟下多机器人控制的协同在线学习

提出异步协同学习策略,兼顾预测精度、查询点差异与延迟,基于伴随多智能体设计分布式控制律,仿真验证显著提升学习与控制性能。

04:00
arXiv cs.LG

带预览的对抗式在线分类

随机预览可使对抗在线分类摆脱序贯复杂度,退化为统计复杂度;二分类超额损失Θ(d/p+√dT),多分类也有类似界。

04:00
arXiv cs.LG

哪款LLM用于哪项工作?不确定评估下的预算模型分配

预算有限下,两解证书判定LLM分配:估计与最不利表一致即确定;否则CASE补评。实例中信息价值高于优化。

04:00
arXiv cs.LG

论持续机器遗忘中的可塑性崩塌

发现持续机器遗忘存在可塑性崩塌,导致遗忘质量下降与记忆回弹,威胁系统长期可靠性。

04:00
arXiv cs.LG

去噪即投影:梯度引导扩散的约束优化

提出用Stein去噪器作近似投影的梯度引导扩散,在三种几何上证明收敛,兼顾目标下降与数据几何保持。

04:00
arXiv cs.LG

计算延迟下网络化系统的事件触发控制与在线学习

提出网络化在线学习控制架构,导出含计算延迟的跟踪误差界,设计异步事件触发机制实现同时间触发性能且排除Zeno行为。

04:00
arXiv cs.LG

HoopMind:面向对手感知控球规划的实时神经博弈树系统

融合五类公开数据建模423万次投篮,用神经网络评估价值,经剪枝期望最大化搜索实现实时控球规划与对手感知。

04:00
arXiv cs.LG

MedCache:面向纵向临床智能体的高效且时间有效的记忆

提出混合框架:构建时间有效记忆与重叠专科视图,路由查询并自适应多专家,提升推理准确性和记忆效率。

04:00
arXiv cs.LG

LLMODE:通过门控令牌注入对齐常微分方程与大语言模型,用于不规则时空预测

提出LLMODE框架,用图感知ODE编码不规则观测,经感知重采样与门控交叉注意力注入冻结大模型,实现高效预测与零样本泛化。

04:00
arXiv cs.LG

多样用户行为下排序策略的自适应双稳健离线策略评估

提出自适应双稳健估计器,融合自适应加权与奖励回归,在观测真实行为模型时无偏且方差更低,合成实验优于现有方法。

04:00
arXiv cs.LG

Wide Learning: Learning to Reach Evidence

04:00
arXiv cs.LG

无监督多尺度Gromov-Wasserstein超图对齐

提出FALCON框架,用多尺度Gromov-Wasserstein对齐超图节点,无需特征或种子,抗噪且优于基线。

04:00
arXiv cs.LG

高维旋转位置编码

提出高维旋转位置编码,基于Paley-I正交基将RoPE扩展至高维旋转,增强通道耦合,性能显著提升。

04:00
arXiv cs.LG

文本到视频扩散模型对硬件故障的韧性研究

首次研究T2V扩散模型硬件故障,单故障降3.7%,内存故障更伤,低精度格式易损,7-28%致语义改变。

04:00
arXiv cs.LG

以目标为中心的量化感知训练综述

以目标为中心的量化感知训练综述,系统梳理方法、跨目标差异与评估范式,探讨优化部署挑战及未来方向。

04:00
arXiv cs.LG

基于Wasserstein梯度流的一步生成模型奖励引导微调

提出基于Wasserstein梯度流的一步生成模型奖励微调方法,无需奖励梯度,缓解奖励黑客与模式坍塌,提升对齐性能。

04:00
arXiv cs.LG

最后一步至关重要:早期不确定性无法预测长周期智能体的失败

早期不确定性无法预测长周期智能体失败,仅最终步骤的置信度有效(AUROC 0.85)。

04:00
arXiv cs.LG

创造始于理解:大语言模型作为隐私保护表格数据合成的策略设计者

该方法用大语言模型设计合成流程而非直接生成记录,基于树摘要,兼顾统计保真度、预测效用与隐私风险,减少计算。

04:00
arXiv cs.LG

GraM-Diff:基于脑电图的阿尔茨海默病数据生成与诊断的统一图-曼巴扩散框架

提出图曼巴扩散框架,融合图卷积与双向状态空间,单模型生成健康与病理脑电,提升AD分类和鲁棒性。

04:00
arXiv cs.LG

PruneShift:结构化剪枝中决策可靠性评估框架

结构化剪枝因评估成本高常用替代指标,但现有摘要不可靠。该框架分离预测保真度与选择决策质量,证明秩相关可高而选择遗憾可大,实验显示决策可靠性需独立评估。

04:00
arXiv cs.LG

敏感度约束神经算子用于偏微分方程系统的数据高效正演与反演建模

敏感度约束神经算子引入采样雅可比监督,增强正演与反演,高维输入下精度成本权衡改善,海啸源反演验证。