11682 条条目 · 106 个活跃源
2026年7月31日
04:00
arXiv cs.LG

平均奖励CMDP中阶最优神经Actor-Critic的分层多级蒙特卡洛

提出分层多级蒙特卡洛神经评论家,解决偏差-成本权衡,实现平均奖励CMDP的阶最优收敛。

04:00
arXiv cs.LG

QQWorld:世界模型正则化的分位数-分位数匹配

提出分位数-分位数匹配正则,替代原方法,改善尾部梯度,提升规划成功率与高斯对齐。

04:00
arXiv cs.LG

GNN中的同图跨任务迁移:协议与预测器

提出无泄漏协议研究同图NC-LP迁移:有方向性,NC→LP在同类图有效,LP→NC脆弱;CTS可指导机制选择。

04:00
arXiv cs.LG

面向大规模动作空间的在线与离线策略学习

研究大动作空间上下文赌博机策略学习,提出在线贝叶斯与离线结构方法,缓解探索低效、覆盖稀疏、方差高问题。

04:00
arXiv cs.LG

QAdapt:面向量子纠错的噪声自适应神经预解码框架

提出噪声自适应神经预解码框架,捕获时空相关,顺序适应噪声,降低逻辑错误率与解码延迟。

04:00
arXiv cs.LG

结合短期图记忆的预算受限分子优化

短期图记忆模块用图神经网络预筛候选,固定预算下优先高价值评估,零额外成本提升前十,对四个生成器有效。

04:00
arXiv cs.LG

基于推理增强语言模型的网络安全检测分类

针对SOC警报疲劳,训练推理增强分类器并加校准器,显著提升良性/恶意召回,精调30B模型优于通用模型。

04:00
arXiv cs.LG

用于图像分类的Nishimori温度下稀疏图上的Kohn-Sham谱嵌入

提出西森温度稀疏图谱嵌入模型,以2124万参数在图像网千类上达88.93%精度,超越大模型。

04:00
arXiv cs.LG

因果性在算法救济中的作用

提出因果性算法救济框架,建模行为响应,实现稳定均衡,减少博弈,避免重复训练,优于经验风险最小化。

04:00
arXiv cs.LG

β-OPSD:用策略优化推导,用自蒸馏训练

提出β-OPSD,将自蒸馏与策略优化统一,用参考/教师logits插值作蒸馏目标,提升数学推理性能与稳定性。

04:00
arXiv cs.LG

APO:面向原子系统三维结构预测的无监督原子策略优化

提出无监督对齐框架,用双奖励组相对策略优化预测原子三维结构,免真实标签,晶体与抗体预测超越监督基线。

04:00
arXiv cs.LG

审稿分数在ML同行评审的不同研究领域间不可比

ML评审分数跨领域不可比,同分录取率因主题相差8倍,应发布校准信号与分层指标。

04:00
arXiv cs.LG

KAISEN:临床风险模型的可复现亚组公平性审计

合成基准可复现审计揭示:阈值优化有效,校准方差大,代理误设难察,漂移阈值不迁移。

04:00
arXiv cs.LG

基础模型地球表征助力美国东北部区域尺度森林地上生物量监测

基础模型表征结合激光雷达,估算森林生物量R²达0.82,偏差降70%,支持年度碳监测。

04:00
arXiv cs.LG

PlantBGC:基于无标签域适应和弱监督的植物BGC发现Transformer

植物BGC发现模型:无标签域适应迁移微生物知识,恢复率29.4%升67.6%,降假阳性,簇更紧凑。

04:00
arXiv cs.LG

Psych-ECA:纵向精神病学中合成对照臂的可复现半合成基准

发布可复现半合成基准Psych-ECA:评估精神病学合成对照臂;轨迹与机器学习最准,Scribe校准最佳,逆强度校正降偏倚。

04:00
arXiv cs.LG

更多数据,更糟决策?Gram不兼容下神经网络的偏好反转

池化重拟合会反转共享偏好;提出Gram失配度量、几何正则化和三步审计,衡量并提升组合可靠性。

04:00
arXiv cs.LG

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准

提出多源多芯片基准,评估大模型/智能体生成内核:智能体优于简单采样,但跨平台性能下降、成本极高。

04:00
arXiv cs.LG

散度解码:免训练能力融合

散度解码免训练融合专家与通用模型:用詹森-香农散度监控分歧,动态路由,超越领域与通用模型。

2026年7月30日
04:00
arXiv cs.LG

跨对齐、模式生物和玩具模型的共享SFT经验

研究将对齐训练等领域的SFT经验相互迁移,验证了行为泛化、能力保持和鲁棒性的跨领域适用性。

04:00
arXiv cs.LG

Top-k帕累托老虎机:多目标候选集选择的超体积遗憾

提出THV-UCB算法,用超体积遗憾理论保证多目标候选集近似帕累托前沿。

04:00
arXiv cs.LG

用于人类反馈强化学习的元学习奖励塑形

提出MeRLa框架,通过元学习任务感知奖励塑形,提升RLHF对齐质量和训练稳定性,在多项基准上超越现有方法。

04:00
arXiv cs.LG

Sim2Win:一种与球队无关、基于事件的足球赛前结果预测与战术画像系统

Sim2Win无需球队身份,基于战术画像预测赛果,未知球队上AUC达0.704,优于基线。

04:00
arXiv cs.LG

中文标题:数据融合与对比对齐实现无限制红外分子结构解析

中文摘要:提出MoE解码器和非加性聚合改进Transformer,结合对比对齐损失,使红外光谱无限制分子结构解析准确率提升超10个百分点。

04:00
arXiv cs.LG

弱至强同策略蒸馏

利用正负弱模型对比构建代理教师,同策略蒸馏使强学生超越弱教师,监督弱时仍有效。

04:00
arXiv cs.LG

动态参数化并非动态推理

动态参数化不等同动态推理,功能动态不保证计算节省,需分别报告系数变化、模型依赖和执行。

04:00
arXiv cs.LG

梯度与自然梯度之间:LoRA初始化的一个连续谱

LoRA初始化方法实为梯度预处理连续谱,最佳点随任务变化,调优后可达或超越全微调性能。

04:00
arXiv cs.LG

早期判断,更优预算:面向计算高效RLVR的序贯自适应推出分配

SARA用序贯分配两阈值停止规则,早期判断提示有效性,节省rollout预算22%-67%,性能匹配或超越现有方法。

04:00
arXiv cs.LG

深度强化学习中冻结随机CNN特征提取器的涌现稀疏性

冻结随机CNN在深度强化学习中涌现稀疏全连接层:活跃神经元数与任务复杂度正相关,限制性能,且早期锁定。

04:00
arXiv cs.LG

Q-Steer:分子策略优化的动作价值引导

Q-Steer用预训练的离线价值评分器引导分子语言模型采样,不增加在线预算,显著提升优化奖励。

04:00
arXiv cs.LG

自同构诱导的图神经网络Top-k解释非规范性

自同构导致GNN的top-k解释存在任意性,提出判据验证其普遍性,报告轨道可消除。

04:00
arXiv cs.LG

FloDR:一种基于归一化流的可逆降维方法

FloDR利用可逆归一化流降维,保留剩余坐标,实现精确逆映射与密度诊断。

04:00
arXiv cs.LG

RAGuard:面向检索增强生成系统抵御数据投毒的分层防御框架

提出RAGuard分层防御,对抗性检索结合ZKIP过滤器,将投毒攻击成功率降至0.000,召回率接近基线。

04:00
arXiv cs.LG

实践中的实体解析:自助服务管线的经验教训

自助ER系统三教训:无最优单一算法,精度与召回分别优化,假阳性合并需主动重验。

04:00
arXiv cs.LG

从多智能体演示中学习隐式因果世界模型

提出隐式因果世界模型,从多智能体离线演示中恢复环境动态,无需预定义因果图,在协调任务中提供可解释因果表示,精度随干预强度提升

04:00
arXiv cs.LG

MetaKoopman:面向分布偏移下结构化动力学的Koopman算子贝叶斯元学习方法

提出贝叶斯元学习框架MetaKoopman,利用Koopman算子线性表示,实现分布偏移下非线性动力学的鲁棒建模与预测。

04:00
arXiv cs.LG

通过k阶忠实性假设松弛的高阶马尔可夫毯发现

提出k阶忠实性松弛,用于发现高阶马尔可夫毯,可处理奇偶关系及数据违反。

04:00
arXiv cs.LG

后训练于可检测性边缘:微调的博弈论方法

提出博弈论框架优化KL正则化系数,平衡奖励与统计可区分性,实验验证有效。

04:00
arXiv cs.LG

ClockRoPE:用于时间例行建模的随机傅里叶旋转

提出ClockRoPE方法,通过随机傅里叶旋转模拟周期注意力,改进序列推荐中的时间建模,已在视频平台部署并提升用户参与度。

04:00
arXiv cs.LG

从接口到推理:从任意顺序模型中引出任意顺序推理

针对掩码扩散模型接口-推理差距,提出插入式与潜在空间两种方法,实现任意顺序推理并提升性能。

04:00
arXiv cs.LG

通过非梯度向量流学习流映射

SGFlow通过非梯度向量流学习流映射,无需可逆约束和反向传播,在CIFAR上10步采样FID最优,具有固定点保证。

04:00
arXiv cs.LG

DHRCL:使用密集分层奖励与课程学习训练代码大语言模型

DHRCL通过密集分层奖励和三阶段课程学习训练代码大模型,自动调整阶段时长,显著提升性能。

04:00
arXiv cs.LG

通过迭代优化从隐式交互流中学习动态用户画像

IRIS从隐式交互学习动态用户画像,无需显式反馈,决策预测准确率达61.0%

04:00
arXiv cs.LG

面向交通预测的神经架构搜索:方法、挑战与未来方向综述

综述NAS在交通预测的应用,按搜索策略分类,分析空间设计与成本权衡,探讨可扩展性等挑战与未来方向。

04:00
arXiv cs.LG

带损坏观测的共形变点定位与根因分析

针对损坏观测,提出加权共形变点定位与根因分析,降权可疑数据缩小置信集,维持目标覆盖概率。

04:00
arXiv cs.LG

从概念水文模型到概念可解释神经网络:一个雪水质量守恒感知机框架用于发现流域尺度降水-存储-径流表征

MCP将概念水文模型转为可解释神经网络,多状态网络在513流域验证,两状态后增益递减,MCP与LSTM精度相当但参数更少。

04:00
arXiv cs.LG

SCOUT:面向稀疏奖励强化学习的逐上下文重置课程

SCOUT为每个上下文独立重置课程,仅凭成功信号动态移除/恢复辅助,解决学习速率差异,优于全局调度。

04:00
arXiv cs.LG

存在场扩散模型用于可变基数空间点过程

提出存在场扩散模型,通过存在变量统一建模位置与基数,无需离散转换,提升可变基数空间点过程生成能力。

04:00
arXiv cs.LG

图神经网络消息传递在回归场景中的效能研究

本文发现深度卷积GNN在回归任务中优于注意力GNN,经典理论GNN仍具竞争力。

04:00
arXiv cs.LG

用于大语言模型端到端强化学习后训练的HiFloat4格式

首次FP4端到端RL后训练,Rollout-ResQ与HiF4格式将精度差距从4.9%降至1.1%。