平均奖励CMDP中阶最优神经Actor-Critic的分层多级蒙特卡洛
提出分层多级蒙特卡洛神经评论家,解决偏差-成本权衡,实现平均奖励CMDP的阶最优收敛。
QQWorld:世界模型正则化的分位数-分位数匹配
提出分位数-分位数匹配正则,替代原方法,改善尾部梯度,提升规划成功率与高斯对齐。
GNN中的同图跨任务迁移:协议与预测器
提出无泄漏协议研究同图NC-LP迁移:有方向性,NC→LP在同类图有效,LP→NC脆弱;CTS可指导机制选择。
面向大规模动作空间的在线与离线策略学习
研究大动作空间上下文赌博机策略学习,提出在线贝叶斯与离线结构方法,缓解探索低效、覆盖稀疏、方差高问题。
QAdapt:面向量子纠错的噪声自适应神经预解码框架
提出噪声自适应神经预解码框架,捕获时空相关,顺序适应噪声,降低逻辑错误率与解码延迟。
结合短期图记忆的预算受限分子优化
短期图记忆模块用图神经网络预筛候选,固定预算下优先高价值评估,零额外成本提升前十,对四个生成器有效。
基于推理增强语言模型的网络安全检测分类
针对SOC警报疲劳,训练推理增强分类器并加校准器,显著提升良性/恶意召回,精调30B模型优于通用模型。
用于图像分类的Nishimori温度下稀疏图上的Kohn-Sham谱嵌入
提出西森温度稀疏图谱嵌入模型,以2124万参数在图像网千类上达88.93%精度,超越大模型。
因果性在算法救济中的作用
提出因果性算法救济框架,建模行为响应,实现稳定均衡,减少博弈,避免重复训练,优于经验风险最小化。
β-OPSD:用策略优化推导,用自蒸馏训练
提出β-OPSD,将自蒸馏与策略优化统一,用参考/教师logits插值作蒸馏目标,提升数学推理性能与稳定性。
APO:面向原子系统三维结构预测的无监督原子策略优化
提出无监督对齐框架,用双奖励组相对策略优化预测原子三维结构,免真实标签,晶体与抗体预测超越监督基线。
审稿分数在ML同行评审的不同研究领域间不可比
ML评审分数跨领域不可比,同分录取率因主题相差8倍,应发布校准信号与分层指标。
KAISEN:临床风险模型的可复现亚组公平性审计
合成基准可复现审计揭示:阈值优化有效,校准方差大,代理误设难察,漂移阈值不迁移。
基础模型地球表征助力美国东北部区域尺度森林地上生物量监测
基础模型表征结合激光雷达,估算森林生物量R²达0.82,偏差降70%,支持年度碳监测。
PlantBGC:基于无标签域适应和弱监督的植物BGC发现Transformer
植物BGC发现模型:无标签域适应迁移微生物知识,恢复率29.4%升67.6%,降假阳性,簇更紧凑。
Psych-ECA:纵向精神病学中合成对照臂的可复现半合成基准
发布可复现半合成基准Psych-ECA:评估精神病学合成对照臂;轨迹与机器学习最准,Scribe校准最佳,逆强度校正降偏倚。
更多数据,更糟决策?Gram不兼容下神经网络的偏好反转
池化重拟合会反转共享偏好;提出Gram失配度量、几何正则化和三步审计,衡量并提升组合可靠性。
KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准
提出多源多芯片基准,评估大模型/智能体生成内核:智能体优于简单采样,但跨平台性能下降、成本极高。
散度解码:免训练能力融合
散度解码免训练融合专家与通用模型:用詹森-香农散度监控分歧,动态路由,超越领域与通用模型。
跨对齐、模式生物和玩具模型的共享SFT经验
研究将对齐训练等领域的SFT经验相互迁移,验证了行为泛化、能力保持和鲁棒性的跨领域适用性。
Top-k帕累托老虎机:多目标候选集选择的超体积遗憾
提出THV-UCB算法,用超体积遗憾理论保证多目标候选集近似帕累托前沿。
用于人类反馈强化学习的元学习奖励塑形
提出MeRLa框架,通过元学习任务感知奖励塑形,提升RLHF对齐质量和训练稳定性,在多项基准上超越现有方法。
Sim2Win:一种与球队无关、基于事件的足球赛前结果预测与战术画像系统
Sim2Win无需球队身份,基于战术画像预测赛果,未知球队上AUC达0.704,优于基线。
中文标题:数据融合与对比对齐实现无限制红外分子结构解析
中文摘要:提出MoE解码器和非加性聚合改进Transformer,结合对比对齐损失,使红外光谱无限制分子结构解析准确率提升超10个百分点。
弱至强同策略蒸馏
利用正负弱模型对比构建代理教师,同策略蒸馏使强学生超越弱教师,监督弱时仍有效。
动态参数化并非动态推理
动态参数化不等同动态推理,功能动态不保证计算节省,需分别报告系数变化、模型依赖和执行。
梯度与自然梯度之间:LoRA初始化的一个连续谱
LoRA初始化方法实为梯度预处理连续谱,最佳点随任务变化,调优后可达或超越全微调性能。
早期判断,更优预算:面向计算高效RLVR的序贯自适应推出分配
SARA用序贯分配两阈值停止规则,早期判断提示有效性,节省rollout预算22%-67%,性能匹配或超越现有方法。
深度强化学习中冻结随机CNN特征提取器的涌现稀疏性
冻结随机CNN在深度强化学习中涌现稀疏全连接层:活跃神经元数与任务复杂度正相关,限制性能,且早期锁定。
Q-Steer:分子策略优化的动作价值引导
Q-Steer用预训练的离线价值评分器引导分子语言模型采样,不增加在线预算,显著提升优化奖励。
自同构诱导的图神经网络Top-k解释非规范性
自同构导致GNN的top-k解释存在任意性,提出判据验证其普遍性,报告轨道可消除。
FloDR:一种基于归一化流的可逆降维方法
FloDR利用可逆归一化流降维,保留剩余坐标,实现精确逆映射与密度诊断。
RAGuard:面向检索增强生成系统抵御数据投毒的分层防御框架
提出RAGuard分层防御,对抗性检索结合ZKIP过滤器,将投毒攻击成功率降至0.000,召回率接近基线。
实践中的实体解析:自助服务管线的经验教训
自助ER系统三教训:无最优单一算法,精度与召回分别优化,假阳性合并需主动重验。
从多智能体演示中学习隐式因果世界模型
提出隐式因果世界模型,从多智能体离线演示中恢复环境动态,无需预定义因果图,在协调任务中提供可解释因果表示,精度随干预强度提升
MetaKoopman:面向分布偏移下结构化动力学的Koopman算子贝叶斯元学习方法
提出贝叶斯元学习框架MetaKoopman,利用Koopman算子线性表示,实现分布偏移下非线性动力学的鲁棒建模与预测。
通过k阶忠实性假设松弛的高阶马尔可夫毯发现
提出k阶忠实性松弛,用于发现高阶马尔可夫毯,可处理奇偶关系及数据违反。
后训练于可检测性边缘:微调的博弈论方法
提出博弈论框架优化KL正则化系数,平衡奖励与统计可区分性,实验验证有效。
ClockRoPE:用于时间例行建模的随机傅里叶旋转
提出ClockRoPE方法,通过随机傅里叶旋转模拟周期注意力,改进序列推荐中的时间建模,已在视频平台部署并提升用户参与度。
从接口到推理:从任意顺序模型中引出任意顺序推理
针对掩码扩散模型接口-推理差距,提出插入式与潜在空间两种方法,实现任意顺序推理并提升性能。
通过非梯度向量流学习流映射
SGFlow通过非梯度向量流学习流映射,无需可逆约束和反向传播,在CIFAR上10步采样FID最优,具有固定点保证。
DHRCL:使用密集分层奖励与课程学习训练代码大语言模型
DHRCL通过密集分层奖励和三阶段课程学习训练代码大模型,自动调整阶段时长,显著提升性能。
通过迭代优化从隐式交互流中学习动态用户画像
IRIS从隐式交互学习动态用户画像,无需显式反馈,决策预测准确率达61.0%
面向交通预测的神经架构搜索:方法、挑战与未来方向综述
综述NAS在交通预测的应用,按搜索策略分类,分析空间设计与成本权衡,探讨可扩展性等挑战与未来方向。
带损坏观测的共形变点定位与根因分析
针对损坏观测,提出加权共形变点定位与根因分析,降权可疑数据缩小置信集,维持目标覆盖概率。
从概念水文模型到概念可解释神经网络:一个雪水质量守恒感知机框架用于发现流域尺度降水-存储-径流表征
MCP将概念水文模型转为可解释神经网络,多状态网络在513流域验证,两状态后增益递减,MCP与LSTM精度相当但参数更少。
SCOUT:面向稀疏奖励强化学习的逐上下文重置课程
SCOUT为每个上下文独立重置课程,仅凭成功信号动态移除/恢复辅助,解决学习速率差异,优于全局调度。
存在场扩散模型用于可变基数空间点过程
提出存在场扩散模型,通过存在变量统一建模位置与基数,无需离散转换,提升可变基数空间点过程生成能力。
图神经网络消息传递在回归场景中的效能研究
本文发现深度卷积GNN在回归任务中优于注意力GNN,经典理论GNN仍具竞争力。
用于大语言模型端到端强化学习后训练的HiFloat4格式
首次FP4端到端RL后训练,Rollout-ResQ与HiF4格式将精度差距从4.9%降至1.1%。