11362 条条目 · 106 个活跃源
2026年9月22日
04:00
arXiv cs.LG

COREM:余弦关系动量重塑与有状态写回

COREM借余弦关系重塑动量并写回状态,提升中后期训练,最终性能更优或相当且计算更省。

04:00
arXiv cs.LG

面向自动化LLM微调的策略积累与引导执行

提出SAGE两阶段框架,积累微调策略经验并引导新任务,平均相对提升由3.2%升至15.6%。

04:00
arXiv cs.LG

教师应提前思考:面向可靠同策略蒸馏的自适应续写

提出AC-OPD,通过方差-偏差权衡自适应选择教师续写范围,提升同策略蒸馏可靠性。

04:00
arXiv cs.LG

RS-Claw-Evolution:面向长时程任务的轻量级遥感智能体环境反馈驱动进化

提出环境反馈驱动三阶段进化框架,经交互、经验与决策进化提升轻量遥感智能体长时程任务表现。

04:00
arXiv cs.LG

复值相位相干Transformer

复值模型需L2归一化Q/K并保持一阶尺度余弦注意力;PCT多任务超实值基线,首次纯复值解Path-X

04:00
arXiv cs.LG

共因,而非交叉注意力:阻断音视频生成中的视觉捷径

音视频生成器易学视觉捷径,从外观而非因果事件预测声音;共享潜变量无效,需干预干扰并保证反事实不变性。

04:00
arXiv cs.LG

通过专家共激活实现高效混合专家投机解码

提升专家共激活可缓解显存传输瓶颈;结合负载均衡、共享专家与一致性损失等设计,吞吐量提升21%。

04:00
arXiv cs.LG

抵制、更新、拒绝:偏好优化植入依赖先验的可靠性开关

偏好优化通过可靠性标注数据,给模型装上依赖先验的开关:按来源声明的可靠性决定是否改答。

04:00
arXiv cs.LG

连接内容检索器:稠密图边特征驱动 LinkedIn 预排序

LinkedIn 提出 CC Retriever 预排序系统,用 GPU 低延迟运行全深度排序模型,参数扩大 50 倍,内容停留时长提升 2.5%。

04:00
arXiv cs.LG

TWIG:面向不规则图上自回归预测的时间因果小波算子

TWIG为图原生神经算子,以因果多尺度小波特征在图小波块上传播,实现不规则图上稳定自回归预测。

04:00
arXiv cs.LG

基于极小极大单臂停时方法的多臂伯努利老虎机

提出基于极小极大单臂停时的伯努利多臂老虎机索引策略,遗憾界4.45√KT+10.75K,达最优阶且数值优于基线。

04:00
arXiv cs.LG

基于因果网的并发感知过程模型预测

用因果网预测过程模型,预测关系/绑定计数重构AND/XOR语义;实验表明优于静态基线,接近重挖掘。

04:00
arXiv cs.LG

基于机器学习方法的用户级切换决策

比较机器学习用于用户级切换决策:SVM、MLP适合切换目标分类,SOFL处理更快,LightGBM估计下载时间误差最小。

04:00
arXiv cs.LG

面向工业4.0预测性维护的混合深度学习架构基准评测

700余次实验表明:LSTM+Transformer混合模型比Transformer更抗噪、更可靠。

04:00
arXiv cs.LG

EmbeddGAN:一种利用嵌入网络与基尼距离相关性的新型GAN框架

提出EmbeddGAN,用嵌入网络与基尼距离相关性替代判别器,依赖博弈训练生成器,缓解不稳定、模式崩溃,多数据集稳定且具竞争力。

04:00
arXiv cs.LG

类别条件误差约束下的带弃权分类

针对类别条件误差约束下的二分类弃权问题,刻画超额弃权风险的极小极大率并提出代理损失方法。

04:00
arXiv cs.LG

面向长周期产量预测的单调约束扩散模型

提出单调约束的条件扩散预测模型,用负引导与等渗投影保证长周期油气产量预测单调,精度具竞争力。

04:00
arXiv cs.LG

用深度强化学习增强PID控制:面向工业基准的混合方法

混合PID-RL控制器用TD3搜索工业基准最优参数,交由PID执行,兼顾性能、效率与可靠性。

04:00
arXiv cs.LG

反向传播权重的起起落落

反向传播存在权重纠缠;提出可复用权重算子,推理时组合,两阶段学习更新选中参数,验证功能参数可识别性。

04:00
arXiv cs.LG

面向数字孪生制造控制的自主模型生命周期管理

汽车制造数字孪生闭环系统自主管理模型生命周期,嵌入操作员信任门控,稳定性提升28-45%,零事故。

04:00
arXiv cs.LG

D-IMPL:面向参数化黑盒优化的扩散求解器

提出扩散求解器D-IMPL,学习最小化策略以摊销参数化黑盒优化成本,兼具理论保证与实验验证。

04:00
arXiv cs.LG

一种学习统一时间感知补丁表示的混合注意力模型,用于不规则多变量时间序列预测

提出混合注意力模型,学习统一时间感知补丁表示,免插补预测不规则多变量时间序列,零样本性能领先。

04:00
arXiv cs.LG

引导之前先观察:几何结构可预测SAE特征的可操控性

SAE解码器空间几何可在干预前预测特征引导成本,跨模型宽度与规模复现,深层减弱。

04:00
arXiv cs.LG

基于对抗强化学习的Hawkes订单流与价格冲击鲁棒做市

将对抗强化学习做市扩展至Hawkes自激订单流与价格冲击环境,引入LSTM建模时序,提升收益左尾鲁棒性。

04:00
arXiv cs.LG

基于多尺度阈值检验的改进私有稀疏协方差估计

提出多尺度随机阈值算法,将差分隐私稀疏协方差估计的隐私相关样本复杂度降低√k并匹配下界。

04:00
arXiv cs.LG

效用、成本与权限约束下的反事实工具排序

提出可证伪的反事实工具评估法,发现直接回归与DR优劣随设定反转,并提供独立公开证据。

04:00
arXiv cs.LG

FIRM-WM:面向无奖励视觉规划的状态因子化事实-干预递归建模

提出状态因子化事实-干预递归世界模型,分离目标可比状态与动态信息,提升无奖励视觉规划性能与效率。

04:00
arXiv cs.LG

基于模型无关元学习的个性化联邦强化学习:精确与无Hessian元策略梯度的收敛性

提出Per-FedAvg-PG,分析精确与无Hessian元策略梯度收敛;适应步长可调控个性化,曲率估计决定精确元梯度可行性。

04:00
arXiv cs.LG

超越平均误差:基于预言机信息的时间序列预测压力测试

提出预言机信息压力测试,将预测误差分解为环境风险与预测-预言机距离;发现环境风险主导,部分结论不可复现。

04:00
arXiv cs.LG

迈向大语言模型的全流程 FP8 强化学习

提出校准裁剪,解决全流程FP8强化学习中量化噪声致训练不稳问题,消除熵激增并恢复BF16级性能。

04:00
arXiv cs.LG

Causilo 技术报告

Causilo 表格基础模型:TabArena 1785.4 Elo,每千样本推理仅 0.10 秒,性能效率俱佳。

04:00
arXiv cs.LG

特征偏斜下联邦学习的联合域-类别建模

提出JDFL,用伪域推断与联合域-类分类头建模特征偏斜,辅以两种监督,兼容现有联邦学习并提升精度。

04:00
arXiv cs.LG

面向高效世界模型视觉-语言-动作策略优化的优先化推演

提出即插即用采样层U-GROW,依据策略不确定性优先推演高价值状态,提升世界模型VLA策略优化效率。

04:00
arXiv cs.LG

Merge++:通过无数据检查点反演实现通用合并精炼

Merge++无需数据,反演专家检查点合成任务图像,再蒸馏知识精炼任意合并模型,平均提升2-8点,最高25.9。

04:00
arXiv cs.LG

通过全局调度去噪轨迹利用扩散模型的推理时计算

提出扩散模型去噪轨迹的全局推理时算力调度,按敏感度分配评估预算,实验节省20%–50%函数评估。

04:00
arXiv cs.LG

核心集选择方法物有所值吗?

端到端基准显示,核心集选择成本难回收,随机采样或全数据训练更优。

04:00
arXiv cs.LG

强化学习中的计算高效安全探索

提出CoLSafe-MDP算法,用Nadaraya-Watson估计器实现恒定计算量的安全探索,远超立方复杂度的高斯过程方法。

04:00
arXiv cs.LG

检验LLM智能体中功能性效价轴的构念效度

LLM好坏结果方向:跨编码迁移好,但受预告历史制约,RL后更预测回报;支持功能性价值解读,非不变效价状态。

04:00
arXiv cs.LG

CurvFlow-DTA:用于药物-靶标亲和力预测的双图离散Ricci曲率流

提出CurvFlow-DTA:在药物与蛋白残基接触图上用加权Forman曲率流,配对选择双分支Flow-GINE预测亲和力,Davis/KIBA冷启动MSE最高降27.4%。

04:00
arXiv cs.LG

令牌效用受选择条件约束:面向高效指令微调的提示上下文与响应监督耦合选择

BRIDGE通过选择条件化令牌效用与交替选择,缓解评估和训练子集状态失配,在推理、代码与指令跟随上领先。

04:00
arXiv cs.LG

超越相似性:面向LLM时间序列预测的覆盖感知提示选择

提出CASP-LLM覆盖感知提示框架,以无参覆盖正则化缓解相似检索偏向主导模式,多数基准持平或更优,失效源于跨批次使用。

04:00
arXiv cs.LG

论注意力头与双线性形式

研究注意力头双线性形式,提出剖面映射至三维单纯形,训练后趋近秩一,对称部分为双曲型与零型之和。

04:00
arXiv cs.LG

LPINNs:面向物理信息神经网络的首层门控局部化

LPINNs以首层局部化增强PINNs,在长域和高阶问题上显著降误差,逆二次族三方程均优于基线。

04:00
arXiv cs.LG

神经谱容量:仅凭网络规格度量与设计架构

提出神经谱容量NSC,仅凭架构规格闭式计算,无需实例化/数据/梯度,并用NSC-DP精确搜索最优架构,在排序与压缩中优于参数量和FLOPs。

04:00
arXiv cs.LG

波前解码:面向循环语言模型的并行自推测解码

WFD免训练自推测解码,借中间循环输出作草稿并共享权重批处理,深浅波前协同,最高加速4.81倍。

04:00
arXiv cs.LG

扩散模型优化器:一项受控基准测试

首个离散扩散优化器受控基准:对比四类扩散、七种优化器,AdamW并非总是最优,Muon等可迁移。

04:00
arXiv cs.LG

MolSC:利用取代基贡献增强大语言模型的细粒度分子理解

提出取代基贡献数据集MolSC与评测基准,训练可显著提升分子大模型细粒度构效关系理解。

04:00
arXiv cs.LG

面向开集监督异常检测的可解释多超球深度异常检测

提出IMHD-AD:各类建独立超球并联合优化,最小边界分数判开集异常,具可解释性,多数AUC最优。

04:00
arXiv cs.LG

AirGC-CD:用于空中联邦学习可精确去偏 PAPR 降低的高斯-循环预编码

提出AirGC-CD,用高斯-循环预编码使裁剪可逆、聚合无偏,压缩传输并降PAPR,实验优于基线。

04:00
arXiv cs.LG

未观测混杂下的因果推断:混合学习视角

从混合学习视角处理未观测混杂,将其视为异质性来源,通过恢复混合分布与成分机制识别并估计因果效应,并拓展至高维指数族混合模型。