11852 条条目 · 106 个活跃源
2026年6月25日
04:00
arXiv cs.LG

用于医疗应用的序数损失深度神经网络

提出OCE序数交叉熵框架,通过成本矩阵量化错分严重性,实现更优化动态和校准,降低预测错误成本。

04:00
arXiv cs.LG

ROAD-VLA:通过自蒸馏实现视觉-语言-动作模型的鲁棒在线自适应

ROAD-VLA用优势引导自蒸馏将稀疏奖励转为密集token监督,实现机器人操作鲁棒在线自适应,性能优于PPO。

04:00
arXiv cs.LG

在数据稀缺的多实例学习中通过重新混合嵌入增强患者数据

提出基于高斯混合模型的患者增强方法,在嵌入空间生成患者,改善数据稀缺下多实例学习性能,在缺失类别场景表现优异。

04:00
arXiv cs.LG

变分深度高斯过程中的后验崩溃、参数化与初始化分析

本研究探讨深度高斯过程的后验崩溃,提出模仿线性先验均值的初始化方法,有效避免崩溃并提升稳定性与性能。

04:00
arXiv cs.LG

Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors

04:00
arXiv cs.LG

神经网络压缩的分层强化学习(HiReLC):剪枝与量化

提出HiReLC分层强化学习框架,自动联合剪枝与量化,压缩比达6.72倍,准确度仅降0.55-5.62%或提升3.83%。

04:00
arXiv cs.LG

后训练中被忽视的免费午餐:面向LLM智能体的进度优势

从RL后训练中原生获取进度优势,无需额外训练奖励模型,在多个任务中超越专用奖励模型。

04:00
arXiv cs.LG

变分蒙特卡洛方法的稳健性:紧矩阈值与重尾随机优化

VMC随机优化受波函数节点几何影响,估计子呈重尾;PS-Clip-VMC通过裁剪实现弱矩区域稳健收敛。

04:00
arXiv cs.LG

模型取证:探究令人担忧的行为是否源于对齐偏差

提出两步取证协议(读思维链+测试假设)区分恶意与良性行为,发现Kimi K2 Thinking走捷径、DeepSeek R1欺骗,方法仍需完善。

04:00
arXiv cs.LG

变分自编码器层

将VAE作为神经网络层嵌入,提出新训练策略并分析其性能。

04:00
arXiv cs.LG

决策导向的数字孪生

针对传统数字孪生训练在策略排序上不优的问题,提出DT^2范式,通过拟合Q评估保留策略排序,提升决策效果。

04:00
arXiv cs.LG

Tensorion: 一种张量感知的Muon优化器泛化

Tensorion扩展Muon至高阶张量,通过线性最小化预言机平衡谱范数约束,提升收敛与梯度稳定性。

04:00
arXiv cs.LG

限价订单簿预测中的推理-计算前沿与低延迟架构

研究发现限价订单簿预测中推理-计算前沿符合幂律,提出的低延迟架构FastBiNLOB以更低延迟超越现有SOTA。

04:00
arXiv cs.LG

FUTO Swipe:布局无关的神经滑动解码

提出布局无关的神经滑动解码器,通过几何增强和布局映射实现跨布局泛化,并发布超1百万次滑动的语料库。

04:00
arXiv cs.LG

非平衡熵最优传输的样本复杂度

研究非平衡熵最优传输的样本复杂度,证明正则化可缓解维数灾难并减少样本需求。

04:00
arXiv cs.LG

TurboMPC:GPU上快速、可扩展且可微分的模型预测控制

GPU可微分MPC求解器,速度提升达58倍,支持约束与隐式积分,贝叶斯优化调参,规划时域超8000点。

04:00
arXiv cs.LG

ConSolv: 溶剂条件性机器学习隐式溶剂势

提出ConSolv溶剂条件性MLP,通过注意力机制整合溶剂效应,在66种溶剂中迁移,超越经典方法并泛化至未见溶剂。

04:00
arXiv cs.LG

RevengeBench:通过行为实验逆向解析代码空间策略

RevengeBench从行为实验逆向重建LLM策略代码,恢复距离闭合34%-72%,验证受控探针提升重建效果。

04:00
arXiv cs.LG

通过MPC解决带未来信息的马尔可夫决策过程

本文用MPC参数化表示带未来信息MDP的最优策略与值函数,通过强化学习学习参数,并在赛车任务中验证。

04:00
arXiv cs.LG

Laplace-Fisher门恒等式用于最优矩阵门控混合分数估计

提出方差最优矩阵门控混合分数估计的Laplace-Fisher门恒等式,应用于贝叶斯逆问题后验密度评估,提升校准与诊断。

04:00
arXiv cs.LG

大规模零样本检索的极端元分类

提出EMMETT框架与IRENE算法,实时合成新物品分类器,检索准确率提升15%,广告点击率提升4.2%。

04:00
arXiv cs.LG

外生上下文马尔可夫决策过程中的极小极大PAC界

外生上下文MDP中,已知奖励转移时策略评估等样本复杂度与上下文空间大小无关,达到极小极大最优界。

2026年6月24日
04:00
arXiv cs.LG

通过自动化流水线搜索系统探索4专家异构混合专家模型

自动化搜索发现,4专家异构MoE中AirNet族主导空间,ShuffleNet+MobileNetV3组合最优,低效族应排除。

04:00
arXiv cs.LG

简并蒸馏器

简并蒸馏法通过Fisher信息几何自动检测并解决参数简并,显著减少后验估计所需的模拟预算。

04:00
arXiv cs.LG

协同物理约束MCMC与化学感知高斯过程进行反应网络发现

提出PC-MCMC-CIGP工作流,整合物理约束与化学感知高斯过程,提升反应网络发现效果,产率提高12.5%。

04:00
arXiv cs.LG

离线推理训练的权重空间几何

六种方法权重更新各异:SFT/RFT/RIFT近乎共线,DFT偏离,离线GRPO正交,DPO近乎正交且精度最高(93.5%)。

04:00
arXiv cs.LG

联邦因果发现与推断综述

系统分类联邦因果方法与挑战,形式化统一管道,聚焦隐私与效率。

04:00
arXiv cs.LG

同一标尺:图宾根双变量因果方向的统一再评估与无参数压缩基线

零参数压缩基线在图宾根因果方向任务上达74.7%,与最强方法持平,颠覆了先前文献中的排名。

04:00
arXiv cs.LG

具有可训练非线性连接的低功耗模拟神经网络用于连续控制

将可训练非线性函数置于模拟神经网络连接上,能以更少节点和连接高效处理平滑连续控制,功耗仅30微瓦。

04:00
arXiv cs.LG

探索二元元学习以提升开放集场景中的域泛化能力

提出MEDIC二元元学习策略,联合域类匹配优化边界,提升开放集域泛化并保持闭集性能。

04:00
arXiv cs.LG

破译3D分子表面指纹以实现精确表位预测

提出SurfBind,直接建模分子表面,利用Transformer和交叉注意力,在表位预测基准上达到最优性能与强泛化。

04:00
arXiv cs.LG

利用时空图神经网络重建GRACE陆地水储量:在南美洲的应用

基于ERA5数据,用时空图神经网络重建1940年以来的GRACE陆地水储量异常,在南美洲实现高精度,开源。

04:00
arXiv cs.LG

灾难性组合生成:为何普通扩散模型无法外推

普通扩散模型因分数估计误差在分布外组合生成中产生灾难性失败,需新方法。

04:00
arXiv cs.LG

医疗中的联邦生存分析:跨机构异构乳腺癌数据多模型评估

在乳腺癌数据上评估联邦生存分析,发现联邦学习优于本地训练,RSF模型平衡最佳,FedAvg/FedProx更稳定,并给出实用指南。

04:00
arXiv cs.LG

激光粉末床熔融增材制造中实时熔池监测的机器学习建模:一种混合方法

混合模型(EfficientNetB0+随机森林)在1200张熔池图上达94.58%准确率,推理仅1.15ms,实现实时异常检测。

04:00
arXiv cs.LG

神经网络的安全保证是否安全?如何计算可信的鲁棒性认证

提出apothem度量并实现线性时间最优认证,证明体积最优不可行,引入对偶认证,实验最小边长提升两倍以上。

04:00
arXiv cs.LG

精确Schur-Sylvester维度缩减用于非光滑随机复杂度与流形采样

提出Schur-Sylvester方法,将非光滑NML计算复杂度从O(N³)降至O(k³+N²k),加速超14000倍,实现高维统计推断。

04:00
arXiv cs.LG

Sesame:通过空间密度图条件实现结构感知的分子生成

Sesame是扩散分子生成模型,利用空间密度图条件实现结构感知,支持从头生成和先导优化,通过联合去噪与轨迹微调提升质量。

04:00
arXiv cs.LG

MGI:成员与生成推断

提出MGI挑战,即区分样本是训练成员还是模型生成,并设计DCB方法解决现有方法误分类问题。

04:00
arXiv cs.LG

GRACE:面向高维时间序列精确因果边发现的门控精炼方法

GRACE用硬具体门与L0正则化精炼因果边,F1显著提升,速度提升75倍,在易北河数据上假阳性减少99%。

04:00
arXiv cs.LG

闭环:形式化验证的法律作为自我改进法律AI的奖励信号

提出形式化验证法律AI架构,通过自动形式化与验证内核提供可证明正确性及结构保证,闭合法律强化学习环。

04:00
arXiv cs.LG

ARIA:基于自适应区域的重要性分配用于条件扩散蒸馏

ARIA自适应分配条件区域训练,聚焦教师学生差异,提升蒸馏效果。

04:00
arXiv cs.LG

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

04:00
arXiv cs.LG

KLip-PPO:从逐样本KL视角看PPO-Clipping

证明PPO裁剪代理梯度等价于逐样本变系数KL代理,揭示隐式惩罚为信任区域边界阶跃函数。

04:00
arXiv cs.LG

标题:无妥协遗忘:固定预算下流式KV缓存驱逐的Nexus采样方法

摘要:提出Nexus采样方法,通过加权蓄水池采样替代确定性top-K,保留微妙重要令牌,在80%驱逐率下接近全注意力性能,缓存占用降低10倍。

04:00
arXiv cs.LG

使用无注意力变换器学习库普曼算子

提出AFT记忆块和动态重编码,抑制Koopman预测器长时误差,在三个基准系统上实现高精度流形保持。

04:00
arXiv cs.LG

DREG:一种作为通用惩罚的逐层雅可比正则化

DREG逐层雅可比正则化在GELU和数据稀缺时表现最优,无需调参即插即用。

04:00
arXiv cs.LG

面向仓库SLAM吞吐量控制的离线强化学习

提出离线RL框架优化仓库吞吐量控制,CQL策略使系统健康提升22.97%,节流时间减少3.18%。

04:00
arXiv cs.LG

贝叶斯上下文Bandits用于实时仓库分拣优化的比较研究

对比三种混合机器学习框架,贝叶斯上下文Bandits在实时仓库分拣优化中表现最佳,奖励提升2.03%,具备在线学习与探索-利用平衡优势。

04:00
arXiv cs.LG

3D掩码自编码器稳健学习显微镜体积与多模态细胞表征

3D MAE优于2D,跨模态对齐与频域正则化提升单细胞显微镜性能,蛋白交互和定位达SOTA。