11672 条条目 · 106 个活跃源
2026年8月3日
04:00
arXiv cs.LG

扩散环境中多臂老虎机策略梯度的收敛性与遗憾

研究扩散环境下多臂老虎机的策略梯度,证明几乎必然收敛到最优臂,遗憾界为对数阶。

04:00
arXiv cs.LG

MOT-SR:基于大语言模型的多目标工具增强科学方程发现

提出MOT-SR:工具提取结构先验,多目标优化精度、复杂度与泛化,在标准与EMRI任务上优于现有方法。

04:00
arXiv cs.LG

学习预测古典钢琴演奏中的情感差异

用演奏特征预测演奏间情感偏差,提出Delta-VA相对回归框架,预测准确但幅度压缩。

04:00
arXiv cs.LG

神经突触:受生物启发的持续强化学习架构,用于缓解灾难性遗忘

受大脑双路径巩固机制启发的NeuroSynth架构,通过分离快速习得与长期保持,在持续导航任务中显著缓解灾难性遗忘,优于PPO和EWC。

04:00
arXiv cs.LG

使用DXA和电子健康档案预测50岁以上成人骨折风险:两大队列中传统与机器学习模型比较

基于DXA与电子健康档案的模型预测50岁以上成人骨折风险优于临床FRAX评分,外部验证中梯度提升模型区分度最高(C指数0.725)。

04:00
arXiv cs.LG

先冻结,后选择:面向稀疏观测PDE发现的结构化场适配器与稳定性验证弱选择

提出先冻结后选择法:适配器重建连续场,稳定性验证弱选择筛项,从稀疏观测中发现PDE,支持恢复率最高。

04:00
arXiv cs.LG

基于对偶正态因子图的高斯图模型加速随机扫描吉布斯采样

研究薄膜先验高斯图模型随机扫描吉布斯采样收敛性,证明对偶域中收敛速率显著加速,与图拓扑无关,由代数连通性决定。

04:00
arXiv cs.LG

Conditioning Tree-Based Diffusions and Flows for Probabilistic Tabular Regression

04:00
arXiv cs.LG

当遗忘失效:智能体网络后训练阶段的可靠数据删除

联邦自改进网络后训练使遗忘失效,MUTE用账本估计影响、隔离高影响轨迹并审计擦除,实现低泄漏可靠删除。

04:00
arXiv cs.LG

地理加权替代模型用于快速小区域慢性病估计

研究评估地理加权机器学习模型作为替代,快速生成县级慢性病小区域估计,支持及时决策。

04:00
arXiv cs.LG

GQ-FSL:绿色量化联邦分割学习

提出绿色量化联邦分割学习框架,通过随机量化和联合优化分割点与精度,在满足精度约束下最小化能耗,实现高效节能。

04:00
arXiv cs.LG

DeltaServe:宿主无关的LLM推理与微调协同服务

该系统将闲置推理算力转为LoRA微调,用SLO感知调度保证推理性能,实测吞吐提升近3倍且完全遵守SLO。

04:00
arXiv cs.LG

开源LLM驱动的形式验证:用于RTL修复的多智能体流水线

提出多智能体流水线,用开源形式后端引导LLM修复RTL,经反例迭代证明正确,案例显示可行,并分析失败模式。

04:00
arXiv cs.LG

LayoutBench:多媒体数据云存储布局的性能基准测试

首个多媒体存储布局基准:对比三种布局,tar中小检索延迟低,Parquet大检索快但传输与成本高。

04:00
arXiv cs.LG

持久卷积:一种用于AI对齐测试与语义空间表征的拓扑框架

该研究提出基于拓扑的多模态对齐测试,利用人类知识结构检验模型嵌入空间,使黑箱模型更可解释、易于比较。

04:00
arXiv cs.LG

PaletteID:面向多模态点击率预测的原型组合语义标识

提出基于原型的语义标识PID,用语义锚点组合表示物品,增强多模态CTR预测,显著提升长尾物品效果,且更稳健可解释。

04:00
arXiv cs.LG

不要对比不可能之事:本地社区平台上用于对比用户建模的区域约束批处理

针对地理约束下不可能负样本,提出区域约束批处理构造同区域批次,提升用户表征与排序。

04:00
arXiv cs.LG

基于预测模型的量子电路优化转译器自动调优

用监督学习自动选择量子电路转译器优化组合,平均额外减少19.1%-32.4%双量子比特门,最高达95.8%。

04:00
arXiv cs.LG

经颅聚焦超声相位-振幅畸变校正的小样本深度学习

提出小样本深度代理模型,从CT预测经颅超声相位/振幅校正,仅需10个目标点微调,速度提升2535倍,精度高。

04:00
arXiv cs.LG

利用随机特征哈密顿神经网络外推哈密顿混沌的涌现

随机特征哈密顿神经网络仅用规则区数据训练,即可外推预测未见参数的混沌涌现,优于传统方法。

04:00
arXiv cs.LG

GALA:淘宝上购推荐系统中实现自适应多模态表示的生成式对齐学习

提出GALA三阶段方法,以生成式RL对齐桥接预训练与微调,部署于淘宝上购,订单量提升0.55%。

04:00
arXiv cs.LG

结构化神经混沌:面向函数不确定性量化与全局敏感性分析的自适应代理建模框架

提出结构化神经混沌展开代理模型,兼顾可解释性与神经网络表达力,低成本实现方差基全局敏感性分析。

04:00
arXiv cs.LG

张量数据散射与切片不可能性定理

提出稀疏张量表示标准,建立数据散射理论框架,证明切片不可能性定理,给出稀疏度公式及参考实现。

04:00
arXiv cs.LG

双重机器学习的解析与Bootstrap置信区间:模拟研究及在城乡肥胖患病率差异中的应用

DML置信区间覆盖概率受算法选择影响,样本增大覆盖反降;城乡数据表明农村化显著增加肥胖率。

04:00
arXiv cs.LG

有限时域多臂赌博机中的贪婪优势

针对有限时域伯努利赌博机,提出正则化贪婪算法,推导出首个遗憾上界,给出参数校准规则,数值实验表明优于现有算法。

04:00
arXiv cs.LG

固定先验期望改进在Matérn与平方指数再生核希尔伯特空间中的简单遗憾率与极小极大最优性

固定先验期望改进:Matérn核简单遗憾率O(N^{-ν/d}),平方指数核指数率;精确EI极小极大最优。

04:00
arXiv cs.LG

RTLCurator:面向RTL生成的标注高效数据策展

RTLCurator对比失败实现学习行为感知先验,用少量验证对校准,平衡对齐/覆盖/结构丰富度筛选数据;保留80%优于全量,仅验证10%。

04:00
arXiv cs.LG

基于图神经网络的有序到无序迁移学习用于高熵钙钛矿氧化物形成能与HOMO-LUMO能隙预测

用GNN从有序钙钛矿迁移预测高熵氧化物性质:形成能迁移有效,带隙迁移差;加入少量数据可改善,编码三体几何信息的ALIGNN更优。

04:00
arXiv cs.LG

Muon的符号压缩:SignMuon、MuonSign与误差反馈的极限

SignMuon将Muon更新压缩为每参数1比特,虽优于SignSGD,但符号放置不当或误差反馈均无法保证下降,实验却显示启发式后置符号法实际最强。

04:00
arXiv cs.LG

差分隐私非参数模态学习及其在回归和聚类中的应用

提出DP-GRAMS实现差分隐私下密度模态估计,达到近最优误差率,并扩展至隐私模态回归与聚类。

04:00
arXiv cs.LG

QASP:查询自适应鲁棒向量搜索策略

QASP用单次回归预测查询召回曲线,据此制定搜索策略,降低计算开销与数据访问,提升召回一致性。

04:00
arXiv cs.LG

Tipping Point Forecasting in Non-Stationary Dynamics on Function Spaces

04:00
arXiv cs.LG

In-situ Autoguidance: Eliciting Self-Correction in Diffusion Models

04:00
arXiv cs.LG

超越黑盒建议:基于Q值预测的MDP学习增强算法

研究时变MDP中一致性-鲁棒性权衡,利用Q值建议动态择优,获得近最优保证,优于黑盒建议。

04:00
arXiv cs.LG

协作方差估计与贝叶斯神经网络用于区分偶然与认知不确定性

协作训练方差估计网络与贝叶斯神经网络,解耦偶然与认知不确定性并提升均值估计。

04:00
arXiv cs.LG

通信高效的去中心化学习安全聚合

CESAR协议首次在去中心化学习中同时实现安全聚合与稀疏化,提供隐私保护,通信量削减66.7%,精度不降甚至提升。

04:00
arXiv cs.LG

Fisher Information, Training and Bias in Fourier Regression Models

04:00
arXiv cs.LG

基于对数正态族的哈密顿驱动神经网络几何构造:金融欺诈检测与网络安全应用

在对数正态统计流形上借助哈密顿动力学与辛几何构造神经网络,应用于金融欺诈检测和网络安全。

04:00
arXiv cs.LG

强化序贯蒙特卡洛用于摊销采样

结合摊销与粒子法,用最大熵强化学习训练SMC采样策略与扭曲函数,离策略训练提升多峰分布采样稳定性。

2026年7月31日
04:00
arXiv cs.LG

超越KV重建:投机解码中MLA草稿模型的功能性重建

将MLA草稿构建视为功能重建而非缓存压缩,优化模块复现原MHA/GQA响应,提升投机解码接受率。

04:00
arXiv cs.LG

面向半导体热机械可靠性的递归Transformer

提出硬件感知评估三种递归Transformer范式,用于半导体封装热机械可靠性代理建模,证明递归权重共享在参数效率与精度间实现有效权衡。

04:00
arXiv cs.LG

训练动力学:语言模型中涌现、可塑性丧失与电路控制的驱动成核速率定律

语言模型能力涌现需电路部件同时对齐,无部分得分;驱动成核速率定律可预测点燃、可塑性丧失并定位恢复。

04:00
arXiv cs.LG

多模态持续学习中的模态贡献漂移正则化

提出模态贡献漂移度量及CMCDR正则化,重放/无重放两版保持旧任务贡献结构,实验验证有效。

04:00
arXiv cs.LG

DoTime:面向干预和反事实时间序列的合成基准生成器

DoTime:开源可扩展的多变量时序因果模型生成器,支持干预与反事实采样,提供基准套件,验证干预训练优势。

04:00
arXiv cs.LG

RLPF:面向代码生成的性能反馈强化学习

提出RLPF,采用分阶段奖励,先依执行进度、后依相对改进排序,训练代码模型同时提升正确率与运行效率。

04:00
arXiv cs.LG

PlatformBid:统一广告平台视角下的自动出价基准

首个平台视角出价基准PlatformBid,覆盖三种竞价场景,新方法BidFlow线上提升0.68%

04:00
arXiv cs.LG

SDO:面向高效大语言模型后训练的结构感知数据组织

提出结构感知数据组织框架通过邻近批处理与曝光均衡调度加速大语言模型后训练收敛并平衡各类问题的精度

04:00
arXiv cs.LG

重新思考基于EEG的疾病诊断:解耦实例表示学习与受试者级监督

两阶段解耦实例表示与受试监督,预训练免标签,MIL聚合;15设置14最优,acc 76.57%,超基线4.28%

04:00
arXiv cs.LG

分数持平,失败放大:错误预算如何掩盖量化LLM智能体中的损伤

4比特量化LLM智能体看似无损,实则放大既有失败2.5倍;错误预算掩盖损伤,缩至两个错误即现17分差距。

04:00
arXiv cs.LG

基准测试残差:长视野评估在匹配短任务性能之外带来了什么

长期任务失败需与基于短阶段的基线对比,用水平残差(对数比率)衡量,并需明确选择机制。