11792 条条目 · 106 个活跃源
2026年7月24日
04:00
arXiv cs.LG

生成式贝叶斯滤波用于状态估计

GBF框架用条件变分自编码器替代线性观测模型,通过贝叶斯更新与分数采样提升状态估计精度与鲁棒性。

04:00
arXiv cs.LG

PhantomFill:当表单要求答案时,语言模型会编造一个

表单必填字段导致模型普遍编造答案,多数无视“证据不足”选项,指令也被覆盖,仅前沿模型能正确拒绝。

04:00
arXiv cs.LG

多LLM系统中基于结构化专家判断的不确定性感知信任估计

提出Cooke加权信任估计,处理多LLM异质性与污染,实现聚合准确性与可靠性平衡。

04:00
arXiv cs.LG

DataPrep-Bench:大语言模型训练数据准备能力基准测试

首个统一评估LLM数据构建与质量评估的基准,新方法在多个领域显著领先。

04:00
arXiv cs.LG

Muon优化器“顿悟”的关键成分

Muon快速顿悟源于正交化(Newton-Schulz迭代),非谱范数;减少迭代可加速但降低稳定性。

04:00
arXiv cs.LG

Codec-Gauge:学习压缩友好的Transformer KV缓存度量

介绍后训练缓存坐标层Codec-Gauge,通过学习正交变换优化KV缓存压缩,平均降低44%的KL散度。

04:00
arXiv cs.LG

观点:停止被动修补模型,开启主动测试驱动AI开发

主张主动测试驱动AI开发,构建测试空间,数学证明其长期扩展更优、迭代更少。

04:00
arXiv cs.LG

当RLVR缩小推理边界:诊断Pass@k反转

RLVR提升单样本准确率但导致Pass@k反转,根源是丢失基础模型稀有正确轨迹,PBA方法可缓解。

04:00
arXiv cs.LG

ReliableTableQA:可靠性标注需要多少监督?

提出ReliableTableQA框架,表明仅需少量示例即可高效标注表格QA可靠性,GRPO仅在SFT不足时有益。

04:00
arXiv cs.LG

利用生物动力学知识先验实现数据稀缺的生物过程建模

数据稀缺下,将ODE知识以数据级预训练或架构级嵌入注入神经网络,两者性能相当且可替代,模拟预训练提供简单高效方案。

04:00
arXiv cs.LG

从原子到熵:凸域中扩散训练的最优噪声分配

发现扩散训练最优噪声调度集中于有限水平,解耦时采样密度正比于熵率平方根,显著提升效率。

04:00
arXiv cs.LG

通过决策感知机器学习改善基本药物获取

提出决策感知机器学习框架,在塞拉利昂全国部署,使基本药物消费增加19%,惠及约200万妇女儿童。

04:00
arXiv cs.LG

HypNO:双曲守恒律的图基物理信息神经算子

HypNO是图基神经算子,用物理信息消息传递处理激波,准确预测交通流模型解。

04:00
arXiv cs.LG

投资者观点落地:Black-Litterman模型中的神经谓词

神经谓词将金融数据映射为BL模型参数,以数据驱动替代主观不确定性,实现可解释与端到端学习。

04:00
arXiv cs.LG

一种面向零样本数字孪生的图神经网络方法

提出零样本数字孪生框架,结合热力学图神经网络与闭环数据同化,实现几何无关的实时物理模拟。

04:00
arXiv cs.LG

SenCos-GEM: SENet校准与余弦定律约束的几何增强分子表征用于性质预测

提出SenCos-GEM,融合余弦定律几何约束和SENet动态调制,在分子性质预测中实现SOTA,回归任务误差降低8%-13%。

04:00
arXiv cs.LG

自动编码器辅助下的地理空间与人口普查代理联合降尺度方法(JUGAAD)——以印度社会经济指标为例

JuGAAD框架融合人口普查与地理空间数据,经自编码器降维和回归映射,实现印度村级社会经济指标高精度预测。

04:00
arXiv cs.LG

SOAP、Muon及超越:推动大语言模型预训练规模扩展

改进了SOAP和Muon优化器,通过稳定化策略和分布式实现,在数十亿参数模型上超越AdamW,代码已开源。

04:00
arXiv cs.LG

SevDiff: 严重性条件扩散模型用于长尾冲突轨迹生成

SevDiff模型根据目标碰撞时间(TTC)生成轨迹,短TTC时命中率100%,长TTC时优雅退化,物理合理,精度高。

04:00
arXiv cs.LG

基于多智能体强化学习的退化监视下空中走廊冲突解决

基于DQN多智能体强化学习解决退化监视下空中走廊冲突,异构飞行器冲突1秒内解决,安全与容量权衡。

04:00
arXiv cs.LG

热力学权重衰减:通过注意力比热探索Grokking加速

通过注意力比热峰值检测相变,动态缩放权重衰减加速泛化,显著降低Grokking延迟。

04:00
arXiv cs.LG

双评分:强彩票的可靠提取

提出双评分方法,用增强评分空间优化替代层稀疏搜索,可靠提取强彩票,性能提升且对超参数不敏感。

04:00
arXiv cs.LG

超越基于结构的药物设计:几何深度学习在多药理学和多靶点药物设计中的应用

几何深度学习整合多靶点几何约束,实现共享口袋表征、多靶点活性预测及双靶点配体生成,突破传统药物设计瓶颈。

04:00
arXiv cs.LG

StabilityBench:大型语言模型的不稳定性基准测试

StabilityBench将单轮查询转为多轮交互,注入用户模拟,发现LLMs性能不稳定,揭示静态评估局限。

04:00
arXiv cs.LG

猴王棒:统一的科学多模态基础模型

MKB统一多模态科学模型,覆盖六学科,两阶段训练实现理解与生成,性能优异。

04:00
arXiv cs.LG

Chronofy:面向时间感知检索增强生成中信息有效性的时间逻辑衰减架构

提出Chronofy框架,通过嵌入时间衰减到检索增强生成中,减少时间幻觉并提升检索精度。

04:00
arXiv cs.LG

单token稀疏自编码器特征是否具有因果必要性?层深度与SAE族效应

单token特征因果角色跨族差异大于族内规模效应,训练方法比激活函数或规模更关键

04:00
arXiv cs.LG

CT-Merging:LoRA适配器合并的共识方向与任务级尺度缩放

提出CT-Merging算法,通过共识方向和任务级RMS尺度缩放解决LoRA合并系数不匹配问题,在CLIP基准上显著提升精度。

04:00
arXiv cs.LG

Fisher宽度:局部学习几何与各向异性恢复

提出原始与逆Fisher宽度,分别度量局部学习几何与各向异性恢复,并建立二者间的锐化不等式。

04:00
arXiv cs.LG

AI驱动的代理模型预测锂离子电池电极尺度放电行为

提出Swin3D Transformer代理管道,结合高斯位置编码与时间编码,精准预测电池放电,计算成本降低数个数量级。

04:00
arXiv cs.LG

贝叶斯不确定性估计改善医疗AI代理的临床决策

蒙特卡洛dropout提供认知不确定性,提升错误检测,以风险标志呈现大幅降低误诊率。

04:00
arXiv cs.LG

STeMP:时空建模协议

STeMP协议标准化时空建模报告与过程,提供指导与警告,增强透明性和可比性。

04:00
arXiv cs.LG

通过内部激活频谱分析检测神经网络失效

发现内部激活频谱漂移现象,SDNN框架监控频谱特征检测失效,AUROC达79%,性能远超置信度基线。

04:00
arXiv cs.LG

当递归成为算法?权重共享循环Transformer中的收敛选择

研究发现权重共享循环Transformer通过预算定律实现线性计算,收敛时间标度可预测泛化,且架构先验而非表达能力决定算法选择。

04:00
arXiv cs.LG

通过残差记忆与偏移框架实现仿射一维细化迭代的精确ReLU实现

利用残差记忆与偏移框架,实现M≥3时仿射细化迭代的精确固定宽度ReLU网络,深度O(n)

04:00
arXiv cs.LG

大语言模型在动态用户意图中迷失

LLMs在静态任务中表现优异,但在用户意图动态演变的多轮对话中大幅下降,暴露关键能力缺失。

04:00
arXiv cs.LG

使用奇偶瓶颈层扩展可解释Transformer

提出ParityTransformer,用参数无关奇偶瓶颈层实现可扩展可解释性,性能优于后验SAE,特征原生。

04:00
arXiv cs.LG

SalesLoop:基于绩效反馈的销售线索排序强化学习

SalesLoop通过闭环反馈和判别式GRPO优化线索排序,NDCG@K提升7.9%,生产测试累计提升4.7%-8.7%。

04:00
arXiv cs.LG

自适应多时间跨度强化学习

提出自适应多时间跨度方法,无需手动调参,灵活适应奖励变化,在连续任务中表现优越。

04:00
arXiv cs.LG

基于控制障碍函数层的高维安全最优反馈控制的端到端学习

结合算子分裂与无雅可比反向传播,实现高维安全控制器的可扩展端到端学习,状态维度达1200。

04:00
arXiv cs.LG

面向可信机器学习驱动光网络的基于解释的运行时验证

利用解释一致性与物理基础一致性,运行时验证光网络ML决策,拦截错误,保持高自动化率。

04:00
arXiv cs.LG

CEDAR:自回归过程的因果边发现

CEDAR方法通过筛选和条件独立性检验,高效发现稀疏自回归时间序列中的滞后因果边,适合数据稀少场景。

04:00
arXiv cs.LG

归因市场:计划任务与执行动作间分数信用分配的费雪市场模型

提出费雪市场模型实现计划与执行间的分数信用分配,用熵正则化抵抗噪声并统一算法。

04:00
arXiv cs.LG

一轮足矣:面向任务异构多标签医学影像分类的分析式联邦学习

提出分析式联邦学习框架,两轮通信解决任务异构与缺失标签,在ChestXray14上性能显著优于现有方法。

04:00
arXiv cs.LG

视角潜变量作为主动推理智能体中因果涌现的结构条件

因果涌现Φr在主动推理中集中于解耦的慢速潜变量,幅度源于架构,学习效应仅体现在组成层面。

04:00
arXiv cs.LG

合成少数类数据多余或无效:一种数据依赖的有效性理论与去偏测试

揭示合成少数类数据标准检验有偏,去偏后显示其大多无效或多余,性能提升微乎其微。

04:00
arXiv cs.LG

面向可信多组学多模态融合的自适应置信加权扩展方法

ACE框架通过生成互补模态与双级置信机制,自适应加权并评估信任,显著提升多模态融合可信度。

04:00
arXiv cs.LG

神经网络训练可解性的新复杂性理论前沿

本文提出新算法,扩展了线性与ReLU神经网络最优训练的多项式时间可解边界。

04:00
arXiv cs.LG

面向大气化学微调AI基础模型的机理可解释性研究

首次检验大气化学微调AI模型:Aurora捕捉了臭氧对氮的一阶响应,但未强制执行化学约束,内部表征仍以气象为主,未形成化学机理。提供了评估AI是否学习化学的框架。

04:00
arXiv cs.LG

Memoir:模型思考时是否应向内存写入?

Memoir实验显示,思考时写入记忆会降低学习速度(0.1354差距),但最终能力不受限,能量信号稳定。