11682 条条目 · 106 个活跃源
2026年7月31日
04:00
arXiv cs.LG

理解基于子模信息度量的表示学习目标:方差与分离视角

统一理论揭示子模信息度量作用:总量信息刻画类内方差/协方差,互信息刻画类间分离,实验验证。

04:00
arXiv cs.LG

FedOGL: 对抗联邦开放世界多模态图学习中的灾难性遗忘

提出FedOGL框架,保留语义结构记忆,将灾难性遗忘性能下降降低42.67%,同时保持或提升下游任务表现。

04:00
arXiv cs.LG

低秩适配的紧样本复杂度:匹配界与秩选择

低秩适配的样本复杂度上界与下界均为O~(rd/n);最优秩等于内在秩,过参数化对无正则经验风险最小化有害。

04:00
arXiv cs.LG

DAS-PMVC:一种通过双重对齐与结构增强的部分多视图聚类框架

提出DAS-PMVC框架,利用双对齐与结构增强进行部分多视图聚类,性能超越现有方法。

04:00
arXiv cs.LG

VESTIGE:一种知识引导的掩码策略,用于基因组Transformer的腐蚀感知微调,并在古DNA重建上验证

提出按位置腐蚀分布掩码的VESTIGE,替代均匀掩码,在古DNA重建中显著提升性能,且适用于多种序列腐蚀场景。

04:00
arXiv cs.LG

事件结构化物理信息神经网络用于可微临界清除边界

提出事件结构化物理信息神经网络,精确链接事件阶段,定义可微稳定边界,高效准确估计临界清除时间。

04:00
arXiv cs.LG

迈向具有最优批量大小调度的联合缩放定律

揭示学习率与批量大小联合影响,推导最优批量调度,联合缩放定律优于静态基线。

04:00
arXiv cs.LG

利用双教师信息瓶颈蒸馏改善对抗攻击下的鲁棒性/准确性权衡

双教师信息瓶颈蒸馏:交叉层注意力传递干净与鲁棒特征,保持对抗鲁棒性并提升干净准确率。

04:00
arXiv cs.LG

ROCS:面向请求的计算共享实现高效大规模推荐

提出面向请求的计算共享范式,延迟交互,按请求共享计算,提升效率与质量,已大规模部署。

04:00
arXiv cs.LG

小规模训练,大规模部署:通过几何重整化实现图神经网络的零样本迁移

几何重整化粗粒化图训练GNN,可直接零样本迁移至原始大图,保持性能并降低训练成本。

04:00
arXiv cs.LG

RIPPLE:生成而非恢复多通道相位

提出生成多通道相位的方法,以相位先验经修正流优化,提升通道间相干性,显著降低地震极化误差。

04:00
arXiv cs.LG

超越最佳教师:扩展与压缩推理解流形

强化学习策略仅为推理解流形的局部探针;提出扩展-压缩框架,通过多教师互补与可靠门控蒸馏,使学生超越最强教师。

04:00
arXiv cs.LG

LoRA脚手架式策略优化(LSPO):一种采样时低秩支架,用于在零奖励悬崖提示上恢复强化学习梯度

针对零奖励悬崖提示无梯度问题,LSPO用低秩适配器监督重采样恢复梯度,平均性能提升3.8点。

04:00
arXiv cs.LG

基础模型时代重新审视预测性流程监控:序列、表格与大语言模型方法的比较研究

比较序列、表格与语言模型:序列模型擅于下一活动预测,表格模型擅长时间任务,语言模型成本高但落后。

04:00
arXiv cs.LG

对比概念重要性:通过自动提取的概念表示解释成对类别决策

提出对比概念重要性方法,通过概念归因目标类与对比类的logit差值,揭示成对类别特有决策行为。

04:00
arXiv cs.LG

类感知强化学习用于反事实解释生成

将实例预测类别加入强化学习状态,显著提升反事实解释生成的有效性、收敛速度和奖励优化,优于不包含类别信息的方法。

04:00
arXiv cs.LG

S-CEReBrO:突破连续脑电监测中的内存屏障

提出S-CEReBrO,用窗式交替注意力实现恒定内存,支持超长连续EEG监测,内存更少、吞吐更高,多项任务达最优。

04:00
arXiv cs.LG

精确动作值并不足够:多区域变风量控制中基于Rollout验证的推理模型强化微调

TD3降耗4.5%,GPT-5降6.2%通风差;critic排序不可靠,RFT无改善,需过渡监督微调。

04:00
arXiv cs.LG

带延迟的线聚合问题的学习增强与随机化算法

线度量带延迟聚合:确定性学习增强算法兼顾鲁棒一致性;随机算法优于确定性下界,随机下界改进至e。

04:00
arXiv cs.LG

TriShield:面向联邦大语言模型微调隐私后门的零效用损失防御——正交梯度投影与优化器状态纠缠

TriShield三层防御通过正交梯度投影与优化器状态纠缠,零效用损失且无额外通信轮次,使NeuroImprint重建率降至0%

04:00
arXiv cs.LG

AutoPref:面向神经组合优化的任务特定偏好目标自动发现

首个LLM引导的神经组合优化偏好目标自动发现框架,在TSP、CVRP等任务上优于人工设计基线。

04:00
arXiv cs.LG

ODEWorld:基于物理时间流的连续预测架构

提出物理时间流连续世界模型用ODE建模动态解决表征崩溃支持任意时间分辨率与反向预测用于视频生成与机器人控制

04:00
arXiv cs.LG

图统一的核心原则与生成式滑动窗口Transformer基座模型

提出图特征统一四原则,用拓扑滑动窗口编码与生成重建,将异构特征转为有序统一表示。

04:00
arXiv cs.LG

超越二元奖励:强化卸载奖励设计比较研究

提出指数与PageRank两类奖励,替代稀疏二元奖励,使卸载遗忘速度提升至3倍且保持模型性能。

04:00
arXiv cs.LG

TAPO:面向LLM智能体的状态转移感知策略优化

提出TAPO框架,利用环境反馈作为监督信号,与策略优化交替训练,轻量提升LLM智能体任务性能。

04:00
arXiv cs.LG

一切都是向量化:einx,张量操作的通用记号

einx基于向量化提出通用张量操作记号,简化框架API,统一规则,提升可读性与可写性。

04:00
arXiv cs.LG

Transformer训练与Wasserstein分布鲁棒性的最优控制泛化界

针对Transformer训练,推导有限样本泛化界,基于动态规划递归和量化模型,并联系Wasserstein分布鲁棒优化。

04:00
arXiv cs.LG

利用贝叶斯域重加权优化数据混合的潜力

提出贝叶斯域加权法,从狄利克雷分布推断权重,学习更稳定高效,数据消耗少,优化大规模预训练数据混合。

04:00
arXiv cs.LG

构建面向开放网络的用户基础模型

针对开放网络身份碎片化,自监督Transformer用户基础模型经LLM优化,提升点击预测与广告效果,CTR增2.13%。

04:00
arXiv cs.LG

LM-GRASP:基于在线模仿学习的实例特定语言模型用于组合构造

将GRASP随机构造转为在线模仿学习,按实例从零训练Transformer策略,无需预训练,在PFSP基准上优于GPU-GRASP。

04:00
arXiv cs.LG

基于特权自蒸馏的对比强化策略优化

提出对比强化策略优化,利用预测熵区分正负样本,缓解特权自蒸馏暴露偏差,超越现有方法,提升稳定性与泛化。

04:00
arXiv cs.LG

增强不规则时间序列预测的连续时间建模框架

提出WrapFlow连续时间建模框架,用连续时间分词直接编码观测事件,结合残差流匹配免模拟训练,实现高精度不规则时序预测。

04:00
arXiv cs.LG

ClawTrack:迈向真实世界自主智能体的轨迹级评估与改进

双评估基准ClawTrack以过程分归因成败,结果验证为瓶颈,轨迹过滤可提升训练。

04:00
arXiv cs.LG

Flux-OPD:利用演化上下文的在线策略蒸馏

提出利用演化上下文的在线策略蒸馏方法,通过反向KL分解稳定目标并加权冲突,超越现有范式。

04:00
arXiv cs.LG

基于牛顿算法的特征学习:一种加速非线性参数化PDE求解器的途径

提出从牛顿轨迹学习特征的两阶段初值策略,构建解与搜索方向特征空间,回归预测加残差校正,减少迭代与计算时间。

04:00
arXiv cs.LG

Chem World:用于可信化学性质预测的大规模基准与物理信息框架

提出含17个数据集、80万样本的化学世界基准,并采用物理信息网络,使性质预测更准确可靠。

04:00
arXiv cs.LG

信息瓶颈学习用于忠实的时间序列预测解释

提出IB-Forecast框架,通过信息瓶颈和可解释掩码实现高保真预测解释,仅需14-20%观测数据即可达到低误差,优于现有方法。

04:00
arXiv cs.LG

从专家归约到行为分岔:通过稀疏MoE推理追踪数值状态

等价专家归约顺序致稀疏MoE行为分岔;相同token不保证相同状态,分岔可跨token延续。

04:00
arXiv cs.LG

GVR-Coder:复杂文档与会议场景下结构化SVG生成的视觉反馈框架

提出视觉反馈框架,用DocMeetSVG数据集,结合课程采样、双渲染奖励与验证修复,生成逻辑美观的SVG图。

04:00
arXiv cs.LG

LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理

提出LedgerMind,用结构化证据账本约束多模态智能体推理,改善答案准确性与轨迹忠实度。

04:00
arXiv cs.LG

最优分类与回归树的搜索策略

提出最优决策树通用搜索框架,评估18种策略,最佳策略显著提升分类表现并大幅加速回归。

04:00
arXiv cs.LG

基于集成一致性的分子图半监督学习

提出集成一致性半监督学习,用于分子图,提升多种GNN预测准确性,增强鲁棒性,减少校准误差,单模型胜过传统集成。

04:00
arXiv cs.LG

使用间隙指数度量降维散点图空白区域的失真

提出间隙指数(GI),度量降维散点图空白区域的视觉失真,通过空三角形变形计算,对小变形敏感且快速可解释。

04:00
arXiv cs.LG

超越几何互补性:稀疏混合专家路由中的相干重叠

专家子空间高度重叠,但路由仍优于备选;前缀缩小表征优势却不减功能增益,称相干重叠。

04:00
arXiv cs.LG

基于元数据分布式期望最大化的加密兼容聚类联邦学习

提出FLAMECHE,将元数据聚类联邦学习重构为分布式期望最大化,服务器仅加法更新,实现加密兼容,平衡隐私、通信与计算。

04:00
arXiv cs.LG

持续高斯扰动防止循环图神经网络中的过度平滑

在循环图神经网络中每步注入高斯噪声,证明平稳表示具有正Dirichlet能量下界,从而防止过度平滑,数值实验验证。

04:00
arXiv cs.LG

多通道增益策略学习

提出快速-慢速因果框架,以无偏梯度与保守决策解决多通道预算分配,实现订单和收入双升。

04:00
arXiv cs.LG

TopoFormer:拓扑与注意力在图学习中的融合

提出一种拓扑-注意力图学习框架,将图结构化为拓扑序列,经变换器处理得嵌入,性能超越强基线且高效。

04:00
arXiv cs.LG

HARGO:HPC任务上LLM强化学习后训练的异构感知奖励引导优化

异构感知奖励引导优化,用于HPC任务LLM后训练,置信度调制优势加权,免任务类型标签,四任务九方法三项指标最优。

04:00
arXiv cs.LG

为什么GUI智能体正确却滞后?在决策关键路径上解码,以预编译策略树验证

提出AAPT,空闲时预编译策略树,事件触发即执行,避免解码延迟;成功率由0.50升至0.79,且无错误动作。