11792 条条目 · 106 个活跃源
2026年7月24日
04:00
arXiv cs.LG

通过同质性-简约性权衡的外部聚类验证

提出基于信息瓶颈的同质性与简约性归一化分数,单调变化,统一评价准则,用于特征选择和算法比较。

04:00
arXiv cs.LG

鲁棒异步Q学习:基于批处理应对奖励与状态污染

提出BR-Async-Q算法,通过分批次处理数据抵御奖励和状态污染,首次给出异步Q学习的鲁棒性保证且误差界最优。

04:00
arXiv cs.LG

基数分解损失:匹配训练目标与异质推荐图中的关系结构

提出CDL损失结合交叉熵与BPR,避免属性嵌入坍塌,提升判别性,由图属性控制性能权衡。

04:00
arXiv cs.LG

半摊销参数优化中的内存-计算权衡

研究离线内存与在线计算预算的权衡,给出强凸和凸情形下的理论界限及加速的内存成本。

04:00
arXiv cs.LG

GaugeQuant:从LLM对称性在线学习量化最优基

GaugeQuant在线学习量化最优基,无需校准数据,显著降低LLM量化困惑度(LLaMA-2 7B W4A4:8.22→6.73)。

04:00
arXiv cs.LG

超越繁重的日志整理:基于困惑度的无监督上下文增强语言模型APT检测

提出CAPTAIN方法,利用预训练语言模型和最小预处理,通过困惑度检测APT,降低日志预处理成本。

04:00
arXiv cs.LG

离线强化学习中的分层动作分块

HiQC算法通过分层潜在规划与动作分块实现无偏值备份,显著压缩视距、缓解误差累积,在长视距任务中性能最佳。

04:00
arXiv cs.LG

位置偏差潜藏于天花板效应:大语言模型基准的排列诊断法

排列诊断揭示位置偏差仅在60-95%准确率区间可测,超出则掩盖;标准MMLU中无信号并非无偏。

04:00
arXiv cs.LG

多级图小波压缩感知与尺度感知神经恢复

提出多级图小波压缩感知框架,结合非参数采样与尺度感知图神经网络,实现图信号高保真压缩重建。

04:00
arXiv cs.LG

信息论安全轻量级联邦学习聚合:抗退出与攻击

提出轻量级信息论安全聚合框架,基于符号联邦学习,高效实现安全多数投票,抗退出与敌手,通信延迟降85.7%。

04:00
arXiv cs.LG

TwistedMerge:面向模型合并的认证高阶诊断与弃权机制

TwistedMerge通过一致性测试认证模型合并全局对齐,否则弃权回退,避免错误提升。

04:00
arXiv cs.LG

结合结构与性能感知奖励的多轮强化学习用于CUDA内核生成

CudaPerf框架融合结构奖励与执行奖励,多轮强化学习优化CUDA生成,速度提升5倍,正确性提升17%。

04:00
arXiv cs.LG

HierarchicalDAEW:领域感知边加权图卷积与证据不确定性用于H&E组织学多切片空间基因表达预测

提出双图架构HierarchicalDAEW,融合领域感知边加权与证据不确定性,在H&E组织学上预测空间基因表达,性能优于13个基线且置信度校准更优。

04:00
arXiv cs.LG

最佳证据:部分验证下的最佳N项选择

提出BoE框架,用带符号候选-因子图在有限证据预算下改进部分验证的N选最佳决策。

04:00
arXiv cs.LG

联邦参数高效微调的三重频谱控制

TRISHUL框架通过三重频谱控制(共享低秩基、核范数收缩、非均匀分配),实现鲁棒联邦微调。

04:00
arXiv cs.LG

训练大语言模型以实现自我解释忠实度

提出强化学习方法直接优化模型自我解释忠实度,实验显示在分布内外均有显著提升,但跨干预泛化较弱。

04:00
arXiv cs.LG

ADABORD: 一种新颖的用于序数分类的AdaBoost方法

提出ADABORD框架,利用序数Gini分裂准则和绝对排序概率得分,显著提升多类别序数分类性能。

04:00
arXiv cs.LG

沉默之重:潜在国际象棋推理中权重优于草稿板的因果论证

因果干预证明潜在推理RL增益源于参数塑造,非推理时草稿板,鲁棒性提升。

04:00
arXiv cs.LG

权重范数临界性:归一化和权重衰减导致损失尖峰的机制

提出权重范数临界性机制,解释归一化与权重衰减相互作用导致损失突增,并实验验证。

04:00
arXiv cs.LG

从评估到优化:面向Python中CWE预测的层级感知训练信号

验证层级感知惩罚作为训练信号,GRPO优于监督方法,最佳策略显著降低CWE预测惩罚。

04:00
arXiv cs.LG

格拉斯曼流形上的正则化优化:理论、算法与应用

提出RPMA框架,在格拉斯曼流形上优化,推导最优性条件,设计高效算法,提升噪声下社区检测与聚类性能。

04:00
arXiv cs.LG

基于CycleGAN和反事实分类器对齐分数的视网膜疾病分类反事实可解释框架

提出CounterFundus框架,用CycleGAN生成疾病转正常反事实图像,引入CCAS评估空间一致性,提升分类可解释性与性能。

04:00
arXiv cs.LG

将蝴蝶效应扼杀于萌芽:自输出微调用于自回归天气预报

提出自输出微调方法,利用模型自身预测校准输入分布,抑制自回归误差累积,实现长期预报最优性能。

04:00
arXiv cs.LG

面向视觉Transformer的联邦LoRA中层间全局秩发现的谱变换

SpecTraL利用谱变换和随机矩阵理论自动发现最优全局秩,消除超参数搜索,提升联邦ViT微调的通信效率与收敛稳定性。

04:00
arXiv cs.LG

CASC:面向多变量时空数据的因果对抗子空间聚类

提出CASC框架,融合对抗聚类与因果子空间损失,发现多变量时空数据的动态因果子空间。

04:00
arXiv cs.LG

基于B样条的平滑神经点过程

提出基于B样条基函数直接参数化条件强度函数的神经点过程模型,实现高效并行训练与平滑正则化,提升计算效率和预测精度。

04:00
arXiv cs.LG

TOUR:离线强化学习中的轨迹级遗忘基准

提出轨迹级遗忘基准TOUR,揭示离线RL遗忘评估依赖多维度指标,单分数审计不可靠。

04:00
arXiv cs.LG

中文标题

APEX框架通过多项式GNN架构实现精确Aumann-Shapley归因,大幅减少计算开销并保持高保真度。

04:00
arXiv cs.LG

暗室效应:密集预测奖励导致GRPO训练的LLM代理崩溃

密集预测奖励在GRPO下引发“暗室”病理,原因是z-score放大信号方差,导致策略退化;辅助损失通道更优。

04:00
arXiv cs.LG

GlucoTune:一个用于糖尿病血糖预处理、预测和基准测试的统一框架

GlucoTune框架标准化血糖预处理、预测与基准测试,通过可配置管道和统一接口实现可重复实验和公平比较。

04:00
arXiv cs.LG

相对价值学习

提出相对价值学习框架,直接学习状态价值差异,具理论保证,与PPO结合在Atari上表现优异。

04:00
arXiv cs.LG

基于人口信息的热-死亡风险曲线:风险图神经网络方法

提出风险图神经网络,融合人口统计特征优化热相关死亡风险曲线,热浪预测校准更优、误差更低。

04:00
arXiv cs.LG

可执行因果研究流程的自动合成与对抗验证

ARA框架通过合成数据与对抗验证揭示因果假设错误,虽不提升数值精度但暴露无效结论,强调应评估可信性。

04:00
arXiv cs.LG

达成模型共识,推理验证:面向HND型Transformer推理的GKR协议

GKR-HND协议通过委托公共计算并验证工作者签名响应,确保HND Transformer推理的防篡改与完整性。

04:00
arXiv cs.LG

子图滤波器学习:代数与性能风险界

提出子图滤波器学习框架及距离感知拉普拉斯代数,建立性能风险界,实验优于基线。

04:00
arXiv cs.LG

均值到分数离散扩散:用于分数熵的后验均值去噪器

提出M2S方法,预测后验均值并映射为分数,修正SEDD违反约束问题,显著提升生成性能。

04:00
arXiv cs.LG

上下文加权离散流匹配

提出上下文加权离散流匹配,通过局部上下文信息改进采样和训练,生成困惑度降低63%,质量媲美半自回归块扩散。

04:00
arXiv cs.LG

涌现性错位依赖于预先存在的角色子空间

窄域微调通过招募模型中已有的角色子空间引发广泛错位,投影删除该子空间可有效防止。

04:00
arXiv cs.LG

基于扩散模型的子群体数字孪生用于移动健康部署:以HeartSteps干预为例

提出条件扩散模型构建数字孪生,用于移动健康干预部署前测试算法,在HeartSteps中验证有效。

04:00
arXiv cs.LG

面向建设性协作多任务的语义感知任务聚类

提出语义感知任务聚类,通过层次密度聚类分组语义对齐任务并联合训练,避免破坏性协作,提升准确率。

04:00
arXiv cs.LG

渐进式编码的希尔伯特算子(HOPE):用于解构深度网络中学习到的表示的数学框架

HOPE将网络压缩转化为希尔伯特空间低秩投影,实现无数据、无超参数的渐进式解构。

04:00
arXiv cs.LG

基于迁移学习的视频游戏状态异构预测的多任务学习

多任务学习用于游戏状态异构预测,能提升泛化并降低训练推理成本,实验验证优于单任务与迁移学习。

04:00
arXiv cs.LG

适配器能写入多少比特?衡量参数高效微调的容量与记忆化

低秩适配器容量取决于参数位置而非数量,MLP容量约为注意力的两倍,监督学习会记录机密而强化学习不会。

04:00
arXiv cs.LG

梯度集中而非权重显著性解释了表示层面的类别遗忘

遗忘梯度集中在最后网络层(约92%),显著性掩码缺乏特异性,表示层面遗忘由梯度集中和表示几何主导。

04:00
arXiv cs.LG

零流双样本检验

提出基于零流准则的双样本检验,通过学习局部错位方向检测分布差异,兼具强检验力与校准误差控制。

04:00
arXiv cs.LG

无信号交叉口自动驾驶车辆的紧凑潜在协调

提出MAPS分层架构,通过紧凑潜在协调实现无信号交叉口无碰撞导航,零样本泛化成功率94%。

04:00
arXiv cs.LG

从注意力到频率:视觉Transformer与FFT-ReLU融合实现增强的图像去模糊

提出ViT与频域FFT-ReLU双域架构,桥接空间注意力和频域稀疏性,有效抑制模糊伪影,性能领先。

04:00
arXiv cs.LG

超越充分性:基于反事实必要性的时间序列解释

TimePNS通过反事实干预识别时间序列中决策关键子序列,实现充分性与必要性平衡。

04:00
arXiv cs.LG

X³-OPD:通过在线策略对齐将推理能力蒸馏至大型音频-语言模型

提出X³-OPD框架,在线策略蒸馏文本推理至音频模型,三类语料显著提升音频推理质量。

04:00
arXiv cs.LG

循环肽系综上的图学习:分子系综建模探究

预训练系综编码模型提升环肽性质预测,混合BERT后R²达0.538。