11482 条条目 · 106 个活跃源
2026年9月2日
04:00
arXiv cs.LG

实践中的模式化:利用敏感度对奖励模型去偏

用patterning按敏感度重加权偏好对,对奖励模型去偏,在RM-Bench Hard提升14.2个百分点,保持整体精度,权重可迁移至其他模型。

04:00
arXiv cs.LG

视觉语言适配中的文本能力损失:注意力汇聚诊断

视觉语言微调破坏注意力汇聚位置,导致模型遵循精确规则能力下降。提出Sink Strength指标,可在数秒内预测性能退化,无需视觉语言训练。

04:00
arXiv cs.LG

在线自加权微调

提出OSW-FT方法,用少量推理采样估计成功率并动态调整SFT损失权重,在中小模型推理任务上优于标准SFT。

04:00
arXiv cs.LG

训练神经网络中的子空间莱文贝格-马夸特算法

本文评估子空间LM算法在神经网络回归与分类中的效果,其相对经典LM降低计算与内存开销,并对比SGD、Adam。

04:00
arXiv cs.LG

语言模型如何在上下文与记忆之间做选择?

反事实实验检验激活方向:干预可复现30-68%权威偏移,跨任务仅9%,本地57%,权威计算因任务而异,不可通用。

04:00
arXiv cs.LG

中文标题:冻结核心需要任务信号:面向低资源大语言模型适配的费雪白化交叉协方差

中文摘要:提出FCCA,利用费雪白化交叉协方差选择固定子空间,在低资源大模型适配中以极少量可训练参数接近LoRA和DoRA性能。

04:00
arXiv cs.LG

你我所想是否一样?:神经架构中的概念分离探究

用激活几何分析:CNN熟悉概念语义有序,未见/域移时弱化;LLM明确领域分离、模糊主题混淆。可作表征鲁棒性诊断。

04:00
arXiv cs.LG

MemoryWalker:停止在从未见过的上下文上训练智能体

提出两种精确修正与一种变分松弛SDCC,解决压缩训练的条件分歧,显著缩小训练-部署差距,提升奖励。

04:00
arXiv cs.LG

泊松-伽马动态系统与时变转移动力学

提出时变转移核的泊松-伽马动态系统,用三种狄利克雷马尔可夫链建模异构突变,高效Gibbs采样,预测性能更优。

04:00
arXiv cs.LG

用于宽带CARS相位恢复的iPINN:非线性光谱中函数逼近与逆建模问题的框架

提出逆向物理信息网络,从原始光谱预测峰参数并重建,多视角损失保证跨条件稳健,误差最低。

04:00
arXiv cs.LG

当Metropolis与Hastings遇上Bradley与Terry:基于偏好投票的精确MCMC

提出Pref-MH:仅用成对比较的精确MH采样器,利用Bradley-Terry偏好比率构造接受/拒绝规则,保证收敛且最优。

04:00
arXiv cs.LG

稳定性边缘梯度下降的多时间尺度:中心流的微扰推导

微扰框架证中心流为梯度下降极限 多尺度显示三时间尺度 中心流为首阶自稳定机制为次阶

04:00
arXiv cs.LG

从截断到承诺:均匀离散扩散中的持久上下文

提出承诺揭示采样法:将选定词元作为持久上下文,免训练即可降低生成困惑度,优化其与熵的权衡。

04:00
arXiv cs.LG

SAGE:子群感知的生成式增强方法以缓解虚假相关

提出SAGE两阶段生成增强框架,无群标签下利用聚类子标签生成合成数据填充欠表示区域,构建平衡验证集,显著提升最差组精度。

04:00
arXiv cs.LG

让置信度改变,而非预测:事后校准的预测保持修复

提出CORD修复校准后概率向量,保持原预测不变,实现零预测改变率,并降低平均校准误差等指标。

04:00
arXiv cs.LG

HarnessEvolve:从参考轨迹中学习以实现可靠的智能体自我进化

通过参考轨迹定位错误,并用质量与性能双重门控,防止捷径学习与遗忘,实现可靠的智能体自我进化。

04:00
arXiv cs.LG

条件流匹配用于基于机器学习的逆向设计问题

条件流匹配(CFM)在工程逆向设计基准上超越扩散模型与GAN,最优性差距更小且采样速度更快。

04:00
arXiv cs.LG

即使有丰富调查和全人口登记数据,生育仍难预测

预测荷兰人生育,数据方法虽好,准确率有限;随机性设定了预测天花板,个体生命预测受限。

04:00
arXiv cs.LG

阈下学习作为特质方向漂移:SFT蒸馏中的机制与定向控制

提出特质方向漂移机制解释阈下学习,并用探针空间走廊正则化在蒸馏中抑制隐特质迁移,保持任务性能。

04:00
arXiv cs.LG

基于深度学习与稀疏建模的神经符号回归

提出神经符号回归框架,用神经网络学习鲁棒近似,再以LASSO提取稀疏表达式,超参调优提升精度与泛化,优于基线。

04:00
arXiv cs.LG

复现TRACE:阈值与粒子预算的实践者指南

复现TRACE发现:最优阈值取决于真实边界;全局阈值仅恢复滞后1真相;F1在N=2即饱和;提炼出五条实践规则。

04:00
arXiv cs.LG

Modelpedia:面向AI元科学的模型发现目录

提出自动化LLM框架Modelpedia,从论文提取模型发现并建成可检索目录,支撑AI元科学。

04:00
arXiv cs.LG

CopyShield:大语言模型中版权防御的跨层级基准

提出CopyShield基准,比较输出、行为、表征三层版权防御,各有合规-效用权衡;DPO易退化,激活干预靠拒绝降险,非字面泄漏抑制仍是难题。

04:00
arXiv cs.LG

叠加潜在自编码器

提出叠加潜在自编码器(SLAE),通过叠加共享存储,同等存储下显著提升重建与下游分类性能。

04:00
arXiv cs.LG

预刻的生态位:早期大语言模型训练中模块化任务划分的形成动态

模块划分预刻于训练前;两次骤变与学习率无关地锁定,伴随梯度相对剥夺;偏差仅现于所学域,模块性追踪学习。

04:00
arXiv cs.LG

Transformer注意力中的缩放幂等性:OV配对几何与共享值代数

注意力中有效OV算子近似满足T²≈αT;缩放幂等性是稀疏训练方向,值共享可构成局部算子代数。

04:00
arXiv cs.LG

边缘端在线自适应何时才划算?时间序列预测中预热、学习率选择与资源权衡的无泄漏评估

在线自适应收益受评估影响:预热预算两向作用,优化器需分设学习率;验证选参后多数胜出但少数不及基线。

04:00
arXiv cs.LG

监督微调的后训练科学

系统测量监督微调中的学习率、批量、LoRA/全参等决策,覆盖多模型多数据集,给出带不确定性的建议。

04:00
arXiv cs.LG

REFACTOR-VLA:类型化运动程序的无监督库学习

提出REFACTOR-VLA,经由行为等价核学习可复用技能;证明模型容量非关键,辅助对比损失大幅提升聚类,全面超越基线。

04:00
arXiv cs.LG

FPGA平台上Transformer推理部署的最新进展:综述

综述FPGA上Transformer推理的最新技术、趋势与设计选择,构建主题分类,为高效部署提供指引。

04:00
arXiv cs.LG

更多探索,更少漂移:仅结果强化学习足以训练长程交互智能体

仅凭结果奖励的强化学习即可让小型开源模型掌握长程交互能力,通过扩大同任务探索并锚定策略,避免信号饥饿与漂移,已在AppWorld登顶并提升SWE-bench成绩。

04:00
arXiv cs.LG

利用合成数据评估性能的深度神经网络解决表内预测问题

提出表内预测:用自监督深度网络根据已知列预测任意列;合成数据下注意力网络在数据充足时表现最佳。

04:00
arXiv cs.LG

Multi-Head Self Attention is a Parameter Identification Mechanism

04:00
arXiv cs.LG

立场:隐私是一种主张,而非合成数据的属性

合成数据隐私常被默认为生成即安全,实则应作为可检验的明确科学主张,而非固有属性。

04:00
arXiv cs.LG

AI治理中的宪法覆盖三难困境

前沿模型宪法供给窄且漂移,自主性覆盖不足;两顶点菜单可降低四成七遗憾,印证预算多元主义三难困境。

04:00
arXiv cs.LG

生产中的多臂老虎机:推理时的超参数优化

提出IMABO与IMOSS,将推理时超参数优化化为无穷臂老虎机,在ML和LLM智能体上获最低累积遗憾。

04:00
arXiv cs.LG

单层Transformer在上下文中被证明可学习多类一最近邻

利用单纯形编码,证明带取最大索引的分类头的单层变换器在多类情形行为等同最近邻,弥补先前取整法缺陷。

04:00
arXiv cs.LG

SMELT:计算匹配的MoE循环Transformer缩放定律

SMELT循环中间层两次,在匹配FLOPs、参数和缓存时损失下降更快,节省6.8%-18%训练算力,下游任务超预期。

04:00
arXiv cs.LG

面向多模态拆分学习的贡献感知带宽分配

提出ModalShare:基于Shapley贡献分配模态带宽,零额外开销,5倍压缩下精度较均分提升15.4和12.4个百分点。

04:00
arXiv cs.LG

使用物理信息神经网络预测地下异常体生长

将物理信息神经网络用于探地雷达数据预测,融合CNN与注意力机制,提升地下异常预测精度,助力基础设施评估。

04:00
arXiv cs.LG

可证明安全的仿真到现实迁移

提出奖励无关安全强化学习框架,利用仿真器信息减少真实交互,同时保证安全探索与近似最优可行策略。

04:00
arXiv cs.LG

CATeye:面向优惠券滥用检测的耦合属性-拓扑不变性学习

提出CATeye,用双选择器应对属性-拓扑耦合偏移,学习不变表示,优惠券滥用检测F1提升8.61%

04:00
arXiv cs.LG

扩散作为无时间步迭代推理的训练课程

去时间步、加隐状态后,扩散可无限深迭代,数独与迷宫近乎全解;推理无需退火,扩散本质是训练课程而非采样。

04:00
arXiv cs.LG

通过Transformer变分自编码器学习稀疏决策树

提出一种方法,利用变换器变分自编码器将决策树映射至连续空间,联合优化预测性能与结构稀疏性。

04:00
arXiv cs.LG

利用幂律熵搜索高效估计最优超参数缩放定律

提出幂律熵搜索(PLES),按单位算力削减缩放定律不确定性,用不到十分之一预算即可估计最优超参缩放定律。

04:00
arXiv cs.LG

边围长:面向图神经网络的结构性边特征

以边围长(最短环长及条数)作结构特征注入GNN,ZINC-12k误差降三倍;恒定时仍限于1-WL。

04:00
arXiv cs.LG

分流框架:面向高效执行的三级路由与智能体引导

提出“轨迹即技能”的分流框架,按直接复用、技能替换、完整推理三档分流,零成本复用历史,令牌节省六成以上,越用越高效。

04:00
arXiv cs.LG

基于量子稀疏自编码器的认知诊断Q矩阵估计

首个将量子机器学习用于认知诊断的QSAE模型,稳定性优于经典自编码器,真实数据上9个数据集6个领先,主要优势是稳健性而非普遍精度提升。

04:00
arXiv cs.LG

NashDreamer:零和不完美信息博弈的基于模型强化学习框架

提出NashDreamer,用集中式MARSSM建模二人零和不完美信息博弈,显著提升早期样本效率,并具备纳什均衡收敛保证。

04:00
arXiv cs.LG

可复用神经基底的网络压缩数学理论

提出可复用神经基底架构,用共享基底线性组合表示网络块,实现高压缩和稳定训练,同参数下可建更宽深网络。