当平坦性代理不是函数:鲁棒性证书与训练干预
曲率上界有效,并不足以证明鲁棒性证书或内在训练干预合理;代理受softmax平移影响,中心化可修复。
使用复值记忆的强化学习
提出复值酉RNN替代PPO循环结构,在部分可观测任务中显著提升奖励。
这个动作还能解释任务吗?面向扩散语言模型智能体的反向打分
掩码解码偏差使扩散语言模型智能体陷入重试循环;免训练的反向打分可抵消该偏差,提升具身任务成功率。
ReLaG:将随机划分推广至潜在关联数据的可扩展框架
ReLaG 以层次潜变量建模样本关联,用近邻图与社区检测推断相关样本组,生成独立划分;可扩展性强,适配分子与蛋白质数据,并支持无标签自适应分辨率。
重新审视奖励优化的缩放定律
奖励优化性能约随√min(log M,K)缩放,M为训练比较数,K为KL预算;理论与实证支持。
新鲜草图在岭回归中的优势
新鲜草图在迭代岭回归中提供可证明优势,通过残差感知采样实现更快收敛。
MM-FinEval:面向真实世界金融预测的多任务多模态基准
提出多任务多模态金融预测基准,含2045场财报电话会议文本、幻灯片、音频及12类任务,验证三模态互补有效。
FlexRouter:学习互补模型集以实现灵活的大语言模型路由
FlexRouter显式建模模型互补性,以答案覆盖为目标,用DPP与贪心策略自适应路由,提升覆盖并降低冗余。
NeurDuo-EEG:一种具有持久状态与显式记忆的长序列脑电基础模型
提出NeurDuo-EEG,具通道级持久记忆,预训练3955小时,五项基准四项最优,支持流式推理。
通过流匹配迈向通用 Wasserstein 重心
提出BaryFM,用流匹配逼近Wasserstein单纯形上全体重心,ODE采样,域适应基准领先。
JARQ:面向量化的联合交替精修
JARQ为插件式量化精修:交替联合拟合组缩放与Babai码提议,免反向传播、不增开销,广泛降困惑度。
学习赋能的估计:样本选择偏差下的紧致刻画
提出样本选择偏差下回归可识别性的紧致刻画,突破先估选择再纠偏范式,并给出有限样本保证与高效算法。
基于恰当评分规则的扩散模型用于概率天气预报
引入辅助条件去噪任务,结合扩散模型与恰当评分规则,提升概率天气预报,尤其长预报期与全球尺度。
含潜在混杂因子的循环线性高斯模型的可微结构学习
针对含循环与潜在混杂的线性高斯模型,提出可微结构学习,用伯努利门控优化带复杂度惩罚似然,并证明一致性。
大语言模型推理中束搜索的可证明测试时扩展
理论证明束搜索测试时扩展优势,CF-Beam将覆盖依赖由二次降至近线性,优于Best-of-N。
几何-物理混杂削弱跨不同域的PDE学习
几何变化与物理性质混杂削弱跨域PDE学习;显式几何-算子去混杂可提升数据效率并准确恢复方程。
通过针对探针训练实现对齐且不损失可监控性
持续更新探针引导微调,可提升无害与诚实,保持效用和可监控性,优于DPO及推理干预。
直接偏好优化的不确定性归一化间隔
提出不确定性归一化边距DPO,结合偏好强度、提示尺度与长度归一化,实验优于DPO/SimPO。
可解释但脆弱?几何-语义扰动下概念瓶颈的鲁棒性
概念瓶颈不天然提升鲁棒性,而是按几何/语义扰动转移敏感性,存在可解释性-鲁棒性权衡。
理解离策略与在策略蒸馏:不同训练目标的故事
多教师蒸馏中,前向KL产生算术混合,反向KL产生几何聚合;在策略蒸馏保留专家偏好,却对错误前缀敏感。
ChartDensity-Bench:视觉密度下多模态大模型数值数据重建基准测试
提出ChartDensity-Bench基准,评估多模态大模型在视觉密度下重建图表数值数据的能力,发现密度越高重建误差越大。
dattri-LLM:面向LLM规模的统一高效训练数据归因库
高效LLM规模训练数据归因库,以紧凑梯度表示与动态路由提速3.2倍,兼容分布式训练,可扩展至110B模型。
结构偏移下的分子性质预测:基于表格基础模型
提出MolPAIR,用分子对比较增强表格基础模型的上下文学习,免微调提升结构偏移下的分子性质预测。
相同损失,不同梯度
揭示相同损失下梯度可不一致,提出AR/FR实现前后向一致并给出三次误差界。
基于模型的离线强化学习中的分布内想象
提出分布内想象,在表征空间估计轨迹支持度并截断越界展开,结合轨迹正则化RL,少数据下稳定提升性能。
多精确才算足够精确?
数值精度是否足够取决于当前学习状态;相同原始误差可致不同学习后果,故精度应视为学习目标的一部分。
概率对比学习中,共享温度是否意味着共享角度尺度?
概率对比学习中,共享温度≠共享角度尺度;vMF角度增益影响边界与梯度,均衡后恢复共享尺度并提升表征。
超越困惑度:抽象预训练的持久影响
抽象栈任务预训练仅占1%词元,可提升小模型多跳推理3.9 F1,效果持久,结构与时机关键。
蒸馏扩散分数差异用于高效训练数据归因
提出TID,以局部分数差异归因并免重训;蒸馏为TIDE,毫秒级归因生成样本,性能领先。
遗忘中的学习:随机训练动力学中的统计支撑选择性保留
RPF动力学:重复强化+持续遗忘,视遗忘为选择,保留强支撑并致MDL压缩,实验验证可调归纳偏置。
可视化生成扩散模型中的分布覆盖
提出pass@k评估扩散蒸馏,发现单样本高分常以分布覆盖为代价,目标选择决定覆盖保留,图像视频皆然。
评估模型知识演化下的持续校准
持续校准:置信度须随模型知识变化且无需持续监督;跨检查点测试显示现有方法不足,多检查点训练有助改善。
黑板智能在全局约束问题上可超越自回归模型
黑板智能:扩散模型在可修改画布上搜索修正解,以平均置信度引导,全局约束任务上超越同规模自回归模型。
面向LLM智能体强化学习后训练的显式轨迹多样性
提出显式轨迹多样性,以任务描述符定义并设计TJPO单策略优化,实验提升多样性且保持性能。
LEARN-TS:基于正常性引导的LLM增强对齐与重建,用于多变量时间序列异常检测
LEARN-TS用冻结语言模型提供观测语义与正常性引导,增强掩码重建与异常评分,提升多变量时序检测。
未见混沌而习混沌:自回归Transformer对全局动力学的外推
自回归Transformer仅用局部轨迹训练,即可外推未见参数下的倍周期分岔、混沌与吸引子。
SparLeak:共享GPU上LLM推理中稀疏注意力引发的隐私泄露
SparLeak利用稀疏注意力的SIMA侧信道,泄露查询属性与模型回复,成功率超87%。
scTrilemma:在单细胞表示学习中平衡身份性、不变性与保真度
该潜瓶颈变分自编码器将表达变异分流至嵌入、解码器与先验,无需标注即兼顾细胞身份、不变性、基因级保真度。
ReSCENE:面向联邦持续学习中灾难性遗忘结构性缓解的服务器端回放
客户端上传浓缩数据代理,服务器留存历史代理并与当前任务联合训练,缓解灾难性遗忘,精度提升31.1点。
得分更高,回答更差:通过协议级评分标准缓解基于评分标准的强化学习中的奖励黑客行为
评分标准RL因求和聚合致奖励黑客,提出协议级评分标准ProRubric,适当性提升10.8分。
利用在线蒸馏缓解长度扩展代价
提出长度自蒸馏,缓解强化学习后训练中已解题的冗余问题,保持性能同时抑制长度增长。
K2P:无标签知识到提示蒸馏
K2P从教师解答合成并精炼可复用提示,以答案一致性引导搜索选择,无需标签即可向冻结学生蒸馏推理能力。
学习蛋白质折叠能否泛化到更广泛的推理?
蛋白质折叠数据后训练既提升结构预测,又在10项推理基准上平均涨3.23个百分点。
VERA:面向约束多智能体控制的可验证可行性表示与反事实信用
提出VERA,分离可行性估计与信用分配,以VFR与CGRA提升约束多智能体控制的成功率并降低违规。
带有偏见LLM评判器的主动偏好学习最优设计
提出NAOD,将评判器偏差纳入采集设计,优化比较选择,理论达紧致下界,实验遗憾降低29.1%。
答案正确,模型昂贵:基于大语言模型的优化建模效率差距
LLM优化建模常答案正确但求解更慢、开销更高;新基准揭示效率差距,应兼顾正确性与效率。
GeoNest:学习为圆形容器中的不规则背包问题选择失败感知邻域
GeoNest用强化学习图策略选择失败感知邻域,提升圆形不规则背包利用率约0.9%。
Unmerge:通过任务算术实现高效机器遗忘
将遗忘重构为任务算术的逆操作,用低秩遗忘子空间优化三目标,实现高效机器遗忘,并扩展到ViT和Llama。
学习随机混杂系统的连续神经表示
用高维潜空间连续SDE逼近随机混杂系统,辅助变量粘合重置分支,无需标注或事件仿真即可学习概率演化。
论从视频中获取非线性标量动力学参数:不变量、标定与可辨识性
提出视频中非线性标量二阶动力学参数可辨识性:辨识性因方程族而异,或唯一、或不变量组合、或需外部标定。