反馈更丰富时,基准测试的可复用性如何?
多准则反馈下基准复用性骤降:测试集需求随准则数指数增长,少量准则即达√k代价,多任务评测频现假优胜者。
面向信用卡欺诈检测的注意力驱动异构图神经网络模型
采用SMOTE-Tomek平衡数据,结合注意力异构图神经网络检测信用卡欺诈,准确率达99.97%。
SAMBAR:通过乘子法进行选择性锚定,以在视觉-语言-动作模型中平衡知识获取与保持
提出SAMBAR,无需旧任务演示,以乘子法和选择性锚定平衡VLA持续学习中的新知获取与旧识保持,避免灾难性遗忘。
CAFE:基于快速后验估计的反事实预测
提出CAFE摊销推断框架,用预训练Transformer单次前向传播逼近贝叶斯反事实后验预测分布,兼顾因果结构不确定性,在可识别、不可识别及实际场景均稳健。
智能手机运动传感器在未见用户与手机机型间的手写数字泄露
传感器可跨未见用户与机型预测手写数字,准确率57.74%,但隐私解读受采集顺序捷径限制。
面向全局采样的并行拆分学习中的延迟感知客户端分配
提出延迟预算并行拆分学习,用流规划与贪心分配客户端,CIFAR-10建模时间减6.75%,精度降0.30个百分点。
REALM:区制切换、可解释且由激活诱导的线性模型
提出REALM:以神经网络激活模式划分区制,每区制拟合线性模型,并用可解释门控复现区制分配。
谱反转:对抗图提示中的奇异值偏置
揭示预训练GNN的谱偏置现象,提出谱反转提示SRP,在谱域重平衡奇异值并增强零空间,实现参数高效适应
我们该冻结什么?守护式冻结:连接性塑造预训练模型的微调
仅冻结权重难保性能;提出守护式冻结:按输入连通性选策略,可切断用移除值,仍连通用漂移值,保旧任务性能。
达到标准杆:面向可证明最优四边形块分解的强化学习
强化学习智能体局部编辑网格,建四边形分解并达顶点不规则度拓扑下界,实现可证明最优,远超Gmsh。
少测量下稀疏线性分类器混合模型的高效支撑集恢复
提出自适应与非自适应方案,减少测量次数并实现亚线性解码,改进混合模型支撑集恢复效率。
基于模拟器集成的不确定性感知在线算法选择
不确定性感知选择基于模拟器集成,缓解离线数据有限问题;多臂老虎机理论遗憾更优,提升机器人控制在线表现。
图上的解析游走旋转位置编码
提出AW-RoPE,将旋转置于边并在所有游走上求和,能区分不同路径;精确版与稀疏版在多个基准上提升15–58%。
重新思考时间序列预测中的跨通道重要性
跨通道重要性≠相关≠有用≠被用;依赖随预测步长变化,自适应选源有增益,但神经模型迁移有限。
DP-Rec:面向高效长序列推荐的动态分块方法
DP-Rec按对比熵惊讶度切分序列,压缩为动态潜行为向量,实现长序列推荐更优的效率-精度权衡。
基于基准加权与块因子化 e-过程的任意时刻有效大语言模型排行榜
提出 BB-EDGE,将 LLM 排行榜视为有向图,用加权块因子化 e-过程认证优势,实现随时 FWER 控制与 Top-k 排名。
CompassPlay:奖励出题者,看它把求解器推向何方
CompassPlay通过梯度对齐奖励出题者,偏好与目标能力参考任务梯度一致的任务,提升性能与训练效率。
“我在哪里能信任你?”:代理模型保真度的边界感知评估
代理模型保真度在教师决策边界附近显著下降,且边界随训练不稳定,全局一致率不足以评估。
随机梯度方法中的算术简洁性
将 AdaGrad、Adam、AdamW 化为仅用加减乘和除以 2^t 的算术简单算法,并分析静态 Adam 的收敛性。
HM-Router:面向智能体系统的模型与执行框架联合路由
HM-Router 联合路由模型与执行框架,可泛化到未观测组合,路由准确率提升 7.3 个百分点。
面向多模态测试时自适应的表征编辑
提出FIRE,用傅里叶表征编辑器逐层校准单模态中间表征,多层目标优化以提升跨模态对齐与预测可靠性。
通往稳定边缘的旅程
按优化器直流增益归一化学习率后,不同优化器轨迹几乎重合,据此划分低、中、高学习率三区制,揭示稳定边缘成因。
旧评估何时能认证新模型?评估器漂移下的标签高效发布决策
评估器漂移下,旧评估能否认证新模型取决于历史可信度;提出组合警觉序列认证法,高效省标签且经实验验证。
自重建动力学用于自编码器重建精化
提出SRD引导的重建精化:用冻结自编码器的自重建轨迹预测隐空间校正,无需逐样本优化,六数据集恢复45.3%可恢复MSE差距,PSNR提升1.74dB。
博弈学习:偏斜迁移表格知识以强化图像模型
提出SKT,用两步纳什博弈自适应整合模态梯度,将表格知识非对称迁移至图像模型,提升其单模态性能。
双曲 Sombor 指数引导的拓扑自适应双曲图注意力网络
提出HSO-GAT,用双曲Sombor指数引导拓扑自适应曲率与注意力,节点分类和链接预测均达SOTA。
HyperLabel:基于超图的标签相关性建模的多标签分类
提出HyperLabel,以超图显式建模高阶标签依赖,跨模态编解码,七基准最优,宏F1显著提升。
高斯LoRA的认证前沿:独立先验、后验风险与保持预测的平衡
高斯LoRA认证需低损失与低KL;保预测平衡降KL,Chernoff可认证,Hoeffding不能。
SIMANF:通过归一化流中的模拟退火实现非归一化分布的无样本学习
融合模拟退火与归一化流,仅用非归一化密度、无需目标样本,逐步退火精修,缓解模式崩塌,学习高维多峰分布
预训练数据投毒的可解理论:机制依赖的标度指数
可解投毒理论:干净性能幂律退化,非整数标度指数源于奇异结构,且指数依赖极限顺序。
FUND:用于采样非归一化分布的密度流
提出无需真实样本训练的密度流算法,迭代重塑目标分布,高效精确采样玻尔兹曼分布。
协同何时有助于主动特征获取?一项基于PID的研究
提出SynAFA,用PID分析协同信息:低预算下有益,高预算消失,且局部信息难转化为有效获取目标。
论硬提示的能力与局限
首次证明硬提示存在性NP完全、最优NP难;短/长硬提示有本质局限,线性硬提示无;给出泛化紧界与充要条件。
基于过渡正则化的扩散模型持续数据遗忘
提出基于过渡正则化的持续数据遗忘框架,用固定容量转移记忆约束更新,平衡删除持久性与生成效用。
刷新还是实现?漂移模型中的算力分配
墙钟匹配时,刷新漂移场比加深拟合FID更低;重绘支持方向变化远大于参数更新。
超维计算的叠加推理
提出SupHDC叠加推理范式,共享编码多个查询,速度最高提升2.08倍,精度损失仅2.67个百分点。
并非所有误差都重要:决策相关预测误差可预测规划质量
提出决策相关预测误差(DRPE),仅衡量影响决策的状态维度误差;实验显示其与规划成功率强相关,而总预测误差仅弱相关。
排行榜能证明什么?面向生物医学文献综述智能体公平评估与训练的组合可控性
提出组合可控性,构建BioLitBench,拒绝11/21不可比比较,并训练SCRIBE获认证排名。
相空间注意力:Hairer 提升绕开单层归纳障碍
将注意力提升至辛相空间,绕过单层归纳障碍;不增参数、缓存不变,开销极低,并观察到归纳能力涌现。
不完整训练数据下的主动特征获取
研究训练数据不完整时的主动特征获取,比较三种学习范式,发现缺失主要损害多步获取,生成式恢复可挽回性能。
当合并系数不再重要:面向持续LoRA适配的近端正则化合并
提出PRM:训练时加近端惩罚,使LoRA任务向量更易合并,拓宽合并系数平台、缓解稳定性-可塑性权衡。
多智能体辩论蒸馏中认知可靠性的黑盒审计
提出ER-Audit黑盒审计框架,对照监控与隐藏任务,揭示辩论蒸馏中被总体增益掩盖的选择性退化。
无需激活函数导数的模拟友好预测编码
提出激活匹配Bregman预测编码,免激活导数、适于模拟硬件,性能近PC/BP并保留其动力学。
面向人类移动性模拟的可编辑地图条件轨迹生成
提出可编辑地图条件的自回归人类移动轨迹生成,路网栅格驱动解码,无需重训适应局部编辑,实验验证可行。
注意力机制与状态空间模型在上下文学习中的对比分析
提出信念几何框架,比较注意力与状态空间模型的上下文学习能力,揭示二者信念维持与内容寻址优势。
无需二次遍历的归因:约1%开销下的在线逐样本梯度溯源
Traceprop 在训练反向传播中在线记录逐样本梯度,免去事后二次遍历,开销约1%,比 LogIX 便宜2–4倍且归因质量不降。
图记忆:基于狄利克雷能量的谱联想记忆
提出基于狄利克雷能量的谱联想记忆,可存储与检索图数据,具备指数级存储容量,并在真实图数据上验证。
DiffPTS:重新思考概率时间序列预测中的扩散ELBO
DiffPTS重新思考扩散ELBO,统一概率时间序列预测端到端优化,多基准SOTA。
STRIDE:基于增量动力学与演化的状态转移表示
提出STRIDE,以增量动力学与演化建模状态转移,将连续预测转化为转移预测,长时预测显著优于基线。
大语言模型金融智能体评估中的测量边界:固定记录回放执行与多缺陷审计
LLM金融智能体评估的两类测量边界:固定回放隔离执行效应;多缺陷审计中目标召回不足以衡量审计质量。