从BERT到前沿智能体:语言模型八年进步、能力-成本曲线崩塌与任务定向模型的兴起
八年从简单模型到智能体,编码能力年增六倍,成本骤降;专用模型分领域领先;高级采样与置信排序显著提升任务效果。
推理中数据选择的能力依赖性效应
推理微调中,高似然数据利于小模型快速提升,低似然数据利于大模型长期训练,选择需视模型容量与算力而定。
整数不在场证明:INT8量化LLM推理中跨内核分歧的定位
INT8内核互换导致输出分歧,源于缩放与舍入而非精确累加器;探针干预可恢复逐位一致。
基于深度学习药物-靶标结合亲和力预测的最新进展
综述深度学习预测药物-靶标结合亲和力方法,分析基准数据集与评估指标,指出数据偏差、冷启动等局限,提出改进方向。
联邦提示学习:统一框架、实证分析与未来方向
综述联邦提示学习:整合联邦学习与大语言模型,解析其动机、特性、权衡、安全隐私挑战及防御机制,并展望未来方向。
SAGE:注意力引导熵驱动的脉冲Transformer代理梯度自适应
提出SAGE,用注意力熵估计不确定性,训练时自适应调整代理梯度斜率,不改变推理,准确率提升1-2%。
CutClean:面向隐私保护推理的神经网络剪枝
提出一种隐私感知剪枝法,减少隐私信息流动并提升稀疏度,同时保持目标任务精度。
用于鲁棒分子过渡路径采样的随机控制策略
提出随机策略FS-TPS与LaS-TPS,稳定生成分子稀有转变路径,提高成功率与路径质量。
HI-MeshGraphNets:基于层次多尺度图神经网络的高效精确网格物理学习
提出层次多尺度图网络HI-MGN,粗化网格传递消息,精度提升,训练时间和内存降低。
带在线请求的动态多车场车辆路径问题:事件驱动Transformer-深度强化学习与滚动时域基准测试
提出事件驱动学习框架,处理动态多车场车辆路径在线请求;学习策略毫秒级决策,但最近可行启发式综合最优。
PPAPlace:芯片布局优化的可微分跨阶段目标
提出PPAPlace,用后布线标签训练双流预测器,端到端优化时序,改善22%/51%,保持功耗可布线性。
基于几何过滤的LLM生成样本用于少样本文本分类
通过样本到真实样例的几何距离过滤LLM生成数据,提升少样本分类,平均超SMOTE 2.61个百分点,并泛化至命名实体识别。
基于极化码的联邦学习:收敛性分析与资源分配
提出跨层极化码联邦学习,利用不等错误保护优化量化比特与码长,收敛分析证明显著提升鲁棒性效率。
基于统一序列组合模型的时尚穿搭生成
提出统一序列组合模型与潜扩展蒙特卡洛树搜索,解决时尚穿搭生成中的组合约束,在多数据集上达最优性能。
混合量子启发Kolmogorov-Arnold网络用于隐私保护联邦生物信号学习
HQKAN以更少参数和通信开销,在联邦心电图分类中优于MLP,兼顾隐私与鲁棒性。
变差布朗核阶梯
提出变差布朗核阶梯,分离非线性递归字典与线性变差叠加,导出泛化界及逼近误差上界。
MedMix:模态异质性下专业化一致的联邦稀疏混合专家
面向模态异质性的联邦稀疏混合专家语义对齐框架,利用模态上下文路由、共识对齐与自适应专家聚合,医学数据F1最优。
基于低秩二次密度投影的高维非参数变点检测
提出低秩二阶密度投影的矩阵均值法,无需参数密度,可检测高维分布变化,误差最优。
混合迭代生成模型的训练后量化
提出HyGenQ框架,通过分层簇解耦与缩放重校准解决异常值问题,实现混合迭代生成模型8位量化(W8A8),显著优于现有基线。
概率性不排水抗剪强度间接模型:运用先进插补与机器学习方法应对数据缺失和变异性
利用CLAY/10/7490数据库,结合多重插补与多头注意力概率神经网络,提出MHA-PNN模型,在数据缺失下显著提升不排水抗剪强度预测精度与不确定性量化。
CForce:通过一致性强制提升扩散大语言模型的并行解码
提出一致性强制蒸馏,对齐扩散LLM掩码预测,减少并行解码错误传播,提升速度质量权衡。
无分类器引导调度的对抗学习
针对文本生成图像扩散模型,提出对抗学习无分类器引导调度,动态预测指导尺度,优于启发式和现有方法。
模型无关的检索增强扩展时间序列预测
RAEF基于检索增强扩展,采用直接检索与拼接聚合,提升精度、降低开销,性能媲美微调。
学习运行电力网络:受AlphaZero启发的有效拓扑控制
受阿尔法零启发的电网拓扑控制,存活率98.43%,优于近端策略优化;简单二元奖励和最小观测空间更有效。
当去噪有害时:重新思考扩散时间序列预测器的终止步骤(扩展版)
扩散模型低噪细化会引入漂移损害预测;提出无标签全局停止准则与伯努利采样器,加速推理并提升精度。
说谎预言机下的序列预测
研究m元序列预测;损失源于经比较查询说谎预言机的预测复杂度。针对随机与对抗环境提出算法,证明遗憾对数上界。
删失需求下单仓多店系统的资源自适应原始-对偶学习
提出资源自适应原始对偶学习,针对需求截断的单仓多店系统,随剩余资源动态调整,实现对数遗憾,优于现有平方根界。
中文标题
部分序上上下文学习的可辨识性与序维极限。摘要:针对部分序上的上下文学习,分离逻辑可辨识性与教学成本,证明补全三分律,给出教学数公式,最大为n(n-1)且仅反链达到,并明确坐标解码器的维数边界。
更多正确数据何时有害?插入稳定性与维度理论的局限
正确数据加入也可能有害;插入稳定学习器可免疫,经典维度无法预测,VC类误差有对数代价。
时间序列基础模型中的预测坍缩
预测千股小时收益现平坦排序差坍缩,源于低可预测性与逐序列目标;校准排序法平衡校准与排序,提升横截面相关性。
结构引导的时空注意力图神经网络用于交通流预测
提出SGSAN,用静态有向依赖图引导时空注意力,兼顾高精度预测与内在可解释性,实验验证有效。
智能路线:用于开发与比较求解带现实约束车辆路径问题算法的系统
研究CVRPTW,对比精确求解器与启发式及深度学习算法,发现50节点时精度接近且更快,100节点时精确法慢约13倍,并开发了Smart Routes实验平台。
通过主动解释引导克服图神经网络中的捷径学习
提出XIGL,用主动解释引导的人机协同策略消除图神经网络捷径学习,降低成本,提升鲁棒性。
带时间窗和容量约束的取送货路径问题的深度强化学习解决方案
首次用深度强化学习(改进JAMPR)求解带容量和时间窗的取送货路径问题,中小规模快速最优,大规模快速次优。
训练公平的表格基础模型
FairTFM用合成任务和梯度反转层学习公平表征,提升公平性且保持精度。
重新审视基于能量的表格异常检测:能量与重构互补
DBM能量与自编码器重构分数融合,显著提升表格异常检测,证明经典能量模型与重构互补。
符号回归中进化特征构建的自适应保护及其在信用分类中的应用
提出基于特征重要性的自适应保护机制,保留重要构建特征,提升回归与信用分类性能。
从固定网格到移动粒子:面向流体动力学的可迁移潜算子
提出可迁移潜算子,统一欧拉场预测与拉格朗日粒子轨迹,无需拉氏监督即可零样本迁移,性能优于现有神经算子。
凸损失及其在SVM、SVR和浅层神经网络中的应用
提出用于支持向量机和神经网络的新凸损失,证明是标准损失的推广,但实验显示泛化性能无提升。
连通子空间聚类:难解性、可扩展启发式算法及海平面大地测量应用
证明连通子空间聚类NP-hard难近似,提出可扩展Lloyd式启发式算法,应用于海平面大地测量,优于现有方法。
利用随机权重平均提升数据增强
研究随机权重平均作为数据增强的集成方法,无需重复训练,在无限宽度极限下提供额外等变性提升,实验验证。
非参数时空轨迹预测:基于状态条件转移采样
无需训练与GPU,用状态转移表采样实现多模态轨迹预测,精度媲美5700万参数模型,且在小数据下更稳定。
基于影响函数检测受污染的代码生成提示批次
提出CodeSIFT,用影响函数检测异常提示批次,AUROC达0.98,优于静态分析。
量子多臂老虎机与线性老虎机:下界与算法
证明量子MAB与有限动作QLB的极小极大下界,提出消除算法使维度依赖从d²降至d。
关注长尾:理解业务流程中延迟检测的困难
延迟检测因长尾分布和不确定性而困难,现有模型对高延迟案例预测差,不确定性感知建模是未来方向。
AutoSchema:异构知识图谱上智能体文本到SPARQL的实时模式锚定
提出免训练的AutoSchema框架,实时获取模式证据,提升生物医学问答准确率,减少工具调用,并支持未见图谱迁移。
捕捉冒名顶替者:通过跨实体特征置换自监督学习物理一致性
提出“冒名顶替”自监督任务,经跨实体特征置换学习物理一致性,在气候、碳通量等任务验证其有效性。
面向模型合并的多目标贝叶斯优化
用多目标贝叶斯优化选取模型合并参数逼近帕累托前沿有限预算下优于随机搜索尤适合TIES等复杂合并
RecipeNet:配方数据的层级Transformer
RecipeNet层级Transformer建模配方数据,捕捉字段交互与步骤依赖,超越表格模型。
DeaMoE:面向快速小批量解码的高效MoE结构
提出DeaMoE架构,专家按领域分组共享参数并带私有参数,两阶段路由避免冗余加载,显著提升小批量解码速度。