超越高斯假设:面向有效连接的分布感知信道容量
提出分布感知的信道容量有效连接度量,用归一化流双流估计器处理非高斯残差,仿真与多模态数据均优于现有方法。
理解并利用后训练中的各向异性
后训练各向异性非缺陷而是分工;提出SphereGate,0.1M参数超越基线并媲美全模型GRPO。
Extender:一种日志结构化的 Transformer
Extender 为日志结构 Transformer,新增拼接通道使 KV 仅读该通道,大幅降低注意力持久内存;短上下文持平,长上下文更优。
学习何时递归:面向不平衡眼科领域增量学习的令牌自适应递归
ToRe:免回放参数高效,令牌自适应递归与参数隔离,缓解不平衡眼科增量学习遗忘,性能领先且近零遗忘。
动机驱动:基于注入式动机提示的可控AI作曲
MotiGen将音乐动机作提示注入预训练模型,辅以注意力偏置与两阶段课程,92.3%生成曲含此动机。
基于 q-指数代理模型的鲁棒贝叶斯优化
提出 q-ED-BO,以 q-指数代理提升贝叶斯优化鲁棒性,具闭式 q-UCB/q-EI,重尾噪声下优于基线。
基于协议—目标—资源归约构建学习范式间的关系
提出协议—目标—资源(POR)框架,以归约统一刻画并比较监督、迁移、持续与元学习等范式,传递复杂度保证。
基于自探测梯度的持续学习
CPLUS利用自探测与旧样本梯度缩放冲突更新,显著缓解灾难性遗忘,少样本时尤佳。
FedHV:面向联邦多目标优化的低开销超体积加权
提出FedHV,以闭式逆松弛权重做联邦多目标优化,通信仅Θ(d+m),无需同步,非IID上优于基线。
AnchorMixGAN:面向云集成物联网网络DDoS检测的锚点对齐生成式半监督学习
锚点对齐生成式半监督提升云IoT DDoS检测,20%标注下准确率达96.5%–97.4%。
注意尖峰:大型视觉语言模型中视觉巨量激活的机制与脆弱性
视觉巨量激活多见于深层,由权重触发方向与图像孤立位置决定;其极脆弱,扰动与攻击即可增删,干预可有效消除。
改变乘积,保留参数:面向 Transformer 的结合代数层
以结合代数稀疏乘积替代矩阵乘法构建 Transformer 投影层,生成吞吐提升 6.2–7.8%,但下游指标下降,属小规模可行性验证。
重定时贝尔曼流:逃离速度自举的不可能三角
提出重定时贝尔曼流,偏移教师查询时刻并解耦噪声,构建无偏速度目标,在离线强化学习中显著优于现有方法。
UniCache:面向统一多模态模型的任务与类型感知KV缓存压缩
免训练任务与类型感知KV缓存压缩,理解编辑5倍、生成2.5倍,近乎无损,吞吐提升1.78倍。
基于草图切向一致性的神经算子在线导数信息训练
提出sTCL,用随机草图扰动在线约束神经算子灵敏度,无需离线导数标签,多类PDE精度媲美DIFNO。
逻辑门网络与查找表网络:面向患者间心电图心律失常分类的轻量级硬件分类器
可微逻辑门与查找表网络实现患者间心电心律失常分类,准确率达94.41%,算力与能耗极低,适合轻量硬件。
异构移动无线网络中的空中联邦学习
提出FedOAG,用梯度归一化与隐式gossip抵消异构衰落,实现无偏空中联邦学习,收敛率O(1/√T)。
面向免对齐神经权重生成的排列等变流匹配
以排列等变图元网络参数化流匹配速度场,无需对齐即可从独立训练网络学习并生成神经权重。
动态文本属性图上的边分类迁移学习
提出动态文本属性图边分类的跨域迁移协议,揭示现有方法泛化不足,并设计时空语义对齐STSA提升性能。
HamiFormer:基于仿射辛映射的双专家扩散场
HamiFormer双专家扩散场,融合全窗口去噪、哈密顿传播与并行仿射辛扫描,降低自回归误差,192步MSE较基线降26.3%/21.4%。
世界模型的自适应潜在容量
提出ALeWM,基于JEPA将预测信息集中于宽潜在表示的紧凑前缀,并设计MixSIGReg防坍缩,成功率更高、规划容量更低。
梯度噪声下的 Muon 与最优解附近正交化的局限
最优解附近噪声主导时,Muon 正交化仅匹配一阶响应,残留协方差抬高损失下限,宜改用匹配动量 SGD。
驻留吸引子:在神经代理模型离开吸引子处监督三维湍流
提出离吸引子监督,用DNS重标注偏离态,三维湍流预测失败中位步数由21升至721。
更少刷新,更优选择:复用陈旧梯度特征实现高效的基于影响数据选择
提出CDIS,复用陈旧梯度特征,仅重算高分候选并校准,选择成本仅约1/3.4,性能近全量重算。
函数级漏洞评分更多衡量标记率而非模型:协议对配对基准的影响
函数级漏洞F1主要反映标记率而非模型:固定输出下协议影响小,模型与基准差异更大。
面向冻结EEG表征的测量门控来源衰减
提出MGPA:在测量门控内校正来源分数,无需重训;跨设备与任务可降低来源可预测性并保持/提升性能。
仅预测下一状态还不够:面向 Lean 定理证明的 JEPA 表示
JEPA提升Lean单步后继排序,却未提高长程证明成功率,说明仅预测下一状态不足以指导搜索。
优化扩散引导RRT的H图混合
针对预训练DiTree,两种免训练推理期多样化策略经H图混合,在AntMaze上平均缩短路径约两成。
当更少计算带来更优效果:自适应早退提升预训练离群点检测
首次研究预训练离群点检测的自适应早退,最优中间层退出可提升检测4.7–7.3%并借助路由加速。
Allspark:通过交替思维链实现弱到强迁移
Allspark以交替思维链实现弱到强迁移,跨模型提升准确率,并考察准确率-令牌权衡。
带删失需求与对抗性库存的最优非参数动态定价
在需求删失、库存对抗的动态定价中提出Threshold-UCB算法,实现T^{2/3}阶最优遗憾。
面向非线性传播的图神经网络高效动态算法
提出非线性图神经网络传播动态维护算法,边增删下摊销O(1/ε)更新,兼顾精度与效率。
倚仗思考的计数:追踪语言模型中的证据整合
大模型直接作答计数存在近因偏差;思考能构建累积计数使证据权重均匀,但难以通过学习内化为直接反应。
结构化约束 MDP 中在线强化学习的末次迭代保证
面向结构化约束 MDP,提出在线强化学习末次迭代收敛框架,支持免模型函数逼近并验证正则化稳定效果。
现象图 JEPA:用于非接触式心肺传感的标签高效表示学习
提出现象图JEPA自监督框架,用于非接触心肺传感,标签效率提升约3.9个百分点,但生理分型未获证实。
随机性对机器学习中罗生门效应的影响
研究独立调控权重初始化、批数据顺序与dropout,发现三类随机源对罗生门效应的解空间、预测与决策依据多重性影响各异,三者互补而非可互换。
场景理论:打破多智能体大语言模型协同中的对称性陷阱
同质LLM智能体无通信并发易陷对称陷阱;提出免训练ToS,靠公共角色与场景分工,在多个基准超越基线。
逻辑的几何:分层诱导语义结构与稳健推理
STRAT将残差流分为数据/类型子空间,提升逻辑推理泛化;算术OOD误差降35倍,分布偏移下更稳健。
TwinS-GCN:用于谱图卷积网络的谱共轭
提出谱共轭分解移位算子,构建TwinS-GCN双滤波器,实现长程无衰减传播,节点分类具竞争力。
面向PDE贝叶斯反演的自然语言条件生成先验
自然语言条件生成先验,融合文本、数据与少量噪声传感,用于PDE贝叶斯反演与不确定性量化。
大语言模型预训练的相对泛化不变性
提出相对泛化不变性(RGI):优化器与架构变化下近似成立,数据流变化则显著改变相对泛化。
基于采样内原始-对偶引导的可行流匹配图重建
提出约束原始-对偶PIFM,以采样中演化的拉格朗日乘子引导图重建,可行性提升11–26个百分点且无需重训。
强化学习中的自确认叠加陷阱
RL训练可陷入自确认叠加陷阱,拟合全局最优仍维持低回报;保留被忽视状态可减少干扰并提升控制。
表格数据噪声标签的自适应集成选择
集成模块依数据属性为多类检测器赋权,诊断并清洗噪声标签;受控噪声下媲美置信学习,效果随数据属性变化。
超越令牌节省:LLM智能体上下文压缩的系统性研究
系统研究LLM智能体上下文压缩,发现令牌减少未必更快更省,策略效果因模型和任务而异。
数据应当教会什么?在电路、存储与使用间迁移瓶颈
电路视角揭示形成计算、内容可用与路径选择三瓶颈,按缺失操作设计监督;实验证明早期电路训练助益后续学习。
基于通用函数逼近的抗饱和对决老虎机
研究BTL偏好模型下通用函数逼近的上下文对决老虎机,提出SI-CDB,消除饱和导致的1/σ'因子。
约束流策略更新:广义薛定谔桥视角
提出RAFALE,沿流策略生成路径直接优化增广拉格朗日,免估计得分,在七个安全任务中兼顾奖励与约束。
裁剪还是不裁剪?重尾噪声下平均 SGD 的有限样本权衡
重尾噪声下,裁剪未必提升平均SGD主导精度,但可让重尾修正对置信度的依赖由多项式降为对数。
偏微分方程先验的高效消息传递
基于因子图消息传递与矩匹配推断PDE参数后验,无需采样或全局优化,精度媲美基线且具结构化不确定性。