奖励即观测:学习基于奖励的策略以实现快速适应
提出仅以奖励和动作为条件的策略,实现观测空间完全不同的环境间零样本迁移与快速适应。
量化救护车滞留影响:维多利亚州急诊医疗服务病例的多年度分析
全州285万次救护车出勤累计损失149万救护车小时,2022年达峰,交接时长随同院前一小时到达车辆数递增。
增加宽度使贪心逐层训练在自监督学习中媲美端到端反向传播
网络越宽,端到端反向传播相对贪心逐层训练的优势越小;浅而极宽网络中贪心逐层训练甚至更优,表征几何更佳。
信号-噪声分解将干扰变异隔离到可移除子空间
通过正则强化信号-噪声分解,将干扰噪声隔离到可移除子空间,显著提升失真图像任务性能。
混合整数规划的重构对比学习
利用等价重构自监督,提出ReMILP学习混合整数规划变量与约束表示,无需求解器标签且可迁移。
可扩展的多任务逆强化学习
提出低秩多任务逆强化学习,共享数据降低覆盖要求,按秩扩展,具样本保证并优于基线。
中文标题:记忆任务间迁移的定位
研究记忆任务间迁移,发现等价与非等价两种模式,消融实验将迁移分解为末层幅度驱动与结构驱动两种效应。
预训练干预的事后实施:跨检查点嫁接模型信念
提出“嫁接”法:预训练检查点训练SDF适配器,再叠加到后训练模型,平均将现实漂移与偏好一致性损失减半。
从有限时间可达性学习目标达成的拟度量几何
ReQRL以有限时域可达性约束价值梯度,解耦动力学与边界几何,在OGBench上媲美或超越现有方法。
面向合成数据选择的训练感知目标覆盖
提出训练感知目标覆盖(TATC)选择合成数据,量化其对目标任务价值,数学推理微调中优于基线。
SHARPO:面向智能体强化学习的片段级信用分配
SHARPO通过片段级师生对数概率差生成有界乘子,调节GRPO优势,在多步智能体任务上超越基线。
TrueMuse:面向文本到音乐模型的数据归因基准
提出TrueMuse基准,用受控微调数据评估文本到音乐数据归因,发现现有方法仍具挑战。
修复一个学到“癌症越严重意味着风险越低”的模型:膀胱癌复发预测中的单调约束
无约束模型将高分期/原位癌学成低复发风险,常规检查未察觉;反事实测试加单调约束可消除且不损性能。
别浪费噪声:全局与局部联合约束下的重要性引导扰动分配
提出重要性引导扰动分配,在共享ℓ1预算与局部约束下,将扰动重分配至高敏感区,不增预算并提升攻击成功率。
重新思考协变量偏移下的数据增强:不变引导扩散与原型重加权
针对协变量偏移下数据增强的生成误导与重加权不稳,提出不变引导扩散与原型重加权框架IGDPR。
Clock Diffusion:高效半自回归连续扩散语言模型
提出时钟扩散,用位置相关噪声调度实现半自回归连续扩散语言模型,支持变长与KV缓存,在多项基准领先,并推出Cache Grab采样器。
智能体编程任务上强化学习的跨基准迁移
在1700个智能体编程任务上做强化学习,六个外部基准均提升,实现显著跨基准迁移且轨迹更短。
即时权重生成:基于 ARC-1D 的超网络概念验证
以 ARC-1D 为测试平台,超网络可从少量示例即时生成专用模型参数,形成结构化权重空间,并泛化至未见变换。
匹配分布,而非算力:后训练多Token预测头
后训练MTP头仅用极少Token,在冻结模型上达到联合训练加速;链感知验证放宽和自适应头选择进一步提速。
AnyJev 技术报告
AnyJev单次预填充读取类型化决策,免训练校正标签与位置偏差,旋转平均和停止规则提升准确率并省算力。
EHR2Trace:面向患者世界模型与临床智能体的可审计电子健康记录数据基础设施
将多源电子病历转化为可追溯患者事件,支撑患者世界模型与临床智能体的训练与评估。
使用机器学习预测供应链管理中的运输时间
利用机器学习与深度学习,基于历史数据构建模型精准预测供应链运输时间,提升物流效率。
深度分类树的移动时域近似分支归约方法
提出移动时域近似分支归约法,融合全局搜索与贪心启发,可高效训练近最优深度分类树,精度与扩展性俱佳。
共形对抗生成集成
提出CAGE,融合生成、对抗与共形预测,动态调权,提升时序预测可靠性,抗异常噪声优于传统集成。
激活条件化自蒸馏
提出ACSD,以正确与其余轨迹激活对比构建引导向量,无需参考答案或教师更新,五模型数学基准平均最优。
FlashDiffusion:融合分块核谱分解
提出无矩阵 FlashDiffusion,在 GPU 融合分块中计算稠密高斯核,并用 β-flow 选尺度、逐级热启动谱求解。
DualCast:面向双模态金融时间序列预测的双路径语言模型
双路径框架以金融词元扩展冻结语言模型,快路径预测、慢路径结合新闻修正,金融时序预测多数最优。
面向水平集界面平流的无数据物理信息神经算子
无数据物理信息神经算子用于水平集界面平流,仅用输运残差与几何约束,无需参考解;精度逊监督,守恒更优。
受损的运动学特征:利用传感器数据与机器学习检测电动滑板车骑手的酒精中毒
骑手醉驾时转向与侧向加速度信号熵降、波动增大;机器学习识别醉驾准确率达85%,AUC 0.94。
Hermes:学习上下文推理,解锁测试时扩展
提出可配置Hermes框架与两阶段Hermes-Learn,使模型学会分配和复用上下文,解锁测试时扩展并可泛化迁移。
具有自适应锚点的函数空间 Transformer
提出函数空间Transformer,用自适应锚点递归精炼潜表示,在PDE与图像分类上超越基线。
MILO:通过编排式多智能体演化实现自动化智能体执行框架发现
MILO以编排式多智能体演化,协同发现更优智能体执行框架与搜索策略,多基准超越SOTA并刷新数学上界。
无需训练的合成:面向表格、时序与关系型合成数据的纯推理流水线
免训练纯推理流水线:统计画像与语言模型约束生成可审计采样器,统一支持表格、时序和关系数据。
基于可回收单元门控的循环神经网络动力系统持续学习
提出可回收单元门控CRUG:L0门控选择并回收任务单元,零遗忘持续重构动力系统,兼顾容量,可迁移至认知任务。
从随机探索中学习规划
仅凭随机探索,用条件能量模型学习多尺度时间关系,无需动作与奖励标签,实现长程迷宫规划与导航。
论同策略蒸馏中的异策略教师
同策略蒸馏中教师监督学生前缀为异策略;SCOUT协同训练教师适配,提升蒸馏效果。
LeanPolish:面向Lean证明压缩的经核验监督
发布3.3万条经验证Lean编辑与候选池,揭示首次成功搜索捷径;符号迭代与微调提升压缩和整证明重写。
面向射频逆向设计的模拟器精炼扩散
提出模拟器精炼扩散SRD,用可微代理梯度引导、高保真模拟器精搜,射频逆向设计S参数匹配最高提升21.2%。
哪些任务能在自监督学习中幸存?
研究同实例自监督学习的信息保留,用语义可恢复性及谱子空间刻画下游任务几何与少样本迁移。
面向基于图像的连续控制的高斯与Beta策略分歧正则化模仿学习
DRIL将策略分歧转为强化奖励,少示教图像连续控制显著优于行为克隆;示教增多优势缩小,β行为克隆强。
梯度冲突能否预测理解—生成权衡?统一多模态模型中冲突度量有效性的受控审计
受控审计发现,梯度冲突指标与理解—生成权衡无显著相关,抑制冲突不改变权衡,其诊断有效性需验证而非假设。
ShamAN-Q:面向亚1比特LLM权重的Shampoo增强NanoQuant
提出ShamAN-Q亚1比特量化法,以稠密曲率替代对角几何,降低困惑度并提升零样本精度。
预训练与中期训练让什么可从奖励中习得?
预训练与中期训练提供可执行计算与检索,使奖励学会任务特定用法;源监督和记忆回放大幅提升成功率。
基于音频语言模型的临床精神病学语音记录中角色引导的说话人删除验证
验证精神病学双人录音中角色语音删除是否彻底:消隐目标角色,用音频语言模型扫描遗漏,F1 0.478。
一种精简输入的深度学习框架用于天气驱动的全国作物产量预测:以巴西大豆为例
低输入天气驱动深度学习框架,巴西大豆产量预测中Transformer最优,误差较基线降47.6%。
从最小范数插值视角看顿悟
建立统计理论,揭示正则化几何与信号稀疏性如何影响插值附近泛化,解释顿悟并揭示最小范数插值的不稳定性。
自回归前沿扩展:用图机器学习生长树状结构
提出自回归前沿扩展框架,用等变GNN与流匹配模型迭代模拟树状结构生长,生成形态与参考分布高度吻合。
图异常检测作为有限时域控制:基于经验贝叶斯的免训练评分
免训练EB-GAD以经验贝叶斯拟合图感知OU弛豫,评分化为有限时域控制能量,无标签选族,11基准9优。
RetroGEF:面向单步逆合成的动态图编辑流
RetroGEF基于流生成,从目标分子动态增原子、改键构建反应物,无需固定图或编辑顺序,性能达最优。
文本能引导神经PDE代理模型吗?基于OperatorCLIP的受控诊断
低误差不等于文本被理解;受控诊断中常量条件均值更低,文本对齐收益不稳,提示干预无语义排序,需路径控制。