基于openEO的对地观测数据立方体机器学习API
提出openEO三阶段ML规范,支持传统与深度学习模型,验证跨后端互操作,提升EO数据立方体ML可复现性。
论多任务学习在预测性流程监控中的潜力
首个全面实证研究:多任务学习可显著提升下一活动预测并缓解类别不平衡,低容量模型下任务平衡尤为关键。
面向样本高效神经接口的预训练
自监督预训练MAPA融合解剖与相对位置编码,跨受试iEEG解码仅164试次即达未预训练3500试次精度。
同一谱,两种资源:自回归预测中的数据—记忆扩展规律
数据与记忆两种资源同受一预测能量谱支配;提出极小极大定律,数据定分辨率、记忆定水平,实验验证。
分布偏移与对抗规避下LLM与经典机器学习用于网络入侵检测的三轴压力测试
同数据集持平;跨域迁移XGBoost占优,对抗规避RoBERTa-LoRA占优,选型取决于评测轴。
GeoTTER:利用最优传输的局部几何结构实现零样本分类
GeoTTER以图拉普拉斯平滑融入局部几何结构,并以聚类引导代价校正角度漂移,零样本分类中位提升6.82%。
面向通信高效的联邦LoRA微调的自适应阶段切换
反向自适应阶段切换,联邦LoRA微调省40.5%通信,损失仅增0.0063,优于FFA-LoRA。
光谱学中的运行范围界定:一种机器学习模型的安全笼框架
提出安全笼并行监控,融合不确定性、域外检测等指标约束运行域;拒识20%数据降误差45%–65%。
AttnFuse:一种将注意力编译为融合GPU内核的可组合DSL
AttnFuse:把RoPE等乘法前变换列为一等操作的注意力DSL,编译为单一融合GPU内核。
分布偏移下的归纳图在线贝叶斯节点分类
提出在线变分贝叶斯末层法,改善分布偏移下归纳图节点分类泛化与校准,五基准准确率和NLL最优。
通过可扩展神经符号模型实现生成式可解释性
主张转向生成式可解释性:推理原生暴露可理解、可干预检查点,并以可扩展神经符号模型实现。
注意力就是你所需要的一切(以避免伪振荡)
提出CFL条件注意力通量有限体积格式,大步长保持锐激波,并验证可迁移性与局限。
当贪心采样进行探索:无需 Eluder 维度依赖的 KL 正则化上下文赌博机
KL正则化上下文赌博机中,贪心采样可实现不依赖Eluder维度的对数遗憾,并揭示其与UCB探索的权衡。
FlowTSFM:将编码器深度转化为分位数传输
FlowTSFM将编码器深度重构为共享参数循环分位数传输,监督中间状态;仅38.8M参数,在GIFT-Eval/TIME接近强基线,轨迹一致性远超Chronos-2。
面向大语言模型定向危害缓解的高效模块化框架
提出模块化框架,用aLoRA适配器与路由机制低延迟定向消除偏见、毒性等危害,兼顾任务性能。
当合规数据被当作评估:已部署AI系统的测量效度
合规监测数据并非为比较评估而设计,不能直接用作已部署AI系统的性能基准,应以评估契约明确假设。
迈向非自适应对手下多臂老虎机的最优切换遗憾
结合固定份额学习器与二进区间子程序,单个算法在非自适应对手下对未知切换次数达到最优切换遗憾。
Hadamard流形上分布式在线优化的曲率无关遗憾界
研究Hadamard流形上分布式在线优化,提出D-ROGD,对h凸函数实现曲率无关的O(√T)/O(logT)静态遗憾界。
认证模型升级:切片级非回归与在任模型回退
提出切片级非回归认证与在任模型回退的升级发布流程,认证失败即回退,并揭示噪声下功效限制。
面向网格作业运行时间预测的防泄漏与调度感知机器学习
用提交时特征无泄漏预测网格作业运行时间,CatBoost时序R²=0.239,预测式SJF降等待50.92%。
JumpStart:从16万次训练运行中汲取经验,快速启动你的策略学习
16万次训练实证:离线策略学习无全能算法,调参与基准影响排名;提供默认配置、推荐器及资源套件。
HarnessBandit:面向多Harness智能体强化学习的可学习性与可迁移性联合调度
提出HarnessBandit在线调度器,每步依据可学习性与可迁移性信号选择训练框架,提升多框架智能体强化学习表现。
不可压缩流上的变分最优传输算子
提出变分不可压缩最优传输算子,前馈生成无散速度场与传输轨迹,较逐对优化提速约万倍。
图神经网络用于社交网络影响力最大化:一种无监督最小支配集方法
提出无监督图神经网络求解最小支配集问题,推理比元启发式快55倍,在真实社交网络上接近最优且泛化良好。
推理能提升大语言模型的心理深度吗?这取决于谁来评判
LLM评判者在心理深度上偏爱推理模型,而人类偏好不一致且近随机,表明开发集表现不足以保证部署效度。
面向领域专家蒸馏的无推理轨迹专家模型训练
专家蒸馏无需推理轨迹,其隐式轨迹选择决定学生表现,调优可调控领域精度与通用能力权衡。
可微分物理模拟器求解逆问题的优化器基准测试
构建12个可微分物理模拟器,涵盖参数辨识、逆向设计与最优控制问题,评测各类优化器性能并给出选型洞见。
PPDL:融合物理先验与深度学习的真实工业用户留存率预测框架
提出PPDL框架,融合物理先验与深度学习,精准预测工业级渠道用户留存率,显著优于现有在线方案。
面向智能灌溉决策支持的不确定性感知数理-机器学习混合模型
水量平衡耦合随机森林,共形预测量化不确定性,24小时技巧+9.4%,不确定性界定可信预报时效。
准确率不等于服务水平:面向间歇性需求预测的决策感知基准
间歇需求下预测精度与服务水平负相关,服务更取决于偏差方向;无训练校正使齐套率由77.5%升至92.0%。
基于图Transformer的预训练
在生物化学领域,用计算属性作标签的有监督预训练对下游任务提升最大,并需限制模型容量以防过拟合。
通过能量精炼与流形投影学习:一种协同 EBM-AE 框架
提出协同EBM-AE框架,融合能量精炼与流形投影,提升生成、修复和OOD检测。
面向延迟张量并行的亲和性感知分片
延迟张量并行中分片成为建模决策:最大化KV头与FFN神经元共置亲和性,蒸馏步数可减半,亲和性还能预测KL。
面向通用交通预测的多分辨率多域预训练框架
FlexST提出多分辨率时空扩散与领域自适应专家混合,在23个交通数据集零/少样本预测上显著领先。
过滤指标安全攸关:塑形奖励下组相对强化学习中的幻影优势
复合塑形奖励下,用塑形分而非任务结果过滤,会让全失败组通过并放大出幻影优势;应改用任务结果信号。
ReH-FUSE:面向对话中多模态情感识别的可靠性感知专家分层融合
ReH-FUSE以可靠性感知分层融合文本、音频与跨模态专家,经决策级路由提升对话情感识别性能。
别对我撒谎:基于对话音频编码器检测财报电话会议中的管理层回避行为
提出文本与对话音频双分支后期融合,检测财报电话会中管理层回避并预警SEC迟交,AUROC约0.89。
不完美数据下的机器学习:挑战与方法
综述不完美数据下机器学习的方法,围绕信息缺失、风险偏差、监督模糊与表示不稳,讨论局限与方向。
机器学习在鱼类养殖中的应用
探讨机器学习如何变革水产养殖,重点涵盖生物量估算、物种识别、行为分析、环境预测及物联网应用。
持续高斯扰动下循环图神经网络的有限时间节点分离
证明持续高斯扰动下循环图神经网络节点表示有限时间保持分离,最小距离为2σ²d。
基于最优传输的工业数据高效无监督异常检测
提出基于最优传输的无监督异常检测框架,无需标注、抗噪且可解释,在工业数据集上优于传统方法。
小批量持续性八年后再审视:批重用耗费多少步数与焦耳,又省下多少数据
小批量复用以数据节省换取代价:仅大批量时省新鲜数据,步数与能耗至多持平,数据可重读时无明显优势。
中文标题:探索面向循环脉冲神经网络的小睡范式
小睡(权重缩放+膜噪声)在循环脉冲网络中准确率可媲美权重归一化,长时间高噪声则增强表征结构分离。
以最少模型部署稳定表演性反馈回路
提出新算法,高精度下以近最少模型部署找到表演性稳定预测器,较先前指数级减少,并可去随机化为确定模型。
Tabby:面向时间序列基础模型的开放预训练配方
开源Tabby:1.45亿参数长上下文概率时序基础模型,公开预训练配方,支持预测、分类与异常检测。
面向分布式在传感器视觉的硬件感知学习表示压缩
OASIS在传感器端压缩任务相关表示,通信量较原始传输降18816倍,系统能耗降约2–4.5倍。
使用更小集成规模的线性集成采样
提出按正则Gram矩阵显著变化刷新集成的集成采样,缩小集成规模,保持最优遗憾,有限臂集下界更紧。
基于可靠性感知原型学习的数据高效智能体图域自适应
提出DEAG,以可靠性原型构建稳定源锚点,软关联目标并正则源先验,提升有限源数据下图域自适应。
面向内存高效机器学习的熵凿孔布隆过滤器
提出熵凿孔布隆过滤器,按经验熵删除低变化位以压缩特征表示,回归任务中存储更省、预测效率更高。
CyFM:用于少步复值流匹配的圆柱最优传输
提出圆柱流匹配与联合最优传输耦合,显著降低复值信号少步生成误差,并揭示分解耦合陷阱。