11292 条条目 · 106 个活跃源
2026年9月29日
04:00
arXiv cs.LG

自主研究项目管理作为智能体技能:精确谱空间回归案例研究

智能体在消费级硬件上自主完成FFT核岭回归研究,74轮会话仅4次人工干预,倡导可检验的自主研究治理。

04:00
arXiv cs.LG

基于经济数据与基础模型的中期多分辨率电力负荷预测

基于经济数据与基础模型的法国中期负荷预测,1–48个月误差约4%–5%,经济特征重要性随预测期增加。

04:00
arXiv cs.LG

NanoForecast v0.5:通过训练流程优化实现有竞争力的时间序列预测

6.5M模型仅经训练流程优化,MASE降43.8%,媲美200M的TimesFM,三个ETT数据集全胜

04:00
arXiv cs.LG

美国西海岸枢纽国内航空的三维排放制图与社会成本估算

利用自编码器重建美国西海岸枢纽航班轨迹,绘制三维排放图并估算社会成本,发现NOx是健康成本主导。

04:00
arXiv cs.LG

同一个探针,不同的数字:激活探针能否抵御推理时的数值非确定性?

激活探针跨批大小与精度数值稳定,但准确率低估判决翻转2–9倍,翻转主因是文本变化而非浮点运算,宜报告逐样本一致性。

04:00
arXiv cs.LG

FFN 压缩改变了下游什么?扩散语言模型中的同状态因果恢复

提出同状态因果恢复,测压缩FFN对扩散语言模型下游去噪轨迹影响,仅恢复4个转换挽回89.9%准确率。

04:00
arXiv cs.LG

主动因果发现基准:在预算受限干预下评估LLM智能体

ACDB基准评估LLM智能体在预算干预下的主动因果发现:PC最强,LLM易过度干预,结果仅为校准。

04:00
arXiv cs.LG

联合嵌入预测架构预训练有助于时间序列预测吗?

大规模评估显示,JEPA预训练效益因骨干而异,部分架构持续提升、部分持续下降,跨任务族一致,并非普遍可靠。

04:00
arXiv cs.LG

当关键词指标下降而分类器仍稳定:KV 缓存压缩下的软拒绝

KV缓存压缩下,关键词拒绝率下降但分类器稳定,人工更支持分类器,属软拒绝;安全审计需多评委。

04:00
arXiv cs.LG

Seq2Cause:一个自回归骨干,完成事件序列中的四类因果发现任务

Seq2Cause以单一冻结自回归骨干统一四类事件序列因果发现,无需重训,并首次扩展至数万事件类型。

04:00
arXiv cs.LG

DOHF:基于杜布h变换引导的在线扩散微调

提出DOHF,用杜布h变换实现在线扩散微调,以最优性权重估计局部校正并蒸馏入模型,支持黑盒奖励,提升生成对齐。

04:00
arXiv cs.LG

面向低轨卫星星座星上学习的资源感知联邦混合专家与自适应剪枝

提出COSMIC-FL,融合联邦混合专家与自适应剪枝,实现低轨卫星星上高效学习,最多降低通信、计算和能耗80%。

04:00
arXiv cs.LG

平均镜像下降与对偶梯度方法:熵正则 Gromov-Wasserstein 问题的收敛算法

提出平均镜像下降与固定步长对偶梯度法,使熵GW问题对任意代价收敛并处理不精确迭代。

04:00
arXiv cs.LG

关系压缩:受限表示中的关系保真框架

提出关系压缩框架,以关系结构为保真核心,统一图摘要、谱稀疏化与关系蒸馏,并用有限码字碰撞实现。

04:00
arXiv cs.LG

CyberWorld:面向样本高效自主网络防御的世界模型

提出CyberWorld世界模型框架,以图等表征学习网络动态,样本效率远超无模型PPO且随规模可扩展,表征选择决定鲁棒性。

04:00
arXiv cs.LG

深度强化学习用于股票交易:基于前向再训练的演员-评论家方法基准测试

五种演员-评论家DRL交易方法基准:DDPG收益最高但风险大,TD3与SAC更均衡,前向再训练效果各异。

04:00
arXiv cs.LG

理解LLM后训练中SFT、RLVR与OPD的协同效应

后训练各阶段相互影响:SFT预热与教师适配可显著提升OPD,而OPD比SFT为RLVR提供更优初始化。

04:00
arXiv cs.LG

TemporalGraphLLM:面向动态文本属性图的大语言模型与时序图神经网络

融合时序图神经网络与大语言模型,通过图-时间感知指令微调和图嵌入注入,提升动态文本属性图推理性能。

04:00
arXiv cs.LG

ROTE:在复杂度可控的符号序列上基准测试神经记忆

提出ROTE基准,以LZW压缩调控序列复杂度,评测多种神经架构的符号记忆与外推能力及计算开销。

04:00
arXiv cs.LG

FARE:用于公平曝光约束下不确定性感知金融内容个性化的深度强化学习

提出FARE,将SOV公平曝光排序建模为深度强化学习,融入CTR不确定性,兼顾公平与参与度。

04:00
arXiv cs.LG

将语言模型整合进基于MEG的聆听与想象语音解码

语言模型可提升MEG语音解码;想象语音神经证据弱,比聆听语音更依赖语言先验,增益更大。

04:00
arXiv cs.LG

同策略注意力线性化

OPAL让学生自采样长上下文轨迹并接受冻结教师密集监督,仅3B token即恢复检索与推理性能。

04:00
arXiv cs.LG

跨嵌入式世界模型解码器的缓存感知 Conv3D 降级

提出缓存感知 Conv3D 降级,将因果 Conv3D 转为批量 Conv2D;Jetson 上 VAE 解码约快 7 倍,生成延迟降超 2 倍且无需回退。

04:00
arXiv cs.LG

多目标贝叶斯优化中单目标采集函数与对冲策略的简单扩展

提出超体积变换将单目标采集函数及对冲策略简单扩展至多目标贝叶斯优化,实验匹配或超越复杂最优方法。

04:00
arXiv cs.LG

模型铸造与低参数门控:迈向更稀疏激活的前馈网络

提出模型铸造与LoPA门控,稀疏激活FFN,FLOPs最多降3.2倍,GPU实测3.31倍加速。

04:00
arXiv cs.LG

机制可解释性揭示脑到语音解码器中的共享因果子空间

激活修补显示,跨模态增益源于小型神经元群;解码器早期表征条件特异、后期共享,有助提升隐蔽语音解码效率。

04:00
arXiv cs.LG

理解海森矩阵与梯度协方差矩阵的子空间稳定化

新度量揭示海森与梯度协方差顶层子空间稳定;类间/类内分解近似top-(C-1)子空间,特征值分离解释。

04:00
arXiv cs.LG

耗散系统中的拉格朗日与哈密顿神经网络

拉格朗日与哈密顿神经网络可预测耗散阻尼振子的物理行为,并有效学习其含时拉格朗日量与哈密顿量。

04:00
arXiv cs.LG

分布偏移下时间序列预测的模型无关在线证书驱动校准

提出模型无关在线鞅PAC贝叶斯校准,时序依赖与分布偏移下给出有限样本证书,提升多种预测器稳定性与精度。

04:00
arXiv cs.LG

电路对齐能否预测分布外泛化?

提出电路对齐分数CAS,无需目标域数据/标签即可预测OOD泛化,排序相关性0.88。

04:00
arXiv cs.LG

通用函数逼近下的交互式分布鲁棒多智能体学习

提出无模型RoMEX-φ,在通用函数逼近下求解分布鲁棒多智能体博弈,用鲁棒MADC刻画探索复杂度并保证次线性遗憾。

04:00
arXiv cs.LG

基于 TRIAGE 的大语言模型遗忘评估

TRIAGE以参数敏感性和曲率等内部视角评估大模型遗忘,量化邻接知识损伤并分类更新,行为相近而内部迥异。

04:00
arXiv cs.LG

算法公平只需不变性吗?移除人口统计信息可能产生新偏见

强制人口统计不变性会妨碍去偏并制造新偏见;区分边际与类条件不变性,证明不变性对公平既非可取也非充分。

04:00
arXiv cs.LG

基于超宽带数据的人体活动识别:降维、模式发现与预测建模框架

UWB雷达人体活动识别框架:降维与模式发现,六类活动分类准确率最高达100%。

04:00
arXiv cs.LG

面向精确原像的表示学习

提出TRIO框架,通过原像分解兼顾表达性预测、精确原像恢复与可处理全局优化。

04:00
arXiv cs.LG

面向分子逆向设计的图前向分布匹配

提出GraphFDM,通过正向过程在线强化学习优化图扩散,多性质分子设计MAE最低,化学有效性超0.99。

04:00
arXiv cs.LG

训练后神经网络精度下限的深度定律:放大效应、残差缩放与量化感知训练悖论

提出精度下限深度定律:预测放大决定下限并随深度增长,残差缩放消除深度惩罚,QAT增益随深度衰减成悖论

04:00
arXiv cs.LG

人类何时应收回控制权?动荡AI风险下的最优委托

提出连续时间随机控制框架,以自激过程刻画AI风险聚集,联合优化人类监督与委托;实验显示动态策略更优。

04:00
arXiv cs.LG

注意力趋于集中时涌现的三分之一标度律

softmax学习尖峰分布时logit按1/3幂律增长成瓶颈;LLM损失符合此预测,注意力头是主因。

04:00
arXiv cs.LG

实值 Transformer 的 VC 维与表达能力

实值 Transformer:VC 维上界 O(n⁴)、分裂 VC 维上界 O(n⁶),均有下界 Ω(n);单/双符号对称函数可表达,六符号部分不可,并限制实数位数访问。

04:00
arXiv cs.LG

反馈更丰富时,基准测试的可复用性如何?

多准则反馈下基准复用性骤降:测试集需求随准则数指数增长,少量准则即达√k代价,多任务评测频现假优胜者。

04:00
arXiv cs.LG

面向信用卡欺诈检测的注意力驱动异构图神经网络模型

采用SMOTE-Tomek平衡数据,结合注意力异构图神经网络检测信用卡欺诈,准确率达99.97%。

04:00
arXiv cs.LG

SAMBAR:通过乘子法进行选择性锚定,以在视觉-语言-动作模型中平衡知识获取与保持

提出SAMBAR,无需旧任务演示,以乘子法和选择性锚定平衡VLA持续学习中的新知获取与旧识保持,避免灾难性遗忘。

04:00
arXiv cs.LG

CAFE:基于快速后验估计的反事实预测

提出CAFE摊销推断框架,用预训练Transformer单次前向传播逼近贝叶斯反事实后验预测分布,兼顾因果结构不确定性,在可识别、不可识别及实际场景均稳健。

04:00
arXiv cs.LG

智能手机运动传感器在未见用户与手机机型间的手写数字泄露

传感器可跨未见用户与机型预测手写数字,准确率57.74%,但隐私解读受采集顺序捷径限制。

04:00
arXiv cs.LG

面向全局采样的并行拆分学习中的延迟感知客户端分配

提出延迟预算并行拆分学习,用流规划与贪心分配客户端,CIFAR-10建模时间减6.75%,精度降0.30个百分点。

04:00
arXiv cs.LG

REALM:区制切换、可解释且由激活诱导的线性模型

提出REALM:以神经网络激活模式划分区制,每区制拟合线性模型,并用可解释门控复现区制分配。

04:00
arXiv cs.LG

谱反转:对抗图提示中的奇异值偏置

揭示预训练GNN的谱偏置现象,提出谱反转提示SRP,在谱域重平衡奇异值并增强零空间,实现参数高效适应

04:00
arXiv cs.LG

我们该冻结什么?守护式冻结:连接性塑造预训练模型的微调

仅冻结权重难保性能;提出守护式冻结:按输入连通性选策略,可切断用移除值,仍连通用漂移值,保旧任务性能。

04:00
arXiv cs.LG

达到标准杆:面向可证明最优四边形块分解的强化学习

强化学习智能体局部编辑网格,建四边形分解并达顶点不规则度拓扑下界,实现可证明最优,远超Gmsh。