11272 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.LG

WIPSNet:用于整夜阻抗呼吸描记图儿科喘息检测的深度学习

提出WIPSNet,利用整夜阻抗呼吸描记的小波尺度图与3D ResNet检测儿童喘息,AUC达0.783,优于EVI等。

04:00
arXiv cs.LG

逻辑与记忆的冲突:浅层 MLP 中的高阶交互学习

单隐层MLP能拟合样本却难还原规则;合成实验表明,优化器与干扰权重学习显著影响高阶交互表现。

04:00
arXiv cs.LG

基于实例学习理论的能量模型中的元认知推理

据实例学习理论提出MERITED,使能量模型按不确定性动态分配算力,并开源1.91亿参数推理模型。

04:00
arXiv cs.LG

来源识别不等于适应度检验:衡量合成数据溯源的局限

生成文本溯源在改写后准确率骤降;但来源识别与筛选有用数据是两回事。

04:00
arXiv cs.LG

VANDAM:以DNA分子先验视角审视核苷酸序列

VANDAM将DNA分子先验融入基因组基础模型训练,预测区域分子性质,在九项任务上提升性能。

04:00
arXiv cs.LG

RACE:面向邻域丰富时间序列基础模型预测的残差感知测试时自适应。

提出RACE,利用同域邻居残差进行测试时校正,提升时间序列基础模型预测并支持跨模型门控迁移。

04:00
arXiv cs.LG

表征跃迁揭示多轮LLM智能体中的新兴安全风险

多轮智能体攻击会在内部表征中留下累积跃迁信号;DART据此检测干预,攻击成功率从84%降至25%。

04:00
arXiv cs.LG

EchoPress:通过虚拟上下文重建实现查询无关的 KV 缓存剪枝

EchoPress无需训练,用预填充信息近似重建,仅重建首块校准KV重要性,高压缩率下精度媲美KVzip且开销大降。

04:00
arXiv cs.LG

更好的分数意味着更好的物理吗?Sim2Real 神经算子的物理基础解释

预测误差低不保证物理统计准确,需以波动能量等物理诊断补充基准评估。

04:00
arXiv cs.LG

NEUROTOKEN:基于条件流匹配的联合声源与方向性听觉注意解码及包络解码

NEUROTOKEN以条件流匹配统一声源、方向性AAD与包络解码,提升源AAD并揭示方向AAD高估。

04:00
arXiv cs.LG

巨型激活的生命周期:随机诞生、权重衰减驱动的增长与竞争性整合

追踪巨型激活的诞生、增长与整合,发现权重衰减因果调控其规模,峰值幅度约随λ的-1/2次方缩放。

04:00
arXiv cs.LG

CommunityKV:基于图划分的高效长上下文解码

将稀疏注意力转为社区检测,从QK^T建token图并划分,局部更新支持流式解码,吞吐最高提升1.71倍。

04:00
arXiv cs.LG

XOR-Trellis:超低复杂度反量化与曲率感知的无Hadamard变换LLM量化

提出超低复杂度网格反量化器与曲率感知路径优化,无需Hadamard变换即可实现高质量超低位LLM量化。

04:00
arXiv cs.LG

去噪曲面:面向扩散大语言模型服务的推理成本建模与预测

提出去噪工作负载曲面(DWS)建模dLLM二维执行结构,轻量预测器精准估计推理成本,降低端到端延迟。

04:00
arXiv cs.LG

IrekoGPT:将结构化剪枝转化为事后可伸缩大语言模型

提出事后方法,将预训练LLM转为推理时宽度可调的可伸缩模型,多层校准加岭回归校正,高压缩下增益最大。

04:00
arXiv cs.LG

每个批次即其自身的验证集:面向大语言模型微调在线数据选择的留一梯度匹配

留一梯度匹配消除协方差惩罚,按梯度信噪比加权选批,无需验证集,微调效果优于全批训练。

04:00
arXiv cs.LG

给更新打分,而非给词元打分:面向组合式LoRA专家的下降对齐路由

VANE让路由器为专家更新打分而非词元,按下降方向对齐组合LoRA专家,以更少参数超越十二种基线。

04:00
arXiv cs.LG

一池多靶:一个守恒层与档案数据所能识别的内容

提出可微RISC池守恒层;审计存档脱靶数据发现,耦合预测增益不足,竞争参数难识别。

04:00
arXiv cs.LG

SGD方法的精确信息核算

SGD精确信息核算:预条件步为高斯后验均值更新,遗憾分解为内在时间成本与比较器信息变化。

04:00
arXiv cs.LG

Gumbel 直线流:将自回归模型蒸馏为一步流映射

提出 GSF,利用预训练自回归模型的噪声-数据耦合构建线性路径,经流映射半群目标蒸馏为一步生成,性能优于基线。

04:00
arXiv cs.LG

从任务混合到专用专家

面向客户端内/间复合异质性的联邦微调,提出FedSEE,按输入路由专用专家,避免负迁移并提升性能。

04:00
arXiv cs.LG

评估用于降阶脑变形动力学的混合量子-经典模型

评估混合量子-经典模型预测脑变形降阶动力学;经典POD-MLP/LSTM优于量子方案,更准更稳。

04:00
arXiv cs.LG

Beyond Affine Transformations: A Soft Dominance Layer for Coordinate-Wise Neural Computation

04:00
arXiv cs.LG

用于学习重尾测度间映射的注意力核

重尾测度下softmax注意力积分发散;改用慢增长注意力核可避免后归一化Transformer集成崩溃。

04:00
arXiv cs.LG

让稀疏奖励发挥作用:面向多奖励强化学习的密度感知奖励聚合

提出DARA,依活跃组密度反比加权聚合多奖励,加速工具调用与数学推理学习。

04:00
arXiv cs.LG

随机递归模型

提出随机递归模型RRM,从层池随机采样执行递归,参数更少,性能匹配或超越基线,推理时可调深度并提升表现。

04:00
arXiv cs.LG

基于训练动力学动作的一步生成建模

TDAction按共享参数实现代价选择传输目标,兼顾分布进展,ImageNet无蒸馏FID<1.1。

04:00
arXiv cs.LG

SimplexUQ:面向单纯形值预测的共形不确定性评估框架与基准

首个单纯形值预测共形不确定性基准,用12项任务比较现有包装器的覆盖分配,揭示全局校准不均且无普适最优。

04:00
arXiv cs.LG

在线非单调DR子模最大化的几何相关界

研究在线非单调DR子模最大化,给出几何相关上下界,将系数提升至4/9,并刻画最优缺口。

04:00
arXiv cs.LG

冗余遇见协同:基于子模优化的MoE依赖感知专家选择

提出DS-MoE,以差子模优化实现MoE依赖感知专家选择,平衡冗余与协同,性能优于基线。

04:00
arXiv cs.LG

ORBIT-FMIB:通过ESM-2追踪按阶数解析的上位性信息

ORBIT-FMIB用Walsh分解与神经依赖估计,探测ESM-2各阶上位性信息;复现显示高阶保留差异不稳健,结论未定。

04:00
arXiv cs.LG

MIKASA-Robo-VLA:面向长时程操作的VLA模型记忆能力基准测试

VLA长时程操作记忆基准:90任务多隐藏线索,28个信息间隙超16帧,2.25万条轨迹,基线成功率0.211。

04:00
arXiv cs.LG

重尾噪声下的线性系统学习:基于单条轨迹的非渐近分析

重尾噪声下,基于单条轨迹给出指数稳定线性系统最小二乘估计的非渐近误差界,并推广至次高斯与次指数噪声。

04:00
arXiv cs.LG

右对齐原地(RiP)卷积:一种简单、通用且近最优的内存高效CNN推理策略

提出RiP卷积,纠正并泛化原地卷积,近最优省内存,峰值激活内存降12.5%–33.3%且输出不变。

04:00
arXiv cs.LG

学习恒等映射:SGD 如何选择函数分解的案例研究

深度线性残差网络学恒等映射时,SGD偏好特定层分解而非零权重;熵损失可解释,重参数化改变结果

04:00
arXiv cs.LG

探索更多,推理更佳:面向扩散语言模型的逐步风险敏感GRPO

提出StepRS-GRPO,随去噪状态调整风险系数,提升扩散语言模型数学推理准确率、覆盖率和多样性。

04:00
arXiv cs.LG

低损失区域错位导致Grokking

本文提出低损失区域几何框架,发现训练与验证的低损失区域错位导致Grokking,并给出反例。

04:00
arXiv cs.LG

群不变统计决定嵌入几何:从巴赫到夜空的表示调和分析

群不变共现统计决定嵌入几何:表示由不可约表示矩阵元构成,统一解释月环、五度圈与天体球谐。

04:00
arXiv cs.LG

量化与高效适配的蛋白质语言模型分析

4比特量化与QLoRA能显著降低蛋白质语言模型显存占用,多数任务保留九成以上性能,生成任务需分布验证。

04:00
arXiv cs.LG

ALER:面向强化学习的自适应可学习经验重写

提出ALER,将LSTM与槽记忆结合,以可学习写入和门控融合重写经验,在迷宫任务中优于基线。

04:00
arXiv cs.LG

hZACH-ViT 中受攻击的曲率:规范对称性、边界饱和与对抗失效

hZACH-ViT中庞加莱曲率与尺度、边界饱和耦合:降曲率提升干净精度却加剧对抗脆弱,非内在鲁棒。

04:00
arXiv cs.LG

在真实气象站观测上基准测试生成式天气数据同化模型

首个真实站点观测的生成式天气同化基准:生成先验优于3D-Var,全梯度引导最佳,稀疏站点更明显。

04:00
arXiv cs.LG

超越单峰基础:多模态数据的拉回几何

提出多模态数据的混合流形拉回几何,以高斯混合建模,改善插值及高似然路径,保持可解释局部结构。

04:00
arXiv cs.LG

JEPA-TTT:面向动力学漂移下规划的潜在世界模型持续测试时训练

JEPA-TTT自监督持续测试时训练潜在世界模型,动力学漂移下预测误差降83%、规划提升153%。

04:00
arXiv cs.LG

学习可迁移技能:基于目标条件的互模拟

提出动作感知时序表示与互模拟技能发现方法,仅以影响执行的状态特征约束技能,实现跨布局的强泛化迁移。

04:00
arXiv cs.LG

LabBook:利用实验历史实现高效的LLM驱动发现

LabBook以智能体维护的记忆引导实验日志检索并辅助生成,提升LLM驱动发现的质量成本权衡。

04:00
arXiv cs.LG

WOMBAT:用于分子基准测试与归因测试的白盒预言机

WOMBAT提供14个白盒GNN基准,决策规则已知,为分子归因提供真值,评估GNN解释器并推动XAI发展。

04:00
arXiv cs.LG

SkillSpec:通过表征专门化实现共识门控的智能体技能演化

SkillSpec提出两阶段框架:共识门控演化筛选技能更新,表征专门化组织技能结构,六项基准平均成功率提升6.89%。

04:00
arXiv cs.LG

初始化提升大语言模型驱动的发现

研究12种模块化框架与5类发现任务,发现模式崩溃,提出并行探索初始化,稳定提升LLM驱动发现。

04:00
arXiv cs.LG

巨正则生成器

提出巨正则生成器,将玻尔兹曼生成器扩展至巨正则系综,含两种设计,在流体与沸石吸附中验证。