11622 条条目 · 106 个活跃源
2026年8月12日
04:00
arXiv cs.LG

迈向大语言模型的人权基准测评:一项试点方法论

开发首个专家验证的场景化基准,评估大语言模型的人权法推理。试点显示模型分数差异大,证明基准有效。

04:00
arXiv cs.LG

CRHT:基于在线聚类采样的连续回归混合Transformer用于船舶轨迹预测

提出CRHT,采用在线聚类采样与CNN注意力混合架构,缓解地理偏差,1小时预测最优,兼顾精度与机动跟踪。

04:00
arXiv cs.LG

长视界工具使用智能体任务的高效强化学习

提出SINKFLEX-RL系统,结合环境接口、RL数据流与注意力设计,提升奖励并降低显存。

04:00
arXiv cs.LG

MERA:面向大规模智能体系统的模型进化与技能自适应路由

多周期适配:回放失败调用、技能蒸馏加微调,进化小模型,配合验证路由,模型通过率升至49.7%

04:00
arXiv cs.LG

可逆Logits变换:用于保精度的事后不确定性校准

提出可逆Logits变换:逐元素单调MLP校准,参数不随类别数增加,保持预测类别,校准更优。

04:00
arXiv cs.LG

Dreamer-SAC:潜在世界模型中的离策略学习实现样本高效自动驾驶

Dreamer-SAC融合潜在世界模型与离策略SAC,利用短轨迹与n步目标,在自动驾驶中超越基线且交互更少,短轨迹最佳,n步优于一步。

04:00
arXiv cs.LG

生成器引导的莱维驱动生成模型逆采样

提出基于马尔可夫生成器的莱维驱动生成模型逆采样法,分解扩散与小/大跳,神经网络仅估计大跳速率,高效可解释。

04:00
arXiv cs.LG

TideRL:基于就绪感知调度提升智能体强化学习有效吞吐

TideRL用就绪感知弹性调度,分三策略提升多轮智能体RL训练吞吐,最高提升5.6倍,减等待77.6%。

04:00
arXiv cs.LG

ELVAE:基于证据学习的变分自编码器,用于不确定性感知生成

ELVAE以证据学习建模隐变量不确定性,生成时利用不确定性区分锚点可靠性与扰动失效。

04:00
arXiv cs.LG

连续敏感属性下公平表示的联合分布途径

用联合分布差异评估公平表示独立性,HSIC实例闭式估计且等价于条件MMD积分,训练更快。

04:00
arXiv cs.LG

预测准确率并不代表模型使用了正确的历史输入;即使延迟报告正确,预测器仍可能使用错误滞后,功能性未用报告历史。

好预测即使延迟报告正确,也不代表模型用了正确历史;大量案例显示其功能上未使用该历史。

04:00
arXiv cs.LG

法官是否像算法一样行事?

研究德州轻罪保释听证发现,法官决策多可被小公式捕捉,但有时不一致,导致类似被告待遇不平等。

04:00
arXiv cs.LG

先共享,再路由剩余:令牌自适应MoE计算的统一框架

提出统一框架,遵循先共享再路由剩余原则,实现令牌自适应专家混合计算,提升性能,降低计算、延迟与内存。

04:00
arXiv cs.LG

检测到效应并不等于学会据此行动:面向LLM获取代理的奖励信噪比下限

奖励信噪比下限决定能否学习逐实例获取策略;低于下限时,学习路由不及随机,表观增益来自噪声,仅可实现设计期门控。

04:00
arXiv cs.LG

可操作幻觉检测:将潜在不确定性转化为智能体批判

提出轻量适配器,实时重构残差流,将潜在不确定性转为局部反馈,无需额外推理即可检测拦截幻觉,准确率超96%。

04:00
arXiv cs.LG

β-VAE 作为有效理论:容差依赖维度

增大正则化会折叠低效用潜变量;非线性下阈值偏移但排序保持,有效维度呈首尾权衡。

04:00
arXiv cs.LG

时间序列的检索校正共形预测

提出检索校正共形预测(RCCP),检索相似残差构建非对称区间,再用共形校正保证覆盖率,基准测试中表现最优。

04:00
arXiv cs.LG

计算最优并非集群最优:面向系统的稀疏混合专家模型扩展

传统分离优化算法与系统,MOSAIC联合设计架构和系统,发现稀疏MoE最优稀疏度仅受集群约束,需统一协同设计。

04:00
arXiv cs.LG

以节点对为中心的图重连:最优传输引导的通信对齐缓解过度压缩

提出以节点对为中心的图重连框架,用需求-支持缺口识别过压缩,结合最优传输分配边预算以缓解之。

04:00
arXiv cs.LG

无评论家预训练用于高效在线强化学习微调

提出无评论家预训练(CFP),抛弃离线评论家训练,新初始化评论家避免偏差,兼容主流算法,提升在线微调效率。

04:00
arXiv cs.LG

MARCO:用于校准广告转化预测的点击意图分解

点击意图分解可校准转化率:用点击类型分意图建模,修正偏差,每点击转化+2.80%,总指标+0.98%。

04:00
arXiv cs.LG

基于内在动机的探索驱动个性化联邦强化学习

提出基于内在动机的探索驱动个性化联邦强化学习,在保护隐私下提升稀疏奖励环境的个性化与样本效率。

04:00
arXiv cs.LG

多玩家赌博机中未知Lipschitz常数的协调

针对连续动作空间多智能体赌博机,未知Lipschitz常数时,提出算法估计常数并离散化,无通信下通过抖动量化达成一致,保证遗憾最优。

04:00
arXiv cs.LG

重尾奖励与信息不对称下的鲁棒多智能体老虎机

研究重尾奖励下多智能体老虎机,针对三种信息不对称情形提出鲁棒算法,遗憾接近集中式最优。

04:00
arXiv cs.LG

基于基线的异常诊断解释方法

提出可扩展的基线参考诊断法,结合异常与正常信息,在高维非线性环境下比LIME更精准识别异常特征。

04:00
arXiv cs.LG

TACTICL:表格型上下文学习模型的任务感知压缩

TACTICL通过剪枝变换器层并替换为轻量适配器,实现表格ICL模型的任务感知压缩,最多替代85%层而无明显性能损失,并保持鲁棒性。

04:00
arXiv cs.LG

你的大模型,你的风格:面向大语言模型行为控制的行为模式轴

提出情境行为数据框架,揭示大模型行为风格稳定且受语境影响,并用思维导出的行为模式轴实现纯净控制。

04:00
arXiv cs.LG

SQuaT:基于学生感知量化教师特征的自监督知识蒸馏

提出SQuaT,用学生量化参数量化教师特征,消除蒸馏损失下界,在极低比特(1/2比特)设置下显著优于基线。

04:00
arXiv cs.LG

ProbGuard:基于LLM输出分布的校准安全风险估计

提出ProbGuard,首个概率化架构无关护栏,利用LLM早期输出分布估计校准安全风险,支持早期停止;校准误差降约72%,攻击成功率≤1%。

04:00
arXiv cs.LG

LLM RL后训练中MoE代理模型用于低成本故障复现与诊断

提出聚类专家剪枝的代理模型,降算力50%-87.5%,每步成本降33.3倍,低成本复现诊断RL后训练故障。

04:00
arXiv cs.LG

基于SA-NODE的长时间轨迹逼近:模型预测与Floquet策略

模型预测策略分段重置使SA-NODE误差均匀有界;Floquet策略对极限环误差线性增长,避免指数恶化。

04:00
arXiv cs.LG

低成本优化,强模型部署:进化优化的成本感知跨层迁移

用廉价模型评估、强模型变异,跨层迁移部署,以5.6至14倍(最高54倍)更低成本获得同等优化效果。

04:00
arXiv cs.LG

线性二次型随机最优控制的路径积分价值匹配

提出路径积分价值匹配法,由截断边缘化得价值递推式,用时序差分和经验回放离策略训练,效率精度兼优并防模式坍缩。

04:00
arXiv cs.LG

IADD-TR:基于干预感知动态解耦与目标正则化的模型强化学习方法

提出IADD-TR框架,解耦干预与自然演化,用目标正则化实现双稳健策略梯度,提升样本效率。

04:00
arXiv cs.LG

ProTAGAD:面向TAG异常检测的解耦拓扑与文本原型基础模型

解耦拓扑与文本原型基础模型,解决TAG异常检测边界模糊问题,跨域数据集上最优。

04:00
arXiv cs.LG

Diffract:大语言模型领域适配的光谱视角

持续预训练不改变奇异谱,适配靠奇异向量;移除60%低重要头可提升4%精度,并发现领域连通性。

04:00
arXiv cs.LG

FiGuRO:多模态数据的内在维度估计

FiGuRO用截断奇异值分解自适应低秩维度,估计多模态内在维度,解耦共享与私有信息,优于现有方法,可事后用于预训练模型。

04:00
arXiv cs.LG

多类PAC学习的乐观速率

填补多类概率近似正确学习乐观速率空白固定最优风险下最优超额风险为根号项与线性项之和并推广至列表学习

04:00
arXiv cs.LG

DEFT:基于逆离散傅里叶变换的数据高效频域Top-k采样方法用于时空动力系统建模

提出频域Top-k采样DEFT,生成物理一致训练数据,减少40%数据需求,精度损失低于2%,实现高效算子学习。

04:00
arXiv cs.LG

多平台调度优化的部分可观测学习

提出POLO,用部分可观测多智能体强化学习优化多平台即时配送,注意力策略与反事实奖励提升收益和效率。

04:00
arXiv cs.LG

面向隐私保护预测的时间序列生成方法基准评测

无生成法可完全替代原数据;噪声匿名隐私强但预测差;简单变换优于深度生成;Grasynda-P达帕累托前沿。

04:00
arXiv cs.LG

ReOrder-OPD:面向在策略蒸馏的可靠性感知提示排序

定义提示级教师延续可靠性,用代理分数排序提示,全面提升数学与代码场景的在策略蒸馏效果。

04:00
arXiv cs.LG

GARLIC:基于图注意力的重症监护多变量时间序列关系学习

提出GARLIC模型,基于图注意力与可学习插补处理ICU不规则缺失数据,实现准确可解释预测,在多个基准达最优并泛化至其他时间序列任务。

04:00
arXiv cs.LG

贝叶斯优化能否在神经密林中高效找到强单一专家?

在随机线性嵌入的权重空间用贝叶斯优化引导无梯度后训练,以五分之一评估次数达到或超越基准,显著降低成本。

04:00
arXiv cs.LG

面向动态系统时间序列数据合成的物理信息扩散生成模型

物理信息扩散模型逐步嵌入物理定律生成时序数据,下游任务性能提升高达48%,数据需求降低10-20倍。

04:00
arXiv cs.LG

ReRound:重构性舍入以消除免校准大模型量化中的中点歧义

ReRound用扩散模型重构低比特权重,引导中点舍入,无需校准,提升小型大模型3/4位量化精度,离线运行无额外推理开销。

04:00
arXiv cs.LG

大语言模型行为演化的映射与度量

用三类句子级差异度量32个模型行为,发现家族聚类、跨代趋同,并给出训练侧解释。

04:00
arXiv cs.LG

DACRI:面向关键供应链的决策感知因果干预排序

提出关键供应链因果干预基准,测试表明自适应排序部分场景提升净价值,但简单策略仍占优。

04:00
arXiv cs.LG

批量大小还是负样本?内存受限推荐训练的一种选择规则

固定内存预算下,采样softmax训练推荐系统,理论证明应最大化批量大小、最小化负样本数(k≈1),收敛更快、效果更好。

04:00
arXiv cs.LG

跨视角特征匹配:综述、基准测试与基础模型视角

综述跨视角特征匹配,涵盖分类体系、统一基准及基础模型,探讨挑战与未来方向。