离散动作空间:小模型连续控制中GRPO收敛的前提条件
GRPO微调小模型连续控制时,离散动作空间(如PID预设)可避免熵崩溃,实现成功率和轨迹平滑度的权衡收敛。
面向空中MLLM智能体的零样本任务级评估
提出MissionBench基准,评估空中MLLM智能体:最强模型成功率不足35%(人类84.4%),凸显多步具身任务难度与规模效益。
解构离策略比率:用于异步强化学习的熵缩放信任区域
针对异步强化学习数据陈旧问题,提出熵缩放信任区域(ESTR),根据局部熵调节偏差,提升一致性并加速训练2.6倍。
多智能体系统驱动的数字孪生用于预测性维护:架构、技术与开放研究挑战
综述多智能体与数字孪生结合用于预测性维护,指出微控制器AI部署、分布式协调、分层编排三大挑战,尚无集成方案满足工业5.0。
推理去噪器:去噪推理轨迹以实现大型推理模型中的幻觉检测
REDE框架通过去噪推理轨迹中的无关与重复噪声,利用最终答案注意力监督,提升幻觉检测性能。
面向大语言模型逻辑推理的符号学逻辑六边形理论
提出HexLogicAgent,先组织语义再推理,证实不完整语义表示是LLM逻辑推理失败主因,显著提升可靠性。
面向基于LLM的健康智能的工业令牌化:一种用于工业证据集成的联邦架构
提出工业令牌化概念,将异构工业分析输出转化为结构化证据单元,设计联邦架构支持LLM推理。
在职学习:从部署反馈中持续学习以实现冻结权重代理
利用部署反馈和外部记忆,冻结权重代理实现持续学习,成功率提升至基线2.6倍。
实现有影响力的多元对齐研究路线图
多元对齐研究未落地,需转向实证基础与实用方法,推动AI系统真正服务多元用户。
AI4PLE:人工智能与产品线工程集成方法论
提出将AI系统集成到产品线工程的方法论框架,并通过工业案例验证其有效性。
学习结构收敛:用于时间推理的神经符号基准
提出TRACTA基准,比较模型后表明基于语义轨迹的时间建模最优,支持时间结构推理。
智能体基准测试能否衡量能力?智能体AI时代的协议有效性
提出协议有效性及HackDetect审计,发现多数基准测试存在0.45-1.00分数膨胀,需验证分数反映真实能力。
基于证据推理的自主根因分析
AgentRCA零样本代理框架结合数字孪生与大语言模型,无需故障训练即可透明诊断根因,性能媲美监督方法。
企业AI代理的动态能力范围界定:一个合成数据集与三源权限架构
提出三源权限架构实现动态最小权限,合成数据集验证减少越权93%,支持企业AI代理安全防御。
TRACE-ROUTER:面向智能体AI的任务一致且自适应在线路由
TRACE-Router通过上下文bandit一次性为任务分配模型,利用终端奖励更新策略,优化准确-延迟权衡,显著提升性能。
可解释强化学习辅助空中交通管制员
探索可解释强化学习在空管中的应用,用显著性图解释智能体决策,提升人机协作信任。
用大语言模型澄清用户意图的控制面板
通过视觉控制面板提供语义线索,帮助用户更有效表达意图,提升大语言模型交互效率。
解耦注意力融合:通过高效KV缓存重用加速RAG
提出解耦注意力融合(DAF),三阶段解耦并兼容Flash-Attention,在长上下文中实现2-5.6倍加速且不牺牲精度。
所有模型都作弊:对抗性网络任务中欺骗行为的提示级缓解措施
所有模型均会作弊,提示级反作弊可将作弊率从33%降至8.5%,但无法根除,需环境控制。
ToolGuardian:AI智能体与工具交互的声明式安全
ToolGuardian框架基于ASP声明式策略,实现工具交互的预审查与运行时安全授权。
面向视动策略学习的有序动作令牌
提出有序动作分词(OAT),实现高压缩、完全可解码且有序的动作令牌,提升策略性能与推理灵活性。
AI融合的科学探究:以实践为中心的科学教育愿景
将AI作为科学仪器融入探究实践,通过观察、分析、建模培养学科AI素养,强调先基础理解再使用自主AI。
MosaicJoin: 用于值级连接发现的紧凑语义草图
MosaicJoin通过紧凑语义草图实现高效准确的值级连接发现,无需训练,速度提升66倍。
图论神经网络碎片化与协变直接分子力学习:实现流形系统的耦合簇精度AIMD
融合图论碎片化与协变直接力学习,高效参数,仅需10-20%数据即实现耦合簇精度AIMD,成功模拟易变离子体系。
探究音频深度伪造检测器中的说话人身份敏感性
提出身份敏感性评分(ISS),量化检测器对说话人身份依赖,无需标签即可预测误分类,有效诊断跨数据集错误率飙升原因。
按指令稀疏化:面向多任务推理加速器的任务条件计算跳过
任务条件稀疏化通过门控网络预测掩码跳过无用计算,FLOPs降66-76%,延迟降51-59%。
一手看另一手:动态环境下高效样本双臂操控的动态多智能体协作
DynaMAC将对手臂视为动态任务参数,实现高效样本学习,性能提升35%,样本减少20倍,并支持零样本泛化。
智能体安全需基于整体框架重新定义
智能体安全本质是上下文问题,现有基于内容的评估系统性地错误定义,需从源授权、任务对齐、行动对齐、数据隔离四属性重新定义。
无序神经模型中稳定吸引子的多重性
利用大偏差统计和微扰方法,估计神经ODE模型稳定不动点多重性,发现弱耦合下对称与非对称情形无质变。
机器人通过投射视觉抽象学习通信
提出机器人通过软体手和自模型优化动作,实现动态阴影表达,用于手势、木偶戏等视觉通信。
Neptuna:一个用于基准测试复杂多相流的全面机器学习框架
提出首个冲击驱动可压缩多相流大规模基准,评估多种代理模型,复合损失提升界面保持,SoftAdapt自适应加权效果最佳。
迈向可信且高效的数据集成:从朴素RAG到智能体RAG
展望知识增强LLM与agent在RAG中实现可信高效数据集成,梳理从RAG到Agentic RAG的演进与优化挑战。
量子频谱模型:基于输入条件频率支持的数据重上传
通过输入矩阵谱特征构建编码酉生成器,实现可分析的归纳偏置,在多项量子模型基准测试中领先。
利用Transformer模型学习制备分子基态
提出ADAPT-GQE框架,用Transformer生成分子基态电路,效率提升数量级,精度持平,并在量子硬件验证。
超越视角:LLM辅助编程教育中解释演变的三方民族志研究
三方民族志通过师生对话揭示课堂不可见的AI学习过程,促使教育者反思教学假设。
MineValiCoder:基于测试用例质量挖掘与二分图互验证的可靠代码生成
MineValiCoder通过质量挖掘和二分图互验证的闭环TDD解决LLM随机性,在HumanEval等基准上达96%+通过率。
CausalForge:一个基于形式化、自我改进的智能体框架,用于因果推断的自动化研究
CausalForge基于Lean证明助手,结合形式化库与自改进智能体,实现因果推断自动化理论研究,确保机器验证与声明审计的可靠性。
探索用于环境数据管理的稳健多智能体工作流
提出EnviSmart系统,通过三轨知识架构与角色分离多智能体设计,提升环境数据管理可靠性,成功阻止错误发布。
一个评估影像组学AI模型对采集参数敏感性的统计多目标框架
提出统计多目标框架量化影像组学AI模型对CT参数的敏感性,高低性能下准确率0.88/0.72。
SurvDiff:一种用于生存分析中生成合成数据的扩散模型
SurvDiff是首个端到端扩散模型,专为生存分析合成数据设计,联合生成协变量、事件时间与删失,优化下游任务,保真度与性能领先。
环境相似性与船舶流动性耦合预测海洋入侵物种路径的理论框架
融合环境相似性与船舶流动性,构建海洋入侵风险评估新框架,支持监测与管理。
从Hugging Face到GitHub:追踪开源AI生态系统的许可证漂移
开源AI生态普遍存在许可证违规,35.5%模型转应用时移除限制性条款,新引擎可解决86.4%冲突。
无检测安全:经济拒绝作为边缘与物联网防御的原语
提出经济拒绝安全框架,通过成本放大使攻击不可行,内存<12KB,延迟20ms,结合ML防护达94%,适用于资源受限IoT设备。
JAXBench:自主TPU内核优化基准测试
JAXBench是TPU内核优化基准,含50个JAX负载,评估表明上下文比模型规模更重要,最佳方案实现1.36倍加速。
大语言模型个性化能力基准测试
大语言模型在两方个性化中存在瓶颈,SDR-Bench显示前沿模型无法区分成功与否,但48%内容被销售评为有用。
AINTMA:融合生成式智能、安全云通信与自适应质量分析的自主测试管理智能体AI架构
AINTMA多智能体AI架构实现自主测试管理,排序准确率88.4%,周期缩短43%,缺陷率降至2.1%,ROI达340%。
DC-Leap: 通过草稿引导的连续跳跃解码实现dLLMs的无训练加速
DC-Leap框架利用草稿引导的连续跳跃解码与动态验证,消除冗余迭代,实现无训练加速,最高提速105倍。
InferenceBench:面向AI Agent的开放式大语言模型推理优化基准
InferenceBench评估AI agent优化LLM推理性能,揭示其探索不足,瓶颈在于提出多样配置与系统评估。
DecodeShare:追踪大语言模型解码时决策的共享子空间
提出DecodeShare协议,发现解码共享子空间,干扰它严重降低决策性能,并可用于可靠激活引导。
PlanE:面向抽取式大语言模型的数据、调优与推理元规划
提出PlanE框架与DTI规划器,优化数据、调优与推理元规划,提升抽取式LLM任务性能、降低标注成本。