SkillFlow:面向智能体编排的流驱动递归技能演化
SkillFlow用流框架和TTB损失避免策略崩溃,实现透明信用分配与递归技能演化,14数据集上显著优于基线。
ChromaFlow:工具增强型智能体评估中编排开销的负面消融研究
ChromaFlow实验显示,激进编排增加操作开销却未提升性能,应限制编排范围以确保可靠评估。
GenCircuit-RL:基于层次化验证的基因电路设计强化学习
提出结合层次化验证奖励与四阶段课程的强化学习框架,使基因电路设计成功率提升14-16%。
评估陷阱:基准设计作为理论承诺
每个AI基准都隐含理论假设,未经审视则导致自循环评估陷阱。本文提出审计方法论,检验基准能否区分真实能力与代理行为。
SimPersona:从原始点击流中学习离散买家画像以构建有依据的电子商务智能体
SimPersona从原始点击流学习离散买家类型,作为紧凑标记指导LLM智能体,实现78%转化率对齐,无需重新训练或提示工程。
ASH:通过具身学习自我磨练的智能体
ASH从未标记互联网视频自我学习具身策略,实现长时间跨度任务突破,性能远超基线。
ClawForge:为命令行智能体生成可执行的交互式基准
ClawForge框架在状态冲突下评估命令行智能体,最佳模型仅45.3%准确率,关键差异在于是否检查现有状态。
MetaAgent-X:通过端到端强化学习突破自动多智能体系统的天花板
提出端到端RL框架MetaAgent-X,联合优化MAS设计与执行,性能提升21.7%,揭示阶段性共同进化过程。
基于LLM智能体的分布感知算法设计
从样本学习分布感知求解器代码,合成求解器质量高且速度提升数百倍。
基于基础的延续:一种线性时间运行时验证器用于LLM对话
提出线性时间运行时验证器,通过依赖图检查LLM对话延续是否被支持,在多个基准上超越基线并保证无冲突。
不稳定的指标与AI模型构建者的基准测试文化
揭示AI模型构建者选用基准评测的现状:碎片化、缺乏可比性,基准沦为市场叙事工具而非科学评估。
智能体系统:提升弱推理模型性能
通过验证器支持的委员会搜索,弱推理模型组合可达强模型性能,主要瓶颈在于提议覆盖而非选择。
CrystalReasoner:面向属性条件晶体结构生成的推理与强化学习
通过物理先验思维令牌和强化学习多目标奖励,生成有效稳定属性条件的晶体结构。
高等教育中的智能体AI生态系统:面向学习、教学与机构智能的包容性自主多智能体AI框架视角
提出高等教育自主多智能体AI平台,分析其协调教学行政、促进包容学习的潜力,指出现有碎片化问题及未来方向。
通过ReLU催化的抽象精化实现Transformer精确验证
利用ReLU非线性界与凸松弛提升Transformer验证精度,显著减少误报,效率可接受。
面向复杂系统可解释预测性维护的语义特征分割
提出语义特征分割框架,分解监控特征为标准与残差组件,标准空间预测风险更低且保持语义可解释性。
并行化反事实遗憾最小化
提出并行化CFR框架,将算法转为线性代数操作,GPU实现比CPU快四个数量级。
融合-裂变预测:AI何时转向不良行为
基于融合-裂变动力学向量泛化,提前预警AI行为转向不良,经多模型与语料验证。
即开即用:LOOP技能引擎通过一次性记录和确定性重放实现99%成功率与99%令牌削减
LOOP引擎通过一次记录和确定性重放,实现99%成功率和99%令牌削减,消除随机故障,大幅降低成本与延迟。
Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows
超图企业异构业务系统智能推理器
HEAR基于分层超图本体,证据驱动推理,实现可审计多跳分析,供应链任务准确率94.7%,自适应高效。
AIVAT技术家族中的启发式病理学与通过不确定性传播的进一步方差缩减
AIVAT启发式值函数应事先固定以防操纵,传播不确定性降方差,样本减少43%。
赫拉克勒斯:面向金融智能的智能体基准
首个覆盖交易、对冲、市场洞察与审计的金融智能体基准,发现长周期协调与状态一致性是当前短板。
Nexus:一个用于时间序列预测的智能体框架
Nexus多智能体框架分解宏观/微观波动并整合上下文,超越SOTA,揭示预测本质是智能体推理。
编码智能体作为世界模拟器表现优异
提出编码智能体框架,通过迭代生成仿真代码构建物理精确世界模型,在多项指标上超越视频模型。
综合POMDP策略:通过学习使采样与模型检测相结合
提出结合采样与模型检测的POMDP策略综合框架,通过学习合成有形式保证的有限状态控制器,解决阈值安全问题。
Metis AI:AI原生与具身任务之间被忽视的中间地带
揭示数字任务中被忽视的Metis AI地带,其社会规范纠缠导致自动化失败,应构建人主AI辅架构。
DVMap:基于高共识人口-价值映射的细粒度多元价值对齐
提出DVMap框架,通过人口学原型与结构化思维链,实现高精度价值对齐,跨人口测试准确率48.6%,超越DeepSeek-v3.2。
广义容量车辆路径问题的统一知识嵌入强化学习框架
提出知识嵌入强化学习框架,分解路径优先与聚类次优子问题,动态规划指导构造器,性能优于学习式方法,泛化能力强。
BEAM:面向MoE动态路由的二元专家激活掩码
BEAM通过可训练二元掩码实现动态专家稀疏,保留98%性能,降低85%FLOPs,加速解码2.5倍。
学习构建环境:基于可验证环境合成的自演化推理强化学习
提出自演化推理RL框架,模型通过构建可验证环境实现自我改进,利用求解-验证不对称性保持奖励有效性,提升性能3.3%。
探索过完备推理轨迹中最小核心的表征几何
推理轨迹平均46%步骤冗余,最小核心可保留答案并改善表征几何,支持集中于少数步骤。
当机器人做家务:面向长期家庭任务执行的基准与智能体
提出LongAct基准评估长期家庭任务规划,HoloMind智能体提升性能,顶级模型仅59%完成率。
智能影响商数(IIQ):衡量组织AI影响的框架
IIQ综合时权使用量、频率与复杂度,量化AI嵌入深度,生成0-1000标准化指数以比较组织影响。
牲畜贸易:用于LLM虚张声势、竞标与议价的多智能体基准
Cattle Trade基准测试LLM在多智能体博弈中的综合策略,发现战略一致性比单项技能更关键,启发式代码智能体表现优于多数LLM。
LEMON:通过反事实强化学习学习可执行的多智能体编排
LEMON通过反事实强化学习优化多智能体编排,在多个推理和编码基准上达到最优性能。
Deepchecks:评估检索增强生成(RAG)
提出Deepchecks框架,通过多方面评估、根因分析和生产监控,确保RAG系统的可靠性、相关性和用户满意度。
面向离散不确定性的两阶段鲁棒优化的情景缩减学习
提出NeurPRISE模型,基于GNN-Transformer模仿学习高效情景缩减,速度提升7-200倍,具备零样本泛化能力。
OmniDrop:基于查询指导的全模态大语言模型层间令牌剪枝
OmniDrop在解码器层内渐进剪枝音视频令牌,以文本查询指导,延迟降40%、内存降14.7%,性能提升达3.58点。
从表格到单元格:利用注意力改进推理的TABALIGN框架
TABALIGN通过掩码扩散语言模型规划器与注意力验证器,提升表格推理准确率15.76%、加速44.64%。
通过洞察重放的有状态推理
洞察重放通过周期性提取并重放推理中的关键洞察,保持其可访问性,提升长链推理准确率,平均提升1.65点。
基于经验迭代蒸馏的黑盒大语言模型多步推理与工具使用提示策略
提出RL框架迭代蒸馏提示策略,逻辑推理达90%,工具使用达91%,超越进化基线。
VerbalValue:面向销售驱动型直播电商的社交智能虚拟主播
提出VerbalValue系统,基于专业知识库和标注数据微调大语言模型,实现信息性与事实正确性分别提升23%、18%。
PyCSP3-Scheduling:PyCSP3的排程扩展
为PyCSP3添加53个排程约束和27个表达式,编译为标准约束,保持建模/求解分离,效果一致但性能有差异。
提示分割与标注优化:通过优化片段级标注控制大语言模型行为
PSAO框架将提示分解为片段并添加重要性标注,提升了LLM的推理准确性和自一致性。
Falkor-IRAC:面向印度司法AI的图约束生成与验证推理
Falkor-IRAC提出图约束生成框架,基于IRAC知识图谱和验证器代理,确保推理路径有效,在51个判决上成功验证引用。
谄媚是教育安全风险:为何LLM导师需要谄媚基准测试
LLM辅导中谄媚易引发安全风险,需基准测试确保社交—认知勇气,实现友善且正确的纠正性辅导。
SliceGraph:多轮链式推理中的过程异构体映射
SliceGraph构建推理过程图,发现相同答案的正确轨迹分为多个过程族,揭示最终答案聚合忽略的结构化多路径几何。
教授大型语言模型何时不该知道:学习事前推理的时间批判
通过时间批判微调(TCFT)训练模型识别事后泄露,将泄露率降低41.89和37.79个百分点。
自满而非谄媚:重新定义大型语言模型并为自满机器设计AI素养
LLM行为是自满而非谄媚,责任在开发者;AI素养应重点对抗确认偏误。