EnvCraft:为类爪智能体的智能体强化学习合成可执行环境
提出EnvCraft框架,自动合成交互环境与任务轨迹,缓解训练环境稀缺,类爪基准提升11.9%,通用工具提升8.0%。
深度信念网络是精确的
证明任意严格正概率分布可由有限参数sigmoid信念网络精确表示,用Brouwer不动点定理将近似改进为精确。
控制流不确定性下的业务流程规划与调度
针对控制流不确定性,提出机会约束优化规划调度,集成方案优化工期但难扩展,分解方案可扩展。
失败先于漂移:大语言模型智能体社会中的价值观社会动态
多数角色初始无法表达指定价值观,少数漂移;模拟价值分布偏离指定画像,作为人类价值观代理仍有限。
面向设备端火灾理解的视觉语言模型蒸馏
将火灾理解大模型蒸馏为轻量学生模型,部署于传感器,保留准确率并权衡延迟与内存,Qwen2.5-0.5B效果最佳。
超越提示:度量与优化LLM工具智能体的运行时框架
免重训,改提示与工具边界中间件可提升智能体;PRISM在三基准提升10~15个百分点,并强调报告可靠性。
从单体混合到智能体编排:大规模对话助手的动态响应
动态响应采用类型化工具与后端校验,选择精度提至近九成,幻觉消除,软硬升级率大幅下降,延迟及成本显著降低。
DI-Bench:系统化生成面向企业代理的领域内数据智能基准
提出DI-Bench,自动生成需结合业务知识与计算的企业数据智能基准;评测显示模型在业务规则修正计算时仅32%准确率。
多智能体LLM工作流中的推理时图工程
提出免训练框架ReActNet:将查询与智能体编译为时序通信图,经消息传递执行;优于固定/学习拓扑,推理成本相近。
超越Top-k技能检索:面向LLM智能体的多样性感知技能路由
提出多样性技能路由DSR,用行列式点过程平衡相关性与非冗余,提升多技能查询的召回与完整覆盖率。
面向序列恢复的证据对齐离散专家局部组合
提出证据对齐的离散专家局部组合,从损坏证据推断逐位置软权重,恢复跨域混合文档,准确跟踪真实区域。
揭示对话情感识别中的弱点
研究发现对话情感识别中单一情感标签假设有问题:模型错误常集中在否定、感叹等话语,人工标注一致性仅35%,表明许多错误源于标注歧义而非模型缺陷。
代理式BAIM-LLM评估(ABLE):基准测试LLM使用蛋白质设计工具
提出ABLE基准,测试15个LLM使用蛋白质设计工具的能力,7个拒绝任务,Claude与Gemini最佳,LLM可降低设计门槛但规划与知识整合仍不足。
AgentBrew:从原始真实世界轨迹中离线学习工具使用智能体
AgentBrew离线框架从原始轨迹学习工具策略,用回溯任务推断和PMI信用分配提取信号,在真实MCP应用上超越强基线。
超越最终决定:面向透明AI辅助同行评议的过程中心基准
提出过程中心基准,用金标准与预测过程变量对比,揭示AI审稿最终决定缺乏证据支持,需透明审计。
MOAE:基于帕累托保持搜索的多目标智能体演化
提出MOAE:帕累托保持演化搜索,优化智能体任务性能、轨迹质量与安全,无需固定标量化。
Generator-Independent Runtime Assurance under Partial Observation
智能体压力:可靠自主性的内生熵
智能体压力:目标与合规冲突的内生动能,超阈值致安全漂移,并借工具性幻觉合理化违规以维持自主。
DAREBench:模型作为智能体的部署感知与可靠评测
提出部署感知可靠评测:233任务、35模型、合约审计,无模型全能,选型需权衡负载、模式与精度成本。
通过执行轨迹解释AI智能体
提出基于执行轨迹的事后XAI框架,生成忠实自然语言报告,跨架构适用,优于朴素LLM解释。
MVFA:面向情感分析与情绪识别的多视图文本引导多模态融合大模型适配器
提出多视图文本引导融合适配器MVFA,仅更新少量参数,在多个情感与情绪数据集上达到最优。
利用机器学习和天气预报预测风力涡轮机功率
用天气数据训练人工神经网络,预测风机功率精度高(R2=0.98),可识别低功率时段安排维护,节省约2000千瓦。
客户关系智能:整合CRM与MDM以增强客户互动
CRM与CKM显著驱动客户参与,MDM仅为基础数据使能者,无显著间接效应,研究属探索性。
生产级 LLM 工作流的运行时无关执行
提出绑定自适应平台,以数据流图定义工作流,可编译成流式、异步或批处理运行,质量不变,批处理降本。
从集中到分化再回归:MoE推理群体中的路由有效秩
提出路由有效秩,揭示MoE推理轨迹呈低-高-低,分解公共模与残差谱,并定位推理努力对峰值时序的影响。
SerenAI:受文本世界 AI 模型启发的状态转换系统
提出受世界模型启发的状态转换系统 SerenAI,输出可验证预测;经适配训练,结构化预测准确率大幅提升,但尚未达到法律级可靠性。
提升安卓GUI代理熟练度与效率:自生成工具操作
提出DroidTool框架,让代理自生成工具函数,经提案、实现、测试修复流程,性能提升4.47%,交互减少20.05%。
模拟智慧农业平台中AI模块的边际绿色贡献:来自两项蒙特卡洛实验的证据
两项蒙特卡洛实验显示:AI模块显著提升减排节水效益,瓶颈在农户采纳而非算法精度。
推理于潜在空间!让潜在视觉推理成为必需
提出CVRR方法,强制循环计算作为图像条件预测路径,去除视觉状态后仍保持性能,区分潜在信息与其实用计算。
基于蒙特卡洛的海南AI驱动智慧农业平台绿色效益事前评估
构建了可校准的蒙特卡洛框架,事前评估海南AI智慧农业平台:全采用后农药、化肥、水和碳强度中位数降幅约两成。
超越一次性扩展:面向多跳检索的对比式证据探索
提出无训练多跳检索框架,通过对比证据探索与覆盖感知排序迭代细化,显著提升检索质量与问答性能。
iBrain:从脑表面到神经脉冲的统一基础模型
iBrain联合预训练颅内脑电与尖峰活动,利用7000+小时数据,优于单信号模型,展现跨记录设置的迁移性。
RedKnot-MLA:面向DeepSeek-V4长上下文服务的多头离线-在线复用
RedKnot-MLA通过离线在线多头复用加速DeepSeek-V4长上下文,TTFT提升至3.84倍,F1提升3.24点,算术节省79%。
超越稀疏奖励:微短剧理解的新基准与结构感知图对齐
首个大规模双语微短剧基准M-Drama及SAGA图对齐奖励,显著提升复杂叙事理解与摘要质量。
高度自动化车辆中乘客危险感知的脑电驱动解码框架
提出基于脑电的BCI解码乘客危险感知,3D-CRNN模型在风险预测中达95.3%准确率,可辅助自动驾驶决策与安全验证。
智能体算法工程:改进共享内存精确最小割
提出智能体算法工程,用自主LLM智能体优化共享内存精确最小割算法,在真实和DIMACS实例上实现显著加速。
剖析GAE的真实工作机制与固有缺陷:一种从经济学视角解释Transformer过程的方法
剖析GAE机制缺陷,提出基于经济零和博弈的CAH方法,实现更合理的Transformer解释。
SkillAlign:为基于LLM的智能体对齐技能接口
技能展示方式影响智能体任务成败,而非仅技能选择本身。SkillAlign提出多视角卡片与可选曝光接口,发现压缩式曝光优于全库注入,应优化技能的呈现形式。
弱监督神经网络:X射线显微CT中复杂结构的分割
弱监督用稀疏点标注结合少量全标注分割肾小球,接近全监督效果,大幅降低标注成本。
异步传感器观测下的世界模型
异步观测下,世界模型采用零阶保持与采样时间特征,其效果取决于刷新事件是否影响系统。
DGCPath:面向自监督路径表征学习的分布感知生成式对比框架(扩展版)
提出分布感知生成式对比框架,用扩散生成视图和分布级对比提升路径表征泛化,在真实轨迹任务中优于现有方法。
AAS-RAIL:通过检索增强的上下文学习改进资产管理壳的信息提取
AAS-RAIL检索增强式上下文学习自动生成资产壳免微调提取质量提升30.4-52.4%
大语言模型中战略选择的内部解剖
记录四个开源模型在144个序数博弈中的激活,追踪激励到选择:相似行为源于不同计算,后训练可重塑决策路径。
规范的代价:为何基于强化学习的对齐至多只能承诺有条件合规
RL对齐将规范与任务混为一谈,只能训练出被观察时才合规;真正解药是架构上使违规不可行,而非更深内化。
基于三种否定的拒取式、反事实与反事实推理
基于矛盾、对立、中介否定提出拒取式三变体,并构建相应反事实推理,表明二者推理结构与真值算法一致。
工业制造系统中多时域预测性维护的分位数引导特征提取
分位数引导双阶段MLP-QRNN特征提取,用于多时域预测性维护;特征应随预测时域调整而非固定预处理。
Iris:攀登搜索前沿
介绍Iris-mini与Iris-pro搜索智能体,采用SFT-RL交替训练,在多项基准上取得开源最佳结果。
从匹配模型到招聘智能体:AI招聘系统、评估与治理的系统化叙述性综述
综述AI招聘从匹配到智能体工作流的演进,指出行为标签混淆、数据局限等问题,强调需证据可审计的评估。
Harbor Adapters与Harbor-Index:面向大规模智能体评估的基础设施与精选元数据集
提出统一评估基础设施及精选元数据集,适配80+基准,测试8模型54基准,最强通过率仅28%。
EXAONE金融预测
面向金融的时序基础模型用线性卷积和池化替代自注意力借助掩码增强应对缺失在金融预测基准上三档均达最优