大语言模型作为优化器:直接方法与工具增强方法的综述及其性能前沿
综述LLM作为优化器的直接、工具增强与工具创建三大范式及性能前沿,指出直接优化潜力与工具增强可审计性的权衡,未来模型或倾向工具创建。
2026年人工智能指数报告
第九版AI指数报告聚焦AI能力与治理差距,新追踪推理、安全测试、经济价值及劳动力影响,首增科学和医学独立章节。
克服阻抗不匹配:融合基础模型与知识图谱的理论路线图
本文提出理论路线图,通过结构化残差流等克服基础模型与知识图谱的“阻抗不匹配”,实现符号逻辑与参数记忆的深度融合。
自增强微调:在文本到SQL中融合推理与泛化
提出CoTE-SQL方法,通过自增强推理、结构化思维链和错误修正,在Spider和Bird上取得SOTA性能,尤其提升复杂查询。
先进机器学习和深度学习技术促进牛只识别与检测:全面综述
系统综述ML/DL牛只识别,DL优于传统方法,面临数据集少、质量差等挑战,推动可持续畜牧管理。
面向Minecraft中时间敏感互补协作的多智能体框架
提出Minecraft多智能体基准,用于时间敏感协作任务,评估显示LLM在动态环境中表现不佳。
基于序列模型的符号谜题循环推理
提出RecurrReason基准,测试序列模型在递归逻辑谜题上的表现,发现架构比规模更重要。
重新思考LLM导师中的支架式教学:基准测试与现实部署的交互不匹配
AI导师基准假设学生接受支架,但现实中常绕过,揭示支架与学习目标的错位,需评估多样化情境。
RetailBench:在真实零售环境中评估LLM代理的长周期推理与连贯决策能力
RetailBench基准评估LLM在长周期零售决策中的表现,仅少数存活,最强模型仍远落后于最优策略。
RoboPIN: 锚定思维链驱动的具身推理
提出锚定思维链(PinCoT)将推理步骤锚定至视觉证据,4B模型在14项基准中平均提升12%超越7B模型。
基于编译的多智能体路径规划中的未分配智能体
本文针对未分配智能体的多智能体路径规划,提出基于布尔可满足性的编译求解方法。
基于神经网络的计算学科实时学生评估与职业指导集成系统
提出AI集成系统,用MLP模型预测学生职业路径,准确率94.71%,结合在线评估平台助力IT就业。
预算受限的LLM验证中的异方差信号:结构异质性限制了优化收益
LLM验证中信号异方差破坏全局分配,结构异质性而非优化不足是瓶颈,分层阈值法可提升17个百分点。
LLM即代码式代理编程:面向代理框架的方法
提出Agentic Programming,由程序控制流、LLM仅作为代码组件处理推理生成,避免控制流幻觉,大幅提升长操作稳定性。
审计代码RL训练环境中的奖励可操控性
代码RL训练环境存在奖励漏洞:28.5%任务可被错误方案通过,门控LLM判断器可修复多数破损任务。
认清局限:论LLM作为求解器和自动形式化器在法律推理中的忠实性
LLM形式推理虽提升基准性能,但存在范围漂白等不忠实失败,揭示准确性与逻辑忠实性的根本差距。
AI多元主义及其所忽略的世界
AI多元主义忽略本体论扁平化,需通过PLG框架保障本体开放、认知包容与生命周期问责,补全缺失维度。
潜在思维流:大语言模型中的高效潜在推理
LTF将推理建模为变长连续轨迹,训练采样器匹配奖励后验,准确率提升9.5%,推理长度减少27.2%。
LiteOdyssey:用于可解释罕见病诊断的轻量级推理AI代理
LiteOdyssey以轻量推理实现罕见病SOTA诊断,无需微调或多智能体,性能优且透明。
PAL-Bench:基于证据的纵向个人相册档案重构
首个纵向个人相册证据档案重构基准,揭示系统在身份绑定与证据引用上的关键差距。
利用模式挖掘符号数值规划中的搜索策略
提出基于符号模式规划的数值规划方法,动态计算模式并搜索中间状态,证明正确性与完全性。
后验双胞胎:面向企业决策的分布行为模拟
提出后验双胞胎方法,平衡模态精度与分布保真度,实现可审计的企业行为模拟与决策证据生成。
基于状态的多智能体合成数据生成,用于工具增强大语言模型
StateGen通过四角色循环和状态管理器生成无工具幻觉的训练对话,支持层次化多智能体,数据质量高且无记忆风险。
医学启发式学习:一种基于大语言模型的可解释且可审计的临床决策规则框架
提出MHL框架,用LLM驱动生成可解释、可审计的临床决策规则,性能媲美SOTA,在小样本和不平衡场景下仍鲁棒。
架构智慧:AI系统中优化治理的框架
提出架构智慧框架,在AI系统中增加可修正的目标治理层,通过四组件和六维元组解决结构失效问题。
AdaSTORM:通过自适应时空多智能体协作扩展LLM在动态图上的推理能力
首款多智能体动态图推理框架,通过自适应分区与时空解耦协作,将图推理规模扩展至千节点,准确率超90%。
模型图归纳学习用于知识图谱补全
MGIL通过实体聚类构建模型图,用GNN捕获全局结构,实现归纳链路预测新SOTA。
忠实性鸿沟:认证自然语言与形式化数学陈述的语义等价性
提出BPF框架认证自动形式化忠实性,检测漂移率89.6%,假阳性3.0%,减少47%漂移。
当智能体自动化变得有利可图:通过痕迹经济承保量化并保险自主AI风险
痕迹经济承保量化并转移自主AI风险,使自动化盈利:定价误差降97%,风险降72%。
TNODEV:神经ODE验证工具箱
TNODEV是首个集成假阳性检查、区间可达性、验证细化循环和并行调度的神经ODE形式验证工具。
用户即代码:面向个性化智能体的可执行记忆
提出用户即代码(UaC)范式,将用户记忆转化为可执行Python代码,实现精准聚合与主动告警,远超传统检索式记忆。
OpenClaw-Skill:面向大语言模型智能体的集体技能树搜索
CSTS框架通过集体知识生成与评估技能节点,构建技能树并强化学习,提升智能体长程规划与工具使用能力。
CoffeeBench:异构多智能体经济中长周期LLM智能体的基准测试
提出CoffeeBench评估LLM在90天多智能体经济中的表现,发现主动沟通的模型收益更高,而Claude Haiku 4.5存在空闲漂移问题。
整合者优势:面向中小企业的可控自主AI
Agentic AI对中小企业近期价值在于受控部分自主,以人为中心保留责任,可提升生产力。
从情感预测到情感预报:纵向文本中不同信息源的证据
文本语义支持当前情感预测,数值轨迹更擅长预测未来情感变化。
医学世界模型:表征患者状态、建模临床动态与指导干预策略
医学世界模型模拟患者状态演变,辅助临床干预决策,综述提出从静态诊断迈向动态模拟与规划的发展路径。
泥孩谜题的历史
追溯泥孩谜题两世纪起源,含众多变体及自指新谜题。
UP-NRPA: 基于用户画像的嵌套展开策略自适应方法,用于面向目标对话系统中与大语言模型结合的规划
提出UP-NRPA框架,基于用户画像动态定制对话策略,无需训练,成功率100%,谈判任务销售清单比提升56.41%。
当样本选择偏差加速模型崩溃
递归训练合成数据易致模型崩溃,低资源下样本选择偏差会加速崩溃并降低多样性,协作代理参考可缓解。
WorkBench 再探:两年后的工作场所智能体
2026年最佳智能体任务完成率89%,有害行为降至2.5%,能力与安全正相关,基本错误仍存,开源模型降低成本。
混合开放三元进化打造更优深度研究者
提出HOTE框架,利用混合强化学习协同进化提议者、求解者、评判者,使8B模型超越更大模型。
Orchestra-o1: 全模态智能体编排
提出全模态编排框架Orchestra-o1,实现多模态协作与并行执行,精度超第二名10.3%,引入DA-GRPO达SOTA。
TwinBI:一种用于与商业智能仪表盘高效增强交互的智能体数字孪生
TwinBI智能体数字孪生框架统一仪表盘与LLM交互,准确率从43.3%提升至63.3%,超时率从40%降至10%,增强分析可靠性。
超越单一方向的拒绝机制:Diff-in-Means与INLP的初步比较
比较DiM与INLP干预发现,INLP反事实翻转与DiM方向消融效果相当,零空间投影较弱,两者几何机制不同,提供可调拒绝控制。
YeasierAgent:以代理社交沙盒为画布,意图驱动创建平台无关的共生代理原生应用
YeasierAgent提出共生代理与叙事世界范式,平台无关快速构建代理原生应用,统一情感陪伴与工具执行,推动从孤立聊天机器人转向社交嵌入环境。
AI接受度还是AI采用广度?对低素养/高使用关联的工具特定再分析
低AI素养不普遍预示更高接受度,主要推动非文本AI工具的广泛采用(采用/未采用差异)。
中文标题
多智能体AI系统自动处理高中成绩单,准确率96.7%,速度45秒/份。
Minim:通过可信本地清理实现面向智能体的隐私感知最小化视图
提出MINIM,在客户端基于上下文完整性进行隐私感知最小化,减少敏感泄露并保留任务关键信息。
VeriGeo:具有数值与分析验证的可控几何问题生成
VeriGeo通过可执行推理轨迹和验证生成一致几何问题,合成8.7k数据提升多模态几何推理性能。
FactoryLLM:一个用于评估智能工厂中大型语言模型的安全开源AI试验场
FactoryLLM提供安全开源环境,评估LLM在跨机器文档的推理性能,双指标验证,实验显示效果良好(groundedness>0.88)。