喜剧中的愚人金:对话幽默中的奖励漏洞与对策
研究对话幽默奖励的漏洞与对策:惊喜嵌入奖励易被乱序回复欺骗,笑声线索可被利用;修正后改善但未达预期。
衡量微任务合格性差距:现成小语言模型何时足以用于智能体执行框架?
构建4项微任务基准测试现成小模型:均未达阈值,量化无改善;差距源于规模而非精度,宜仅作基线补充。
因果世界模型何时有助于模块化 LLM 智能体
因果世界模型仅在跨模块接口可统计识别、且行动时可用时,才有助于模块化 LLM 智能体。
面向个性化偏好优化的梯度对齐配对选择
提出GAP-DPO,以效用梯度几何对齐选择偏好对,提升LLM个性化偏好优化效果。
K-Dense BYOK:一款本地运行、以哈希链保存实验记录本的开源 AI 科研助手
开源本地 AI 科研助手,自带模型密钥,哈希链实验记录不可篡改,跨学科表现优于管理平台。
科学智能体:在科学任务上评估专业特定系统提示
专业系统提示不提升科学任务准确率,成本高2–4倍,工具任务更差;长提示仅增强抗API中断。
EviGraph:面向时序公共服务知识图谱的携带证明式选择性推荐
区分关键决策需求与可留待未决信息,用语言代理链接时序图谱证据并确定性校验,减少不必要弃答。
分布式多智能体委托中的容错预算守恒
分布式多智能体委托的容错预算守恒机制,通过独占托管信用与调度许可,在崩溃、重试、分区等故障下防止超支。
Build2SPARQL:面向建筑知识图谱查询的大规模文本到SPARQL基准数据集
提出建筑知识图谱文本到SPARQL大规模基准,含6136条查询、30680个问题,检索增强显著提升准确率。
稳健即显著:知情对手将最优信号移至显著性极点
知情对手下稳健最优信号与显著性极点重合,预算增大使最优从后验最大转向边际最大,致对抗意识评估不可区分
冲突监督改变的是承诺,而非能力:在约定无关评分下恰好为零的 12.29σ 排列效应
同一语料换序,学习率调度决定顺序效应;恒定率下达12.29σ,但约定无关评分下为零,模型只改承诺不改能力。
从规则到工具:面向科学计算中大语言模型智能体的可执行检查
R2T将科学需求转为可执行检查;SciCode修复中工具组效果依任务而异,多数提升且影响成本。
JevSpawn:通过组合式动作空间实现自适应智能体推理
JevSpawn将自然语言任务映射为有限概率动作空间,并行生成并反馈筛选动作分支,免训练提升任务表现与速度。
更糟地在一起:多用户多智能体团队中的性能崩坏
多用户多智能体团队共享资源时协调失败,表现普遍逊于单一协调者,出现停滞、互相覆盖与编造行为。
智能体应当记住什么?在有界记忆评估中解耦留存与检索
构建流式回忆基准:固定访问时查询感知选择提升必需事实回忆率15.5个百分点;有界记忆评估应固定访问、分列留存与选择。
智能体决策之前:基于大语言模型系统中的认知行动
论文将认知行动引入大语言模型智能体,主张决策前需生成决策就绪证据,区分获取、转化、探测三种模式。
冻结场景,赢家更迭:文本到3D评估中的配置脆弱性
审计300冻结场景与19评估器:配置方差常超生成器差异,赢家随协议变化,但无确认反转,敏感性有限。
基于本体的情境化人工智能评估(OB-CAIE)方法论
提出OB-CAIE方法:领域本体界定测什么,过程本体界定怎么测,平衡人机,失败点可追溯分析。
科学还是垃圾?——AI生成论文中科学劣质内容的基准测试与缓解
构建390篇AI论文基准,六指标识别AI准确率85.9%;提出证据约束修订框架,缩小人机差距63%。
法律研究基准:衡量长程法律研究智能体的端到端可靠性
推出LRB基准,含413道专家编写美国法律研究题,评测13个前沿模型;最强模型全对率仅42.9%,成本与准确率无关。
空间策略,而非动作:向量量化测地线作为LLM驱动智能体的工具
LLM智能体借向量量化测地线构建可调用空间工具,在部分可观测网格中以低成本达到思维链级目标达成率。
基于零空间投影的LoRA微调大语言模型后门净化
零空间投影净化LoRA后门,无需触发器或重训练,ASR近100%降至<10%,保持基座与下游能力。
Incident-Arena:让智能体达到可靠性的最后九个“9”
Incident-Arena:20项真实K8s故障注入基准,采用功能验证,前沿模型低于64.3%。
ReLiveGym:在数周重放现实环境中评估长期运行智能体
提出ReLiveGym,用重放数周现实数据评估长期智能体,发现行动时机与反馈机制是设计关键。
企业表示简化(ERS):降低企业AI的表示复杂度
提出企业表示复杂度(ERC)四维模型及经济成本模型,简化任务级表示可降低AI理解负担、提升推理准确率。
偏好不确定性下的鲁棒纳什对齐
提出鲁棒纳什对齐,用四玩家代理博弈与乐观镜像下降算法应对偏好不确定性,具收敛保证并提升表现。
Kepler:面向 ARC-AGI-3 的可审计世界模型
Kepler以可执行世界模型表示假设并加以验证,在ARC-AGI-3公开25款游戏全获满分,表明公开集分数区分度有限。
面向交互策略快速适应的元多智能体强化学习及其在自动驾驶中的应用
提出元多智能体强化学习框架,建模马尔可夫博弈并定义元纳什均衡,实现交互策略快速适应,自动驾驶中优于基线。
目标条件强化学习中的多时间尺度学习
提出GITA,多时间尺度优势加权监督训练统一策略,OGBench成功率较HIQL提升25个百分点。
VeriHarness:扩展长时程任务的智能体验证能力
VeriHarness把基础模型转为智能体验证器,用分歧消解与共识挑战结合证据筛选并修正结果,五个长时程基准最高提升6.4分。
控制论的与认知的:可信智能体委托中缺失的一套词汇
提出智能体委托中控制论与认知语言之分,主张每个关键决策须附第三方可检验的反事实条件。
超越最先进水平:为AI研究标准化环境影响指标
AI研究环境影响报告几近缺失,本文提出标准化可持续性指标与碳排放估算工具,并倡导"最小可行模型"框架。
超越答案置信度:对黑盒决策模型自我知识的受控审计
Jev置信度校准良好,却无法标示知识缺失;边界外新闻高估0.21–0.33,黑盒审计须控制表面线索。
通过价值引导的信息性搜索提升数学推理
APIVIS将有限预算Gumbel搜索用于块级数学推理,以信息性奖励与选择性监督提升模型数学推理能力。
超越最终准确率:审计大语言模型多智能体系统中的通信
ICR框架审计LLM多智能体通信,揭示相似准确率掩盖不同修订行为,消息与接收策略共同影响选择性修正。
网络世界模型:复杂系统算法设计的环境
提出动作条件网络世界模型,快速预测干预结果,辅助算法设计;138/141设置超越基线,最高加速14.5倍。
运动特异性关节选择何时有效?评估与控制设计的审查
审查1,057次康复动作发现,关节选择增益随评估方式变化,需明确估计目标与结构对照,未确立新算法或临床益处。
面向动态推理的修订感知独立智能体图
提出RIAG多智能体策略,分离时间解析与推理,缓存并条件审计修复,动态路由准确率显著优于基线。
ITC-MoE:面向MoE扩散语言模型的重要性引导Token感知压缩
提出ITC-MoE,结合重要性引导Tucker压缩与Token感知补偿路由,降低MoE扩散语言模型开销并保持生成质量。
TRACE:轨迹回报归因与对比擦除,面向多轮对话安全
TRACE以token级回报归因与对比擦除约束多轮风险,在35个模型—攻击组合中均获最低攻击成功率,效用损失不超过1.23分。
超越记忆:以显式信念状态驾驭长时程智能体
PoS构建并维护显式信念状态作为决策上下文,校验一致性、检测信念陷阱并针对性恢复,四基准性能领先。
跨部门危机管理本体:核心模块与公共卫生模块
提出模块化OWL本体ECMO,统一危机管理核心概念,公共卫生模块衔接SNOMED CT与ICD-11
面向个性化体检解读与指导的多智能体大语言模型框架
多智能体LLM框架将复合体检查询分解并行处理,解读优于单智能体,人工偏好更高,但延迟和成本增加。
一个确定性且可审计的AI安全风险评估框架:具备与ATLAS对齐的可执行规则和形式化验证
提出确定性、可审计的AI安全评估框架,将工程证据映射到ATLAS技术级结果并经形式化验证。
SpikeMoE:面向灵活脉冲专家混合模型的类脑竞争性路由
提出脑启发脉冲k-WTA路由与SpikeMoE,融合稀疏专家计算,多任务性能优且能效高,鲁棒应对缺失模态。
DRelay:面向前缀感知并行推测解码修复的全局草稿上下文
DRelay 利用全局草稿上下文对候选选择做前缀感知修复,纠正早期错误、延长接受前缀,显著提升解码速度。
OpenMTB-Audit:揭示基于LLM的分子肿瘤委员会安全评估中的过度拒绝与临床专家视角
提出OpenMTB-Audit基准,发现LLM普遍过度拒绝,并开发MTB-AuditAgent将过度拒绝降至6.7%,准确率达91.2%。
vFedProtoQNAS:面向虚拟联邦学习的原型引导个性化量子神经架构搜索
提出vFedProtoQNAS,以类原型共享实现虚拟联邦协作,避免异构QNN参数聚合,精度较FedAvg提升3.70%。
评估自动驾驶生成式场景模型中的物理一致性与合理性
提出五层评估协议,从内部表征到车辆动力学约束检验生成场景,揭示视觉合理未必物理一致。
智能体是系统,而非模型:重新审视智能体评估
智能体应作为可配置系统评估:配置中信息影响最大,重复运行差异约占54%,验证工具比提示更有效。