基于数据驱动的用户画像智能体模拟A/B测试
用真实行为数据构建LLM智能体模拟A/B测试,40组实验中方向准确率达0.75-0.90,可低成本预筛。
WorldBench:面向多语言智能体的文化基础基准
现有基准未充分测试状态保持与多语言。WorldBench覆盖7种语言、8种文化共1600个任务,引入约束任务成功率达49.2%,显示智能体在多语言长程场景中仍脆弱。
基于跨多源行为预训练的手机游戏用户表征
提出跨多源预训练模型CM-PTM,用级联掩码预测统一建模异构行为,显著提升手游推荐性能。
CoBRA:利用反事实边际学习工具使用边界
提出基于反事实边际的框架,学习工具使用边界,估计调用工具的边际收益,优化决策,提升效率与准确率。
太阳能收集的空间生成式AI
提出太阳能供电空间生成式AI框架,权衡计算与通信,优化生成步数,提升端到端性能。
通过裂缝越狱文生图模型:多代理辩论穿越异构安全过滤器
提出检测面框架分析异构安全过滤器,用多代理辩论框架CRACK自适应搜索越狱提示,攻击成功率最高99.63%。
FinLifeBench:基于纵向银行对话的完整生活事件历史与财务状态重建
FinLifeBench评估银行对话中的事件与财务状态重构,发现模型随会话增长易漏报事件、误将过时信息当现状,两项重构表现关联弱。
双过程运动规划
结合符号推理与学习的双过程运动规划架构,由元认知控制器协调,显著提升效率、精度与泛化性。
LEAP:面向基于大语言模型的概率预测的似然提取与聚合方法
LEAP逐条提取证据似然,结合先验与概率模型聚合为后验,替代整体预测,提升多种模型的预测与校准性能。
框架之框架:多日自主软件开发与持续改进
提出一种元框架,通过迭代规划-编码-测试使智能体持续改进软件,三轮后平均相对提升52.25%,并多日自主开发出完整游戏。
FastSLM:高效长语音适配的层次时间抽象
FastSLM用层级时间抽象器将语音压缩97%(1.67词元/秒),性能相当且计算量大幅降低。
理解并强制任务算术中的权重解缠
提出任务特征专门化(TFS)作为权重解缠的充分条件,通过强制权重更新正交化(OrthoReg)促进解缠,显著提升任务算术性能。
SEGRA:面向属性图问答的结构化经验引导推理智能体
SEGRA结合模式引导与可复用技能库,企业图问答评分提升7倍,LLM调用减20%,成本降18%。
HALT:面向检索增强搜索代理的验证感知停止策略
HALT基于证据覆盖而非生成置信度决定停止,在保持精确匹配的同时减少冗余检索。
自适应感知与执行的自我不确定性调节视觉-语言-动作模型
提出SCALE推理策略,基于自我不确定性联合调节感知与动作,无需额外训练或验证器,单次前向即可提升VLA模型鲁棒性。
ASA:免骨干训练的工具调用智能体表征工程
提出免训练激活引导适配器,单次干预中间层,路由混合转向向量,将工具调用F1从0.18提至0.50,误报率降至0.05。
过度参数化时代中低成本生物启发的优势
约束控制中参数过多反损性能,浅层MLP与密集CPG优于深层架构,CPG无递减效益,生物先验有益。
SpecMine:规范驱动开发制品的大规模语料库
SpecMine构建GitHub上规范驱动开发制品的大规模语料库,含两大普查、相关PR及类型化引用,揭示AI时代软件规格实践。
评估评估者:大语言模型评估中的拉施测量理论
拉施测量理论用于大语言模型评估,分解评分维度、识别评分者偏差,揭示其与人类评分者的系统差异。
可测试人类知识的时间胶囊:单一免费本地模型中的41年《危险边缘》
本地模型跑通41年《危险边缘》53万题,严格匹配答对67%,事实类超85%,且能答训练截止后的新题,胜过沃森。
并非所有解释都会被寻求:人本可解释AI的信息寻求心理学
本文主张人本可解释AI应结合信息寻求心理学,基于工具、享乐、认知效用及认知偏差,使解释从可用变为被寻求。
LongGuard:安全护栏长上下文失败的机制分析与免训练缓解
安全护栏长文本下性能显著下降,源于危险信息稀释。提出两种免训练缓解方法,性能分别提升22%和13%。
思考消耗令牌:更多结构何时值得付出代价
存在令牌预算阈值,约1000-1500令牌时验证搜索超越单体,更高预算保持优势。
SETU:面向多语言、角色感知沟通教练的智能体生态系统
SETU是面向企业沟通教练的智能体生态系统,分解多模态分析,生成可审计报告,保留人工终审。
WM-R1:使用强化学习训练GUI代理进行推理并利用世界模型
首个用世界模型替代真实环境训练图形界面代理强化学习框架,无需真实交互,并行轨迹生成,多维奖励,超基线。
生成式人工智能拓展课程型本科生科研体验(CUREs)的智力边界
生成式人工智能以个性化支持、分布式认知和保留人类判断力拓展了CURE研究的智力边界
如果智能体是天使,就无需治理:可信工具边界上的带外策略执行
提出带外策略执行,在可信工具边界授权操作并过滤数据,跟踪失败率由57.6%降至0.2%。
协作流程的对象中心预测监控框架
提出对象中心协作流程预测监控框架,映射为OCEL,重定义预测任务,用五个日志评估。
ReToolSQL:面向稳健文本到SQL的智能体强化学习
ReToolSQL用两阶段训练(监督微调+智能体强化微调)提升文本转SQL,BIRD单模型准确率74.32%居首,无需人工标注。
探测多模态大模型感知先验:基于可解释生成控制的吉布斯采样
提出用吉布斯采样直接抽取多模态模型的感知先验,发现直接提示无法揭示的偏见与新先验。
为何不检查?两个配备工具的语言模型中的无依据最终声明及其修复
工具型模型证据不足仍下结论,补充证据可修复33/33,无关信息不修复;自动检查纠错且不损害正确。
CURA:计算机使用代理的认证运行时警报
CURA外部监控器利用轨迹遥测,以认证误报控制提前检测代理失败,恢复23/70失败,平均分达86.8,无需模型内部或额外调用。
CEDAR:自动机作为语言引导具身行动的可验证接口
CEDAR用反例引导将指令转为正则语言,以DFA表示技能与约束,可验证并复用,在Minecraft中优于基线且减少LLM查询。
基于证据的高阶集合论辩框架
提出基于证据的高阶集合论辩框架,统一处理支持、高阶关系与集合交互,给出三值与模糊语义,证明无环下等价。
从博弈论视角审视AI对齐:综述
从博弈论视角综述AI对齐,聚焦偏好多样性、对齐优先级与时间动态三挑战,厘清方法适用边界及鲁棒自适应可验证系统构建难题。
KLOD:基于非目标分布保持的局部性保持知识编辑
提出KLOD,通过保留非目标分布减少知识编辑中的局部性退化,实现可控的泛化-局部性权衡。
CoRe-MoE:面向持续多模态指令调优的紧凑可复用MoE
CoRe-MoE复用方向基座仅训练紧凑坐标专家,以<1%参数提升持续多模态调优性能最高5.90点。
SpikeOPD:面向自回归脉冲语言模型的稳定同策略蒸馏
提出SpikeOPD稳定同策略蒸馏,用于自回归脉冲语言模型,通过教师修正与策略锚定解决前缀不匹配,提升准确率并保持稀疏计算。
观察、假设、验证:发现控制偏微分方程的多模态智能体框架
提出MAGE多模态智能体框架,无需预设库发现偏微分方程,结构恢复8/8,系数误差降约3个数量级。
从文档到推理:面向金融数值推理的验证合成数据管道与语义感知微调
提出合成数据管道与语义感知微调,改进金融问答,用新评估指标和损失函数,在ConvFinQA上显著提升精度。
“假设”的幻觉:评估大语言模型中反事实推理的失效
提出WhatIfBench基准与PRISM评估法,测试大模型反事实推理,最强仅64.62分,揭示流畅叙述掩盖因果缺陷。
从困难提示中学习:动态采样中难度感知的优势放大
针对动态采样忽视难提示中难采样正确回答的问题,提出难度感知优势放大(DA3PO),提升训练效率并超越GRPO。
基于深度学习的涡扇发动机剩余使用寿命预测堆叠集成框架
提出堆叠集成框架,融合LSTM、CNN等基学习器与XGBoost元学习器预测涡扇发动机剩余寿命,在C-MAPSS上误差显著降低,优于基线。
CASTANET:基于交通事件效应的因果感知时空对抗网络
提出因果感知时空对抗网络CASTANET,用图神经网络和因果推断预测突发拥堵,缓解选择偏差。东京实测RMSE降4.0%,事件场景降10.1%,严重拥堵时提升14.55%。
跨会话分解攻击:扩展风险与意图对齐检索防御
跨会话分解攻击揭示缩放定律的安全风险,更大模型更危险;22M参数的意图对齐检索器提供有效防御。
AERA:自适应证据残差分配以实现高效测试时推理
提出AERA自适应分配推理预算,动态判断是否继续计算,在GSM8K上减少95.99%计算量,准确率仅降0.4%。
SABER:对抗分支探测下的LLM推理稳定性感知早退
SABER:对抗分支探测的无训练稳定性感知早退,减少30.2%-39.8%推理token,精度不降。
openJiuwen:超越静态框架的长周期编码智能体
openJiuwen开源框架实现结构可组合与运行时自适应,在SWE-bench和Terminal-Bench上分别达82.6%和87.19%,超越官方基线。
当证据塑造协作:多智能体系统的知识条件化拓扑生成
K-GAT用外部证据指导多智能体拓扑生成,精度提升15.7%,能耗减半。
基于检索增强LLM引导专家切换的机制感知投资组合管理
提出检索增强专家切换框架,利用LLM依据历史相似行情选择最优策略,提升多市场收益与夏普比率。