5312 条条目 · 106 个活跃源
2026年9月2日
04:00
arXiv cs.AI

基于数据驱动的用户画像智能体模拟A/B测试

用真实行为数据构建LLM智能体模拟A/B测试,40组实验中方向准确率达0.75-0.90,可低成本预筛。

04:00
arXiv cs.AI

WorldBench:面向多语言智能体的文化基础基准

现有基准未充分测试状态保持与多语言。WorldBench覆盖7种语言、8种文化共1600个任务,引入约束任务成功率达49.2%,显示智能体在多语言长程场景中仍脆弱。

04:00
arXiv cs.AI

基于跨多源行为预训练的手机游戏用户表征

提出跨多源预训练模型CM-PTM,用级联掩码预测统一建模异构行为,显著提升手游推荐性能。

04:00
arXiv cs.AI

CoBRA:利用反事实边际学习工具使用边界

提出基于反事实边际的框架,学习工具使用边界,估计调用工具的边际收益,优化决策,提升效率与准确率。

04:00
arXiv cs.AI

太阳能收集的空间生成式AI

提出太阳能供电空间生成式AI框架,权衡计算与通信,优化生成步数,提升端到端性能。

04:00
arXiv cs.AI

通过裂缝越狱文生图模型:多代理辩论穿越异构安全过滤器

提出检测面框架分析异构安全过滤器,用多代理辩论框架CRACK自适应搜索越狱提示,攻击成功率最高99.63%。

04:00
arXiv cs.AI

FinLifeBench:基于纵向银行对话的完整生活事件历史与财务状态重建

FinLifeBench评估银行对话中的事件与财务状态重构,发现模型随会话增长易漏报事件、误将过时信息当现状,两项重构表现关联弱。

04:00
arXiv cs.AI

双过程运动规划

结合符号推理与学习的双过程运动规划架构,由元认知控制器协调,显著提升效率、精度与泛化性。

04:00
arXiv cs.AI

LEAP:面向基于大语言模型的概率预测的似然提取与聚合方法

LEAP逐条提取证据似然,结合先验与概率模型聚合为后验,替代整体预测,提升多种模型的预测与校准性能。

04:00
arXiv cs.AI

框架之框架:多日自主软件开发与持续改进

提出一种元框架,通过迭代规划-编码-测试使智能体持续改进软件,三轮后平均相对提升52.25%,并多日自主开发出完整游戏。

2026年9月1日
04:00
arXiv cs.AI

FastSLM:高效长语音适配的层次时间抽象

FastSLM用层级时间抽象器将语音压缩97%(1.67词元/秒),性能相当且计算量大幅降低。

04:00
arXiv cs.AI

理解并强制任务算术中的权重解缠

提出任务特征专门化(TFS)作为权重解缠的充分条件,通过强制权重更新正交化(OrthoReg)促进解缠,显著提升任务算术性能。

04:00
arXiv cs.AI

SEGRA:面向属性图问答的结构化经验引导推理智能体

SEGRA结合模式引导与可复用技能库,企业图问答评分提升7倍,LLM调用减20%,成本降18%。

04:00
arXiv cs.AI

HALT:面向检索增强搜索代理的验证感知停止策略

HALT基于证据覆盖而非生成置信度决定停止,在保持精确匹配的同时减少冗余检索。

04:00
arXiv cs.AI

自适应感知与执行的自我不确定性调节视觉-语言-动作模型

提出SCALE推理策略,基于自我不确定性联合调节感知与动作,无需额外训练或验证器,单次前向即可提升VLA模型鲁棒性。

04:00
arXiv cs.AI

ASA:免骨干训练的工具调用智能体表征工程

提出免训练激活引导适配器,单次干预中间层,路由混合转向向量,将工具调用F1从0.18提至0.50,误报率降至0.05。

04:00
arXiv cs.AI

过度参数化时代中低成本生物启发的优势

约束控制中参数过多反损性能,浅层MLP与密集CPG优于深层架构,CPG无递减效益,生物先验有益。

04:00
arXiv cs.AI

SpecMine:规范驱动开发制品的大规模语料库

SpecMine构建GitHub上规范驱动开发制品的大规模语料库,含两大普查、相关PR及类型化引用,揭示AI时代软件规格实践。

2026年8月31日
04:00
arXiv cs.AI

评估评估者:大语言模型评估中的拉施测量理论

拉施测量理论用于大语言模型评估,分解评分维度、识别评分者偏差,揭示其与人类评分者的系统差异。

04:00
arXiv cs.AI

可测试人类知识的时间胶囊:单一免费本地模型中的41年《危险边缘》

本地模型跑通41年《危险边缘》53万题,严格匹配答对67%,事实类超85%,且能答训练截止后的新题,胜过沃森。

04:00
arXiv cs.AI

并非所有解释都会被寻求:人本可解释AI的信息寻求心理学

本文主张人本可解释AI应结合信息寻求心理学,基于工具、享乐、认知效用及认知偏差,使解释从可用变为被寻求。

04:00
arXiv cs.AI

LongGuard:安全护栏长上下文失败的机制分析与免训练缓解

安全护栏长文本下性能显著下降,源于危险信息稀释。提出两种免训练缓解方法,性能分别提升22%和13%。

04:00
arXiv cs.AI

思考消耗令牌:更多结构何时值得付出代价

存在令牌预算阈值,约1000-1500令牌时验证搜索超越单体,更高预算保持优势。

04:00
arXiv cs.AI

SETU:面向多语言、角色感知沟通教练的智能体生态系统

SETU是面向企业沟通教练的智能体生态系统,分解多模态分析,生成可审计报告,保留人工终审。

04:00
arXiv cs.AI

WM-R1:使用强化学习训练GUI代理进行推理并利用世界模型

首个用世界模型替代真实环境训练图形界面代理强化学习框架,无需真实交互,并行轨迹生成,多维奖励,超基线。

04:00
arXiv cs.AI

生成式人工智能拓展课程型本科生科研体验(CUREs)的智力边界

生成式人工智能以个性化支持、分布式认知和保留人类判断力拓展了CURE研究的智力边界

04:00
arXiv cs.AI

如果智能体是天使,就无需治理:可信工具边界上的带外策略执行

提出带外策略执行,在可信工具边界授权操作并过滤数据,跟踪失败率由57.6%降至0.2%。

04:00
arXiv cs.AI

协作流程的对象中心预测监控框架

提出对象中心协作流程预测监控框架,映射为OCEL,重定义预测任务,用五个日志评估。

04:00
arXiv cs.AI

ReToolSQL:面向稳健文本到SQL的智能体强化学习

ReToolSQL用两阶段训练(监督微调+智能体强化微调)提升文本转SQL,BIRD单模型准确率74.32%居首,无需人工标注。

04:00
arXiv cs.AI

探测多模态大模型感知先验:基于可解释生成控制的吉布斯采样

提出用吉布斯采样直接抽取多模态模型的感知先验,发现直接提示无法揭示的偏见与新先验。

04:00
arXiv cs.AI

为何不检查?两个配备工具的语言模型中的无依据最终声明及其修复

工具型模型证据不足仍下结论,补充证据可修复33/33,无关信息不修复;自动检查纠错且不损害正确。

04:00
arXiv cs.AI

CURA:计算机使用代理的认证运行时警报

CURA外部监控器利用轨迹遥测,以认证误报控制提前检测代理失败,恢复23/70失败,平均分达86.8,无需模型内部或额外调用。

04:00
arXiv cs.AI

CEDAR:自动机作为语言引导具身行动的可验证接口

CEDAR用反例引导将指令转为正则语言,以DFA表示技能与约束,可验证并复用,在Minecraft中优于基线且减少LLM查询。

04:00
arXiv cs.AI

基于证据的高阶集合论辩框架

提出基于证据的高阶集合论辩框架,统一处理支持、高阶关系与集合交互,给出三值与模糊语义,证明无环下等价。

04:00
arXiv cs.AI

从博弈论视角审视AI对齐:综述

从博弈论视角综述AI对齐,聚焦偏好多样性、对齐优先级与时间动态三挑战,厘清方法适用边界及鲁棒自适应可验证系统构建难题。

04:00
arXiv cs.AI

KLOD:基于非目标分布保持的局部性保持知识编辑

提出KLOD,通过保留非目标分布减少知识编辑中的局部性退化,实现可控的泛化-局部性权衡。

04:00
arXiv cs.AI

CoRe-MoE:面向持续多模态指令调优的紧凑可复用MoE

CoRe-MoE复用方向基座仅训练紧凑坐标专家,以<1%参数提升持续多模态调优性能最高5.90点。

04:00
arXiv cs.AI

SpikeOPD:面向自回归脉冲语言模型的稳定同策略蒸馏

提出SpikeOPD稳定同策略蒸馏,用于自回归脉冲语言模型,通过教师修正与策略锚定解决前缀不匹配,提升准确率并保持稀疏计算。

04:00
arXiv cs.AI

观察、假设、验证:发现控制偏微分方程的多模态智能体框架

提出MAGE多模态智能体框架,无需预设库发现偏微分方程,结构恢复8/8,系数误差降约3个数量级。

04:00
arXiv cs.AI

从文档到推理:面向金融数值推理的验证合成数据管道与语义感知微调

提出合成数据管道与语义感知微调,改进金融问答,用新评估指标和损失函数,在ConvFinQA上显著提升精度。

04:00
arXiv cs.AI

“假设”的幻觉:评估大语言模型中反事实推理的失效

提出WhatIfBench基准与PRISM评估法,测试大模型反事实推理,最强仅64.62分,揭示流畅叙述掩盖因果缺陷。

04:00
arXiv cs.AI

从困难提示中学习:动态采样中难度感知的优势放大

针对动态采样忽视难提示中难采样正确回答的问题,提出难度感知优势放大(DA3PO),提升训练效率并超越GRPO。

04:00
arXiv cs.AI

基于深度学习的涡扇发动机剩余使用寿命预测堆叠集成框架

提出堆叠集成框架,融合LSTM、CNN等基学习器与XGBoost元学习器预测涡扇发动机剩余寿命,在C-MAPSS上误差显著降低,优于基线。

04:00
arXiv cs.AI

CASTANET:基于交通事件效应的因果感知时空对抗网络

提出因果感知时空对抗网络CASTANET,用图神经网络和因果推断预测突发拥堵,缓解选择偏差。东京实测RMSE降4.0%,事件场景降10.1%,严重拥堵时提升14.55%。

04:00
arXiv cs.AI

跨会话分解攻击:扩展风险与意图对齐检索防御

跨会话分解攻击揭示缩放定律的安全风险,更大模型更危险;22M参数的意图对齐检索器提供有效防御。

04:00
arXiv cs.AI

AERA:自适应证据残差分配以实现高效测试时推理

提出AERA自适应分配推理预算,动态判断是否继续计算,在GSM8K上减少95.99%计算量,准确率仅降0.4%。

04:00
arXiv cs.AI

SABER:对抗分支探测下的LLM推理稳定性感知早退

SABER:对抗分支探测的无训练稳定性感知早退,减少30.2%-39.8%推理token,精度不降。

04:00
arXiv cs.AI

openJiuwen:超越静态框架的长周期编码智能体

openJiuwen开源框架实现结构可组合与运行时自适应,在SWE-bench和Terminal-Bench上分别达82.6%和87.19%,超越官方基线。

04:00
arXiv cs.AI

当证据塑造协作:多智能体系统的知识条件化拓扑生成

K-GAT用外部证据指导多智能体拓扑生成,精度提升15.7%,能耗减半。

04:00
arXiv cs.AI

基于检索增强LLM引导专家切换的机制感知投资组合管理

提出检索增强专家切换框架,利用LLM依据历史相似行情选择最优策略,提升多市场收益与夏普比率。