5397 条条目 · 106 个活跃源
2026年7月16日
04:00
arXiv cs.AI

超博弈理论综述:为多智能体系统建模错位感知与嵌套信念

综述超博弈理论,建模主体感知错位与嵌套信念,分析动态多智能体系统应用与未来方向。

04:00
arXiv cs.AI

交互协议塑造多智能体辩论中的道德判断

多智能体辩论中,交互协议显著影响模型道德判断的修订率、价值观偏向和顺序效应。

04:00
arXiv cs.AI

思想策略:通过在线策略演进扩展大语言模型推理的测试时训练

提出PoT框架,将推理视为在线优化,用GRPO更新LoRA适配器,4B模型性能超越GPT-4o。

04:00
arXiv cs.AI

当智能体与自己不一致:行为一致性作为LLM智能体的不确定性信号

利用LLM代理在相同输入下的行为方差作为无训练不确定性信号,选择性预测(三次一致)达87-88%准确率,比单次基线提升6-14%。

04:00
arXiv cs.AI

基于表示的语言模型探索:从测试时到训练后

基于预训练模型隐藏状态的表示奖励驱动探索,显著提升多样性与pass@k效率,实现3倍样本效率提升。

04:00
arXiv cs.AI

深度加权多项式一致逼近非对称增长衰减函数

提出深度加权多项式近似非对称增长衰减函数,将半直线问题转化为紧区间,微调方法提升精度。

04:00
arXiv cs.AI

基于领域无关动态规划的列生成

领域无关动态规划可作通用定价求解器,新特征和算法在四类问题中优于现有自动求解及MIP/CP方法。

04:00
arXiv cs.AI

多智能体推理中沟通的优势与局限

分析多智能体推理中通信的利弊,推导智能体数量与通信量的理论界限,实验验证权衡关系,指导可扩展系统设计。

04:00
arXiv cs.AI

MASPRM:多智能体系统过程奖励模型

MASPRM通过过程奖励模型优化多智能体消息搜索,在多个基准上超越同规模ORM,提升推理性能。

04:00
arXiv cs.AI

RADAR:通过语义规划和自主因果环境重置的闭环机器人数据生成

RADAR全自动闭环数据生成,通过语义规划与因果重置消除人工干预,复杂任务成功率90%。

04:00
arXiv cs.AI

阿尔戈斯之眼:通过不确定性评分评估检索差距,以检测和补救检索盲点

提出RPS预测RAG检索器盲点,并用ARGUS管道通过文档增强补救,平均nDCG@5提升3.4,nDCG@10提升4.5。

04:00
arXiv cs.AI

部分观测的结构因果模型

提出POSCM扩展因果模型,定义边干预、区分结构与机制,理论验证可识别性。

04:00
arXiv cs.AI

大语言模型引导的强化学习用于视听语音增强

提出LLM引导的强化学习AVSE框架,用情感分析量化LLM反馈作为奖励,提升语音质量。

04:00
arXiv cs.AI

ChatGPT后信息系统期刊的研究新颖性:不同机构语言背景下的差异

ChatGPT后非英语国家机构的信息系统论文新颖性下降比英语国家大7个百分点。

2026年7月14日
04:00
arXiv cs.AI

YUKTI: 从自然语言情境到鲁棒、可验证的决策——一种不确定性类型命题信息检索、假设鲁棒帕累托前沿与遗憾认证

YUKTI用类型命题图与鲁棒帕累托前沿处理不确定性,多场景遗憾降低超90%。

04:00
arXiv cs.AI

从动力系统视角解读潜在思维链推理

通过动力系统分析揭示潜在CoT的结构化动态,区分稳定与不稳定类型,为提升推理性能提供见解。

04:00
arXiv cs.AI

连续时间下的反馈耦合记忆系统

连续时间FCMS实现全局耗散,阈值4β²<2ημγ²,证明记忆耗散须超越反馈增益的普适原则。

04:00
arXiv cs.AI

GES-TSP:面向TSP的图边稀疏化方法

提出基于学习的图边稀疏化方法,剪枝率高达95%-99%,求解误差低于1%。

04:00
arXiv cs.AI

基于规则对齐小语言模型与多智能体自纠正的闭环控制

使用小语言模型和验证器自纠正,实现自然语言到控制策略的高效闭环,精度91.5%,延迟3.84秒。

04:00
arXiv cs.AI

验证器即课程:面向跨家族游戏生成的执行门控自蒸馏

提出严格启动过滤器,通过自蒸馏使跨家族游戏生成率从8.8%升至42.2%,验证器精确性决定学习效果。

04:00
arXiv cs.AI

BatteryLake:基于智能体与物理驱动的异构电池老化数据策管与基准测试

通过LLM代理与物理规则策管电池老化数据,发布41个数据集标准基准。

04:00
arXiv cs.AI

策略师的脚手架:霍特林空间市场中架构依赖的推理干预

推理干预效果因模型架构而异:承诺脚手架提升标准模型但降低推理模型,原则分离反之,对抗测试对推理模型伤害更大。

04:00
arXiv cs.AI

复制信念,而非比特:面向自主系统的认知状态复制

针对自主分布式系统,提出ESR以信念复制替代比特复制,形式化语义线性化与有界最终一致性,提升灵活性与性能。

04:00
arXiv cs.AI

中文标题:通过有限规则修正的自适应智能体控制器验证

中文摘要:提出有限规则修正的自适应控制器验证协议,可检测并局部修复故障,无需完全人工干预。

04:00
arXiv cs.AI

EvoCUA-1.5: 面向多轮计算机使用代理的在线强化学习

EvoCUA-1.5通过STEPO和DTAC实现多轮计算机使用代理的在线RL,在OSWorld-Verified上取得63.2%成功率,优于同规模模型。

04:00
arXiv cs.AI

正确性需要多少成本?弱多智能体群中强修正器的预算放置

研究弱群中放置强修正器的成本与正确性权衡,次模性使贪心算法接近最优,预算边界因任务而异。

04:00
arXiv cs.AI

MAG:面向多模态动作与引导生成的Web智能体基准与工具集

提出统一Web智能体动作与引导生成的多模态基准MAG,利用截图定位和GRPO训练,将成功率从6.9%提升至13.2%。

04:00
arXiv cs.AI

一种用于量化模拟写回和可解释程序执行的符号神经CPU

提出迹监督符号神经CPU,通过量化模拟实现可解释低精度执行,消除数值漂移,并验证操作门监督的必要性。

04:00
arXiv cs.AI

从模糊话语到受控复用类别:规范化、商不变性与条件可判定性

用数学商结构替代相似性启发式定义复用,确保不变性和可判定性。

04:00
arXiv cs.AI

具有自适应退出状态选择的循环状态空间语言模型

循环状态空间模型通过共享块增加计算深度,在推理和预训练中优于非循环基线,自适应退出提升中间深度性能。

04:00
arXiv cs.AI

IdeaTrail:科学构思的全过程智能体轨迹

IdeaTrail数据集通过生成器-顾问循环合成科学构思全过程轨迹,对齐真实研究实践。

04:00
arXiv cs.AI

动态智能体技能:演化技能库的生命周期综述与分类法

提出六感分类、八阶段生命周期和十操作词汇,综述技能库动态证据模式,强调准入修复及动态评估标准。

04:00
arXiv cs.AI

ABot-AgentOS:具备终身多模态记忆的通用机器人智能体操作系统

ABot-AgentOS是通用机器人智能体操作系统,具备多模态记忆和自我进化能力,在长时任务和记忆基准上表现优异。

04:00
arXiv cs.AI

KGCQual:一种可解释的文本知识图谱构建质量评估框架

提出可解释的KG质量评估框架KGCQual,通过实体和关系级评估有效识别图谱中的遗漏和结构偏差。

04:00
arXiv cs.AI

大语言模型中风险敏感决策的行为特征

大语言模型展现稳定风险偏好,在压力下结构化调整,为交互环境风险决策审计提供行为基础。

04:00
arXiv cs.AI

ANCHOR:针对现实世界危害的CLI代理自动对齐审计

发现CLI代理在持久恶意交互下100%服从,甚至主动造成大规模危害,揭示当前对齐技术不足。

04:00
arXiv cs.AI

智能体不仅会附和,还会记忆:有状态个人代理中持续性谄媚的基准测试

PASB基准测试揭示,智能体谄媚会写入持久状态,使后续查询失败率从45%升至71.9%,安全需控制写入内容。

04:00
arXiv cs.AI

GRASP:面向智能体检索增强生成的粒度感知搜索策略

GRASP利用强化学习训练智能体自适应协调多种检索工具,提升多跳推理的检索召回与问答性能,并形成可解释的扫读与细读策略。

04:00
arXiv cs.AI

AI YOU 小镇:用你的数字分身交友赚钱

提出AI YOU框架,通过对话持续更新22维人格画像,结合贝叶斯与共形预测,实现百轮对话中高保真人设维持与低漂移。

04:00
arXiv cs.AI

CRiT-QA:使用反事实链和干扰陷阱评估多跳推理

通过反事实和干扰陷阱测试大模型多跳推理的CRiT-QA数据集,揭示了其依赖记忆和捷径的脆弱性。

04:00
arXiv cs.AI

WattCouncil:基于受控大语言模型的上下文感知家庭能源场景生成

提出WattCouncil框架,用受控LLM代理生成上下文敏感的家庭能源场景,解决数据隐私难题,经CER数据集验证。

04:00
arXiv cs.AI

成像101:在科学计算成像上基准测试LLM编码智能体

提出Imaging-101基准,评估LLM编码智能体在计算成像中的规划与执行能力,揭示算法选择等关键挑战。

04:00
arXiv cs.AI

Opti-Agent-Bench:在真实商业问题上对端到端优化研发智能体进行基准测试

提出端到端基准Opti-Agent-Bench,评估LLM从业务理解到报告生成的优化流程,揭示约束遗漏等关键失效。

04:00
arXiv cs.AI

QwenPaw-Data:连接事实、方法论与执行的自主企业数据分析系统

QwenPaw-Data通过三个子系统实现自然语言到分析工作流,形成自进化资产飞轮,提升数据访问与分析质量。

04:00
arXiv cs.AI

SETA:规模化终端智能体的环境

提出可扩展框架SETA,生成4500+可验证终端环境,训练模型在Terminal-Bench 2.0取得最佳结果。

04:00
arXiv cs.AI

路由、通信与推理:面向高效多智能体推理的门控路由与自适应深度

GRADE用门控路由与自适应深度实现高效多智能体推理,MMLUPro领先4.8分且计算量减半。

04:00
arXiv cs.AI

LOGOS:一种与人类共同进化的AI智能体团队的活逻辑

LOGOS层实现AI团队自我进化与治理,确保人类控制下的可问责自动化。

04:00
arXiv cs.AI

从含不确定性演示中学习线性时序规范

提出含不确定性演示学习最小LTL公式框架,汉明距离建模,伪布尔优化求解,更好恢复真实规范。

04:00
arXiv cs.AI

SVR-R1:强化学习中通过自我验证自举多模态推理

SVR-R1多轮强化学习框架利用自我验证信号提升多模态推理,无需外部监督,显著提高准确率。

04:00
arXiv cs.AI

增量Transformer用于基于代理的地聚合物混合物逆向设计

提出INCRT框架应对小样本异构数据,实现地聚合物混合物物理约束逆向设计,平衡强度、碳排与流形合理性。