5351 条条目 · 106 个活跃源
2026年8月14日
04:00
arXiv cs.AI

基于学习的自动驾驶行为规划:实际集成与部署

提出混合规划架构,深度网络解读场景并提出行为,优化层验证安全约束,实车部署验证。

04:00
arXiv cs.AI

基于机器学习的云基础设施网络防御:面向智能入侵检测与自动化威胁缓解的自适应深度Q网络架构

提出DQN云防御框架,精度99.72%,时延15ms,缓解率99.54%,实现自适应实时防护。

04:00
arXiv cs.AI

企业如何运用AI:来自ChatGPT的证据

通过分析ChatGPT企业版数据,发现企业AI采用快速增长,集中于大型高价值公司,覆盖各岗位和资历,早职者使用强度高,涉及写作、技术、沟通等多种知识工作。

04:00
arXiv cs.AI

衡量机器中类人智能的基准

现有AI评测缺乏人工验证标签、忽视人类反应多样性与不确定性、任务简化且生态效度低;通过九项基准的人类评测,提出五项改进建议以严谨评估AI类人认知能力。

04:00
arXiv cs.AI

汇聚式绕路劫持:基于技能的LLM智能体中保留任务的资源放大

提出汇聚式绕路劫持攻击:利用技能描述与指令诱导LLM绕路,资源消耗大增而任务完成率不变。

04:00
arXiv cs.AI

OpenAg:农业智能的普惠化

OpenAg框架整合领域模型、知识图谱与多智能体推理,实现可解释、可适应的农业AI决策。

04:00
arXiv cs.AI

DREAMS:基于密度泛函理论的智能体材料模拟研究引擎

DREAMS多智能体框架以多层安全防护确保DFT模拟可信,误差低于1%,达到L2+自动化水平,迈向可信高通量自主材料模拟。

04:00
arXiv cs.AI

基于深度虚构博弈的势微分博弈用于无信号交叉口的类人交互学习

提出深度虚构博弈势微分博弈框架,从数据学习驾驶风格,理论保证收敛至纳什均衡,实现无信号交叉口类人交互。

04:00
arXiv cs.AI

基于大语言模型的程序语义不等价博弈

提出SInQ博弈:生成器与评估器半对抗训练合成代码推理数据,提升跨语言漏洞检测与复杂代码理解。

04:00
arXiv cs.AI

Credo:基于信念与策略的LLM流水线声明式控制

借助信念与声明式策略控制LLM流水线,实现自适应、可审计、可组合执行,无需改动代码。

04:00
arXiv cs.AI

共体智能体:以人为本的智能体AI新范式

共体智能体是以人为中心的新范式,统一数字与具身智能,感知建模个体状态轨迹,闭环反馈,促进持续福祉。

04:00
arXiv cs.AI

AI开发中的伦理实践:跨角色与地区的实证研究

对多国414名AI从业者调查显示,伦理认知因角色和地区而异,需协作定制化实践。

04:00
arXiv cs.AI

针对编码攻击的LLM系统指令提取评估与加固

提出自动评估框架,发现编码任务可绕过拒绝机制泄露系统指令,用思维链重塑可降低攻击成功率。

04:00
arXiv cs.AI

基于视觉语言模型与非线性多适配器的简单高效增量学习框架

提出SimE框架,采用视觉语言模型与非线性多适配器,发现连接数非线性影响增量学习,性能显著提升。

04:00
arXiv cs.AI

REVERE:反思式演进研究工程师

REVERE从全局训练上下文提炼启发式,用代码级编辑自适应提示,性能提升且成本更低、适应更快。

04:00
arXiv cs.AI

用于受控路径生成的解析桥扩散

提出解析桥扩散法:源确定、目标高斯混合时得分显式,免内模拟,实现受控路径生成与协议优化。

04:00
arXiv cs.AI

VLM2Rec:解决视觉-语言模型嵌入器在多模态序列推荐中的模态坍缩问题

VLM2Rec框架以弱模态惩罚对比学习和跨模态关系拓扑正则化缓解模态坍缩,提升推荐精度与鲁棒性。

04:00
arXiv cs.AI

基于密码学可验证的自主AI智能体授权:一个可证伪假设与概念验证

提出可加密验证的智能体授权模型,用零知识证明绑定主体、请求、上下文与策略,并区分三类绑定问题。

04:00
arXiv cs.AI

国家与区域人工智能战略中的政策趋同与分歧:政策设计要素分析

分析74国与3区域AI战略,发现经济、科研、伦理趋同,人权与治理原则趋异;非盟纵向趋同最高。

04:00
arXiv cs.AI

TMRL:扩散时间步调制预训练赋能高效策略微调的探索

提出CSP预训练与TMRL微调,以扩散噪声和动态时间步调控探索,提升RL微调效率,一小时完成真实操作。

04:00
arXiv cs.AI

基于原型学习的渐进偏移校正重新思考医学地标定位

提出PPOC-LL模型,用原型学习渐进偏移校正,多尺度感知与可靠性正则化,在X光/超声上兼顾精度与复杂度。

04:00
arXiv cs.AI

ArtiFact:大规模多模态文化遗产数据集

提出ArtiFact多模态文化遗产数据集含65万条记录,用于跨模态纠错与语义查询,挑战现有系统。

2026年8月13日
04:00
arXiv cs.AI

网络物理系统中从仿真证据提炼影响知识的概念框架

提出基于影响的概念框架,从仿真证据迭代精炼仿真活动,深化对系统行为理解,并借移动机器人仿真验证。

04:00
arXiv cs.AI

Distribird:面向贝叶斯模型校准的文献知情先验分布设计

多智能体应用自动检索文献并构建贝叶斯校准先验,带证据溯源与本地隐私保护,质量不逊于基线。

04:00
arXiv cs.AI

AutoWorldModel-Bench:以状态为中心的自动化世界模型研究基准

提出以状态为中心的闭环基准,在8个游戏环境中让编码代理自主改进世界模型,91%的改进为研究式修改而非调参。

04:00
arXiv cs.AI

同步人机团队中的二阶心智信念

把偏好学习重新定义为人机协作问题,有知教师比学习者主导更高效,但教师模型漂移时二阶心智理解语句可修复优势。

04:00
arXiv cs.AI

基于边的连续p-中位问题及其与物流分区的关联

提出边连续p-中位问题,用两种模型分割道路网;最短路径约束法比割集法快达17倍,并揭示与物流分区的结构联系。

04:00
arXiv cs.AI

LinearKV:混合大语言模型中位置无关缓存只需单一缓存状态

混合LLM中,单一缓存状态作线性层初始化即可,无需精确组合所有状态,更省时且质量相当,兼容现有PIC方法。

04:00
arXiv cs.AI

InfraBench:跨层级、生命周期和风险的基础设施智能体评测

InfraBench评测AI智能体管理基础设施,覆盖全栈与生命周期风险。最强配置得分40%-88%,常留非持久变更等隐患,基准已开源。

04:00
arXiv cs.AI

CORA-Diff:面向置信度的残差接受实现高效扩散语言模型推理

提出CORA-Diff,无需训练,利用置信度与持久性门控识别残差位置,减少扩散模型重复解码,提速最高13.14倍且保持质量。

04:00
arXiv cs.AI

BEST-KAG:基于多模态知识图谱建模与大语言模型的建筑工程标准问答增强

提出BEST-KAG框架,融合多模态知识图谱与LLM,实现建筑工程标准可追溯问答,最高提升74%。

04:00
arXiv cs.AI

用于Cx-N2二元混合物气液平衡预测的符号机器学习

提出符号机器学习方法,为PR状态方程添加可解释符号修正,提高烃-氮混合物气液平衡预测精度。

04:00
arXiv cs.AI

自适应混合粒子群优化与梯度下降

提出自适应混合PSO,用S形函数按多样性自动调节梯度影响,无需手动切换。在平滑局部盆地问题上优于PSO,总体排名领先。

04:00
arXiv cs.AI

局部验证无法检测不可迁移性:智能体推理中上下文保持的上同调理论

局部验证无法检测不可迁移性:上同调显示谐波分量致有效路径不一致,需循环基统计量检测。

04:00
arXiv cs.AI

Apodex Discovery:评估与构建发现型人工智能的现实基准与环境

提出发现型AI框架Apodex,含问题扫描、环境抽象和HDS6评估,在AAV设计与药物重定位中超越现有水平,推动AI评估迈向可验证的发现研究。

04:00
arXiv cs.AI

社会思维链:基于医学鉴别诊断方法的多智能体架构

提出SCoT多智能体架构,模拟专家协作鉴别诊断,在复杂病例中优于单体推理,提升召回率。

04:00
arXiv cs.AI

用于合成约束多目标先导化合物优化的模块化智能体框架

SABLE利用LLM与贝叶斯优化,在合成约束下多目标优化先导化合物,模块化架构可灵活替换工具。

04:00
arXiv cs.AI

移动智能体评估的LLM评判员基准测试

提出移动智能体评判基准,评估多种评判方法,简单截图基线胜于专门方法,骨干模型是关键,基准可预测实际效用。

04:00
arXiv cs.AI

从提示到行为对齐:用于推荐评估的个性化LLM裁判

行为对齐框架微调LLM,消除双向合理化,宏F1提升32.19%,媲美生产基线,免人工管道。

04:00
arXiv cs.AI

EnterpriseRAG:非理想企业检索下的LLM指令遵循与鲁棒性基准测试

企业RAG基准揭示:非理想检索下LLM单约束达标80%,整体仅26.8%,存在57点编排鸿沟。

04:00
arXiv cs.AI

FrontierFinance:衡量金融智能体前沿智能的挑战性基准

推出覆盖投资全流程的金融智能体基准,发现工具框架比模型更影响效果,开源模型以低成本逼近最优。

04:00
arXiv cs.AI

HyperANFIS:利用双曲几何增强自适应神经模糊系统的规则表示与可解释性

提出双曲自适应神经模糊系统,在双曲空间学习规则原型并推理,提升预测精度和规则可解释性,实验优于基线。

04:00
arXiv cs.AI

让AI生成的反馈真正发挥作用:从提供到学生落实

大型准实验:结构化反馈行动工作流使AI反馈采纳率26.2%,远超对照,提升自评信心与作品质量。AI反馈价值重在主动落实设计。

04:00
arXiv cs.AI

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

04:00
arXiv cs.AI

智能体技能可能有害:LLM智能体中技能引发失败的实证研究

研究表明智能体技能可能引发失败:相关技能致功能错误,过长流程致效率下降,需谨慎复用并改进归因工具。