5348 条条目 · 106 个活跃源
2026年8月15日
04:00
arXiv cs.AI

立场:我们需要实用的AI对齐方法来模拟人类推理

主张开发与人类认知对齐的AI,能模拟用户推理并清晰传达理由,以提升信任,需弥补现有对齐方法差距。

04:00
arXiv cs.AI

移动边缘计算中基于LLM辅助合同网协商的流处理多智能体调度

提出MAS-DecStream与LLM-MR-CNP,多轮合同网协商显著降低延迟违规至3%、消除资源超订、冲突解决率0.91,效用提升22%。

04:00
arXiv cs.AI

双流变换器:将主预填充路径与附加解码计算解耦

双流模型将预填充与解码计算解耦,共享权重与缓存,降低推理开销并改善模型质量,支持分阶段专家分配。

04:00
arXiv cs.AI

研究助手:阿斯利康的研发智能体系统

阿斯利康内部LLM系统,集成文献等多源数据,支持快速与复杂模式,证据溯源,支撑研发。

04:00
arXiv cs.AI

推理陪审团:多模型共识评估推理轨迹

推理陪审团用多模型共识评估推理痕迹,优于前沿模型,成本更低,并助力理解推理失败模式。

04:00
arXiv cs.AI

治理式持久内存:面向长周期智能体的源绑定状态语义与故障关闭发布

提出治理式持久内存(GPM),源绑定状态语义与故障关闭发布,在3600例基准中全匹配,修复全部失败且无回归。

04:00
arXiv cs.AI

产品线与阶梯:一种面向大规模零售价格分类的上下文感知多智能体框架

提出上下文感知多智能体框架,以LLM智能体自动化构建零售价格分类,F1达0.83,优于单智能体。

04:00
arXiv cs.AI

摇摆的裁判:沉默、压力与坚持下的认知稳定性

LLM裁判在重复提示、质疑或持续施压下常改变判决,翻转率高达25-91%,且改变多为错误。

04:00
arXiv cs.AI

MindMemOS:面向AI智能体的可移植自进化记忆操作层

提出自进化记忆操作层,统一实体属性时间结构,自动优化记忆与技能,提升任务准确率。

04:00
arXiv cs.AI

具有因果知识的因果概率一般化

通过协变量和中介变量中的因果信息,推导出多值因果概率更紧的界,比现有非二元界更紧。

04:00
arXiv cs.AI

论Transformer的表达能力

本文用电路复杂性理论刻画Transformer的表达能力:通过资源参数与电路类比较。

04:00
arXiv cs.AI

正确不等于受治理:智能体工作流中的来源完整性

正确结果不等于受治理;需可检查来源。Matrix记录依赖、验证完成、失效影响,非提升准确性,而是保障可审计可验证。

04:00
arXiv cs.AI

通过向外部大语言模型隐藏敏感信息实现隐私保护的RAG

提出SEAG框架,生成别名替换查询和文档中的敏感实体,防止外部生成器获取敏感信息,实验准确率超80%。

04:00
arXiv cs.AI

智能体行为契约II:不假设独立性的组合可靠性认证

组件共因失效严重,独立性假设不成立;数据增多反使拟合认证更差,线性规划有限样本证书更可靠。

04:00
arXiv cs.AI

扰动响应中证据、矛盾与脆弱性的分解

将扰动响应分解为证据、矛盾与脆弱性,三者之和精确等于原幅度,并能准确预测模型行为,兼具高效性。

04:00
arXiv cs.AI

DMDIntel:通过动态模式分解解释大型语言模型

DMDIntel用动态模式分解分解LLM隐藏状态,为输入令牌排名,其归因性能远超PCA、积分梯度和SHAP。

04:00
arXiv cs.AI

罕见异常故障下的解释性参与:模型行为中的渐近稀有性(或:渐近AI)

随着故障率渐近降低,LLM解释参与总体单调下降,但即时强制提示下先升后平,提示结构是关键调节变量。

04:00
arXiv cs.AI

基于混沌冲突度量与历史经验加权的鲁棒Dempster-Shafer证据融合

提出混沌冲突度量与历史经验加权融合框架,联合评估冲突与不确定性,16个数据集上F1达85.78、AUC达93.30,优于现有基线。

04:00
arXiv cs.AI

重新思考大语言模型的归一化位置:课程深度增长下的后归一化

课程深度增长下,后归一化比前归一化提升显著,且非计算量所致;归一化位置应与训练课程耦合设计。

04:00
arXiv cs.AI

组合式智能体工具链修复的能力层:受控商与真实仓库压力测试

用能力层建模工具链故障,商掉隐藏中间态可减少候选,但真实仓库测试未见上同调优势。

04:00
arXiv cs.AI

大语言模型的数值能力:根本局限与改进路径

大型语言模型在基础数值任务上不可靠。提出数值扎根框架(NGF)分析其局限,并给出微调、推理脚手架与外部工具等改进路径。

04:00
arXiv cs.AI

教其量级而非方向:面向多轮多步LLM智能体的验证器受限信用分配

提出分层信用分配框架,融合验证器奖励与稠密词元信号,解决轨迹级信用混杂,提升多轮工具智能体性能。

04:00
arXiv cs.AI

面向居家日常生活中的情境感知临床运动理解:基于第一视角视觉的冻结步态检测

研究用同步第一视角视频与IMU检测帕金森冻结步态,IMU模型最优(F1=42.3),视频可补充情境信息,支持多模态融合。

04:00
arXiv cs.AI

vToken:面向可回收KV缓存的令牌级虚拟化

vToken令牌级虚拟化解耦KV缓存逻辑与物理块,消除碎片;vLLM实现,保留块降27%-72%,吞吐升1.37倍,并发翻倍。

04:00
arXiv cs.AI

NAS驱动的边缘AI硬件加速器探索及量化对Pareto空间的影响

提出三阶段流水线,研究INT4量化对NAS Pareto空间的扰动,发现FP32零样本代理优于INT4代理。

04:00
arXiv cs.AI

TopoIntent:将安全意图编译为可执行、合规检查的网络拓扑

将安全意图编译为网络拓扑,经CIS v8.1.2合规检查,自动修复结构缺口并导出可执行Mininet脚本,显著提升合规率与策略通过率。

04:00
arXiv cs.AI

StateBridge:大语言模型多智能体系统中潜在通信的无训练隐藏状态对齐

提出状态桥方法,无需训练,用闭式正交变换对齐发送方与接收方隐藏状态,作为连续前缀,在推理等任务优于基线。

04:00
arXiv cs.AI

LongEarth-R1:面向长时序地球观测推理的视觉语言模型基准评测与对齐

提出长时序遥感评测基准及LongEarth-R1模型,结合思维链与强化学习,12项长序列任务最优。

04:00
arXiv cs.AI

规则还是品格?AI安全设计的规模法则

AI安全最优设计随规模略向品格塑造偏移,主导因素是品格脆弱性而非规模。

04:00
arXiv cs.AI

基于Transformer的课程与成绩联合预测模型

联合预测课程与成绩的TRACE模型,误差降近50%,优于LSTM和GNN。

04:00
arXiv cs.AI

Assessment Design in the GenAI Era: The X1-X2-X3 Assessment Pattern for Testing Students' AI Literacy, Learning Outcomes, and Reflection

04:00
arXiv cs.AI

从穴居人到专家分析师:不同LLM任务的能耗

非推理模型能耗仅推理模型1/20,节省14.1万家庭年电;提示词修改再降65%。

04:00
arXiv cs.AI

StorySpark:面向故事前提生成的模块化演化搜索

提出模块化演化搜索框架,生成故事前提,显著提升原创性,并改善下游故事质量。

04:00
arXiv cs.AI

为何AI治理框架难以落地:基于角色的NIST AI RMF压力测试

AI治理框架常流于形式。通过角色模拟压力测试发现,核心障碍不在局部转化,而在于跨层级治理价值与权限衔接;部署场景影响结构适配,风险降低需两者兼备。

04:00
arXiv cs.AI

StreamReason-Bench:大语言模型能否理解事件时间流处理语义?

新基准测试显示,LLM对事件时间流处理理解差;思维链提升有限,仅最强模型接近解决,难点在迟到数据处理。

04:00
arXiv cs.AI

交互就绪:构建与评估承担人类角色的AI智能体框架

提出交互就绪框架,区分内容与交互规范,发现权限误校准是角色型AI代理的主要失败点。

04:00
arXiv cs.AI

SchemaLink:LinkML模式管理的智能Web编辑器

SchemaLink是一款基于Web的LinkML模式图形化编辑器,利用RAG技术辅助模式构建与修改,提升模式质量。

04:00
arXiv cs.AI

FluctlightDB:AI智能体的数据记忆模型

提出AI智能体长期记忆作为独立数据模型,嵌入式引擎实现经历写入与线索激活,基准召回率超97%。

04:00
arXiv cs.AI

你在跟我讲逻辑吗?评估语言模型的三段论推理能力

研究发现知识表示符号能助小模型高效完成三段论推理,提出SEF分类增强提示,开源CLGC库。

04:00
arXiv cs.AI

多模态认知的分层能量模型

提出IM-LEPP分层能量模型,整合视觉与语言,解释注意及心理语言现象。

04:00
arXiv cs.AI

规范优先的AI编码代理收敛:无测试预言机且无人工审查下,拆除71.7万行代码库核心架构不变量的案例研究(涉及189个文件)

AI代理在规范优先协议下成功重构71.7万行代码库,涉及189文件,修正201缺陷,三天耗资2430美元。

04:00
arXiv cs.AI

中文标题

中文摘要

04:00
arXiv cs.AI

代码大语言模型的记忆诊断应具备规模感知

现有探测技术在规模化模型上失效,需分离表征负荷与记忆,以适应性为重。

04:00
arXiv cs.AI

SynAct:自适应综合优化的推理-行动大语言模型智能体

SynAct闭环智能体迭代诊断综合报告,动态调优命令,将最差负裕量降至引导综合的27%。

04:00
arXiv cs.AI

AutoQuREO:自动化量子资源估算与优化框架

提出自动量子资源估算优化框架AutoQuREO,集成代理建模与多目标优化,支持全栈资源估算与设计空间探索。

04:00
arXiv cs.AI

FSGR:缓解令牌频率偏差以实现公平的SID生成式推荐

FSGR框架优化SID构造与训练,缓解令牌频率偏差,Gini公平性提升超20%且保持精度。

04:00
arXiv cs.AI

标签并非终点:MCP代理安全评估中的处理泄露与构念效度

审计揭示MCP代理安全评估中标签受处理泄露影响,修正错误标签,提出完整性链与检查器,非总体评估。

04:00
arXiv cs.AI

PIPES:利用来源与先验保障智能体感知安全

提出PIPES,利用来源与先验筛查防状态破坏攻击,成功率84.7%→2.3%,效用保持约92.5%

04:00
arXiv cs.AI

InFactPlanner: 可持续地理分布式LLM数据中心的规划

提出InFactPlanner框架,用于LLM数据中心部署的假设分析,评估能耗、碳排放、水耗等,验证误差小于10%,发现可持续最优与延迟最优可能不同。