立场:我们需要实用的AI对齐方法来模拟人类推理
主张开发与人类认知对齐的AI,能模拟用户推理并清晰传达理由,以提升信任,需弥补现有对齐方法差距。
移动边缘计算中基于LLM辅助合同网协商的流处理多智能体调度
提出MAS-DecStream与LLM-MR-CNP,多轮合同网协商显著降低延迟违规至3%、消除资源超订、冲突解决率0.91,效用提升22%。
双流变换器:将主预填充路径与附加解码计算解耦
双流模型将预填充与解码计算解耦,共享权重与缓存,降低推理开销并改善模型质量,支持分阶段专家分配。
研究助手:阿斯利康的研发智能体系统
阿斯利康内部LLM系统,集成文献等多源数据,支持快速与复杂模式,证据溯源,支撑研发。
推理陪审团:多模型共识评估推理轨迹
推理陪审团用多模型共识评估推理痕迹,优于前沿模型,成本更低,并助力理解推理失败模式。
治理式持久内存:面向长周期智能体的源绑定状态语义与故障关闭发布
提出治理式持久内存(GPM),源绑定状态语义与故障关闭发布,在3600例基准中全匹配,修复全部失败且无回归。
产品线与阶梯:一种面向大规模零售价格分类的上下文感知多智能体框架
提出上下文感知多智能体框架,以LLM智能体自动化构建零售价格分类,F1达0.83,优于单智能体。
摇摆的裁判:沉默、压力与坚持下的认知稳定性
LLM裁判在重复提示、质疑或持续施压下常改变判决,翻转率高达25-91%,且改变多为错误。
MindMemOS:面向AI智能体的可移植自进化记忆操作层
提出自进化记忆操作层,统一实体属性时间结构,自动优化记忆与技能,提升任务准确率。
具有因果知识的因果概率一般化
通过协变量和中介变量中的因果信息,推导出多值因果概率更紧的界,比现有非二元界更紧。
论Transformer的表达能力
本文用电路复杂性理论刻画Transformer的表达能力:通过资源参数与电路类比较。
正确不等于受治理:智能体工作流中的来源完整性
正确结果不等于受治理;需可检查来源。Matrix记录依赖、验证完成、失效影响,非提升准确性,而是保障可审计可验证。
通过向外部大语言模型隐藏敏感信息实现隐私保护的RAG
提出SEAG框架,生成别名替换查询和文档中的敏感实体,防止外部生成器获取敏感信息,实验准确率超80%。
智能体行为契约II:不假设独立性的组合可靠性认证
组件共因失效严重,独立性假设不成立;数据增多反使拟合认证更差,线性规划有限样本证书更可靠。
扰动响应中证据、矛盾与脆弱性的分解
将扰动响应分解为证据、矛盾与脆弱性,三者之和精确等于原幅度,并能准确预测模型行为,兼具高效性。
DMDIntel:通过动态模式分解解释大型语言模型
DMDIntel用动态模式分解分解LLM隐藏状态,为输入令牌排名,其归因性能远超PCA、积分梯度和SHAP。
罕见异常故障下的解释性参与:模型行为中的渐近稀有性(或:渐近AI)
随着故障率渐近降低,LLM解释参与总体单调下降,但即时强制提示下先升后平,提示结构是关键调节变量。
基于混沌冲突度量与历史经验加权的鲁棒Dempster-Shafer证据融合
提出混沌冲突度量与历史经验加权融合框架,联合评估冲突与不确定性,16个数据集上F1达85.78、AUC达93.30,优于现有基线。
重新思考大语言模型的归一化位置:课程深度增长下的后归一化
课程深度增长下,后归一化比前归一化提升显著,且非计算量所致;归一化位置应与训练课程耦合设计。
组合式智能体工具链修复的能力层:受控商与真实仓库压力测试
用能力层建模工具链故障,商掉隐藏中间态可减少候选,但真实仓库测试未见上同调优势。
大语言模型的数值能力:根本局限与改进路径
大型语言模型在基础数值任务上不可靠。提出数值扎根框架(NGF)分析其局限,并给出微调、推理脚手架与外部工具等改进路径。
教其量级而非方向:面向多轮多步LLM智能体的验证器受限信用分配
提出分层信用分配框架,融合验证器奖励与稠密词元信号,解决轨迹级信用混杂,提升多轮工具智能体性能。
面向居家日常生活中的情境感知临床运动理解:基于第一视角视觉的冻结步态检测
研究用同步第一视角视频与IMU检测帕金森冻结步态,IMU模型最优(F1=42.3),视频可补充情境信息,支持多模态融合。
vToken:面向可回收KV缓存的令牌级虚拟化
vToken令牌级虚拟化解耦KV缓存逻辑与物理块,消除碎片;vLLM实现,保留块降27%-72%,吞吐升1.37倍,并发翻倍。
NAS驱动的边缘AI硬件加速器探索及量化对Pareto空间的影响
提出三阶段流水线,研究INT4量化对NAS Pareto空间的扰动,发现FP32零样本代理优于INT4代理。
TopoIntent:将安全意图编译为可执行、合规检查的网络拓扑
将安全意图编译为网络拓扑,经CIS v8.1.2合规检查,自动修复结构缺口并导出可执行Mininet脚本,显著提升合规率与策略通过率。
StateBridge:大语言模型多智能体系统中潜在通信的无训练隐藏状态对齐
提出状态桥方法,无需训练,用闭式正交变换对齐发送方与接收方隐藏状态,作为连续前缀,在推理等任务优于基线。
LongEarth-R1:面向长时序地球观测推理的视觉语言模型基准评测与对齐
提出长时序遥感评测基准及LongEarth-R1模型,结合思维链与强化学习,12项长序列任务最优。
规则还是品格?AI安全设计的规模法则
AI安全最优设计随规模略向品格塑造偏移,主导因素是品格脆弱性而非规模。
基于Transformer的课程与成绩联合预测模型
联合预测课程与成绩的TRACE模型,误差降近50%,优于LSTM和GNN。
Assessment Design in the GenAI Era: The X1-X2-X3 Assessment Pattern for Testing Students' AI Literacy, Learning Outcomes, and Reflection
从穴居人到专家分析师:不同LLM任务的能耗
非推理模型能耗仅推理模型1/20,节省14.1万家庭年电;提示词修改再降65%。
StorySpark:面向故事前提生成的模块化演化搜索
提出模块化演化搜索框架,生成故事前提,显著提升原创性,并改善下游故事质量。
为何AI治理框架难以落地:基于角色的NIST AI RMF压力测试
AI治理框架常流于形式。通过角色模拟压力测试发现,核心障碍不在局部转化,而在于跨层级治理价值与权限衔接;部署场景影响结构适配,风险降低需两者兼备。
StreamReason-Bench:大语言模型能否理解事件时间流处理语义?
新基准测试显示,LLM对事件时间流处理理解差;思维链提升有限,仅最强模型接近解决,难点在迟到数据处理。
交互就绪:构建与评估承担人类角色的AI智能体框架
提出交互就绪框架,区分内容与交互规范,发现权限误校准是角色型AI代理的主要失败点。
SchemaLink:LinkML模式管理的智能Web编辑器
SchemaLink是一款基于Web的LinkML模式图形化编辑器,利用RAG技术辅助模式构建与修改,提升模式质量。
FluctlightDB:AI智能体的数据记忆模型
提出AI智能体长期记忆作为独立数据模型,嵌入式引擎实现经历写入与线索激活,基准召回率超97%。
你在跟我讲逻辑吗?评估语言模型的三段论推理能力
研究发现知识表示符号能助小模型高效完成三段论推理,提出SEF分类增强提示,开源CLGC库。
多模态认知的分层能量模型
提出IM-LEPP分层能量模型,整合视觉与语言,解释注意及心理语言现象。
规范优先的AI编码代理收敛:无测试预言机且无人工审查下,拆除71.7万行代码库核心架构不变量的案例研究(涉及189个文件)
AI代理在规范优先协议下成功重构71.7万行代码库,涉及189文件,修正201缺陷,三天耗资2430美元。
中文标题
中文摘要
代码大语言模型的记忆诊断应具备规模感知
现有探测技术在规模化模型上失效,需分离表征负荷与记忆,以适应性为重。
SynAct:自适应综合优化的推理-行动大语言模型智能体
SynAct闭环智能体迭代诊断综合报告,动态调优命令,将最差负裕量降至引导综合的27%。
AutoQuREO:自动化量子资源估算与优化框架
提出自动量子资源估算优化框架AutoQuREO,集成代理建模与多目标优化,支持全栈资源估算与设计空间探索。
FSGR:缓解令牌频率偏差以实现公平的SID生成式推荐
FSGR框架优化SID构造与训练,缓解令牌频率偏差,Gini公平性提升超20%且保持精度。
标签并非终点:MCP代理安全评估中的处理泄露与构念效度
审计揭示MCP代理安全评估中标签受处理泄露影响,修正错误标签,提出完整性链与检查器,非总体评估。
PIPES:利用来源与先验保障智能体感知安全
提出PIPES,利用来源与先验筛查防状态破坏攻击,成功率84.7%→2.3%,效用保持约92.5%
InFactPlanner: 可持续地理分布式LLM数据中心的规划
提出InFactPlanner框架,用于LLM数据中心部署的假设分析,评估能耗、碳排放、水耗等,验证误差小于10%,发现可持续最优与延迟最优可能不同。