用于最优决策树全局分析的代数模型计数
提出ADTC框架,将优化、计数等任务统一为半环和积计算,实现决策树假设空间的高效全局分析。
A-TMA:解耦长期智能体记忆中的状态感知故障
提出ATMA状态感知层,分离记忆存储、检索与回答中的时序混淆,在冲突基准上提升准确率0.240。
Episodic-to-Semantic Consolidation Without Identity Drift
InduceKV:通过诱导KV记忆实现多模态大模型固定足迹持续适应
提出InduceKV,在固定内存预算下双层选择构建紧凑记忆集,实现多模态大模型持续适应并优于基线。
基于检索增强的多智能体运维助手的电池储能系统可追溯故障诊断
提出检索增强多智能体运维助手,实现电池储能系统可追溯故障诊断,通过任务路由等提升可靠性并有初步评估。
PACE:智能体能力评估的代理基准
PACE框架利用少量原子评测实例预测智能体基准性能,成本降低超99%,误差低于4%,相关性超0.8。
持续多模态学习中的隐性遗忘:准确率未降,但证据关联失效
持续多模态学习存在隐藏遗忘:准确率未降但证据使用失效,RCL通过约束证据依赖同时保留答案与推理路径。
编码智能体能够复现科学机器学习论文
提出Paper-replication工作流,使智能体通过记录目标、重建方法并验证,可靠复现论文声称。
基于证据状态的奖励机制用于长上下文推理
提出Maven框架,通过奖励证据状态转换改善长上下文推理,优于一次性提取方法。
净化版OPSD:在不失思考能力下进行在线自蒸馏
OPSD在长思维链中因参考诱导机械记忆失效,净化版通过分离非迁移成分并应用PMI蒸馏,保留推理并提升性能。
A²utoLPBench:基于逆向KKT构造的自动生成、智能体友好的线性规划基准
通过逆向KKT构造自动生成线性规划问题,提供无限新样本、防数据泄露、答案准确,支持智能体一键评估。
基于评分准则的前沿语言模型在专家撰写的临床推理任务上的受控对比
临床推理关键标准通过率仅32-42%,低风险达80-90%,半数关键无一模型通过。
ContextNest:面向自主AI智能体的可验证上下文治理
提出上下文治理框架ContextNest,通过元数据、哈希链等技术确保知识版本可验证,实验表明优于传统检索,解决检索无法处理的故障模式。
UA-ChatDev:不确定性感知多智能体协作,助力可靠软件开发
UA-ChatDev通过token log概率与相位阈值校准触发检索验证,抑制幻觉传播,显著提升多智能体软件开发质量。
基于关键性的自主电信网络AI智能体决策护栏验证
提出护栏验证框架,基于关键性分级拦截验证AI决策,支持冲突检测与合规日志。
DRIFTLENS:衡量个性化语言模型中记忆引发的推理漂移
提出DRIFTLENS框架量化记忆引发的推理漂移,发现用户属性记忆导致中到大漂移,后训练方法部分缓解但效果不统一。
EvoPolicyGym:在交互环境中评估自主策略演化
提出自主策略演化评估框架EvoPolicyGym,GPT-5.5在16个环境中表现最优,并提供预算分配与反馈转化的轨迹诊断。
用于安全关键实时自主系统的硬件强制语义协调
提出硬件强制语义协调架构,通过FPGA实现确定性协调,确保时序同步与约束。
通过RFM-AGOP实现快速多维拒绝子空间
提出RFM-AGOP方法,秒级识别多维拒绝子空间,性能优于现有方法。
G-RRM:利用循环推理模型引导符号求解器
G-RRM神经引导法在搜索空间大且求解器能动态重写分支时显著加速符号求解,如Sudoku上达33.3倍。
人工智能赋能的会计信息系统与尼日利亚金融服务业欺诈检测:自然语言处理的调节作用
研究证实AI会计信息系统显著提升欺诈检测与审计效果,自然语言处理通过语义解释增强正向调节作用。
ReContext: 递归证据重放作为长上下文推理的大语言模型工具
提出无训练递归证据重放方法,利用内部信号构建证据池,提升长上下文推理的证据利用。
持久状态AI控制中的分布式攻击
研究AI编码代理在持续代码库中跨PR分发攻击,发现单一监控器无法同时防御两种攻击,状态链路追踪器将渐近攻击规避率降至47%。
大语言模型作为数学考试评分的助教:可靠性与实际可用性
评估六种LLM评分助教,宽松策略降低误差,但评分校准与排名保持仍为不同目标。
生成式人工智能与联邦学习在入侵检测系统中的应用:综述
综述生成式AI和联邦学习在入侵检测中的应用,涵盖模型类别、挑战及未来方向。
基于人工智能的最优灵敏度双中子星引力波搜索
Aframe AI算法实时搜索双中子星引力波,灵敏度媲美匹配滤波,计算成本更低,已用于LVK运行。
基于稀疏自编码器的神经量子态机制可解释性与因果特征引导
稀疏自编码器无监督揭示神经量子态内部特征与物理量强相关,并实现因果控制。
VLAFlow:基于协同训练与未来潜在对齐的视觉-语言-动作模型统一训练框架
提出VLAFlow框架,对比四种训练范式,发现语言监督与未来潜在对齐结合可提升异构动作监督迁移性能。
面向非光滑非凸优化的带通信压缩的分布式随机次梯度类方法
提出带通信压缩的分布式随机次梯度统一框架,证明非光滑非凸优化全局收敛,新方法实证有效。
AI原生工程团队的风险架构:自主系统治理的组织框架
提出AI原生团队风险架构框架,发现风险覆盖随团队类型退化,严重故障集中在确定性依赖边界。
AI之善:人工智能时代何为“好”知识?
本文分析2024年553篇AI论文中的认知美德(如创造性),提出评估AI知识价值的新框架,面向生成性未来。
ProCal: 开放词汇目标检测中的推理时提议校准
ProCal通过前景与背景分数校准提议,抑制背景误激活,提升新颖目标定位,在OV-LVIS上APr提升2.5。
MMBench-Live:一个持续演进的多模态模型基准
MMBench-Live通过多智能体自动化流水线实现低成本的持续演进,保持模型排名稳定且抗数据污染。
解耦代码复杂度与新手参与:OSS中AI编码代理采用的因果研究
AI代理使代码复杂度升约11%,但新手参与未减少,未出现挤出效应。
基于场景条件的PINN-GNN多径射频地图:跨场景生成与场景内补全
提出PINN-GNN框架,融合物理与空间约束,实现多径RF地图跨场景生成与场景内补全,性能优于基线。
RareDxR1:超越人工标注的罕见病诊断自主医学推理
RareDxR1端到端推理模型,内化罕见病知识并自进化学习,直接从临床笔记诊断罕见病,达SOTA。
可用于交互式游戏的可教练智能体
提出可教练智能体框架,结合UVFA,让智能体在复杂任务中展现风格,用户可实时控制行为。
Agri-SAGE:基于模拟的多智能体大语言模型用于情境感知农业咨询生成
Agri-SAGE整合检索增强多智能体LLM与APSIM生物物理模拟,闭环生成验证农艺咨询,三种推理方法均优于静态基线。
个性化作为逆规划:通过结构去噪学习智能体幻灯片生成的潜在设计意图
通过结构去噪和强化学习,SPIRE框架学习潜在设计意图,解决页面级幻灯片个性化问题。
AGI迷宫:世界建模智能体的基准框架
AGI Maze框架评估大型语言模型的世界建模能力,结果显示其在简单迷宫任务中表现不佳,即使有工作记忆也难解决小型迷宫。
Self-GC:面向长周期LLM智能体的自治理上下文
Self-GC将上下文转为索引对象,通过规划器管理生命周期,剪枝43.95%前缀令牌,84.85%未来延续不受影响。
Theoria: 非形式化推理状态上的重写-可接受性验证
Theoria通过可审计的状态转换序列验证AI推理,精确率91.4%,有效捕捉隐藏前提和伪造引用错误。
两种AI指标分歧:会带来天壤之别吗?
前沿AI能力集中与否取决于性能指标的有界性,有界指标促普及,无界指标致垄断。
PedNStream:行人交通管理的可扩展网络流模拟
开源行人网络流模拟器PedNStream,基于LTM模型,支持随机动态与控制干预,高效可扩展。
图原生强化学习通过概念重组实现可追溯的科学假设生成
图原生强化学习结合GRPO提升科学假设生成的推理可追溯性与语义多样性,在材料科学问题上实现40-65%的性能提升。
具备随时有效证书的自演进智能体
提出SEA架构,用随时有效门控制自修改,在SWE-bench上强基模型提升4-5分,未来需验证方差。
智能体能否泛化到开放世界?揭示工具使用中静态训练的脆弱性
智能体在静态训练中表现良好,但面对开放世界环境变化时性能显著下降,提出了扰动增强微调策略提升鲁棒性。
AutoMem:将记忆作为认知技能的自动化学习
AutoMem通过自动化优化记忆结构及训练信号提升模型记忆熟练度,使长时任务性能提升2-4倍,证明记忆管理是可独立学习的技能。
对话推荐系统中用户模拟的提示优化:一个多目标框架
提出多目标框架自动优化提示,缓解LLM用户模拟的偏差与数据泄漏,实现行为对齐。
为何先进编码器在稀疏检索中落后?答案与弥合词汇差距的方法
词汇差距导致先进编码器稀疏检索性能落后。提出词汇迁移框架,通过语义初始化和激活势校准弥合差距,达到SOTA。