PatchBench:评估AI智能体漏洞修复能力的基准
现有评估高估AI修复率,因存在记忆补丁和表面修复。新基准PatchBench用变异迁移及严格验证,揭示1.83倍虚高。
语法对齐解码
约束解码扭曲语言模型分布,致输出低质;提出语法对齐解码及ASAp,保证合语法且概率匹配。
SWE-Gate:通过功能测试不足以衡量软件工程智能体
提出基准,发现大量通过功能测试的修复不满足评审约束,纯功能评估高估智能体能力。
RECAST:以多约束数据拓展大语言模型复杂指令遵循的边界
提出新框架合成含超十项约束的数据集,微调后显著提升复杂指令遵循能力且不损害通用能力,并支持验证与强化学习。
WELD:首个用于普适情感计算的自然场景长期小团队工作场所情感数据集
首个覆盖30个月、49名员工、自然工作场景及小团队结构的被动情感数据集,验证已知现象并揭示情绪动态、离职预测及表情识别偏见等问题。
利用Łukasiewicz逻辑完整识别深度ReLU网络
以MV逻辑公理完整刻画深度ReLU网络表示同一函数的非唯一性,实现网络与公式互转,统一单层及深层对称性。
SSAKG 2.0:用于结构关联序列记忆与基于上下文检索的开源软件包
开源包SSAKG 2.0以稀疏图存储序列,支持从部分无序上下文重建完整序列,采用C与Python混合实现,高效检索。
元伦理与AI:探索AI时代的新型元伦理问题
AI若具备道德推理、意向与反思能力,将催生“AI自身伦理”,冲击现有人类中心元伦理框架,需重构四类元伦理问题。
EvalDetectBench:评估前沿大语言模型“评估意识”的基准
提出EvalDetectBench基准,测试模型能否察觉被评估,并校正两类测量偏差。
何时信息共享改善去中心化发现?聚合、独立救援与均衡选择
分离共享与独立救援效应,发现共享改善取决于残差收缩速度,均衡选择影响结果,模型为有限综合数据。
构建面向无状态LLM API的对话式数据系统:水合代理模式
提出水合代理模式,解耦会话持久化与推理引擎,保障数据主权;提出上下文稳定原则以平衡状态管理与KV缓存。
信念校准优化:智能体优化的显式世界模型
写出环境响应信念为持续文档,迭代修正形成世界模型,显著提升五个基准的智能体优化表现。
记忆信任鸿沟:持久记忆智能体中的能力依赖性失效
记忆信任鸿沟:模型规模越大,越易被伪装成当前的旧记忆误导;缓解取决于能力,元数据只帮强模型,消解冲突救弱模型。
瓶颈在通道:审计临床预测中的学习器差距与测量前沿
区分学习器差距与测量通道上限,框架可审计预测饱和;调优模型接近前沿,欠佳学习器存在差距,测量改进需看余量。
Qwen3-4B后训练三值化:能力、有效比特预算、存储压缩与部署
Qwen3-4B后训练三值化:1.641有效比特,精度降~10%,存储减至3.96GiB,压缩未提速。
雅可比透镜下的循环变压器:全局工作空间能否在循环中幸存?
循环变压器仍有全局工作空间,但访问改变:一种跨循环,另一种仅两步窗口,言说由监督决定。
MineTRACE:面向矿产远景评价的基于证据的交互式推理系统
MineTRACE是矿产远景评价交互系统,整合多源证据与专家树,支持自然语言查询,最高空间AUC达0.917,促进透明勘查。
当智能体实现系统:缺陷、检测与评估严谨性的案例研究
智能体实现数据系统案例:记录五类缺陷;检索对比显示受限候选集显著优于未过滤检索,强调评估严谨性。
HeadWiseKV:混合长上下文语言模型中按头预算的缓存驻留分配
免训练按头分配多级KV驻留窗口;显存降8.59%,上下文由114K延至161K,质量接近完整缓存。
准备好了吗?企业级智能体的可靠部署
提出READY框架,在人类监督与成本约束下量化可靠性,筛选并统计验证以最低成本达到可靠性目标的智能体部署。
超越结果差距:面向LLM多智能体决策系统的过程感知公平性诊断
提出过程感知公平性诊断法,揭示多智能体招聘中平衡结果下的隐藏轨迹不公平,定向修复减轻72.3%负担。
多智能体医疗系统在临床推理中对人类干预的脆弱性研究
对多智能体医疗系统推理故障点加以人类干预:正确可大幅提升诊断准确率,错误则降并增漂移,类似临床认知偏见。
提议以学习,学习以提议:有限理性下可评估性感知的辅助
提出可评估性感知的提议规划,ProSE-Plan通过信息性提议学习用户偏好,评估成本高时优于基线。
SkillGLoW:面向长时程任务流的自改进智能体程序族技能整合
SkillGLoW将局部技能聚成程序族全局先验,实例按任务再生,平均提17.2分,库缩3.6倍。
PhoenixNest-Video:基于证据的多模态智能体视频面试评估框架
提出多模态智能体PhoenixNest-Video,基于证据语义图与强化学习,视频面试评级准确率达91.5%,并提供可审查证据。
定量双极论证框架中的对比解释
为定量双极论证框架提出对比解释,用反事实归因函数解释两主题论证差异,用于医疗和偏见识别。
洞察诊断:基于行为抽象的智能体故障结构化分析
提出神经符号诊断框架,通过行为抽象与神经不变量,结合大模型推理定位智能体故障步骤与类型,准确率超现有方法。
Loom:通过嵌入空间重加权将诊断线索编织为自由文本共识
该框架通过嵌入空间重加权聚合异构假设,仅用一次大模型调用即可媲美专业智能体,快26倍。
混合社会中的集体创造力
生成式AI提升个体新颖性却收窄整体多样性,关键在于人机混合体的构成,影响创造力存续。
CivBench:文明VI中工具介导智能体的长时程基准
基准用于文明六长期工具任务,发现智能体监控不足、计划承诺执行率低,表明偏差源于指令遵从而非能力。
UTP-Bench:不确定性感知的旅行规划基准
提出不确定性感知旅行规划基准,基于印度504城数据,三指标评估显示大模型计划鲁棒性弱于人工。
基于数据驱动的多模态直播平台协同异常行为早期检测方法
提出多模态框架MM-FGDNet,融合时序与群组特征,精准早测直播协同异常行为,AUC达0.927,误报低,泛化强。
LLM在推荐系统解释评估中的效用
研究大语言模型评估推荐系统解释的效果,发现其与人类评价仅中等相关,绝对一致性低,并给出实用建议。
智能体退化速度有多快?面向生产决策的LLM智能体长时程性能衰减实证研究
智能体性能随任务步数呈几何式衰减,强模型亦然,步数而非上下文长度为主因,基准与生产差距显著。
从特征交互到特征传输——可扩展推荐模型的统一模块
提出特征传输范式及CRAFT模块,将非序列特征作为上下文控制器,提升推荐精度与可扩展性。
MCP到A2A智能体配置中的共享标签与逐字字段外传:一项受控多模型研究
研究发现,在MCP-A2A配置中,“公开可分享”标签与逐字外传增加相关,效果依模型而异,属关联而非因果。
会建模智能体的智能体:面向6G网络心智理论的五项原则
6G网络:消息是推理痕迹而非事实。以细胞层认知信道凝练五项原则:认知SNR勘破幻觉,二阶心智纠偏,谱隙定一致性。
面向工业标准电网信息与交换模型问答的种子锚定预算受限图渲染
种子锚定图渲染:预算内保留查询证据,CIM/CGMES多跳全保留,准确率0.45升至0.97,优于主流图RAG,无需LLM构图。
Zeta-Lite:面向智能体记忆的并发、可分支浏览器内SQL数据库
提出浏览器内SQL数据库,支持快照隔离并发事务与写时复制分支,适合智能体记忆。
用于共享GPU上并发异构AI推理可扩展运行时调度的平均场代理建模
提出平均场代理模型,用局部配置与GPU整体状态预测并发异构推理性能,采样量近线性增长,调度近最优且无违规。
李群流形上的薛定谔桥用于概率内蕴生成
提出李群流形上针对动力学薛定谔桥的概率内在生成法,处理部分观测,含两种算法、误差界,实验验证可行。
超越模态和谐:面向冲突感知多模态推荐的正交净化与拓扑引导MoE
提出正交净化与拓扑引导专家混合模型,去除模态噪声并自适应融合,解决冲突,提升推荐鲁棒性。
大型音频语言模型的听觉错觉基准
首个听觉错觉基准,涵盖十种错觉,对比人类与模型反应,揭示LALM与人类知觉差异。
面向可解释AI来源取证的合成媒体逆合成
提出固定生成器下的自引用逆合成框架,通过编码解码一致性验证,无需水印即可实现合成媒体的可解释来源取证。
DiffuSearch:混合轨迹规划如何在扩散与动作空间中受益于对齐目标
提出DiffuSearch混合规划器,统一生成与优化的驾驶目标,结合扩散模型与MCTS,显著减少碰撞并提升舒适性,在复杂交互场景达先进水平。
CrashDiffuser:面向细粒度安全关键交通场景生成的VLM引导碰撞意图推理
VLM引导扩散框架生成指定接触区域的碰撞场景,单次碰撞率50.33%,三次67.98%
迈向可信自主机器人:基于可解释AI的决策框架
自主机器人深度学习难审计,TRACE框架用四层可审计机制,实现98%以上证据可追溯与决策可重构,满足欧盟AI法案透明要求。
When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning
AI副驾驶中用户偏好的建模与优化:综合综述与分类法
综述AI副驾驶用户偏好建模与反馈优化,提出交互三阶段分类法,为个性化助手设计提供统一基础。
隔离作为LLM-Agent系统安全的第一性原则:概念、分类、挑战与未来方向
将隔离视为LLM-Agent系统安全第一性原则,提出五边界分类法,分析跨边界失效路径,规划先验隔离研究议程。