6007 条条目 · 106 个活跃源
2026年6月5日
04:00
ArXiv AI

工具失效之时:LLM代理动态重规划与异常恢复基准测试

ToolMaze基准测试发现工具扰动致LLM性能骤降,恢复率降37%,动态重规划为模型扩展无法解决的瓶颈。

04:00
ArXiv AI

基于分子感知探索的智能体分子恢复

针对无效SMILES,提出AMREC方法,通过分子感知探索与轨迹级选择,在保留分子身份的同时实现最优恢复。

04:00
ArXiv AI

QCFuse:通过压缩视图实现查询感知的缓存融合以提升RAG服务效率

QCFuse用压缩视图实现查询感知缓存融合,达到全预填充质量,预填充时间加速1.7倍。

04:00
ArXiv AI

连续动作空间中的重试策略梯度

将ReMax扩展到连续动作空间,用路径导数估计器优化重试目标,通过重塑梯度鼓励探索;ReMAC算法性能与SAC相当。

04:00
ArXiv AI

迈向生物医学研究中的世界模型

提出生物医学世界模型新范式,通过学习潜在状态和动力学模拟未来,助力虚拟细胞、患者等应用。

04:00
ArXiv AI

记忆是重构的,而非检索的:面向LLM Agent的图记忆

提出MRAgent框架,将记忆重构为关联图,动态适应推理,提升23%并降低开销。

04:00
ArXiv AI

自我纠正幻觉:大语言模型能纠正他人却无法自我纠正

LLM纠错不对称性源于角色标签伪像,非能力缺陷;通过改变错误来源角色即可大幅提升纠错率。

04:00
ArXiv AI

Edit-R2:上下文感知强化学习用于多轮图像编辑

Edit-R2通过强化学习后训练,重构会话意图并联合优化推理与生成,解决多轮编辑中的长期约束稀释和状态污染。

04:00
ArXiv AI

最长路径的双向搜索:面向前端启发式适用性分析

提出BiXDFBnB双向深度优先分支定界算法,利用前端启发式减少节点扩展,有时提升运行时间。

04:00
ArXiv AI

RLVR中自我一致性诱发与奖励设计的预注册因果分解

证明RLVR中naive估计偏误源于混淆自我一致性诱发与奖励设计,分解实验揭示非加性交互,可诊断主导因素。

04:00
ArXiv AI

PLAN-S:将规划与潜在风格动态桥接的自动驾驶世界模型

PLAN-S通过解码风格条件语义成本图,解决紧凑性与可控性困境,在nuScenes和NAVSIM上分别降低碰撞率42%和达89.4 PDMS。

04:00
ArXiv AI

RedditPersona:基于Reddit的社区条件大语言模型自适应的模块化框架

提出标准化社区条件LLM自适应框架,发现可识别性与分布相似性存在权衡。

04:00
ArXiv AI

构框、判断、引导:面向学生用生成式AI推理教学的可评估能力模型

提出CoRe-3能力模型,将生成式AI的合理使用分解为构框、判断、引导三种可评估技能,并验证其区分效度。

04:00
ArXiv AI

超越相似性:面向个人AI代理的可信记忆搜索

提出轻量级插件MemGate(9M参数),在记忆搜索中引入任务条件过滤,解决语义相似性导致的信任漏洞,降低风险并保持效用。

04:00
ArXiv AI

记忆何时应保持沉默:测量记忆增强对话代理中的使用边界

现有评估忽略敏感内容是否应整合,RBI-Eval发现模型在拥有敏感记忆时行为偏差显著,需在检索与生成阶段进行记忆感知决策。

04:00
ArXiv AI

通过模态差距感知自蒸馏从符号状态学习视觉空间规划

提出MGSD两阶段框架,通过自蒸馏弥合视觉与符号规划差距,在4B和8B模型上分别提升19.3%和18.4%。

04:00
ArXiv AI

衡量对集合型AI建议适当依赖的框架

提出首个衡量对集合型AI建议适当依赖的框架,定义分类和回归新指标,揭示人机协作中被忽略的细微差别。

04:00
ArXiv AI

超越语义组织:记忆作为长时程智能体的执行状态管理

MAGE将记忆作为执行状态管理,构建层级状态树,通过四项操作维护,提升任务成功率7.8-20.4个百分点,减少55.1% token消耗。

04:00
ArXiv AI

评估计算机网络中的智能体配置修复

智能体架构结合形式验证与上下文检索,使网络配置修复效果提升12%,安全性提升17%。

04:00
ArXiv AI

从奖励黑客激活到代理风险状态:LLM智能体中的上下文校准机制监控

研究发现奖励黑客激活可转移至动作选择,但需结合熵和上下文特征才能有效预测风险,支持上下文校准监控。

04:00
ArXiv AI

利用测试时重建实现潜在推理的闭环

提出ReLAT方法,用查询重建损失锚定潜在推理,在数学推理等任务上显著提升性能。

04:00
ArXiv AI

RedKnot:基于头感知KV复用与SegPagedAttention的高效长上下文大语言模型服务

RedKnot以头感知分解KV缓存,实现高效复用、压缩与分布式管理,无需重训即提升长上下文LLM服务效率。

04:00
ArXiv AI

重新思考基础设施检测:作为图像差异分类——以交通标志为例

将缺陷检测重构为图像差异分类可减少数据依赖,指令型分类器优于编码器,有效应对数据限制。

04:00
ArXiv AI

TokenMizer:面向长程LLM上下文管理的图结构会话记忆

TokenMizer用知识图建模会话历史,压缩上下文,节省token并提高召回,平均恢复块仅78 token。

04:00
ArXiv AI

大语言模型自我识别:引导与提取激活特征

通过随机稀疏向量引导生成,LLM创建可检测指纹实现自我归因,准确率超98%且不降文本质量。

04:00
ArXiv AI

DragOn:用于基于拖拽的GUI交互的基准和数据集

提出DragOn拖拽基准数据集,含28.6万截图和350万任务,在文本高亮等四领域提升模型性能。

04:00
ArXiv AI

基于大语言模型决策的传染病传播模拟

使用LLM模拟个体决策,结合空间数据,发现收入和学历主导报告率变化,支持空间流行病学建模。

04:00
ArXiv AI

自动驾驶风险评估:整合技术故障、伦理困境与政策框架

基于NHTSA等数据,自动驾驶主要技术故障为感知错误,伦理法规不一致,需协同治理。

04:00
ArXiv AI

虚拟圆桌:多智能体角色模拟人类头脑风暴动态

提出多智能体架构模拟圆桌头脑风暴,通过发散与收敛两阶段生成评估想法,AI角色互动提升讨论质量。

04:00
ArXiv AI

Unsupervised Skill Discovery for Agentic Data Analysis

04:00
ArXiv AI

全维度基准测试:面面俱到,同步推进

提出自主基准构建系统Benchmark Agent,高效生成多场景高质量样本,揭示模型领域推理短板。

04:00
ArXiv AI

MLEvolve:用于自动机器学习算法发现的自我进化框架

提出MLEvolve框架,通过跨分支信息流和记忆机制实现自我进化,在算法发现任务取得SOTA性能。

04:00
ArXiv AI

RAINO:将智能体锚定于现实——基于Agent建模中现实主义的系统综述与概念框架

系统综述发现现实主义定义模糊,引入RAINO框架(现实锚点、输入输出),拓宽建模视角并解释评估差异。

04:00
ArXiv AI

结构何在?关于人机协作与混合智能促进学习的实证研究系统文献综述

系统综述62项人机协作与混合智能学习实证研究,揭示协作结构、应用情境,提取设计知识与研究空白。

04:00
ArXiv AI

得分哈密顿量:将扩散模型映射到绝热输运

扩散模型与绝热输运精确对应,采样极限由得分匹配误差平方与谱间隙之比决定。

04:00
ArXiv AI

评估AI图像生成中地域表征的地理多样性

发现旧模型多样性更高,提示修改比生成更能增强多样性,但模型同质化易导致刻板印象。

04:00
ArXiv AI

大步长梯度下降恢复多通路深度线性网络中的对称性

大学习率梯度下降后期通过震荡迫使信号多通路再分配,恢复对称性,避免单通路主导。

04:00
ArXiv AI

可微分高效算子搜索

提出可微分高效算子搜索,自动联合搜索token缩减位置、数量与处理方式,在积极压缩下实现性能与效率的竞争优势。

04:00
ArXiv AI

深度研究智能体中的搜索时污染:公共基准评估中性能膨胀的衡量

搜索时污染使深度研究智能体在基准测试中性能虚高4%,需采取隔离沙箱等防污染措施。

04:00
ArXiv AI

本体约束的多LLM评分:预测处理文献中的假设支持评估

使用多LLM对预测编码文献进行本体约束评分,映射假设空间并揭示结构化分歧,证明了可审计的定量证据映射方法。

2026年6月4日
04:00
ArXiv AI

Toward Pre-Deployment Assurance for Enterprise AI Agents: Ontology-Grounded Simulation and Trust Certification

04:00
ArXiv AI

Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Representation Signal

04:00
ArXiv AI

通过符号思考:PEEL作为面向认知负责的AI驱动研究的符号学脚手架

PEEL框架结合Voyant工具与Claude,基于皮尔斯符号学揭示AI量化扭曲与认知责任缺失,三者设计启示:须有确定性工具、流畅非忠实、权威需内置。

04:00
ArXiv AI

VAMPS:视觉辅助数学问题解决基准

多模态模型用可视化工具时性能下降,VAMPS基准测试发现直接解析求解优于视觉辅助。

04:00
ArXiv AI

通用智能体能否自动化数据整理?

通用Agent可自动化数据整理循环,但需脚手架引导弥补执行-研究差距。

04:00
ArXiv AI

描述人机协作的初始证明形式化工作流

研究AI对数学证明形式化工作流的影响,发现人们偏好AI辅助但保持人类控制,使用AI提高准确率并灵活选用多种工具。

04:00
ArXiv AI

模拟、推理、决策:基于大语言模型的科学推理驱动模拟决策

提出MechSim框架,使LLM推理模拟器机制,提升解释质量与决策可靠性。

04:00
ArXiv AI

数字学徒:人类指导的自主AI开发框架

提出数字学徒框架,通过方法论捕获、分级授权和持续对齐,实现可扩展且可信的AI代理,自治需逐步获得。

04:00
ArXiv AI

Trivium:将时间遗憾作为因果记忆控制器的首要目标

提出时间遗憾作为因果记忆核心,弥补结果遗憾忽略“何时为何”的结构缺陷,实现对数级错误修正。

04:00
ArXiv AI

元智能体挑战:当前智能体能自主开发智能体系统吗?

提出MAC基准,测试模型自主开发智能体,发现多数无法匹敌人类,存在鲁棒性与对齐缺失。