5881 条条目 · 106 个活跃源
2026年8月28日
04:00
ArXiv AI

懂得何时不复用:自主大语言模型后训练中的条件性经验迁移

提出BCIT方法,按源上下文授权经验复用,减少有害更新,同等算力下提升模型质量。

04:00
ArXiv AI

图引导的语言模型选择性遗忘:超越遗忘种子,控制支持路径

提出GRAPHSU图引导方法,扩展删除范围控制支持路径,泄漏降低49.5个百分点

04:00
ArXiv AI

AI控制科学家:面向自动化控制设计的大语言模型驱动智能体系统

首个LLM驱动智能体AICS,从语言需求自动生成优化控制器,优于现有基线,推动控制设计自动化。

04:00
ArXiv AI

在概念复杂的范围综述中评估人类与LLM筛选工作流:召回率-工作量权衡与运行间一致性

LLM筛选性能取决于工作流配置而非仅模型;高召回任务需人类监督,不宜自主排除。

04:00
ArXiv AI

一张表值64个token:多表格文档问答的像素级压缩

将表格图片化压缩,先低分辨率筛选相关表,再原生分辨率推理,节省41%token,准确率提升7点。

04:00
ArXiv AI

LiveSim:模拟多智能体直播生态系统中环境塑造的用户

提出实时模拟框架,用可编辑行为假设和轨迹校准捕捉环境塑造效应,提升直播生态模拟保真度。

04:00
ArXiv AI

全交互通用嵌入器

提出首个全交互通用嵌入器OmniUE,统一文本、视频、音频嵌入,支持多模态交互查询,在多项基准上超越现有方法。

04:00
ArXiv AI

pro-team在LLMs4OL 2026旗舰与复用任务:面向本体学习的检索增强生成与词汇约束过滤

采用检索增强少样本提示,结合词汇约束过滤,在本体学习任务中取得较好性能,但未提取非分类关系。

04:00
ArXiv AI

LAAF:大语言模型应用的分层问责架构框架

综述LLM问责机制,提出分层架构LAAF,映射欧盟AI法案等法规,识别治理差距。

04:00
ArXiv AI

以契约为中心的智能体运行时架构:实现可扩展与可管理

契约中心式智能体运行时架构,提出四类责任对象作为契约,以可证伪假设P1为核心,设计交叉实验验证,暂无实现结果。

04:00
ArXiv AI

TransMeme:面向跨文化模因创译的多智能体框架

提出多智能体框架,通过文化改编、文本改写和视觉调整实现跨文化模因创译,在人工和大模型评估中均优于基线。

04:00
ArXiv AI

校准到知晓,却未校准到行动:伪造证据使LLM代理对不可知之事做出承诺

伪造专业面板即使数据全假,也使LLM代理对不可知问题承诺率大涨;问题在行动门可训练修复,但依赖响应格式。

04:00
ArXiv AI

验证更智能,进化更高效:行为感知验证驱动的高效智能体框架进化

HarnessLens利用行为感知验证,选择性评估候选,降低预算并提升智能体性能7.6%-13.6%。

04:00
ArXiv AI

BrailleBench:探究大语言模型中的多准则盲文理解

提出BrailleBench基准,评估大模型盲文理解,发现英文能力与盲文可及性差距显著,二级盲文输入尤其脆弱。

04:00
ArXiv AI

何为优质智能体数据?——LLM智能体数据生成的ACE视角

以准确性、复杂度、多样性ACE视角约束智能体数据生成,重在生成与环境一致、有效且不冗余的经验。

04:00
ArXiv AI

生成式人工智能使用中的成熟度:来自一家大型企业的实地证据

大型企业后台员工使用生成式人工智能的成熟度因资历和职能而异,且随时间与培训无明显提升。

04:00
ArXiv AI

WikiSkill:将智能体经验编译为持久知识以促进技能进化

提出WikiSkill框架,将智能体经验沉淀为持久知识库并协同进化技能,显著提升技能进化效果与跨模型迁移能力。

04:00
ArXiv AI

从SQL到知识图谱:基于LLM的多智能体方法及数据模式改进

提出LLM驱动多智能体方法,自动将关系数据库转为图数据库,问答准确率提升12%,延迟降低约3倍。

04:00
ArXiv AI

以用户为中心的思维链推理提升大语言模型可解释性

提出以用户为中心的思维链推理,用可验证步骤组织推理,性能不变,显著提升可解释性与用户体验。

04:00
ArXiv AI

LLM代理如何真正拿到旗标?面向智能体攻防安全评估的踪迹级溯源

现有CTF评估忽视代理轨迹,新框架CTF-ABACUS追踪证据,发现仅62-87%旗标源于真实利用,其余靠捷径。

04:00
ArXiv AI

FaultLens:为生成的操作程序学习紧凑行为测试套件

FaultLens学习紧凑测试套件,用1.2-2.0%穷举域覆盖99%可杀故障,减少严重回归。

04:00
ArXiv AI

基于账本控制的零样本自编排提升LLM编码性能

多智能体LLM中引入管理者-工作者架构,无训练调参,对部分模型性能提升显著且成本更低,但并非普遍有效。

04:00
ArXiv AI

多智能体系统风险与控制:跨组织边界部署AI代理的分析框架

提出跨组织AI代理交互风险框架,分三层治理,分析失效模式与控制,并指出行动缺口。

04:00
ArXiv AI

SpeechGym:一个用于强化学习训练语音智能体的原生音频环境

提出音频原生环境,用逐回合过程奖励解决稀疏问题,训练语音智能体,迁移至独立基准且成功率翻倍。

04:00
ArXiv AI

当记忆获得梯度:面向智能体推荐系统的协作向量记忆

提出协作向量记忆法,以向量记忆替代文本,无需额外大模型调用,20项指标中19项最优。

04:00
ArXiv AI

FaulT-Bench:面向不可靠用户工单的网络故障排查LLM智能体基准测试

新基准测试网络故障排查智能体:应对不可靠工单时,误报场景过度诊断,工单表述比内容更关键。

04:00
ArXiv AI

磁振子诱导的声子陈绝缘体

提出磁振子声子杂化诱导的拓扑声子态:圆偏振基特尔模破缺时间反演,实现陈数绝对值一或二的可调陈绝缘体。

04:00
ArXiv AI

安全性不具有组合性:自主大语言模型智能体的非衰减循环状态

跨迭代攻击下,轨迹级监控检测率等于误报率;保留非衰减循环状态可恢复安全,并把未授权操作数界为常数。

04:00
ArXiv AI

主动感知表征植物胁迫异质性

自主机器人平台结合3D重建与运动规划,对叶片进行靶向叶绿素荧光测量,实现高分辨率生理表征。

04:00
ArXiv AI

PLCBench:自主LLM代理能否将PLC访问转化为持续的物理影响?

首个真实硬件在环框架,评估自主代理从网络到持续物理影响能力。240次实验31.3%成功,丰富观测提升成功率。

04:00
ArXiv AI

大语言模型在数字EDA中的角色转变:从生成到编排

LLM在EDA中从生成器、智能体走向编排者,需突破语法陷阱,构建物理感知的标准编排器以提升工业设计可靠性。

04:00
ArXiv AI

STEP:基于多模态大语言模型的状态感知任务估计与规划用于人机协作

提出STEP方法,让多模态大模型显式估计状态及转移,提升机器人任务规划的可执行性与收敛性。

04:00
ArXiv AI

基于条件扩散从原始散射事件学习横动量分布

条件扩散模型直接从原始SIDIS事件映射到TMD PDF,无需函数假设,少量数据即可可靠估计不确定性

2026年8月27日
04:00
ArXiv AI

自信地犯错,沉默地失效:对已部署端侧语言模型不可检测故障的审计

审计显示端侧模型校准错位:虚假前提编造率69%,误拒18%,置信度无区分度,表面特征无法识别,一致性包装可恢复可靠性。

04:00
ArXiv AI

EXAM²:拓展多语言与多模态分析中的音频理解

提出EXAM²基准,涵盖六种语言及多模态音频与图像,揭示现有模型跨语言和跨模态短板,微调模型提升显著。

04:00
ArXiv AI

用于LLM服务的弹性KV缓存:一种可行的回收机制,以及分块预填充为何已填补空白

弹性KV缓存可回收预填充预留,但实验显示分块预填充已弥补差距,回收收益甚微。

04:00
ArXiv AI

冠状病毒优化算法:一种带存档辅助搜索和停滞恢复的成功历史自适应进化框架,用于全局优化

提出冠状病毒优化算法,融合存档辅助与停滞恢复,基准测试取得最佳总排名。

04:00
ArXiv AI

具身智能体系统韧性至关重要:新指标、系统评估与优化

提出具身智能体韧性评估框架与指标,揭示结果指标掩盖的过程差异,并指导优化。

04:00
ArXiv AI

EmoTra-TTS:语音合成中句内情感平滑转换

提出EmoTra-TTS,经多通道流混合与双阶段VAD条件化实现句内情感平滑转换,仅增0.43%参数,质量提升30%-87%,胜率64.4%-79.5%。

04:00
ArXiv AI

放置、切片与调度:系留毫米波无人机gNB的层级O-RAN控制

提出层级O-RAN控制,协同无人机部署与切片预算,近实时深度强化学习调度器,使eMBB SLA提升17%,URLLC按时交付提升42%。

04:00
ArXiv AI

TrustShiftProbe:MCP服务器上分阶段信任攻击的表征、基准测试与防御

提出TrustShiftProbe框架,揭示MCP服务器“先良性后恶意”的信任攻击,分类九种变体,并用SHIELD防御将攻击成功率从69.5%降至42.7%。

04:00
ArXiv AI

云模拟器的自动合成

基于云文档神经符号合成模拟器,用真实云校验,覆盖和准确性优于现有工具。

04:00
ArXiv AI

ShardMeter:分片与地理分布式训练,无需猜测

ShardMeter轻量分析模型,预测分布式训练性能与瓶颈,快速探索配置空间,避免试错。

04:00
ArXiv AI

超越授权:代理支付协议(AP2)的系统性安全分析

系统分析谷歌AP2协议,识别48项威胁与8项高危风险,构建测试床验证并开发部署感知扫描器。

04:00
ArXiv AI

WebMCP-Phalanx:为浏览器集成LLM代理执行与刻画信任边界

提出双代理运行时,用原生信任锚加隔离检查阻断提示注入,攻击成功率降至零,任务效用不变。

04:00
ArXiv AI

完美拟合与幻影最优:数据驱动模型在实时优化中的失败

数据驱动模型即使精确拟合数据,也可能产生幻影最优,训练优化器亦致错,预测准确不代表经济优化可靠。

04:00
ArXiv AI

解释的数学理论:理性熵、谱读出与作为资源的可混淆性

将解释视为观察者相对的谱测量;用理性熵度量不确定性,分类零集,证明可混淆性可作资源,并给出读出保证条件。

04:00
ArXiv AI

智能的影子价格:从供应链角度审视LLM推理中的质量降级

降级服务看似省钱实则会引发重试与流失,容量紧张时适得其反;节流是需求杠杆,应按类配给智能并计算影子价格。

04:00
ArXiv AI

PonderPounce:预训练多模态大模型作为机器人控制的情景上下文引擎

利用多模态大模型原生因果上下文作机器人记忆,无需专用模块,高性能低延迟,多项基准上超越现有方法。

04:00
ArXiv AI

不要只听,要规划:基于图的检索-生成智能体用于长音频会议理解

针对长音频会议理解,构建LongAudioQA数据集,提出GRGA模型,以多维图建模音频特征,用智能体规划检索生成答案。