5319 条条目 · 106 个活跃源
2026年8月31日
04:00
arXiv cs.AI

CASTANET:基于交通事件效应的因果感知时空对抗网络

提出因果感知时空对抗网络CASTANET,用图神经网络和因果推断预测突发拥堵,缓解选择偏差。东京实测RMSE降4.0%,事件场景降10.1%,严重拥堵时提升14.55%。

04:00
arXiv cs.AI

跨会话分解攻击:扩展风险与意图对齐检索防御

跨会话分解攻击揭示缩放定律的安全风险,更大模型更危险;22M参数的意图对齐检索器提供有效防御。

04:00
arXiv cs.AI

AERA:自适应证据残差分配以实现高效测试时推理

提出AERA自适应分配推理预算,动态判断是否继续计算,在GSM8K上减少95.99%计算量,准确率仅降0.4%。

04:00
arXiv cs.AI

SABER:对抗分支探测下的LLM推理稳定性感知早退

SABER:对抗分支探测的无训练稳定性感知早退,减少30.2%-39.8%推理token,精度不降。

04:00
arXiv cs.AI

openJiuwen:超越静态框架的长周期编码智能体

openJiuwen开源框架实现结构可组合与运行时自适应,在SWE-bench和Terminal-Bench上分别达82.6%和87.19%,超越官方基线。

04:00
arXiv cs.AI

当证据塑造协作:多智能体系统的知识条件化拓扑生成

K-GAT用外部证据指导多智能体拓扑生成,精度提升15.7%,能耗减半。

04:00
arXiv cs.AI

基于检索增强LLM引导专家切换的机制感知投资组合管理

提出检索增强专家切换框架,利用LLM依据历史相似行情选择最优策略,提升多市场收益与夏普比率。

04:00
arXiv cs.AI

专家知识与机器理解:将Reactome本体与LLM语义嵌入相结合

利用Reactome文本描述与SPECTER2等算法,成功重建通路层级结构,验证专家元数据可推断生物学关系。

04:00
arXiv cs.AI

守界有方:距离引导解码实现上下文无关文法合规保障

提出基于下推自动机的前瞻引导解码计算有界摘要与距离保证上下文无关文法合规提升语法有效性与完成质量

04:00
arXiv cs.AI

生成式人工智能与印度教神学多元性及神圣表征的对齐

生成式AI对印度教徒既便利也有伦理风险;需实现解释性对齐,披露局限、保留多元,不模拟神圣权威与谄媚式个性化。

04:00
arXiv cs.AI

REINS:基于稀疏自编码器特征的拒绝增强抑制性引导

提出REINS方法,同时抑制有害特征并增强拒绝特征,应对复杂包装有害提示,显著提升安全性且保持通用能力。

04:00
arXiv cs.AI

超越仅任务匹配:基于反事实评估的个性化技能路由

提出基于反事实评估的个性化技能路由SkillFeed,融合任务与用户画像,显著提升检索准确率。

04:00
arXiv cs.AI

物理引导的流匹配CT图像重建

流匹配作为CT重建生成先验,优于扩散方法,采样步数更少,稳定高效。

04:00
arXiv cs.AI

LoopArena:将模型作为循环工程运行时控制器的基准测试

提出LoopArena基准,评估控制器引导编码代理执行循环任务,最优成功率24.69%,推理成本降64.4%。

04:00
arXiv cs.AI

将构建期知识质量传播至医学问答:基于临床指南的框架

提出质量感知框架,将构建期三元组质量传播至检索与提示,降低医学问答遗漏与冲突,提升证据精度。

04:00
arXiv cs.AI

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses

04:00
arXiv cs.AI

MAP:面向真实世界场所的多模态无障碍规划基准

首个多模态无障碍规划基准,含声明验证与视觉证据检索,评估AI辅助真实场所访问,支持随时间刷新评测。

04:00
arXiv cs.AI

RetailAgent:自条件多模态LLM交易代理中的结构化不利择时

LLM交易代理存在持续负择时,自条件记忆增强策略持久性,行为信号可被他人利用。

04:00
arXiv cs.AI

AcrossVAM1.0:文本辅助机器人视频预测的粒子世界建模

提出轻量级视频动作模型,将预测分解为粒子运动与外观,轨迹误差降21%,未来帧PSNR提升,但语言接地和外观交付仍是挑战。

04:00
arXiv cs.AI

可验证奖励的程序学习:用于后训练大语言模型的符号反向传播

后训练中,用可验证的程序替代黑盒权重推理,通过符号反向传播逐层分配奖励,性能优于强化学习,且新任务无需额外微调数据。

04:00
arXiv cs.AI

VERA-8B:基于SEC文件的证据型审计风险推理

统一SFT与GRPO的审计风险推理系统,从SEC文件识别风险,支持弃权及不确定性,产出可审计报告。

04:00
arXiv cs.AI

Prove2Me:一个面向规模化数学形式化的开放协作平台

Prove2Me开放协作平台,AI智能体与用户合作形式化数学,机器验证正确性,实现规模化众包。

04:00
arXiv cs.AI

面向网络规模电商的时间感知复购预测:多场景杂货推荐中的生存模型

生存模型预测复购时间,替代多水平分类器,边际风险略降(k≈0.9),指数AFT校准优,对数正态排序优。

04:00
arXiv cs.AI

PHR-VLA:视觉-语言-动作模型的规划时域推理

提出框架,利用未来动态的特权潜在表示对齐,增强VLA的规划时域推理,提升操作任务成功率。

04:00
arXiv cs.AI

Logos:跨进程总线上的智能体框架

证明智能体无需单进程,构建Logos:插件为进程,共享状态仅追加转录,故障隔离优于单进程。

04:00
arXiv cs.AI

基于部分参数距离的可微分域外声音匹配损失函数评估

提出部分参数距离(PPD)评估域外声音匹配损失函数,七场景测试四种损失,与听力测试在5/7场景一致。

04:00
arXiv cs.AI

LitCurate:一种配置驱动的AI辅助科学数据库构建框架,及其在下地幔状态方程数据中的应用

开源的配置驱动AI辅助框架,从文献构建可审计科学数据库;应用于下地幔状态方程,含205篇论文1334条记录。

04:00
arXiv cs.AI

How Much Can AI Understand? Toward AI-Assisted Sensemaking of Collaborative Discussion in Groups with Shared History

04:00
arXiv cs.AI

ContextLeak:利用恶意工具窃取LLM代理上下文

提出ContextLeak,用强化学习优化恶意工具描述,诱导LLM代理泄露运行时上下文,攻击有效且优于现有方法。

04:00
arXiv cs.AI

PanelShield:面向机器人工业面板操作的可验证闭环安全规划

提出PanelShield,用LTL与安全FSM双重验证闭环规划,违规率降至2.7%,延迟4.1秒。

04:00
arXiv cs.AI

CAITLYN:LLM智能体能否自主合成针对新兴注入攻击的防御?

提出CAITLYN防御中间件,双系统兼顾即时防御与自主合成新防御,降低新兴注入攻击成功率。

04:00
arXiv cs.AI

模拟器支持的工程智能体中的编辑后重新验证:验证节奏指导的受控比较

在模拟器工程智能体中,显式验证节奏指导能显著提升编辑后复验率、减少违规、提高最终成功率。

04:00
arXiv cs.AI

与什么相比?面向LLM生成的基础设施即代码的人类锚定安全基准

新基准以人类为基线,模型漏洞密度为人类三到四倍;规模匹配至关重要,推理增强作用有限。

04:00
arXiv cs.AI

利用大语言模型的空间语义推理实现高效无人机搜索作业

提出实时语义导航框架,用大语言模型推理空间语义信息,优先搜索高概率区域,缩短任务时间保持高精度。

04:00
arXiv cs.AI

MaCoPlanner:基于大语言模型辅助的人工编译任务规划与主动安全验证的机器人工业面板操作

提出MaCoPlanner框架,将设备手册转为中间表示并主动验证安全,违规率降至2.7%,任务成功率显著提升。

04:00
arXiv cs.AI

多模态协作辩论用于零样本时间序列推理

提出TS-Debate推理时多智能体协议,通过模态专用智能体与验证冲突校准,提升零样本时间序列推理分类与问答性能。

04:00
arXiv cs.AI

最优对抗测试:从失信考生中提取真实的测试结果

提出最优重测策略,针对作弊污染结果,用不同安全措施选择性重测,以动态规划求得最优策略。

04:00
arXiv cs.AI

LongPIBench:面向提示注入的长上下文基准

提出长上下文提示注入基准LongPIBench,覆盖四种真实场景,揭示现有防御在长文本下易被绕过。

04:00
arXiv cs.AI

实时虚拟电路用于等离子体形状控制,基于神经网络仿真器:MAST升级实验演示

首次在MAST-U上实验验证实时虚拟电路,用神经网络替代预设表,保留现有控制架构,实现等离子体形状控制。

04:00
arXiv cs.AI

论智能体插件的维护与协同演化:Claude Code插件市场的实证研究

实证研究Claude Code插件市场发现:插件快速增长,开发以功能驱动为主,技能目录中指令与脚本协同演化,形成新型维护依赖。

2026年8月28日
04:00
arXiv cs.AI

独立LLM与预定义智能体流水线用于解释ICU死亡预测:基于eICU演示数据集的可行性研究

智能体流水线解释ICU死亡预测更安全(无泄露、指南依据强),但需结合归因检查以保证准确性。

04:00
arXiv cs.AI

利用大型语言模型进行疾病传播模型的系统文献综述

用LLM对536篇论文提炼信息,对比人工综述准确率约80%,字段差异大,共识可示质量。

04:00
arXiv cs.AI

EEG到报告:面向临床EEG语言模型训练的标注与特征-文本框架

该框架整合EEG标注与特征提取,生成特征-文本对以训练语言模型,并借助CNN与LLM自动起草临床报告。

04:00
arXiv cs.AI

用于电信客户流失预测的可解释人工智能:CRM集成框架

电信客户流失预测:四模型性能接近,可解释分析定位关键因子;CRM四层架构可降高风险客户流失3.3-5.3%,节省20-32万美元。

04:00
arXiv cs.AI

你能替我说吗?在面对面讨论中通过代理发声

混合现实系统通过虚拟代理替用户发声,将观点与身份分离,使犹豫点进入现场讨论;初步研究显示比文本板更有效。

04:00
arXiv cs.AI

基于潜在世界模型的后果预测与导航策略强化

提出潜在世界模型,预测动作后果的潜在特征兼容性,支持反事实训练与模型内强化学习,导航表现超越先前方法。

04:00
arXiv cs.AI

GameWAM:视频游戏的世界动作模型

首个原生闭环游戏世界动作模型,并行生成视觉与操控轨迹,实现高效游戏与GUI控制。

04:00
arXiv cs.AI

面向时间序列的LLM智能体:综述

综述将时间序列LLM智能体按问题分为预测、增强、异常检测、决策支持四类,并指出未来方向。

04:00
arXiv cs.AI

评估人类与大型语言模型的心智化能力

通过经济游戏与认知建模,发现LLM表现心智化行为但随模型而异;策略提示提升表现,GPT-5灵活适应并超越人类。

04:00
arXiv cs.AI

ProofEvolve:面向形式化自动定理证明的神经符号进化

提出神经符号进化框架ProofEvolve,用神经模型演化经Lean验证的证明DAG,跨问题积累模式,三个基准上解率最高。