5474 条条目 · 106 个活跃源
2026年5月25日
04:00
arXiv cs.AI

中文标题:当正确执行仍导致规划失败:论基于LLM的多智能体系统的认知校准

中文摘要:解决LLM多智能体系统因认知失调导致的规划失败,提出EPC-AW方法,通过信息一致性校准提升成功率9.75%。

04:00
arXiv cs.AI

CP还是DP?为何不两者兼得:以部分车间调度问题为例

本文结合动态规划与约束规划,以DP为主框架、CP子程序利用全局传播,解决部分车间调度问题,展示混合集成可行性。

04:00
arXiv cs.AI

Co-ReAct:将评分准则作为ReAct智能体的步骤级协作工具

Co-ReAct通过步骤级评分准则指导推理决策,优化秩相关奖励,显著提升搜索推理任务性能。

04:00
arXiv cs.AI

MemAudit:通过因果归因和结构异常检测对中毒智能体记忆进行事后审计

MemAudit通过因果归因与异常检测审计中毒记忆,将攻击成功率降至0%。

04:00
arXiv cs.AI

Agentic Proving for Program Verification

04:00
arXiv cs.AI

单一策略,无限NPC:面向可扩展游戏智能体的个性可追踪共享强化学习策略

提出PCSP共享策略,基于冻结LLM嵌入实现可扩展实时个性NPC控制,零样本识别超随机17倍,推理快22倍。

04:00
arXiv cs.AI

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

提出LAR和RCSL,通过对抗子空间对齐增强多模态知识编辑的泛化鲁棒性。

04:00
arXiv cs.AI

SkillOpt:自我进化智能体技能的执行策略

SkillOpt是首个系统可控的文本空间优化器,通过有界编辑进化技能,52项评估均最佳,大幅提升准确率。

04:00
arXiv cs.AI

LFRAG: 面向布局的多模态文档理解中的细粒度检索增强生成

提出块级检索与语义布局融合,实现精确对齐,文档问答准确率提升7.2%,令牌消耗减少73.07%。

04:00
arXiv cs.AI

联盟内的战略胁迫:作为AI压力测试的格陵兰主权博弈

以格陵兰主权危机为压力测试,模拟8个前沿LLM在联盟内博弈,发现胁迫框架加剧升级,中西模型权力权重迥异,和平收购仅1.9%。

04:00
arXiv cs.AI

依规分期:基于评分规则的自动睡眠阶段分类

提出透明、基于规则的AASM睡眠分期方法,提供自然语言解释,虽准确率低于深度学习,但可互补用于审计与治理。

04:00
arXiv cs.AI

ObjectCache:分层对象存储检索实现KV缓存重用

提出ObjectCache,将KV缓存存于S3对象存储,通过分层检索与调度优化,64K上下文仅增5.6%延迟,显著降低集群成本。

04:00
arXiv cs.AI

PilotWiMAE:导频原生的无线信道表示学习

PilotWiMAE自监督框架直接处理含噪导频,因子化注意力利用信道分离结构,跨频域性能优于监督基线。

04:00
arXiv cs.AI

Agentic-VLA:视觉-语言-动作模型的高效在线自适应

提出Agentic-VLA框架,通过自适应奖励、语言引导探索和经验记忆实现高效在线适应,在LIBERO上长时任务提升12.3%,1-shot提升28.5%,收敛快2.4倍。

04:00
arXiv cs.AI

LLM生成代码的安全性:一项比较分析

评估7种主流LLM生成的代码,均含严重或高危漏洞,安全性堪忧。

04:00
arXiv cs.AI

哲学倾向作为AI辅助代码审查的行为约束:一项实证研究

通过哲学倾向约束AI代码审查行为,实现46%与人类一致,75%独特发现且零假阳性,51%发现为通用模型所无。

04:00
arXiv cs.AI

合成脑部MRI能否可靠改进肿瘤分类?基于BRISC 2025的StyleGAN2-ADA类平面增强研究

合成MRI增益依赖架构与比例,仅对MobileViTV2有微小提升,视觉保真度不保证效果。

04:00
arXiv cs.AI

在学术环境中定义AI疲劳:维度、指标及基于扎根理论的分阶段模型

基于扎根理论分析1054名学生,提出AI疲劳五维度及阶段模型,揭示学术中AI使用的累积压力。

04:00
arXiv cs.AI

基于强化学习的变分量子算法经典态制备

CRiSP框架利用强化学习生成Clifford初始态,提升变分量子算法优化效率,在QAOA上平均能量精度提升3.17倍。

04:00
arXiv cs.AI

生成式人工智能与劳动力需求的重组

生成式AI通过招聘重分配(52%)和任务重新设计(39.5%)调整劳动力需求,且高级与初级岗位调整方式不同。

04:00
arXiv cs.AI

PoisonForge:指令微调大语言模型的任务级定向投毒基准

PoisonForge基准评估任务级投毒:1%预算下11/12模型攻击成功率超70%,主因是投毒设计而非模型规模。

04:00
arXiv cs.AI

前沿LLM是否已为网络安全做好准备?——来自双模式漏洞基准对垂直基础模型的证据

前沿LLM在网络安全中误报率高(10-50%)、覆盖率低(4-8%),领域专用模型通过结构化方法显著提升性能,论证了构建垂直基础模型的必要性。

04:00
arXiv cs.AI

基于运动基元几何组装的稀疏组合流匹配

提出直接组合运动基元的稀疏流匹配,精度SOTA,FDE/ADE比从1.8降至1.07,ADE及FDE分别提升19.2%、21.0%

04:00
arXiv cs.AI

AI保障:企业AI系统的全面测试策略

企业AI系统测试应聚焦持续风险降低,将评估作为核心工程,通过故障分类和保障金字塔实现可操作战略。

04:00
arXiv cs.AI

从稀疏横截面快照中学习个体动态

CADENCE框架利用稀疏横截面快照恢复个体连续动态轨迹,性能媲美密集全轨迹模型。

04:00
arXiv cs.AI

VACE:学习几何结构化的时间序列异常检测表示

VACE自监督方法通过速度一致性学习紧凑方向一致的嵌入,结合位置与方向分数,在时间序列异常检测中达到SOTA。

04:00
arXiv cs.AI

DrawVideo:基于故事板关键帧草图生成长视频

DrawVideo以草图引导故事板分解长视频,层次化生成结构可控、外观一致的长视频。

04:00
arXiv cs.AI

Precise: 面向流匹配模型强化学习后训练的SDE一致随机采样方法

Precise通过SDE一致性平衡探索与稳定,加速流匹配模型RL训练并提升对齐分数,减少训练时间13%-53%。

04:00
arXiv cs.AI

重点是人的因素,而非数据:大语言模型中的地缘政治偏见源于后训练阶段,并因提示语言而放大

大语言模型地缘政治偏见源于后训练而非预训练,受开发者背景和提示语言影响显著。

04:00
arXiv cs.AI

时间概念漂移下的对抗漏洞:安卓恶意软件检测纵向研究

多年纵向研究显示,时间漂移显著降低安卓恶意软件检测的对抗鲁棒性,再训练可部分缓解但未消除。

04:00
arXiv cs.AI

通过噪声学习:潜意识学习为何有效及何时失效

潜意识学习依赖于兼容输出头而非初始化;兼容辅助头可转移教师信号,甚至达到教师级性能,并推导出失败上界。

04:00
arXiv cs.AI

Any2Any:面向人形机器人全身追踪的高效跨本体迁移

Any2Any实现预训练全身追踪模型跨本体迁移,仅用1%数据与计算完成运动学对齐与动力学微调,性能媲美从头训练。

04:00
arXiv cs.AI

MedSAE:用稀疏自编码器剖析MedCLIP表示

提出MedSAE评估框架,实验表明其神经元比原始MedCLIP特征更具单义性和可解释性,促进临床可靠表示。

04:00
arXiv cs.AI

知识图谱上带有软实体约束的交互式查询回答

提出两种轻量方法融入软约束,调整查询答案分数,保持性能,实现交互式偏好指定。

04:00
arXiv cs.AI

尺度感知适配器:面向结构基础的大语言模型推理

提出Cuttlefish多模态LLM,通过尺度感知分块和几何适配器自适应缩放结构令牌,减少幻觉,性能领先。

04:00
arXiv cs.AI

情节中的既视感:利用检索增强大语言模型跨会话证据进行直播风险评估

提出CS-VAR,利用检索增强LLM跨会话证据,小模型高效实时检测直播风险。

04:00
arXiv cs.AI

TCAP:面向MLLM微调中无监督后门检测的三分量注意力剖析

提出TCAP无监督框架,利用三分量注意力分配差异检测后门,有效过滤MLLM微调中的中毒样本。

04:00
arXiv cs.AI

VGAS:面向少样本视觉-语言-动作适应的价值引导动作块选择

VGAS框架通过价值引导的动作块选择,解决少样本适应中的几何歧义,提升成功率和鲁棒性。

2026年5月23日
04:00
arXiv cs.AI

利用不可能类别成员探究概念对齐

通过不合理类别成员测试,发现AI概念边界与人类存在显著差异,影响安全。

04:00
arXiv cs.AI

SMDD基准测试:大语言模型能否解决真实世界的小分子药物设计任务?

SMDD-Bench评估LLM在真实小分子药物设计中的表现,最先进模型仅解决40.2%任务,远未实现完全自动化。

04:00
arXiv cs.AI

AI使用与信息量对逻辑推理技能发展的影响

AI使用越多,技能发展越弱;高信息量AI提升短期表现且不损害长期,低信息量AI削弱学习。

04:00
arXiv cs.AI

中文标题

将拒绝抑制重新定义为潜在空间逃避攻击,提出受控投影突破决策边界,实现最高攻击成功率。

04:00
arXiv cs.AI

AttuneBench:基于对话的LLM情商基准

基于200组真实多轮对话评估LLM情商,发现情感能力可分解,偏好对齐比情绪识别更区分模型。

04:00
arXiv cs.AI

评估与改进大语言模型中分布外对齐失败的监控器

提出MOOD基准测试,结合防护模型与OOD检测器,将召回率从39%提升至45%,表明OOD检测是关键。

04:00
arXiv cs.AI

TO-Agents: 一种用于偏好引导拓扑优化的多智能体AI流水线

多智能体框架将自然语言意图转化为迭代拓扑优化,通过视觉语言评判生成符合偏好的结构,提升设计效率。

04:00
arXiv cs.AI

ECPO:面向证据认证候选排序的证据耦合策略优化

提出ECPO方法联合优化排序与证据证书,通过耦合奖励提升决策证据耦合性。

04:00
arXiv cs.AI

来自群体偏好的隐式安全对齐

提出从群体偏好提取安全技能的框架,无需显式安全奖励即可降低安全成本、保持任务性能。

04:00
arXiv cs.AI

面向AI可视化联合科学家:一种解决复杂数据可视化任务的通用端到端代理框架

提出端到端代理框架,仅凭数据与任务描述自动设计可视化应用,实现AI协同科学分析。

04:00
arXiv cs.AI

FLUID:从临时ID到多模态语义编码的工业级直播推荐

FLUID框架用多模态语义编码取代ID,解决直播推荐冷启动问题,大规模工业部署中显著提升效果。

04:00
arXiv cs.AI

格式-约束耦合在统计表格知识图谱构建中的研究

格式与约束超加性耦合致知识图谱保真度下降,不匹配触发灾难性覆盖缺失。