中文标题:当正确执行仍导致规划失败:论基于LLM的多智能体系统的认知校准
中文摘要:解决LLM多智能体系统因认知失调导致的规划失败,提出EPC-AW方法,通过信息一致性校准提升成功率9.75%。
CP还是DP?为何不两者兼得:以部分车间调度问题为例
本文结合动态规划与约束规划,以DP为主框架、CP子程序利用全局传播,解决部分车间调度问题,展示混合集成可行性。
Co-ReAct:将评分准则作为ReAct智能体的步骤级协作工具
Co-ReAct通过步骤级评分准则指导推理决策,优化秩相关奖励,显著提升搜索推理任务性能。
MemAudit:通过因果归因和结构异常检测对中毒智能体记忆进行事后审计
MemAudit通过因果归因与异常检测审计中毒记忆,将攻击成功率降至0%。
Agentic Proving for Program Verification
单一策略,无限NPC:面向可扩展游戏智能体的个性可追踪共享强化学习策略
提出PCSP共享策略,基于冻结LLM嵌入实现可扩展实时个性NPC控制,零样本识别超随机17倍,推理快22倍。
超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑
提出LAR和RCSL,通过对抗子空间对齐增强多模态知识编辑的泛化鲁棒性。
SkillOpt:自我进化智能体技能的执行策略
SkillOpt是首个系统可控的文本空间优化器,通过有界编辑进化技能,52项评估均最佳,大幅提升准确率。
LFRAG: 面向布局的多模态文档理解中的细粒度检索增强生成
提出块级检索与语义布局融合,实现精确对齐,文档问答准确率提升7.2%,令牌消耗减少73.07%。
联盟内的战略胁迫:作为AI压力测试的格陵兰主权博弈
以格陵兰主权危机为压力测试,模拟8个前沿LLM在联盟内博弈,发现胁迫框架加剧升级,中西模型权力权重迥异,和平收购仅1.9%。
依规分期:基于评分规则的自动睡眠阶段分类
提出透明、基于规则的AASM睡眠分期方法,提供自然语言解释,虽准确率低于深度学习,但可互补用于审计与治理。
ObjectCache:分层对象存储检索实现KV缓存重用
提出ObjectCache,将KV缓存存于S3对象存储,通过分层检索与调度优化,64K上下文仅增5.6%延迟,显著降低集群成本。
PilotWiMAE:导频原生的无线信道表示学习
PilotWiMAE自监督框架直接处理含噪导频,因子化注意力利用信道分离结构,跨频域性能优于监督基线。
Agentic-VLA:视觉-语言-动作模型的高效在线自适应
提出Agentic-VLA框架,通过自适应奖励、语言引导探索和经验记忆实现高效在线适应,在LIBERO上长时任务提升12.3%,1-shot提升28.5%,收敛快2.4倍。
LLM生成代码的安全性:一项比较分析
评估7种主流LLM生成的代码,均含严重或高危漏洞,安全性堪忧。
哲学倾向作为AI辅助代码审查的行为约束:一项实证研究
通过哲学倾向约束AI代码审查行为,实现46%与人类一致,75%独特发现且零假阳性,51%发现为通用模型所无。
合成脑部MRI能否可靠改进肿瘤分类?基于BRISC 2025的StyleGAN2-ADA类平面增强研究
合成MRI增益依赖架构与比例,仅对MobileViTV2有微小提升,视觉保真度不保证效果。
在学术环境中定义AI疲劳:维度、指标及基于扎根理论的分阶段模型
基于扎根理论分析1054名学生,提出AI疲劳五维度及阶段模型,揭示学术中AI使用的累积压力。
基于强化学习的变分量子算法经典态制备
CRiSP框架利用强化学习生成Clifford初始态,提升变分量子算法优化效率,在QAOA上平均能量精度提升3.17倍。
生成式人工智能与劳动力需求的重组
生成式AI通过招聘重分配(52%)和任务重新设计(39.5%)调整劳动力需求,且高级与初级岗位调整方式不同。
PoisonForge:指令微调大语言模型的任务级定向投毒基准
PoisonForge基准评估任务级投毒:1%预算下11/12模型攻击成功率超70%,主因是投毒设计而非模型规模。
前沿LLM是否已为网络安全做好准备?——来自双模式漏洞基准对垂直基础模型的证据
前沿LLM在网络安全中误报率高(10-50%)、覆盖率低(4-8%),领域专用模型通过结构化方法显著提升性能,论证了构建垂直基础模型的必要性。
基于运动基元几何组装的稀疏组合流匹配
提出直接组合运动基元的稀疏流匹配,精度SOTA,FDE/ADE比从1.8降至1.07,ADE及FDE分别提升19.2%、21.0%
AI保障:企业AI系统的全面测试策略
企业AI系统测试应聚焦持续风险降低,将评估作为核心工程,通过故障分类和保障金字塔实现可操作战略。
从稀疏横截面快照中学习个体动态
CADENCE框架利用稀疏横截面快照恢复个体连续动态轨迹,性能媲美密集全轨迹模型。
VACE:学习几何结构化的时间序列异常检测表示
VACE自监督方法通过速度一致性学习紧凑方向一致的嵌入,结合位置与方向分数,在时间序列异常检测中达到SOTA。
DrawVideo:基于故事板关键帧草图生成长视频
DrawVideo以草图引导故事板分解长视频,层次化生成结构可控、外观一致的长视频。
Precise: 面向流匹配模型强化学习后训练的SDE一致随机采样方法
Precise通过SDE一致性平衡探索与稳定,加速流匹配模型RL训练并提升对齐分数,减少训练时间13%-53%。
重点是人的因素,而非数据:大语言模型中的地缘政治偏见源于后训练阶段,并因提示语言而放大
大语言模型地缘政治偏见源于后训练而非预训练,受开发者背景和提示语言影响显著。
时间概念漂移下的对抗漏洞:安卓恶意软件检测纵向研究
多年纵向研究显示,时间漂移显著降低安卓恶意软件检测的对抗鲁棒性,再训练可部分缓解但未消除。
通过噪声学习:潜意识学习为何有效及何时失效
潜意识学习依赖于兼容输出头而非初始化;兼容辅助头可转移教师信号,甚至达到教师级性能,并推导出失败上界。
Any2Any:面向人形机器人全身追踪的高效跨本体迁移
Any2Any实现预训练全身追踪模型跨本体迁移,仅用1%数据与计算完成运动学对齐与动力学微调,性能媲美从头训练。
MedSAE:用稀疏自编码器剖析MedCLIP表示
提出MedSAE评估框架,实验表明其神经元比原始MedCLIP特征更具单义性和可解释性,促进临床可靠表示。
知识图谱上带有软实体约束的交互式查询回答
提出两种轻量方法融入软约束,调整查询答案分数,保持性能,实现交互式偏好指定。
尺度感知适配器:面向结构基础的大语言模型推理
提出Cuttlefish多模态LLM,通过尺度感知分块和几何适配器自适应缩放结构令牌,减少幻觉,性能领先。
情节中的既视感:利用检索增强大语言模型跨会话证据进行直播风险评估
提出CS-VAR,利用检索增强LLM跨会话证据,小模型高效实时检测直播风险。
TCAP:面向MLLM微调中无监督后门检测的三分量注意力剖析
提出TCAP无监督框架,利用三分量注意力分配差异检测后门,有效过滤MLLM微调中的中毒样本。
VGAS:面向少样本视觉-语言-动作适应的价值引导动作块选择
VGAS框架通过价值引导的动作块选择,解决少样本适应中的几何歧义,提升成功率和鲁棒性。
利用不可能类别成员探究概念对齐
通过不合理类别成员测试,发现AI概念边界与人类存在显著差异,影响安全。
SMDD基准测试:大语言模型能否解决真实世界的小分子药物设计任务?
SMDD-Bench评估LLM在真实小分子药物设计中的表现,最先进模型仅解决40.2%任务,远未实现完全自动化。
AI使用与信息量对逻辑推理技能发展的影响
AI使用越多,技能发展越弱;高信息量AI提升短期表现且不损害长期,低信息量AI削弱学习。
中文标题
将拒绝抑制重新定义为潜在空间逃避攻击,提出受控投影突破决策边界,实现最高攻击成功率。
AttuneBench:基于对话的LLM情商基准
基于200组真实多轮对话评估LLM情商,发现情感能力可分解,偏好对齐比情绪识别更区分模型。
评估与改进大语言模型中分布外对齐失败的监控器
提出MOOD基准测试,结合防护模型与OOD检测器,将召回率从39%提升至45%,表明OOD检测是关键。
TO-Agents: 一种用于偏好引导拓扑优化的多智能体AI流水线
多智能体框架将自然语言意图转化为迭代拓扑优化,通过视觉语言评判生成符合偏好的结构,提升设计效率。
ECPO:面向证据认证候选排序的证据耦合策略优化
提出ECPO方法联合优化排序与证据证书,通过耦合奖励提升决策证据耦合性。
来自群体偏好的隐式安全对齐
提出从群体偏好提取安全技能的框架,无需显式安全奖励即可降低安全成本、保持任务性能。
面向AI可视化联合科学家:一种解决复杂数据可视化任务的通用端到端代理框架
提出端到端代理框架,仅凭数据与任务描述自动设计可视化应用,实现AI协同科学分析。
FLUID:从临时ID到多模态语义编码的工业级直播推荐
FLUID框架用多模态语义编码取代ID,解决直播推荐冷启动问题,大规模工业部署中显著提升效果。
格式-约束耦合在统计表格知识图谱构建中的研究
格式与约束超加性耦合致知识图谱保真度下降,不匹配触发灾难性覆盖缺失。