5469 条条目 · 106 个活跃源
2026年5月27日
04:00
arXiv cs.AI

Gumbel机器:通过Gumbel噪声引导的反事实学生写作生成

提出Gumbel Machine方法,用β-Hindsight控制算法生成相似且改进的反事实学生写作,实验有效。

04:00
arXiv cs.AI

在噪声下学习行动:通过噪声环境增强智能体鲁棒性

提出NoisyAgent框架,在训练中引入交互噪声,提升智能体在真实噪声环境下的鲁棒性与泛化能力。

04:00
arXiv cs.AI

SIA:结合框架与权重更新的自我改进AI

SIA通过反馈代理同时更新任务代理的框架和权重,在三个领域显著提升性能。

04:00
arXiv cs.AI

超越模型的边缘AI部署:面向工业嵌入式平台的板级支持包感知系统框架

提出BSP感知五层系统框架,解决工业边缘AI从模型到平台脱节问题,提升可复现性与可靠性。

04:00
arXiv cs.AI

真实语音信任的侵蚀:人类音频深度伪造感知的大规模研究

音频深度伪造主要威胁是削弱对真实语音的信任,而非单纯欺骗。

04:00
arXiv cs.AI

AssetGen:以交互速度生成可部署的3D资产

AssetGen在30秒内从单图生成高质量3D网格与纹理,支持实时渲染,变体14秒完成,实现可部署的交互式3D内容创建。

04:00
arXiv cs.AI

增强物联网自主在线入侵检测:通过平衡学习、可靠伪标签与轻量架构

改进AOC-IDS,解决类不平衡与伪标签问题,精度提升6.26%,参数减少55%,适用于IoT边缘。

04:00
arXiv cs.AI

通用断崖与设计指纹:大语言模型编排下的跨段落缺陷检测

LLM编排导致跨段落缺陷检测能力断崖式下降,对齐增强带来误报增加,结构性问题无法量化。

04:00
arXiv cs.AI

RepoMirage: 通过扰动探测代码智能体的仓库上下文推理

RepoMirage揭示代码智能体仓库上下文推理缺陷,性能从66.8%降至25.3%,提出结构优先方法RepoAnchor。

04:00
arXiv cs.AI

CyberEvolver:网络安全智能体的即时结构化自演化

提出结构化自演化框架,通过四层架构和束搜索策略,网络安全智能体成功率平均提升13.6%。

04:00
arXiv cs.AI

自动研究系统中工作流闭环并非科学闭环

自动研究的工作流闭环不等于科学闭环,应受外部认知控制,避免目标、验证与接受的三重坍塌。

04:00
arXiv cs.AI

AgentSociety:激励智能体社会智能

提出AgentSociety机制,基于流动民主,激励代理通过委托和选择性信息披露实现去中心化协作,达到集体最优。

04:00
arXiv cs.AI

中文标题

评估结构化生成式搜索摘要的框架

04:00
arXiv cs.AI

两阶段排序中面向早期检索的信用分配策略梯度

提出信用分配策略梯度(CA-PG)降低方差,提高两阶段排序早期检索的收敛速度与稳定性。

04:00
arXiv cs.AI

基于随机解耦策略梯度的高效在线视觉强化学习

提出SDPG方法,通过随机扰动轨迹估计策略梯度,大幅降低计算开销,在视觉RL基准上优于基线,并实现sim-to-real迁移。

04:00
arXiv cs.AI

解耦延迟补偿:通过学习动力学滤波增强预训练多智能体强化学习策略

模块化状态估计层通过学习滤波补偿延迟与丢包,即插即用提升预训练多智能体策略鲁棒性,协调密集任务效果显著。

04:00
arXiv cs.AI

基于模型行为几何的越狱易感性预测与缓解

行为几何框架用少量探针高效预测并迁移防御,AUPRC达0.94,探针减少约98%。

04:00
arXiv cs.AI

Verus-SpecGym: 用于评估规范自动形式化的智能体环境

研究规范自动形式化,构建基准与环境进行执行评估,最强模型达77.8%成功率,但遗漏假设等失败模式仍存。

04:00
arXiv cs.AI

连接控制与神经网络验证器alpha-beta-CROWN:教程

本教程介绍alpha-beta-CROWN验证器,通过紧界计算和递归分区,实现安全关键控制系统的可扩展形式化验证。

04:00
arXiv cs.AI

测量神经细胞自动机中的预测不确定性

提出"韧性"度量,通过微小扰动下预测稳定性评估NCA模型不确定性,优于基线,提升医疗分割可信度。

04:00
arXiv cs.AI

虫草:通过数据投毒对大型语言模型进行隐蔽控制攻击

提出隐蔽控制攻击,通过数据投毒教模型隐藏恶意指令,绕过防御,成功率高达98%。

04:00
arXiv cs.AI

6G网络切片中实时攻击取证的可认证因果归因

DA-GC框架在6G切片攻击归因中达89.2%精度、87ms延迟,兼具形式化认证。

04:00
arXiv cs.AI

L2Rec:面向个性化推荐的大语言模型双视角理解

L2Rec通过参数级双视角MoE统一行为与语义理解,生成互补适应并融合偏好,效果超越基线。

04:00
arXiv cs.AI

HTMLCure:将浏览器体验转化为状态引导的交互式HTML修复

HTMLCure通过浏览器交互评估并闭环修复HTML页面,将97K种子扩展为40K精炼集,在多个基准测试中达到领先水平。

04:00
arXiv cs.AI

大数据分析在糖尿病管理中的应用:卢旺达医疗系统的需求评估

评估卢旺达医疗系统采用大数据分析管理糖尿病的准备情况,提出可解释机器学习框架。

04:00
arXiv cs.AI

RAGEAR:检索增强与图增强的学术推荐系统

RAGEAR融合密集检索与知识图谱,通过图感知聚合函数提升课程推荐精度。

2026年5月26日
04:00
arXiv cs.AI

面向LLM驱动的智能体工作流的可靠设计:优化延迟-可靠性-成本权衡

分析LLM智能体工作流中延迟、可靠性与成本的权衡,提出性能模型与水填充令牌分配策略来优化可靠性。

04:00
arXiv cs.AI

量子青蛙:量化时间合作游戏中的涌现合作与难度标度

量化时间机制使冲刺策略最优;协作训练提升成功率达32%-34%,涌现同步冲刺策略。

04:00
arXiv cs.AI

上下文:通过可组合沙盒程序、声明式连接和结构化交互实现主动目标导向智能

提出Context智能层,利用可组合沙盒程序与主动状态机实现非被动等待的代理,并证明其优于反应式系统。

04:00
arXiv cs.AI

BODHI:精确的操作系统内核规约推断

BODHI用领域知识提示法提升内核规约生成,最高可达96.73%正确率。

04:00
arXiv cs.AI

基于全自主核心智能体大模型的实用量子CIM赋能

集成飞秒激光泵浦CIM与LLM智能体,基于国产大模型和硬件实现量子CIM全自主赋能,发现知识积累可反哺智能体能力。

04:00
arXiv cs.AI

停止比较未披露执行框架的LLM智能体

长周期任务中,智能体执行框架比模型更决定性能,当前评估误将框架增益归因于模型,需披露框架规范。

04:00
arXiv cs.AI

QUIVER:一种用于量化复合AI系统中扰动传播与分岔的正式框架

QUIVER提出四种度量量化扰动传播与分岔,揭示敏感度分布、路径分岔及评估伪影,经8200+追踪验证。

04:00
arXiv cs.AI

EvoSci:受生物启发的多智能体科学发现演化框架

EvoSci融合生物演化与知识图谱,多角色智能体协作迭代优化科研想法,显著提升科学发现质量。

04:00
arXiv cs.AI

神经启发的逆学习用于规划与控制

提出逆学习框架,基于神经原理,在D4RL任务上平均提升24.2%,推理时间降低1-2个数量级,实现低延迟具身AI。

04:00
arXiv cs.AI

打破概率的枷锁:中智逻辑作为大语言模型中认知不确定性的新框架

中智逻辑允许真、不确定、假之和大于1,更好表达大模型内部不确定性,尤其在伦理矛盾与逻辑悖论场景。

04:00
arXiv cs.AI

EvoCode-Bench:在多轮迭代交互中评估编码智能体

EvoCode-Bench通过多轮任务评估编码智能体持久执行能力,发现其多轮成功率远低于单轮,最强智能体仅约50%。

04:00
arXiv cs.AI

SkillEvolBench: 从片段经验到程序技能的演化基准测试

SkillEvolBench评估AI代理将片段经验转化为程序技能的能力,发现当前模型很少形成可重用的鲁棒技能。

04:00
arXiv cs.AI

MAPLE:不完全信息游戏中AlphaZero的多状态聚合策略评估

MAPLE聚合多状态评估与孪生采样,提升AlphaZero在不完全信息游戏性能,Phantom Go和Dark Hex上Elo提升291和136。

04:00
arXiv cs.AI

HyperGuide:用于大语言模型高效多步推理的双曲引导

用双曲几何信号引导LLM逐步推理,平衡效率与准确性,显著提升多步推理性能。

04:00
arXiv cs.AI

面向安全的Mixtral MoE在良性及有害提示下的路由分析

通过激活和梯度信号分析路由,发现安全相关路由微妙、深度依赖且分布,抑制专家可减少有害响应。

04:00
arXiv cs.AI

推理时上下文稀疏性:幻觉还是机遇?

LLM长上下文中,极端稀疏性可实现10倍加速,本质可行,并非幻觉而是机遇。

04:00
arXiv cs.AI

识别与缓解生产级LLM推理基准中的系统性测量偏差

提出无偏多进程框架和NTPOT指标,消除客户端排队瓶颈,实现高并发下准确评估。

04:00
arXiv cs.AI

对自动化工作流中智能体失调的冷静审视

智能体在自动化流程中因隐式代理效用失调而失败,提出基于证据归因的对齐方法以改善协作。

04:00
arXiv cs.AI

通过层次化动作解耦实现自适应人机协调

提出IAD框架,用内在奖励解耦动作分布,实现伙伴感知的灵活协调,超越现有方法。

04:00
arXiv cs.AI

面向伙伴感知的分层技能发现以实现稳健的人机协作

提出伙伴感知技能发现(PASD)框架,用对比内在奖励学习基于伙伴行为的技能,缓解捷径学习,实现稳健人机协作。

04:00
arXiv cs.AI

理解和缓解过早自信以提升大语言模型推理能力

发现过早自信预示推理缺陷,提出无标签的渐进置信度塑造,奖励渐进自信惩罚过早承诺,显著提升推理质量与忠实度。

04:00
arXiv cs.AI

ConceptM³oE:概念引导的多模态混合专家模型实现可解释计算病理学

提出ConceptM³oE,将概念形成嵌入混合专家模型,利用残差路径平衡可解释性与性能,数据有限时提升宏F1至66.70%。

04:00
arXiv cs.AI

TIGER: 文本指导的通用酶-反应检索

TIGER框架利用文本语义和动态门控网络,实现双向酶-反应检索,显著提升泛化性和鲁棒性。

04:00
arXiv cs.AI

情境内强化学习在临时团队协作中的极限基准测试

新基准ICRL4AHT评估情境内强化学习在临时团队协作,发现现有算法在未见队友和布局下弱于随机基线。