6012 条条目 · 106 个活跃源
2026年6月2日
04:00
ArXiv AI

证书引导的强化学习泛化评估

提出证书引导的RL泛化评估框架,用神经证书函数验证轨迹,违规率低则任务成功率高。

04:00
ArXiv AI

面向规约的强化学习中可扩展归纳泛化的解耦行为克隆

DIBS解耦行为克隆,分离任务策略与演化函数学习,提升RL归纳泛化训练稳定性和零样本泛化。

04:00
ArXiv AI

Ryze:面向生物医学论文的证据增强数据合成

Ryze自动从生物医学论文合成含证据的QA对,训练出BioVLM-8B(成本<200美元),准确率48.0%,超越GPT-5.2。

04:00
ArXiv AI

对抗性信息流引导LLM代理背离默认决策

对抗性信息流可诱导LLM代理背离默认决策,但无法动摇其固有偏好,强调需审计信息流层。

04:00
ArXiv AI

AnyEdit++:基于贝叶斯惊讶的自适应长文本知识编辑

AnyEdit++利用贝叶斯惊讶自适应分割语义边界,提升长文本知识编辑的一致性与控制力。

04:00
ArXiv AI

潜意识学习就是引导向量蒸馏

潜意识学习通过引导向量介导,学生微调时学习对齐向量,本质是引导向量蒸馏的特例。

04:00
ArXiv AI

大语言模型在交通系统管理与运营中的应用:从文本推理到多模态决策支持

综述大语言模型在多模态交通系统管理中的应用,涵盖运营、服务与决策支持,指出挑战与未来方向。

04:00
ArXiv AI

堆叠双层材料的性质预测:一种多模态学习方法

提出多模态学习方法,预测垂直堆叠双层材料新性质,实验有效。

04:00
ArXiv AI

MindClaw:面向精准干预的闭环具身心智状态推理

提出MindClaw闭环具身心智推理框架,实现精准干预,通过触发技能优化在适时行动与静默间平衡,优于VLM基线。

04:00
ArXiv AI

"技能问题":以数据为中心的湖仓一体代理优化

通过分支湖仓将代理评估转为状态验证,数据驱动优化技能使准确率提升31.9%。

04:00
ArXiv AI

SkillRevise:通过轨迹条件技能修订改进LLM生成的智能体技能

SkillRevise框架通过执行证据诊断缺陷并迭代编辑,将技能成功率从36.05%提升至61.63%,且具有跨模型迁移性。

04:00
ArXiv AI

ANDES:面向自主指令对齐的原生智能体数据进化合成工具

Andes框架使智能体自主合成高质量训练数据,在PostTrainBench上达到最优并实现跨任务泛化。

04:00
ArXiv AI

HomeFlow:面向智能家居智能体训练的可验证数据飞轮

HomeFlow通过可验证数据飞轮生成训练数据,8B模型在智能家居任务中达到87.03%成功率,超越GPT-5.5。

04:00
ArXiv AI

Brain-Atlas-Guided Generative Counterfactual Attention for Explainable Cognitive Decline Diagnosis Using Multimodal Connectomes

04:00
ArXiv AI

在局部比较上训练的Transformer中涌现的序数几何

仅训练相邻比较,Transformer自动学习一维序数表示,决策置信度随排序距离单调增加,模拟符号距离效应。

04:00
ArXiv AI

LLM代理能否维持长期组织动态?

TaskWeave框架以记忆为中心协调,使LLM代理在长期组织模拟中保持连贯动态。

04:00
ArXiv AI

SkillSmith:技能与工具的协同进化——面向自我改进的智能体系统

SkillSmith通过技能与工具协同进化、生态模型及反模式记录,显著提升复杂多任务性能。

04:00
ArXiv AI

GovAI-Pipe:面向土耳其电子政务面向公民AI的分层治理管道

提出四层AI治理管道,涵盖预部署到事后,应用于土耳其电子政务高风险用例,确保合规与审计。

04:00
ArXiv AI

自愈型自主编排器用于可靠的工具增强型大语言模型系统

自愈编排器通过故障感知、预算恢复与验证,在故障注入测试中实现98.8%成功率,消除静默失败。

04:00
ArXiv AI

基于新颖性信号的智能体记忆与探索联合学习

提出JAMEL框架,利用新颖性信号联合训练记忆与探索,实现高效探索并降低计算成本。

04:00
ArXiv AI

通过压力感知的联合邻域优化重新审视知识编辑中的涟漪效应

提出JNO框架联合优化编辑传播与保持,在RippleEdits上提升超7%。

04:00
ArXiv AI

RoleCDE:角色扮演智能体中角色-对齐权衡的基准测试与缓解

提出RoleCDE基准,评估角色-对齐价值冲突,发现角色价值解耦现象,通过微调缓解。

04:00
ArXiv AI

S-SPPO:语义校准的自我博弈偏好优化

针对SPPO因语义相似导致策略退化,提出双空间语义校准框架,保持纳什均衡,提升对齐性能。

04:00
ArXiv AI

TRON:目标导向的规则可验证在线环境用于视觉推理强化学习

TRON提出在线环境,通过可控生成程序产出无限可验证实例,含520个环境,显著提升多种视觉推理模型性能。

04:00
ArXiv AI

ReSkill:在智能体强化学习中协调技能创建与策略优化

ReSkill利用GRPO组结构嵌入三种机制,实现技能与策略协同进化,显著提升泛化能力。

04:00
ArXiv AI

EvoBrain:面向异构BCI任务的EEG基础模型持续学习

EvoBrain通过任务归一化与蒸馏机制,平衡可塑性与稳定性,在异构BCI任务上实现统一持续学习。

04:00
ArXiv AI

用于因果发现的基准一致性评估

首次系统评估因果发现基准图质量,自动检索论文并用LLM检查一致性,发现各基准与领域研究一致性差异显著。

04:00
ArXiv AI

面向蛋白质-蛋白质相互作用位点预测的结构引导自适应传播

提出SGAP-PPIS模型,利用等变图网络几何状态生成自适应传播系数,实现残基级信息扩散平衡,显著提升PPIS预测性能。

2026年6月1日
04:00
ArXiv AI

MAVEN:提升智能体工具调用的泛化能力

MAVEN是一种轻量级符号推理框架,通过结构化分解与中间验证,将模型准确率从48%提升至71%,成本仅为1/10。

04:00
ArXiv AI

PhyDrawGen:基于物理的自然语言图表生成

神经符号管道分离语义与物理约束,生成高精度物理图表,显著优于GPT-5等模型。

04:00
ArXiv AI

物理可行的世界模型:论查询条件化的具身AI

具身AI需构建物理可行的世界模型,通过辨识最简物理抽象回答干预查询,避免误判行为。

04:00
ArXiv AI

使用MAP-Elites程序化生成第一人称射击地图

应用MAP-Elites算法及新表示法生成FPS地图,有效提升其多样性和质量。

04:00
ArXiv AI

面向SAT求解的因子化任务变换与编码:何者有益,何者有害(扩展版)

提出多种因子化任务SAT编码策略,分析并行性利用及任务变换对SAT规划器性能的影响。

04:00
ArXiv AI

战略提供商响应下的政策即代码搜索中的医疗机制

通过多智能体模拟与LLM进化搜索,合成混合目标程序,消除编码升级、减少拒绝并保持利润基线资金。

04:00
ArXiv AI

SLAT:面向高效思维链推理的段级自适应修剪

SLAT框架通过段级自适应修剪冗余段,降低50%推理长度并保持准确率。

04:00
ArXiv AI

蒸馏大语言模型反馈用于Lean定理证明

提出反馈蒸馏法,在token级匹配LLM特权反馈,用于Lean4定理证明,保持多样性,与GRPO互补,提升后训练效果。

04:00
ArXiv AI

面向长周期任务的智能体兼容上下文管理

提出AdaCoM,用外部LLM和强化学习管理冻结智能体上下文,提升长周期任务性能,发现保真度-可靠性权衡。

04:00
ArXiv AI

通过扩散模型生成图状规则用于知识图谱推理

提出GRiD框架,将图状规则发现转为离散生成,两阶段训练(预训练+强化学习)提升知识图谱补全效果。

04:00
ArXiv AI

BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动态基准测试

提出台球物理基准,测试碰撞、反弹和最终位置;发现大模型随模拟复杂性下降易预测无交互(静态偏差)。

04:00
ArXiv AI

PReMISE:将策略评分标准作为大语言模型评审的测量规范

PReMISE框架从人类偏好数据中发现并审计评分标准,显著提升评审准确性与鲁棒性,是唯一同时满足多维度要求的方案。

04:00
ArXiv AI

形式化与证伪罕见事件的因果路径

提出罕见事件因果路径的形式定义与可检验含义,引入因果抽象桥接解释与模型。

04:00
ArXiv AI

通过跨模型局部等距一致性的向量链接

利用局部几何一致性,从种子锚点哈希恢复跨模型向量对应,实现准确鲁棒链接。

04:00
ArXiv AI

资源受限视觉代理中共享状态协作的故障模式诊断

弱学习者协作推理中,共享工作空间会放大幻觉,瓶颈在于通信保真度而非推理深度。

04:00
ArXiv AI

中文标题:利用非结构化数据增强体制转换检测:基于国债市场的研究

中文摘要:结合LLM与统计检验的体制转换检测框架,在国债市场实现F1=0.82,优于纯数据驱动方法。

04:00
ArXiv AI

TRINE:一种面向多模态AI的令牌感知、运行时自适应FPGA推理引擎

TRINE是单比特流FPGA加速器,无需重配置执行多模态推理,通过模式切换和依赖感知卸载,20-21W功耗下延迟降低22.57倍。

04:00
ArXiv AI

结构化交互在实际多机器人系统中超越模型扩展提升分布式协调

固定预算下,交互结构(模块层次化)比扩大模型尺寸带来更显著性能提升(47分 vs 9分)。

04:00
ArXiv AI

人工智能失控事件管理:响应与恢复力

提出AI失控事件管理框架,区分不可控与可控场景,针对意外与对抗性失控制定分级响应指南。

04:00
ArXiv AI

基于多重网格分层学习的工程尺度三维飞机全场预测

提出MHLF框架,实现工程尺度三维飞机全场流场预测,加速收敛3-8倍且保持精度。

04:00
ArXiv AI

Evolutionary Algorithm for Reservoir Learning and Yielding

04:00
ArXiv AI

机器中的社会推理:探究大型语言模型辩论中的集体求真动态

通过多智能体辩论验证论辩推理理论,集体求真优于个体,并提出模型内在属性评测新方法。