证书引导的强化学习泛化评估
提出证书引导的RL泛化评估框架,用神经证书函数验证轨迹,违规率低则任务成功率高。
面向规约的强化学习中可扩展归纳泛化的解耦行为克隆
DIBS解耦行为克隆,分离任务策略与演化函数学习,提升RL归纳泛化训练稳定性和零样本泛化。
Ryze:面向生物医学论文的证据增强数据合成
Ryze自动从生物医学论文合成含证据的QA对,训练出BioVLM-8B(成本<200美元),准确率48.0%,超越GPT-5.2。
对抗性信息流引导LLM代理背离默认决策
对抗性信息流可诱导LLM代理背离默认决策,但无法动摇其固有偏好,强调需审计信息流层。
AnyEdit++:基于贝叶斯惊讶的自适应长文本知识编辑
AnyEdit++利用贝叶斯惊讶自适应分割语义边界,提升长文本知识编辑的一致性与控制力。
潜意识学习就是引导向量蒸馏
潜意识学习通过引导向量介导,学生微调时学习对齐向量,本质是引导向量蒸馏的特例。
大语言模型在交通系统管理与运营中的应用:从文本推理到多模态决策支持
综述大语言模型在多模态交通系统管理中的应用,涵盖运营、服务与决策支持,指出挑战与未来方向。
堆叠双层材料的性质预测:一种多模态学习方法
提出多模态学习方法,预测垂直堆叠双层材料新性质,实验有效。
MindClaw:面向精准干预的闭环具身心智状态推理
提出MindClaw闭环具身心智推理框架,实现精准干预,通过触发技能优化在适时行动与静默间平衡,优于VLM基线。
"技能问题":以数据为中心的湖仓一体代理优化
通过分支湖仓将代理评估转为状态验证,数据驱动优化技能使准确率提升31.9%。
SkillRevise:通过轨迹条件技能修订改进LLM生成的智能体技能
SkillRevise框架通过执行证据诊断缺陷并迭代编辑,将技能成功率从36.05%提升至61.63%,且具有跨模型迁移性。
ANDES:面向自主指令对齐的原生智能体数据进化合成工具
Andes框架使智能体自主合成高质量训练数据,在PostTrainBench上达到最优并实现跨任务泛化。
HomeFlow:面向智能家居智能体训练的可验证数据飞轮
HomeFlow通过可验证数据飞轮生成训练数据,8B模型在智能家居任务中达到87.03%成功率,超越GPT-5.5。
Brain-Atlas-Guided Generative Counterfactual Attention for Explainable Cognitive Decline Diagnosis Using Multimodal Connectomes
在局部比较上训练的Transformer中涌现的序数几何
仅训练相邻比较,Transformer自动学习一维序数表示,决策置信度随排序距离单调增加,模拟符号距离效应。
LLM代理能否维持长期组织动态?
TaskWeave框架以记忆为中心协调,使LLM代理在长期组织模拟中保持连贯动态。
SkillSmith:技能与工具的协同进化——面向自我改进的智能体系统
SkillSmith通过技能与工具协同进化、生态模型及反模式记录,显著提升复杂多任务性能。
GovAI-Pipe:面向土耳其电子政务面向公民AI的分层治理管道
提出四层AI治理管道,涵盖预部署到事后,应用于土耳其电子政务高风险用例,确保合规与审计。
自愈型自主编排器用于可靠的工具增强型大语言模型系统
自愈编排器通过故障感知、预算恢复与验证,在故障注入测试中实现98.8%成功率,消除静默失败。
基于新颖性信号的智能体记忆与探索联合学习
提出JAMEL框架,利用新颖性信号联合训练记忆与探索,实现高效探索并降低计算成本。
通过压力感知的联合邻域优化重新审视知识编辑中的涟漪效应
提出JNO框架联合优化编辑传播与保持,在RippleEdits上提升超7%。
RoleCDE:角色扮演智能体中角色-对齐权衡的基准测试与缓解
提出RoleCDE基准,评估角色-对齐价值冲突,发现角色价值解耦现象,通过微调缓解。
S-SPPO:语义校准的自我博弈偏好优化
针对SPPO因语义相似导致策略退化,提出双空间语义校准框架,保持纳什均衡,提升对齐性能。
TRON:目标导向的规则可验证在线环境用于视觉推理强化学习
TRON提出在线环境,通过可控生成程序产出无限可验证实例,含520个环境,显著提升多种视觉推理模型性能。
ReSkill:在智能体强化学习中协调技能创建与策略优化
ReSkill利用GRPO组结构嵌入三种机制,实现技能与策略协同进化,显著提升泛化能力。
EvoBrain:面向异构BCI任务的EEG基础模型持续学习
EvoBrain通过任务归一化与蒸馏机制,平衡可塑性与稳定性,在异构BCI任务上实现统一持续学习。
用于因果发现的基准一致性评估
首次系统评估因果发现基准图质量,自动检索论文并用LLM检查一致性,发现各基准与领域研究一致性差异显著。
面向蛋白质-蛋白质相互作用位点预测的结构引导自适应传播
提出SGAP-PPIS模型,利用等变图网络几何状态生成自适应传播系数,实现残基级信息扩散平衡,显著提升PPIS预测性能。
MAVEN:提升智能体工具调用的泛化能力
MAVEN是一种轻量级符号推理框架,通过结构化分解与中间验证,将模型准确率从48%提升至71%,成本仅为1/10。
PhyDrawGen:基于物理的自然语言图表生成
神经符号管道分离语义与物理约束,生成高精度物理图表,显著优于GPT-5等模型。
物理可行的世界模型:论查询条件化的具身AI
具身AI需构建物理可行的世界模型,通过辨识最简物理抽象回答干预查询,避免误判行为。
使用MAP-Elites程序化生成第一人称射击地图
应用MAP-Elites算法及新表示法生成FPS地图,有效提升其多样性和质量。
面向SAT求解的因子化任务变换与编码:何者有益,何者有害(扩展版)
提出多种因子化任务SAT编码策略,分析并行性利用及任务变换对SAT规划器性能的影响。
战略提供商响应下的政策即代码搜索中的医疗机制
通过多智能体模拟与LLM进化搜索,合成混合目标程序,消除编码升级、减少拒绝并保持利润基线资金。
SLAT:面向高效思维链推理的段级自适应修剪
SLAT框架通过段级自适应修剪冗余段,降低50%推理长度并保持准确率。
蒸馏大语言模型反馈用于Lean定理证明
提出反馈蒸馏法,在token级匹配LLM特权反馈,用于Lean4定理证明,保持多样性,与GRPO互补,提升后训练效果。
面向长周期任务的智能体兼容上下文管理
提出AdaCoM,用外部LLM和强化学习管理冻结智能体上下文,提升长周期任务性能,发现保真度-可靠性权衡。
通过扩散模型生成图状规则用于知识图谱推理
提出GRiD框架,将图状规则发现转为离散生成,两阶段训练(预训练+强化学习)提升知识图谱补全效果。
BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动态基准测试
提出台球物理基准,测试碰撞、反弹和最终位置;发现大模型随模拟复杂性下降易预测无交互(静态偏差)。
PReMISE:将策略评分标准作为大语言模型评审的测量规范
PReMISE框架从人类偏好数据中发现并审计评分标准,显著提升评审准确性与鲁棒性,是唯一同时满足多维度要求的方案。
形式化与证伪罕见事件的因果路径
提出罕见事件因果路径的形式定义与可检验含义,引入因果抽象桥接解释与模型。
通过跨模型局部等距一致性的向量链接
利用局部几何一致性,从种子锚点哈希恢复跨模型向量对应,实现准确鲁棒链接。
资源受限视觉代理中共享状态协作的故障模式诊断
弱学习者协作推理中,共享工作空间会放大幻觉,瓶颈在于通信保真度而非推理深度。
中文标题:利用非结构化数据增强体制转换检测:基于国债市场的研究
中文摘要:结合LLM与统计检验的体制转换检测框架,在国债市场实现F1=0.82,优于纯数据驱动方法。
TRINE:一种面向多模态AI的令牌感知、运行时自适应FPGA推理引擎
TRINE是单比特流FPGA加速器,无需重配置执行多模态推理,通过模式切换和依赖感知卸载,20-21W功耗下延迟降低22.57倍。
结构化交互在实际多机器人系统中超越模型扩展提升分布式协调
固定预算下,交互结构(模块层次化)比扩大模型尺寸带来更显著性能提升(47分 vs 9分)。
人工智能失控事件管理:响应与恢复力
提出AI失控事件管理框架,区分不可控与可控场景,针对意外与对抗性失控制定分级响应指南。
基于多重网格分层学习的工程尺度三维飞机全场预测
提出MHLF框架,实现工程尺度三维飞机全场流场预测,加速收敛3-8倍且保持精度。
Evolutionary Algorithm for Reservoir Learning and Yielding
机器中的社会推理:探究大型语言模型辩论中的集体求真动态
通过多智能体辩论验证论辩推理理论,集体求真优于个体,并提出模型内在属性评测新方法。