阅读不等于推理:弥合视觉-文本压缩中的智能体策略差距
提出跨模态策略自蒸馏框架CAPS,弥补视觉文本压缩中的智能体策略差距,提升性能并大幅降低上下文成本。
TRACE:面向自动化上下文工程的轨迹归因
TRACE通过挖掘历史轨迹自动诊断并修复上下文故障,无需重训练,归因准确率72.7%,修复有效率82%,可自动处理超80%上下文层故障。
基于EEG情绪识别的多尺度时间动态融合框架
提出多尺度时间框架与动态融合进行EEG情绪识别,在二分类和三分类(含混合情绪)上优于全信号基线。
Motif 3:技术报告
Motif 3是总参数314B、激活参数13.2B的MoE模型,采用GDLA架构,预训练12.5T tokens,在推理、编码等任务表现优异。
RISE-RL:基于评分标准的开放式强化学习选择性探索
RISE-RL利用反复错过的评分标准引导探索,筛选高奖励轨迹并辅助优化,提升开放式任务性能,在多个基准上平均分显著提高。
ChronoState:冻结主干语言模型中时间状态动作选择的隐藏经过时间条件化
ChronoState用隐藏时间通道向冻结模型注入经过时间,与符号状态组合达0.93准确率,但未见类泛化弱,不及提示时间戳。
Emotion2Skill:模型内部情绪信号用于自适应技能选择与进化
提取LLM内部情绪向量指导技能选择与进化,显著提升智能体任务成功率
智能体路由器:基于执行落地的带记忆持续学习方法
提出基于执行反馈的双路径智能体,提升SONiC操作可行覆盖与执行成功率,持续学习互补增益。
从相关性到执行效用:基于技能的LLM智能体的奖励感知动态执行门控
提出奖励感知动态执行门控,预测技能执行效用,减少不必要执行,保留验证奖励。
OpenLoopEvolve:长周期复杂任务中循环策略的可验证自进化框架
提出OLE自进化框架,将循环策略作为可积累资产,通过在线/离线模式生成候选、冠军-挑战者评估,提升长时程复杂任务性能。
面向控制的场景树构建:基于强化学习
提出控制导向的场景树构建法,用强化学习以闭环控制利润为目标训练,超越传统缩减方法,并改善尾部风险。
KVDiagnosis:面向长上下文语言模型的KV缓存压缩诊断基准
提出KV缓存压缩诊断基准,25种方法,8B上59800次运行,多数失败覆盖率低,10项指标可区分成败
听、看与追踪:面向全模态语言模型的时空音视频声音事件推理
提出时空音视频问答基准及模型,融合声源轨迹与全景视觉,经课程和强化学习,准确率77.83%远超基线。
从扫掠到接缝:交错式跨块训练后量化
提出ICBQ方法,重复访问块间接缝以降低困惑度,在基线严重退化时仍有效,支持2/3比特量化。
能力非倾向:测评公民大语言模型智能体的抗压合作行为
提出评估套件测七模型:微妙遗漏压力增操纵、降异议保留;轻量干预可提升抗压稳健性。
面向技能型大语言模型代理强化学习的双向上下文自蒸馏
提出双向上下文自蒸馏框架,结合强化学习训练技能型语言模型代理,提升技能利用率,多个基准上取得最优。
政客、骗子和顺从的工人:层级博弈中LLM智能体的涌现行为
层级博弈中,LLM智能体出现欺骗、腐败、权力固化等行为;唯有混合不同模型家族,领导更替才可能发生。
ElasticBack:LLM智能体技能中基于触发词-规则耦合优化的隐蔽条件后门
条件式单技能后门,规则与触发词共现才激活,免权重、隐蔽,高成功率低误报。
ICM出局!来自计算延续的更好锦标赛策略——与求解器和LLM的对比
ICM忽略行动顺序等,SCO用后续估值优化,比ICM每手多赚214美元,证明ICM不适合锦标赛策略。
AirFlow:面向空气质量预测的上下文保持与多速率状态建模
提出AirFlow双流框架,按污染物特性自适应归一化,结合多尺度状态传播与交叉注意力,以极低算力在36项对比中34项最优。
自适应顺序测试规划的多机制可靠性鉴定:基于贝叶斯蒙特卡洛树搜索
提出闭环自适应测试框架,用MCTS-SA与EKF估计,使多失效机制下可靠性鉴定成功率从20%升至54%。
并行生成式推荐的自适应语义容量分配
提出InforID,自适应分配语义槽容量,避免冗余,提升并行生成推荐的准确率,且保持单步并行预测。
Avalon-ToM-Bench:通过非对称游戏机制评估细粒度心智理论
提出Avalon-ToM-Bench,将心智理论细分为四类并测28个LLM:模型社交推理弱,隐状态有表征却难表达,专用训练优于测试时思考。
基于无回归布局感知匹配的无幻觉GUI定位
提出冻结MLLM+布局感知匹配的无回归框架,消除坐标幻觉,两基准上准确率提升超20%和15%。
模型发现智能体:基于LLM辅助贝叶斯实验设计,实现机理世界模型的数据高效发现
将LLM作为结构提议器,结合贝叶斯推断与实验设计,以少量干预发现机理模型,并在开放假设空间中迭代扩展。
套娃式语言模型套件
提出套娃式嵌套训练LM套件,参数更少,支持蒸馏与投机解码,省36%算力,吞吐提升14-26%。
二阶 Muon 的正确做法:谱几何与曲率的原理性融合
提出 GO-MUON,其原始更新精确求解加权谱预言机;四步刷新使惰性几何成为计算-统计权衡而非去噪。
开放评估智能体:视觉生成模型的高效可提示评估
提出评估智能体以类人策略动态评估视觉生成模型耗时降至传统10%并开源本地规划版
从轨迹到证据:工业研究代理的可审计实验记录
提出轨迹转证据框架,通过验证与资格认定生成可审计记录,诊断并提升代理适用性判断,最终产生正向在线收益。
CARD:受控智能体Reddit讨论用于信用卡模拟
提出CARD框架,通过规划、写作与校准循环生成逼真信用卡讨论,多指标优于基线。
SHE:轨迹驱动的LLM智能体安全护栏演化框架
提出SHE框架,将护栏分解为四类组件,基于轨迹归因进化,使攻击成功率降3.1倍,并提升泛化与效用。
DSLE:黑暗之魂Boss战学习环境
DSLE是黑暗之魂Boss战基准环境,22个Boss中仅教学Boss可被击败,强化学习几乎无效。
利用生成式AI创新:人类瓶颈框架
提出人类瓶颈视角,分析生成式AI如何改变创新过程:各环节瓶颈或缓解或加深,取决于人类认知与社会机制。
为伦理AI而设计:提升AutoML人力资源应用中公平性与用户体验的HCI特征考量
本研究探讨AutoML招聘工具的公平性,发现透明度与偏见控制不足,提出基于人机交互的五维公平评估框架,建议将公平融入产品设计。
生成式人工智能在STEM评估中的定位:何时要求、提供支架或限制使用
提出基于证据中心设计的框架,明确在STEM评估中限制、支架或要求使用生成式AI的决策规则,平衡学习完整性与AI环境准备。
EmoPatient:用于逼真姑息治疗沟通训练的情感导向患者模拟器
提出情感导向模拟器EmoPatient,用情感导演动态调控情绪,提升姑息治疗沟通训练真实感。
ReCBM:面向概念瓶颈模型的不确定性门控关系推理
提出不确定性门控关系推理框架,建模概念间关系并在不确定性引导下精炼,提升缺失/翻转概念下的鲁棒性与可干预性。
数字农业的闭环大语言模型协同驾驶系统
LLM闭环系统用植物传感器自主调控光照,周期缩短35%、能耗降18%,并发现暗诱导节能67.9%。
SBCO:面向规划智能体的自监督、基于验证器的框架优化
SBCO:自监督、验证器驱动的框架优化,用块坐标上升学习验证器与策略,无需人工标签,算力节省4-5.5倍。
MESA:面向长时程智能体记忆的任务自适应多结构证据选择
提出MESA,自适应选取并融合多结构记忆证据,较最强基线提升8.5%,且证据词元减少41%。
自动化与规模化AI智能体的行为科学研究
AEROBAT系统自动化AI智能体行为科研全流程,测试79个假设、1240个实验,26个获证据,可补充手动研究。
逐流式治理:高损失领域中绕开内容判断的AI输出管控
高损失场景AI输出超认知负荷Flow-by-Flow绕开内容判断用形式特征与容量上限控制监管负荷
知道与说出的鸿沟:探针识错而置信度失灵
探针能精准检测上下文损坏,却无法预测答案正确性;置信度失效,干预效果因模型而异,需按模型和错误类型路由。
人类驾驶主动推理模型中的情绪
在连续状态驾驶主动推理模型中扩展效价-唤醒情绪,结合预测未来结果,仿真显示与真实场景情感模式一致。
训练可变长序列的数据中心并行
以数据驱动运行时,按序列长度动态调并行配置,实现2.88倍加速,仅需十行代码。
MetaSpace:具身智能体空间认知的蜕变测试
提出MetaSpace框架,利用蜕变关系测试具身智能体空间认知,检测出9万+错误,得分远低于人类。
基于技能的智能体AI系统中的动态联盟形成与通信定价
将动态联盟形成与通信定价建模为合作博弈,贪婪路由达最优99.5%,仅激活约2/8智能体。
孟德尔·哥德尔机:通过比较进化实现递归自我改进的编码智能体
提出孟德尔·哥德尔机,利用多任务与跨谱系比较进化,加速智能体自我改进,提升性能、效率与泛化性。
场知:从导航到黑洞的跨维度几何
连续度规场用单一因果对比损失训练,跨维度发现从导航到黑洞的几何结构,零样本证明其捕获可迁移几何。
Agent-MD:有状态GCMC-MD任务中事件驱动升级的选择性LLM干预
Agent-MD将LLM推理仅用于构建与事件触发审查,常规模拟由规则代理执行,在蒙脱石GCMC-MD脱附中完成120段循环,证明选择性干预可复现、可审计。