智能体记忆蒸馏:以层级教师记忆赋能小型LLM智能体
提出免训练框架AMD,将大模型智能体的层级记忆蒸馏给小模型,显著提升工具使用准确率,最高提升27.2个百分点。
EMAS:通过证据引导修订稳定多智能体系统演化
EMAS利用经验修订多智能体系统拓扑和提示,提升准确率并大幅降低token消耗,在多个基准上取得最优结果。
SetEasy: 多模态课堂参与度评估与座位优化框架
融合多模态感知与CP-SAT,实现固定座位优化,四周期实验将参与度从0.30提至0.70,RMSE降至0.53。
超越黑箱:人类随机化失败的可解释模型
用可解释模型预测人类随机化偏差,发现重复/回避行为是主要可剥削信号,频率追踪无额外增益。
从概率到因果:概率逻辑编程中的因果推断
概率逻辑编程学习结构时,分布可能对应多种因果序。研究利用贝叶斯网络导出唯一因果序的条件,并结合关系对称性验证干预语义的良定义性。
利用LLM辅助工具与溯源知识图谱编写和管理随机临床试验出版物的透明研究诚信评估
利用大语言模型辅助工具和溯源知识图谱,编写管理随机试验论文的诚信评估,并构建140项评估知识图谱。
课程即代码:STEM教育中AI辅助教学设计架构
提出六阶段AI辅助教学设计架构,结合生成式AI与LaTeX/Python,自动化创建STEM材料,降低教师负担,经一年验证高 reproducibility 与质量评分。
WNM-3D:基于3D场景条件的世界导航模型,用于闭环视觉语言导航
提出WNM-3D,用3D场景条件生成未来视图与动作,经闭环优化,在GN-Bench上优于基线。
偷看致胜:未强制执行的预算与测试集选择夸大短预算AutoML比较结果
短预算比较易错:Orcetra用测试集选模型且超预算致胜率虚高,修正后优势消失。
FinRank:面向SEC文件金融问答与检索的基于证据的基准
面向SEC文件的金融问答检索基准FinRank,含1185个标注问答,评估证据溯源与硬负样本区分,最佳基线召回率仅44.8%。
评估人机协作中分层强化学习策略的可解释AI支持
首次在基准环境中系统评估可解释强化学习策略,发现音频解释降低人机联盟感,提示解释模态需匹配策略能力。
WorldMark:跨宿主语言模型水印的即插即用世界知识接口
WorldMark通过世界知识记忆调整水印强度,提升跨宿主检测性能,无需重训,开销极小。
面向智能交通系统的多模态驾驶员情绪识别与安全导向干预
提出安全优先的多模态驾驶员辅助框架,融合语音情绪与道路视觉,生成结构化干预,平衡风险报告与情绪调节。
爆炸半径
解决智能体编码高成本,预测性内存管理归档重复内容,减少17-26%令牌,可逆恢复。
交互产生孤立状态不存在的动态AI行为
单向指令使下属AI陷入从未出现的异常动态行为;老板倾听则同化。动力学理论解释信息传递方式之关键。
Fisher-R1:训练LLM智能体进行可靠假设检验
LLM智能体假设检验易错,新方法Fisher-R1强化学习提升可靠性,平均改善21%
用于评估神经退行性和慢性疾病中疲劳、睡眠和活动的移动交互
利用智能手机交互数据客观评估神经退行性疾病和慢性病患者的疲劳、睡眠及活动症状,分析屏幕使用特征与患者报告结果的相关性。
从转换后的基于规则的本体中恢复解释
研究从重写规则下的证明恢复原始规则证明,确定计算复杂性并识别两种实用语言。
面向符号执行的智能体规划
提出Agolic智能体规划系统,依据历史运行证据配置符号执行,平均分支覆盖提升3倍多,并覆盖其他工具未达分支。
SyncSBC:面向同步自主控制的去中心化群体行为预测
提出同步群体行为分类,融合机器学习与共识,去中心化同步决策,高精度低延迟,支持异常检测与行为协调。
刻画生产中AI生成C++代码的质量特征
大规模分析352万次代码变更,发现AI生成C++代码存在接口耦合、拷贝开销等问题,导致计算资源消耗增5-8%,但定向反馈可降低11.1%静态分析警告。
策略掩蔽的私有专家:稀疏MoE模型中可审计且可逆的能力访问控制
冻结预训练MoE,训练独立专家分支,未授权请求不执行私有专家,实现可审计、可逆的能力访问控制,并保持任务效用。
HLSmith:专家引导的C/C++到HLS转换智能体框架
HLSmith框架借助专家知识库与分阶段优化,将C/C++转成高性能HLS加速器,较ChatHLS提速4.24倍,设计正确率达100%。
LifelongCrossNav:面向跨楼层多目标导航的持久3D语义记忆框架
提出LifelongCrossNav,以持久3D语义记忆与跨楼层可通行建模,实现未知多楼层连续多目标导航,性能超基线。
探究经典数据集上量子嵌入Transformer的跨模态分类
实验表明参数化量子电路在混合模型中无一致性能提升,无法证明量子优势,需对照组件归因。
LLM智能体中耦合规划与情景记忆以解决软件问题
提出耦合分层规划与情景记忆的方法,软件修复基准多解25例,减少重复失败与上下文溢出。
面向虚拟细胞扰动建模的基因几何条件对照锚定残差流匹配
提出基因几何流模型,以生物网络基因几何条件化对照锚定残差流,精准预测细胞扰动转录响应。
解耦意图与轨迹:面向世界动作模型的表征推导框架
提出PILOT框架,通过表征推导将状态转移推理融入动作生成,提升机器人操作成功率与泛化性,缓解监督稀疏问题。
Same physical state, different collective dynamics: state encodings select synchronization outcomes in language-model agents
基于OpenArm的实验室移动操作中的表征交接
报道基于OpenArm的移动操作原型,以表征交接整合语言、感知与规划,通过试运行暴露部署障碍。
PHOENIX:微调小语言模型驱动的卫星寿命自主延长,基于预测性自愈与多智能体AI恢复
立方体卫星在轨85分钟无法地面联系,故障常被延误。PHOENIX用机载小语言模型实时监测自愈,地面多智能体在联系窗口内生成指令,延长寿命。
自主发现加速器调试算法
用语言模型代理自动编写、测试并改进加速器调试算法,在仿真中超越人工方案,并探索多目标权衡。
面向TinyML边缘设备的以人为本可解释AI:基于帕累托的LLM引导设计选择框架
针对微型机器学习边缘设备,用大语言模型映射偏好至可解释人工智能,经帕累托优化权衡解释质量与部署成本。
SCALE:借助大语言模型与嵌入的科学概念聚合,实现细粒度分类体系扩展
利用大语言模型与嵌入将散乱关键词聚合为科学概念,为现有分类新增细粒度层级。
这首歌里有多少AI?量化混合音乐中AI生成分轨的比例
将AI音乐检测重构为回归问题以量化AI能量占比,混合内容下CNN回归达MAE=0.076,优于二分类。
SkillTrace:面向LLM智能体技能复用的多轨迹来源审计
提出SKILLTRACE多轨迹溯源审计框架,提取表达、实现、操作三轨迹检测LLM技能复用,AUROC达0.938。
智能体嵌套:面向现有企业应用集成与服务的新方法论
提出智能体嵌套框架,将现有企业应用封装为分层组织的AI代理,实现自然语言交互与跨应用编排。
人类认知与行为的小型基础模型
小模型在分布内性能饱和,0.6-1B参数可媲美70B;分布外大模型更优;依赖刺激与反馈而非选择历史。
搜索到技能:基于评分强化学习的知识边界外技能蒸馏
提出搜索到技能框架,基于评分强化学习,搜索外部知识并蒸馏为可复用技能,超越知识边界,在八个专家领域表现优异。
连贯性导向的梦境场景可视化
DSV系统将梦境文字转为四格时序图像,用大模型分段并保持视觉连贯,经CLIP等模型评估质量、保真度与连贯性。
WorldClaw:可扩展的智能体式3D开放世界生成
提出智能体框架WorldClaw,从粗到细生成大规模3D开放世界,保持全局连贯且资产可编辑。
长时程终端任务的递归合成
提出递归验证合成框架RST,以低成本规模生成长时程终端任务,难度递增,微调显著提升性能。
CASCADE:一种经患者数据验证的下游扰动预测智能体调控网络框架
基于ARACNe调控网络与MCP的智能体框架CASCADE,预测基因扰动下游效应;经TCGA患者数据验证方向,MYC准确率高且具基因特异性。
C³PO:评估全模态模型中的跨模态组合与反事实性能
提出C³PO基准,评估跨模态组合与反事实推理,揭示模态主导导致模型表现差:最强73.17%,人类88.64%。
自适应竞技场式可争议论证专家网络用于开放式护理计划协调
提出CANOE多智能体神经符号框架,通过论证与人工争议实现安全透明的护理计划协调。
SCP-NL2TL:自然语言到时序逻辑规范的选择性共形预测与语义验证
提出选择性翻译框架,用共形预测与语义验证决定何时信任生成的时序逻辑规范,不可靠时弃权,提升安全性。
生成式AI中的认识论可信度:高风险工作流中合理信赖的规范性框架
生成式AI应具备认识论可信度:以谦逊、可检视、抗认知不公三条件确保用户合理信赖,而非被行为诱导。
精炼优于重采样:大语言模型推理中的测试时自我纠正
提出无验证器的广度-深度自纠正框架,迭代自我修正提升LLM推理,超越重采样与验证器方法。
基于Volve油田的接地气井况异常检测:构建标签、基准模型与双头模型
用公开Volve数据构建经工程文档验证的异常标签,测试无监督与双头模型,证明标签可靠、模型可跨井泛化。
基于显式规划与反应分解的轨迹预测统一框架
提出INTraJ框架,将社交影响分解为规划与反应两阶段,在多个基准上提升轨迹预测性能。