AI赋能严肃游戏:在培训系统中整合智能与适应性
探讨AI如何实现严肃游戏中的实时教学适应性,区分智能与适应性,概述历史,讨论LLM、RL及挑战
大语言模型在临床决策支持中的主动证据寻求与诊断推理
多轮证据寻求使LLM诊断准确率降12.75%,证据质量降24.36%,原因在于过早诊断和低效提问。
IdleSpec:通过投机规划利用空闲时间优化LLM智能体
IdleSpec利用空闲时间生成计划候选,提升LLM智能体性能,在GAIA和FRAMES上准确率提升5.1%,在MLE-Bench上提升达9.1%。
免训练时空池化与网格化增强视频大语言模型视觉标记表示
提出ST-GridPool,通过金字塔时间网格化和范数空间池化免训练增强视频LLM视觉标记,有效提升性能。
MPDocBench-Parse:面向实用多页文档解析的基准测试
提出多页文档解析基准MPDocBench-Parse,覆盖15种文档,评估发现模型在语义连续性方面有局限。
感知还是偏见:多模态大语言模型能否超越对个性的第一印象?
提出GPR任务和MM-OCEAN数据集,评测27个MLLMs发现51%正确评分无证据支撑,揭示偏见差距。
Unlocking Proactivity in Task-Oriented Dialogue
Skill Weaving:通过模块化技能包实现高效LLM改进
SkillWeave框架通过模块化技能包压缩,使9B模型性能超越32B模型,速度提升4倍。
ST-SimDiff:平衡时空相似性与差异性以高效进行MLLM视频理解
提出并行双选策略,基于相似性去冗余、差异性抓关键事件,精简视觉令牌,高效保留静态与动态内容,显著降低计算开销并提升性能。
朝着保证论证中量化置信度评估的组合语义学
提出基于主观逻辑的组合语义,将论证转化为可分析的置信网络,实现量化置信度评估。
大语言模型作为实时战略代理的评估:提供商表现、混合分解与限时风险游戏中的运行差距
在限时风险游戏中,LLM整体系统行为比规划能力更关键,Gemini胜出。
SciCore-Mol:用可插拔分子认知模块增强大语言模型
提出模块化框架SciCore-Mol,通过三个可插拔认知模块解决分子数据与语言模型间的语义鸿沟,实现分子理解、生成与推理的优异性能。
在不确定领域中扩展观测感知规划
通过分解POMDP识别感知函数,将传感器选择与位置可观测问题的求解性能提升数个数量级。
跨领域基准测试揭示协调式AI智能体何时能从部分证据中改进科学推理
协调AI在跨学科部分证据下提升推理(AUROC 0.944-0.955),但需比较器验证;单一信号时改善可解释性。
三思而后言:面向说服型智能体的双知识增强心智理论推理
提出双知识增强心智理论推理框架,显式建模心理状态依赖,在说服对话中提升意图与策略预测效果。
TerminalWorld:在真实终端任务上对智能体进行基准测试
TerminalWorld自动从八万终端记录构建1530个任务,测试8模型6智能体,最高通过率仅62.5%,与现有基准相关性弱。
AtelierEval:人类与多模态大语言模型作为文生图提示者的智能评估
提出AtelierEval首个统一基准,量化文本到图像提示能力,含360个任务,评估器达专家级相关性,实验揭示模仿优于规划。
Claw AI实验室:自主多智能体研究团队
Claw AI Lab实现自主多智能体研究团队,支持交互协作与代码执行,提升实验完整性和论文质量。
WorkstreamBench:评估LLM代理在金融领域端到端电子表格任务中的表现
提出金融电子表格端到端任务评估框架,发现最强LLM代理仍难达专业标准。
参数化模块化回答集程序的声明式实现
引入参数化模块逻辑程序,支持子程序参数和内涵声明,捕获集体控制语义,建立模块ASP理论。
HarnessAPI:一个以技能为先的统一流式API和MCP工具框架
HarnessAPI以技能文件夹为唯一真理源,自动生成流式API和MCP工具,减少74%样板代码。
使用Chronos时间序列基础模型的多变量金融预测
Chronos-2多变量预测优于单变量,但混合不同市场会降低准确性。
蛋白质思维:结合思考树与嵌入空间流匹配的可解释推理用于蛋白质相互作用发现
提出可解释PPI搜索框架,整合多信号与思考树及流匹配,排名提升76%,F1达91.08。
用数据自适应应对JPEG隐写分析中的覆盖源不匹配
提出TADA框架,利用小样本未标记数据自适应模拟未知处理流程,显著提升隐写分析在覆盖源不匹配下的鲁棒性。
面向闭源多模态大模型的可迁移攻击的频域正则化对抗对齐
提出FRA-Attack,通过频域正则化抑制冗余特征与代理特定梯度,实现跨模型可迁移攻击,在GPT-5.4等闭源MLLM上达SOTA。
最优交易执行中深度强化学习智能体因记忆引发的超竞争结果
记忆和反馈使深度强化学习智能体在共享执行环境中更易实现并维持低于博弈论基准的超竞争结果。
弥合协同差距:设计空间的六个要素
提出设计空间六要素(社会技术背景、决策框架、人类参与者、AI能力、交互与整体评估)以弥合人机协同差距。
PocketAgents: 一种清单驱动的自主防御代理库
PocketAgents通过清单驱动和类型边界,实现LLM防御的可衡量、可扩展,18次试验中13次成功阻止攻击。
电动汽车充电系统中的规划、调度与行为:批判性综述与三难困境框架
综述提出了PSB三层次框架,揭示了保真度与可处理性的三难困境,并总结了开放挑战。
学习异构多团队系统中的利他协作
基于汉密尔顿规则和图神经网络的异构多团队利他协作框架,实现机器人动态分配,仿真验证近优性能。
理解患者、照护者和临床医生对新兴协作决策技术的看法
儿科协作决策技术看法因群体而异,接受度与信任相关,需设计策略建立信任。
车载协作感知中的对抗性信任投毒
提出TrustFlip攻击,利用一致性检测防御给良性车辆投毒,降低信任并排除协作;引入TrustReflect缓解,减少攻击成功率。
一个开放的多中心全身FDG PET/CT肿瘤分割基础模型
提出开放多中心全身PET/CT基础模型,早期融合与掩码自编码,10%标签达全量性能,降低标注需求。
EvoScene-VLA:面向分块机器人控制,在动作解码器中演化场景信念
EvoScene-VLA跨块持久化动作更新场景状态,融合观测与先验,提升分块控制成功率约2%。
时间编码作为感觉运动物体推理的基底:千脑架构的脉冲重释
时间编码替代密集向量,利用接触顺序,区分相同特征不同空间排列物体,准确率提高30-50%。
视觉原语动作
提出AVP架构,VLM生成视觉原语token引导动作,拾放任务成功率提升27.61%,优于先前方法。
无先验知识的多元时间序列动态超图表示学习
提出动态超图构建模型,通过社区检测和注意力机制实现无先验知识的高阶关系挖掘,用于多元时间序列预测。
单脉冲电磁故障注入下英特尔神经计算棒2的故障响应特性
研究发现NCS2在EMFI下18-31%试验出现持续严重精度退化(<5%),空闲注入也可诱发且API无法检测。
Steins;Gate Drive:面向延迟解耦的LLM规划的结构化未来语义安全仲裁
提出延迟解耦LLM规划架构,通过世界线未来选择与原子谓词运行时检查,将有效延迟从+3.07秒降至-0.01秒,维持无碰撞安全。
声明式数据服务:用于组合数据系统的结构化智能体发现
DDS架构通过分层合同和子智能体搜索,实现从声明式意图到数据系统组合的结构化发现与收敛。
评估智能体规划-执行流水线中的时间语义缓存与工作流优化
工业Agent基准中,MCP工作流优化加速1.67倍、时延降40%,时间缓存命中加速30.6倍,揭示纯语义缓存对参数敏感查询失效。
VBFDD-Agent用于电动汽车电池故障检测与诊断:电池数字信号的描述性文本建模
提出描述性文本建模,构建VBFDD-Agent,融合大模型推理与案例检索,生成可解释的电池故障诊断与维护建议。
层级递归推理中的交互局部性
提出交互局部性框架,揭示递归模型信息局部写入并累积成全局解,3D模型因果局部性集中于模块边界。
通过基准构建教授AI:QuestBench作为课程实践以实现负责任的知识工作
学生构建基准测试AI,揭示高级系统低通过率(16.85%),培养评判AI输出的能力。
ScenePilot: 可控边界驱动自动驾驶关键场景生成
提出ScenePilot框架,生成物理可行但导致自动驾驶失败的边界场景,碰撞率提升6.2%且保持有效性。
洞见生成器:LLM智能体的系统性语料级追踪诊断
提出多智能体系统Insights Generator,通过假设测试生成有证据支持的洞见报告,使LLM Agent性能提升30.4个百分点。
PALS:面向混合专家模型的功率感知LLM服务
PALS将GPU功率上限作为可控变量,联合优化批大小,能效提升26.3%,QoS违规减少4-7倍。
Targeting Clause Type Distributions: a Picklock for Random Satisfiability Problems
GrandGuard:面向老年人与聊天机器人交互安全的分类体系、基准测试与防护措施
针对老年用户聊天风险,构建50种风险类型分类与10404条数据集,提出两种防护措施,检测准确率超90%。
设计中的治理:构建面向组织学习与可扩展自主性的代理型AI
通过架构设计内置治理,平衡代理型AI的自主性与责任,从IT公司案例提炼七条实践教训。