塑造人机交互以提供改进路径并平衡竞争目标
研究如何设计人机交互,帮助用户准确理解AI并改进表现,同时防止投机行为,确保AI达成目标。
RA-CAD:为状态感知的文本到CAD生成学习执行后批评
RA-CAD将执行后批评作为可学习策略,优化状态感知文本到CAD生成,实现最优结果。
DreamGuard:基于风险感知世界模型的高效大语言模型智能体运行时护栏
提出“梦境卫士”护栏,用风险感知世界模型预测未来风险并提前干预,安全效用最佳,延迟25毫秒。
提示侧智能体剧本何时可迁移?智能体部署中的准确性、成本与运行时变化
提示侧剧本迁移需条件验证,非默认复用;部分场景有益,但存在成本激增与兼容性异质性,需目标端验证。
谨慎上下文引导用于语言模型个性化
提出CCS,用轻量适配器按词控制用户上下文影响,单数据集训练即可跨域泛化,免逐用户微调,降低推理成本。
当智能体AI遇上通感一体化
智能体AI将通感一体化转为闭环智能系统,提出六阶段框架与五级成熟度,指出验证缺口和挑战。
AppDeltaWorld:面向移动GUI智能体的过渡锚定增量代码世界模型
提出以代码更新形式预测GUI的世界模型,提升移动端GUI生成保真度,并支持闭循环训练与测试期强化学习,显著增强智能体性能。
当自我进化适得其反:LLM智能体技能污染的提交前门控机制。
技能池过大会引发不可逆污染,致性能下降;VaG门控以三类审查和子集选择,小池实现更高性能。
眼见不等于决策:多模态大模型能成为高效CEO吗?
多模态提升证据推理但破坏资源分配,信号拥挤是主因,视觉增强需谨慎。
改进国防与国家安全本体间的互操作性:分析与评估任务
分析60多个公开本体,为OAEI新增赛道,含8个匹配任务、共识对齐和人工校验的银标准映射。
ChainClaw:面向可靠链上执行的分层智能体框架
提出ChainClaw框架,通过分层架构解决链上执行的反应性、不可逆性与可观测性缺陷,显著提升安全性与任务完成度。
异构注意力内存的运行时可观测性
提出覆盖四类注意力内存运行时可观测契约,三算子组合风险账本,指标类型化分级,千万级实测零违规并定位静默损坏。
基于图支架证据锚定的个性化深度研究查询精化
借助意图引导图将请求精化为个性化研究规格,平衡证据成本,提升加权覆盖度与报告个性化,提问仅为基线三分之一。
OPERA:基于算子残差反馈的语言模型智能体可靠自主光学实验
自主光学实验中,仅用分数反馈的决策有23.6–39.0%无物理改进,而算子残差反馈仅0.9–1.9%,且提升目标达成率、降低预算,并成功迁移至实物仪器。
视觉语言模型用于视频游戏数据标注
研究VLM标注游戏帧奖励信号,发现赛车游戏表现差,用输出混合与提示优化,分析长度、分辨率、批处理影响。
当历史说谎:在多轮误导历史下评估与改进工具使用
历史轨迹虽结构有效但语义过时,会干扰工具调用。提出基准与教师软监督方法,显著提升工具使用准确率并可扩展。
基于图的多示例学习整合隐式与显式关系偏差:皮肤病变诊断案例研究
提出隐式补丁建模与显式图消息传递结合框架,在皮肤病变数据集上平衡准确率分别提升至79.27%和60.67%,优于基线。
评估大型语言模型中的投资逻辑:面向个性化金融智能体的真实世界基准
提出投资逻辑基准,含151位真实投资者20万余条决策;大模型逻辑合理但事件依据弱,仅看收益掩盖缺陷。
弥合差距:混合思维实现人类模拟
提出Anacreon,以混合思维模拟个体,在特定领域达个体级预测,序数对齐0.775,并减少偏差。
PaDoc:基于布局的并行解码文档解析
提出PaDoc,以布局为分支并行解码,减少解码深度,在文档解析基准上取得领先性能,速度提升显著。
大型技能库智能体检索方法的比较研究
混合检索优于知识图谱:图边来自同一嵌入邻域,无法扩展检索范围;作者查询高估命中率44点。
MicroEvo:知识引导LLM采样用于高效微架构设计空间探索
知识引导LLM采样高效探索微架构空间,Pareto质量提升36.2%,效率提升10.6倍。
EnvACE:通过世界预演内化环境动态的智能体强化学习方法
EnvACE用世界预演替代外部环境,自演环境响应并端到端优化,内化动态,提升智能体性能。
TS-RAG:面向时间序列预测的检索增强生成
提出TS-RAG,用检索增强生成提升时间序列预测,通过参考令牌融合检索序列,达到最新最优性能。
静态与演化数据解释方法评估中的挑战
XAI评估不足,以DetoxAI为例,探讨解释适应数据流漂移及数据-模型-解释共同演化的挑战。
超越信息检索:生成式AI作为认知仲裁者促进协作问题解决
生成式AI作为认知仲裁者,重构协作问题解决,引导从冲突到协同推理。
正在关闭的窗口:政府如何失去约束先进AI的能力
随着AI能力提升,风险加剧,政府可能无法再有效约束AI发展,建议尽早采取低成本措施保留控制权。
自主研究智能体:AI科学家综述与验证鸿沟
综述35项研究发现代码开放普遍,但可复现性与论断验证不足;瓶颈在于验证AI生成论断。
ASTELD:自主AI智能体六轴分类框架——设计、评估与OpenClaw案例研究
提出ASTELD六轴分类框架,评估八个平台及OpenClaw案例,揭示安全-可访问性对角线等模式,发现本地优先与企业级安全结合的空缺区域。
IMMENSE:社交网络中的归纳式多视角用户分类
提出IMMENSE,融合内容、社交与空间信息,采用归纳学习识别恶意用户,无需重训练即可分类新用户,优于现有方法。
基于多智能体Transformer的TSN网络队列级XR流量调度
提出MAT调度TSN中XR队列流量,通过注意力建模队列间依赖,时延降71.42%,失效率降83.2%
面向智能体科学的分层服务器架构
提出分层动态架构,自动发现云端、边缘及超算资源,并行模拟验证高谈判准确率,已支撑实际任务。
生命科学中人工智能的伦理:普遍性、文化多样性与关怀架构
AI伦理非特例,基于人脑架构与关怀,平衡普世判断与道德多样性。
时间敏感应用中在线流量调度的多智能体强化学习
提出基于HAPPO的多智能体强化学习调度,每队列为代理,平均等待和最大延迟降26.8%与16.8%
当经验成为指令:自进化智能体技能系统中的轨迹投毒
提出轨迹投毒攻击PoisonedEvolution,以少量支持即可将目标行为嵌入自进化技能系统,成功率高达91%,揭示证据提升是安全边界。
图灵最初的模仿游戏:设计概念与一场近似机器的人类阅读
图灵1948年象棋模仿游戏强调机器会犯错、排除物理特征、人类裁判及搜索为核心,实为“人模仿机器”,考察人类智能何时类机器。
SafeDivertor:利用时频先验从宏观等离子体状态信号忠实重建偏滤器热流
提出在线信号重建范式及数据集DivMPS2HF,SafeDivertor结合物理先验与谱优化,重构偏滤器热流,五项指标全面领先。
搜索辅助的智能体-环境联合强化学习,用于带旋转的鲁棒终身多智能体路径规划
提出SJRL算法,结合搜索与联合强化学习,解决带旋转和鲁棒约束的终身多智能体路径规划,性能优于强基线。
多智能体LLM系统推理时并行的双层级视角
提出双层级并行框架,统一副本与结构并行。实验证提升精度降延迟但增开销,中等难度任务收益最大。
BrainBench:全面脑电理解的大语言模型基准测试
提出BrainBench基准,评测大模型指令化EEG理解,涵盖17数据集多任务,比较代码执行与代理分析范式,发现能力因模型和操作而显著不同。
基于预训练Transformer的感知模型的对抗鲁棒溯因融合
提出无领域知识几何标签池方法,实现对抗鲁棒溯因融合,优于多数投票并抗协调攻击。
MatrAIx:用83亿角色代理模拟世界
MatrAIx:83亿角色代理的模拟用户评估基础设施,覆盖多环境多任务,验证中角色遵循率达91.5%。
内感受注意力:觅食智能体中的动态稳态优先级分配
固定感知预算下,将内感受精度动态分配给最需通道,可倍增生存率并加速学习。
SafeCommit:为基于记忆的智能体安全行动时机提供认证
SafeCommit在记忆不确定下为智能体行动提供风险控制认证,确保不安全提交概率不超过设定阈值。
抗泄漏遗忘:评估多跳推理一致性与恢复鲁棒性的新基准
针对多跳推理与恢复攻击的遗忘基准;现有方法脆弱,需权衡遗忘质量、鲁棒性和效用。
CARGO-VL:面向视觉-语言模型的反事实仲裁与风险约束组优化
提出CARGO-VL,以组相对优化处理证据冲突,平衡回答与弃权,提升反事实一致性与可靠性。
技能价值几何?结构感知的智能体技能 Shapley 估值
提出结构感知Shapley技能估值法,评估内部单元,区分内容与上下文成本,支持安全剪枝。
A/B Agent:面向工业A/B测试中策略迭代的自进化智能体
提出A/B智能体闭环,用层级经验树与Tree-RAG生成策略,据在线反馈自进化,GMV提升4.829%
一致性先于多样性:异构语言模型协同的验证优先互补性
ABD规则:锚点答案获两项印证则保留,否则异构合成;理论界定精度差距,实验提升显著。
延迟容忍网络中基于强化学习的无人机飞行与机会路由联合优化
提出JUROR,PPO联合优化无人机飞行与机会路由,集中训练分散执行,优于PRoPHET和MaxProp。