解释AI的根本局限性
论文证明AI解释存在四重困境,表明完全忠实的解释不可能,治理应基于解释的不完全性。
MDIA:HealthBench专业版上的多智能体诊断智能流水线
MDIA通过7节点专科路由架构,在HealthBench上达0.6272,超临床版ChatGPT 3.72%,并发现评估者模型选择影响评分。
使用多智能体语言模型自动检测和分类自然音频日记中的妄想相关内容
多智能体LLM管道自动检测自然音频日记妄想内容,多数投票法效果最佳,F1达0.872和0.779。
Geo-Expert:通过参数高效微调迈向专家级地质推理
参数高效微调的地质大模型,8B参数在专业推理上超越70B通用模型和GPT-4o,32B接近前沿水平,性价比优异。
GRAIL:面向科学家卫星数据应用工作流的AI翻译系统
GRAIL将Python卫星数据分析工作流自动翻译为Spark程序,无需学习新框架,通过分层代码生成和针对性修复确保正确性与可扩展性。
Agent Manufacturing: Foundation-Model Agents as First-Class Industrial Entities
ProActor:面向主动任务调度智能体的时序感知强化学习
ProActor框架通过自动标注与时序感知强化学习,提升任务调度智能体的主动时序质量,同时保持动作一致性。
NeurIPS:基于球体脑解码的神经解剖归纳先验
利用解剖先验,NeurIPS框架实现高效脑解码,10轮收敛达SOTA,20%数据即可适应新被试。
噪声鲁棒的金融数字实体属性标注
提出NORA方法,通过任务感知加权和邻域先验KNN过滤应对噪声标签,联合建模多属性,在660万实例上性能领先。
通过区域感知注意力重校准缓解视觉语言模型中的物体幻觉
提出无需训练的注意力量校准策略,利用抗异常中点和区域分歧动态抑制幻觉,保持生成质量,性能领先。
面向工业资产运维的多轮对话系统
提出监督-专家多智能体架构,通过结构化复用与并行执行,规划有效性提升54.5%,任务完成提升37.8%。
进化增强的多智能体强化学习在协同空战中的应用
提出ACE-MAPPO框架,融合进化算法与MAPPO,通过遗传更新、进化优先回放和对抗课程学习,提升多机协同空战决策效率与胜率。
超越前沿:用于高效测试时扩展的随机回溯
提出持久池随机回溯,以更少token实现更高推理准确率,优化测试时计算效率。
RECTOR:面向合规感知的自动驾驶轨迹选择的优先级感知规则重排序
RECTOR采用层次化规则(安全>合法>道路>舒适)对轨迹重排序,无需重训练,显著降低违规率并抗置信度攻击。
NeuroNL2LTL: 一种面向线性时序逻辑自然语言翻译的神经符号框架
提出验证器参与训练的神经符号框架,实现自然语言到时序逻辑的可靠翻译,在20万+需求上86%输出可满足。
RMA:面向研究级数学问题的智能体系统
RMA智能体系统通过多模块协作与迭代优化,在研究级数学证明中解决80%难题,优于GPT-5.2R。
每成功目标能量:代理型AI系统的目标级能量核算
提出A-LEMS框架与EpG/OOI指标,发现代理系统平均能耗为线性系统的4.33倍,工具增强任务中反向降低。
EVE-Agent:可验证证据的自进化智能体
EVE-Agent通过证据验证机制,让自进化搜索智能体生成可审计的证据跨度,提升可信度与正确性。
Human-in-the-Loop Multi-Agent Ventilator Decision Support with Contextual Bandit Preference Learning
GENSTRAT:迈向大型语言模型策略推理的科学
GENSTRAT用程序生成博弈和剖面分析评估LLM策略推理,揭示实力相当模型的关键差异。
知识工作的设计与报告基准
本文提出知识工作基准设计三步法:定义活动、指定设置、评分产品,通过18个活动和三个案例揭示高分不等于实际部署能力。
解决飞机拆解调度问题
提出约束规划和MIP两种模型,解决含上千任务及多约束的飞机拆解调度,基于工业数据测试。
EDGE-OPD:证据引导的在线策略蒸馏内化特权上下文
提出EDGE-OPD方法,通过引导展开和证据掩码,解决在线策略自蒸馏中特权上下文导致的副作用,成功学习目标身份并保持通用能力。
从原始经验到技能消耗:对模型生成智能体技能的系统性研究
系统研究模型生成智能体技能全生命周期,发现其平均有益但存在负迁移,提出元技能以改善质量。
可计算公平性:面向AI资源分配的Boltzmann-Softmax控制
提出可计算公平分配框架,用Boltzmann-Softmax概率分配资源,AHC++实时调节β平衡效率与公平,抑制垄断且扩展性优异。
误归因鸿沟:当记忆毒化在自主AI系统中表现为模型失效
记忆毒化攻击使系统误归因为模型失败,提出语义规范漂移,反事实测试可识别,跨会话控制阻断97%。
基于边缘智能的智慧城市节能环境监测AI框架
利用TinyML和边缘智能动态激活传感器,降低能耗并延长寿命,实现高效环境监测。
KPI2KVI:从服务描述中计算关键价值指标的多智能体工作流
KPI2KVI利用大语言模型多智能体工作流,从服务描述自动生成KVI区间估值并提供可追溯解释。
RAG4Outcome:一种用于慢性骨髓炎预后预测的检索增强多模态框架
RAG4Outcome利用检索增强生成,整合多模态数据,实现慢性骨髓炎可解释预后预测。
认知卡尔达肖夫等级:量化文明计算的物质上限
提出认知卡尔达肖夫等级量化文明计算力,当前人类K≈0.73接近一级,一级时每人可享一个个人AI的认知量。
LLM代码坏味:分类体系与检测方法
提出9种LLM代码坏味分类及检测工具,在692个开源项目中验证,73.5%受影响,精确率91.3%,召回率71.8%。
知道该问什么的机器人:通过针对性解释恢复对齐不当的奖励
提出检测不足特征并主动请求针对性演示的框架,利用统计信号推断未充分特征,机器人解释并查询,显著改善奖励恢复。
MadEvolve:基于大语言模型的交易系统进化优化
MadEvolve用大语言模型进化优化比特币交易策略,显著提升性能,支持AI驱动进化算法在量化金融的应用。
关系数据库上深度同态网络的表达能力
深度同态网络通过聚合操作与一阶逻辑片段对应,揭示与SQL的联系,并在预测任务中验证表达能力差异。
PrefBench:评估零样本LLM代理在隐藏偏好个性化定价谈判中的表现
提出PrefBench基准,发现零样本LLM达成率高但利润弱于简单启发式,表明协议遵循与利润敏感可分离。
谁的利益,谁的地方?面向社会福祉的智能体AI的道德地理
调查112篇智能体AI论文,73%未指定地理背景,尤其机构类SDGs仅13%指定,且仅25%有实际部署,存在问责缺口。
基于深度强化学习的多切片6G网络边缘感知效用优化
提出DRL驱动的边缘缓存与资源分配框架,利用DQN优化多切片6G网络,降低延迟、提升吞吐量,满足VR服务。
一个用于自主Kubernetes操作的测量基底:方法论及一个关于检索复合证伪的案例研究
提出agent-breakage框架测试K8s代理,案例发现三个混淆因素,检索增强效果仅为部分证伪。
基于前沿的视觉语言模型引导自主探索
VLM引导自主探索,通过多模态提示选择最优前沿,提升地图覆盖率24%,轻量且无需训练。
KAPLAN:面向生存分析的柯尔莫戈洛夫-阿诺德可学习激活预测网络
KAPLAN-HR用B样条KAN非参数估计生存风险,自动捕获交互和时间效应,收敛不受维度影响,临床数据表现优异。
XWind:面向可再生能源农场的LLM推理服务的跨站点路由器
提出AI绿篱部署模式,利用风能,XWind路由器实时调度,P99延迟降低52%-98%。
6G通信网络赋能具身智能体:架构与原型
研究6G赋能具身智能体通信,提出分层架构并原型验证,实现毫秒级延迟与稳定闭环。
社交流畅型AI解耦在线互动中的对话信号与来源身份
实验中人们无法区分AI与人类队友,依赖弱相关的怀疑启发式,导致AI可大规模操纵在线对话。
RA-DCA: 面向最大结构DC程序中方向稳定性的随机有效集DCA方法
提出随机有效集DCA,解决最大结构DC程序非方向稳定问题,保证几乎必然方向稳定,实验验证有效。
CBANet: 一种基于注意力机制的紧凑型CNN-BiLSTM网络,用于激进驾驶事件检测
提出CBANet框架,利用工程化特征和SMOTE+加权损失处理数据不平衡,通过阈值校准提升激进驾驶检测的召回率和安全关键F值。
AI安全研究应更好地激励防御研究
AI安全研究攻击多、防御少,攻击评估条件宽松而防御标准严格,导致实用防护薄弱,需激励防御。
面向未知有效维度的实用贝叶斯优化的自动随机嵌入
提出动态共享嵌入贝叶斯优化,自动调整子空间维度,平衡近似与优化误差,提升高维优化性能。
同时学习一切的目标条件智能体
提出LEO方法,一次网络前向传播并行更新所有目标,速度快250倍以上,在目标条件任务中显著优于其他方法。
基于元学习的低成本模型评估
利用元学习在参考模型池上获取可迁移初始化,实现无标签数据上的低成本、高准确度新模型评估。
理解序贯强化学习中的目标泛化
研究发现,智能体在序贯训练中目标泛化受显著特征驱动且早期目标持续影响,提出潜在策略梯度法可准确预测分布外行为。