AI知识系统中实体重要性的表示:受众评价与结构权威的双信号框架
提出受众评价与结构权威双信号框架,验证两者非冗余,支持任务感知系统保留不同重要性信号。
超越独立优化:多模态边缘智能中的压缩、MoE路由与量化交互
多模态边缘智能中压缩、MoE路由与量化相互依赖,需协同设计以应对延迟、内存和能量约束。
交付而非存储:线索锚定的工作记忆作为编码代理的框架属性
代理记忆应由框架自动递送而非自主存储,实验显示自愿记忆近零,线索注入可靠,交付比存储更重要。
SciExplore:从科学导航到信息集成的自主智能体评估
SciExplore基准评估科学信息检索与推理,揭示任务复杂度增加时性能显著下降,结构化合成任务准确率极低。
集群边缘智能:超越边缘计算与人工智能的简单融合
提出集群边缘智能(CEI)框架,将智能视为可共享重用的独立实体,在边缘-云间实现描述、发现、观察、交换与管理。
重新审视零样本摘要:LLM摘要器可信度的实证研究
提出双层次稳定性诊断协议,实证发现LLM摘要器在不同指标下存在显著生成变异性,影响可信度。
生成式推荐能否触达冷启动物品?基于时间视角的语义ID生成研究
语义ID生成推荐在时间视角下能触及部分冷物品,但受限于未见token和路径,需改进语义空间与评分接口。
V-DEAL:将视频安全去校准诊断为一种理解-拒绝耦合故障
V-DEAL诊断框架揭示视频LLM中良性查询耦合有害视频导致安全失效,提示注入干预降低攻击成功率48个百分点。
可微逻辑编程以缓解神经符号系统中的推理捷径
提出可微逻辑编程方法,通过矩阵统一编码规则与约束,有效缓解神经符号系统中两类推理捷径。
带差分约束的回答集编程的有界基础语义:初步报告
引入多类有界基础逻辑,为带线性约束的ASP提供统一框架,揭示clingo[DL]等系统的语义根源。
规则如何表征因果知识:基于概率逻辑编程的因果建模
将Pearl因果理论引入概率逻辑编程,提出因果语义与干预方法,实现循环因果建模。
因果过程的逻辑编程语义
逻辑编程的稳定模型与支持模型分别对应因果过程从中立态或任意起点出发的最终状态,为因果规则语义提供时间视角。
专家行为先验强化学习
提出Q-CVAE在线生成专家先验,结合专家指导与梯度校正,提升在线强化学习样本效率和稳定性。
基于LLM的自动过程控制策略生成与调优工作流(从动态过程模型)
提出LLM驱动自动化控制设计工作流,分解为代码生成与验证,实现分散PI控制,贝叶斯优化降低闭环误差26.5%。
监管自主与能动型人工智能
监管自主AI的挑战在于需将供应链纳入监管,变革治理模式,变被动为主动应对新系统性风险。
SPORD:一种面向供应链规划的“模拟—提出—然后—OR—处置”方法
SPORD通过模拟-决策解耦加速供应链规划,将跨区域履约率从6.1%降至4.9%,月均减碳约5745吨。
面向可泛化脑电图表示学习的多模态预训练
开发多模态EEG基础模型,结合Mamba、ViT和轻量文本编码器,预训练后微调在CHB-MIT上达0.874 AUROC,实现鲁棒癫痫检测与泛化。
带公理的规划中的逻辑回归
提出近似逻辑回归避免重算公理,嵌入执行监控,减少70%变量,恢复率超50%。
PATS:面向智能体强化学习的策略感知训练支架
提出PATS框架,将技能作为动态训练支架,通过上下文调整提升弱策略性能,节省提示令牌。
穿越地层的磁感应通信与组网:综述
全面综述透地磁感应通信,提出信道分解与几何模型,构建支持TCP/IP和Linux的网络框架。
MIRROR:从另一种视角学习多模态推理
MIRROR通过自监督强化学习,选择最优视图作为教师训练其他视图,提升多模态几何推理的一致性。
同一危险目标,截然相反的建议:直接暴露 vs. 多智能体中介
直接暴露危险目标时模型给出反对建议,经多智能体中介后却支持,暴露组合安全漏洞。
超越谄媚:大语言模型道德推理中的结构化抵抗与顺从
大语言模型道德判断修正受距离、归因和联盟结构影响,谄媚只是广义社会影响过程的一种表现。
迈向工业中AI智能体创建民主化的持续保障
针对民主化AI智能体创建导致的可靠性问题,提出包含依赖映射、就绪合约等轻量级持续保障框架。
学习、推理、精炼:GUI代理中卡尼曼双系统智能框架
提出CogniGUI框架,结合快速解析与GRPO强化学习实现迭代优化,并引入新基准ScreenSeek,性能超越现有方法。
未被监测的安全失误:现代AI系统中隐藏的关键安全挑战视角
AI安全应关注未被监测的隐蔽失败,包括认知、控制、时间、组织、生态系统五层完整性风险,从模型评估转向社会技术可靠性。
SENTINEL: 一种面向基础模型具身智能体安全评估的多层次形式化框架
提出SENTINEL框架,基于时序逻辑多层次验证具身智能体物理安全,有效暴露语义、规划与执行中的安全隐患。
Assistax:面向辅助机器人的多智能体硬件加速强化学习基准
基于JAX和MuJoCo-MJX,提出高吞吐GPU加速辅助机器人多智能体RL基准,支持人机协作与未知策略泛化,速度提升412倍。
学会交友:训练LLM代理走向涌现的社会纽带
通过行为奖励与上下文学习,让LLM代理涌现出类似人类的社交网络与互动模式。
Dr. Zero:无需训练数据的自进化搜索智能体
Dr. Zero让搜索智能体仅靠搜索引擎自进化,无需训练数据,性能媲美全监督模型。
基于LLM的可解释AI:时序图注意力网络赋能供应链风险早期预警
提出TGAT与LLM结合的供应链风险预警框架,预测AUC0.761,解释方向一致性99.6%。
成分相关相图的贝叶斯推断
利用贝叶斯推断整合多源热力学数据,构建温度-浓度相图并量化不确定性,优化后续模拟。
抵抗与更新:面向激励兼容大语言模型的反事实报告坐标
提出反事实报告坐标钳制,实现大语言模型抵抗非证据压力并依据证据更新,因果验证内部激励兼容。
参数高效持续微调:综述
综述持续学习与参数高效微调,聚焦参数高效持续微调(PECFT)方法,探讨评估与未来方向。
基于多智能体强化学习的弱电鱼群中的主动电感知与通信
用MARL训练弱电鱼群模型,重现真实行为,揭示社会觅食的因果机制。
RoboInspector:揭示LLM机器人操作中策略代码的不可靠性
RoboInspector从任务复杂度和指令粒度揭示策略代码不可靠性,识别四种失败行为,通过反馈改进使可靠性提升35%。
在退相干和时变条件下的鲁棒置信状态策略学习用于量子网络路由
提出结合q-POMDP和GNN的鲁棒置信状态路由框架,利用原子微时段和混合控制器,改善量子网络高保真吞吐量并降低决策成本。
非理想条件下的超对角可重构智能表面:基于学习的架构发现与优化
针对非理想BD-RIS性能与电路复杂度权衡,提出基于学习的两层架构发现框架,实现近最优性能优化。
QuArch:评估大语言模型在计算机体系结构中推理能力的基准
首个计算机体系架构LLM推理基准QuArch,含2671专家题,模型准确率34%-73%,微调后设计效率提升1.99倍。
TransDex:基于点云重建预训练的视觉-触觉策略用于透明物体灵巧操控
提出点云重建预训练视觉-触觉融合策略TransDex,恢复透明物体3D结构,灵巧操控性能优于基线。
FVRuleLearner:基于算子级推理树(Op-Tree)的规则学习用于形式验证
FVRuleLearner基于算子推理树学习规则,将自然语言转为SystemVerilog断言,语法和功能正确性平均提升3.95%和31.17%。
AnchorRefine:基于轨迹锚点和残差细化的协同操作视觉-语言-动作模型
提出层次化框架分解VLA动作为轨迹锚点和残差细化,提升精确操作成功率最高达18%。
面向光网络自动化的大语言模型人类基础评估
HuGLEN通过LLM评判与专家评分,实现光网络自动化中LLM的可扩展比较,中型模型平衡质量与效率。
全球自动化图谱
用大语言模型评估124国近2万项任务,自动化比例3.3%-61.6%,收入越高自动化类型越偏向增强而非替代。
幻影与披露:合成数据隐私审计的统计框架
提出统计审计框架,区分真实与幻影披露,无需模型访问,高效评估隐私泄露。
可证伪的发布门控:自改进系统中的大规模持续不变性
提出可证伪发布门控,确保自改进系统每次新增能力时固定不变量不变,经多版本验证安全核心未削弱。
几何引导的约束学习用于大语言模型安全分类
SAE特征提取使安全分类约束K=2最优,精度96-99%,支持线性表示假说,引入自适应锥约束。
NEXUS:面向使用工具的大语言模型代理的结构化运行时安全
NEXUS结构化安全监控器,结合规则与风险评分实现分级干预,F1达0.949,延迟仅0.205毫秒。
LISA:线性索引稀疏注意力实现高效长上下文推理
LISA通过线性注意力和索引器将注意力复杂度降至线性,实现16K上下文50%加速和5.6%性能提升。
GraphContainer:一个用于比较和调试图RAG方法的统一平台
提出GraphContainer平台,统一多格式图表示,可视化追踪检索过程,便于比较和调试图RAG方法。