面向“检索或拒绝”热机械点阵搜索的属性注册表契约
用属性注册表契约实现热机械点阵检索或拒绝:可行则返回可重建行,无解则给出极小不可满足约束与修复松弛。
TriCalRAG:面向AIOps本地化LLM根因分析的三策略检索增强基准
提出TriCalRAG本地LLM根因分析基准:RAG较零样本提升F1约0.10–0.27,且显著改善校准稳定性。
随机代理:面向工具调用型LLM智能体的结构性租户隔离
指出LLM代理解析租户标识的越权风险,提出移出工具模式、绑定凭据并在代理下层强制隔离,实验验证有效。
RAIN:用于语义水印提取的区域感知反演网络
RAIN将水印端点恢复分解为图像锚点与噪声残差,免提示一步提取语义水印,开销低于OSI与FARI。
大语言模型作为神谕:对主观个人问题的依赖
人们将主观个人判断外包给大模型,此类“神谕式”使用随时间增长、年轻人更普遍,用户常不自知且不满。
LiftGCN:基于Joukowski谱提升的高效能量保持图学习用于有限元应力预测
LiftGCN用Joukowski谱提升实现能量保持的图网络,单层仅一次稀疏聚合,精准重建有限元应力集中。
IMPACT-VLA:面向视觉-语言-动作策略的交互感知多模态传播归因——基于反事实轨迹
提出IMPACT-VLA,通过反事实轨迹闭环重执行量化各阶段模态贡献,揭示主导模态转换与跨阶段交互耦合。
重新思考程序化音频预训练:数据源缩放与目标适配
程序化音频预训练需源感知:公式类覆盖与渲染多样性收益各异,且偏好10%–25%低掩码率,异于自然音频。
生成以探索,选择以利用:将基于大语言模型的标题生成与个性化推荐对齐
提出GESE框架,解耦LLM标题生成探索与实时选择利用,线上CTR提升2.57%,停留时长提升0.87%。
光伏预测中的集成复杂性
消融与匹配对比表明:光伏集成静态融合仅部分数据集降误差,天气门控无稳定增益,成员冗余,宜组件级评估。
超越数值时间序列:面向异构上下文的多模态预测统一基准
提出MUSE-Bench统一基准,覆盖8个领域14个数据集与6类上下文,系统评测多模态时间序列预测,揭示数值基础模型领先、外部上下文有益等发现。
并非所有提示都同等:面向多模态强化后训练的探索引导提示脚手架
提出探索引导提示脚手架,动态调整提示分布,借探索潜力分与教师改写显著提升多模态强化后训练效果。
分支最优传输摊销
受分支最优传输规模经济启发,提出可扩展分支流匹配算法,学习高维分支生成流,并在生物与图像生成中验证。
先收敛后多样化:多目标贝叶斯优化中收敛性与多样性的解耦
提出先收敛后多样化(CTD)方法,将多目标贝叶斯优化的收敛与多样性解耦为两阶段,在紧预算下更优。
OrchSLM:探究小语言模型编排的动态
提出OrchSLM路由框架,统一非交互式小模型编排,揭示任务结构、模型池与共识对编排动态的影响。
有据可依的提取时间线差异裁定(GAVEL):将临床时间线与其病例报告比较
GAVEL:以病例报告为准的LLM评判协议,逐项裁定两条临床时间线的差异;合并后多数比较更优,差异大幅减少。
面向智能供应链分析的混合智能体AI框架
混合智能体框架协调专业智能体完成供应链分析,兼顾探索与确定性流程,测试准确率达90%,token用量降约四倍。
GeoSkill:面向地理空间智能体的经验驱动分层技能学习与协同修订
GeoSkill提出分层技能库与协同修订机制,将历史经验转为可复用技能,提升地理空间任务准确性与工具可靠性。
τ-Elicitation:语音智能体中多轮实体抽取基准测试
提出语音实体抽取基准τ-Elicitation,语音配置精确成功率仅0.14–0.41,验证后错误修复率24–37%,策略脚手架可提升14–31点。
身份不止于回忆:已部署AI智能体中持久身份的基准
提出PAI-Bench,区分身份回忆、表达与行为执行,发现提示和启动线索影响身份成分,且评估者敏感。
安全作为约束:微调大语言模型推荐器使其自我解释
微调推荐大模型生成个性化解释,约束GRPO兼顾忠实与无害,三标准通过率大幅提升,推荐性能不变。
实践中的 FedV-KGQA:设计经验与交互式原型
垂直分区图谱多跳问答:联邦融合可近集中式精度,锚定与数据丰富比模型选择更关键,并附交互原型。
太阳能智能
太阳能智能混合检索增强框架,融合结构化分析、证据型科学问答与机器学习预测,支持多源数据与代理调用。
可恢复性作为长时程 AI 智能体的系统原语
提出"可恢复性"系统原语,将状态复用变为受证据与独立校验约束的显式决策,防止错误延续。
增强事件链接的候选事件获取
MACE以证据专用LLM智能体提炼时间、地点、参与者等证据优化候选事件获取,在两个基准上提升链接准确率。
一个向量能容纳多少思想?叠加推理的容量
累积叠加保留完整推理历史,比仅存当前前沿更省维度且更可靠;均匀累积加权最优。
窗口化 A-K-MDP
提出窗口化 A-K-MDP,枚举指定除数窗口内所有可行划分,避免遗漏更优抽象状态,33 例中 25 例提升、8 例持平。
漂移约束优化:微调指令模型时只有方向重要
预设漂移预算,微调转为方向选择;选对方向可逆转纯问答微调失败,提升推理与百语翻译能力。
IBBench-Light:面向外部指令的任务条件响应的配对评估
IBBench-Light 配对评估同一记录的执行与处理任务,配对成功率揭示单任务均值掩盖的差异,须结合停止策略解读。
JaxAHT:一个基于JAX的临时团队协作库
首个基于JAX的开源临时团队协作库,标准化并加速AHT研究,较PyTorch约快95倍,提供多域评估队友。
可信智能体AI:威胁态势、防御架构与开放挑战的综合网络安全与系统综述
综述206项研究,形式化智能体架构与六维可信分类,剖析威胁面并提出零信任纵深防御架构。
稳态持续学习
提出稳态持续学习法,借助输出异常发现环境数据中的离群点,使智能体在变化环境中持续学习且不遗忘。
旁路观测:一种非侵入式逐层语义提取架构的概念设计
提出非侵入式旁路观测架构:在Transformer选定层加只读观测头且不回传主干,实现逐层语义读取,并分析开销与变体。
面向公共充电系统中电动汽车-充电站-电网统一优化的LLM增强多智能体强化学习
提出LLM增强多智能体强化学习框架,统一优化电网、车辆与充电站,自适应平衡多目标,训练提速超70%。
ViperQ:基于拍卖市场理论的订单流模式识别用于强化学习交易
ViperQ以拍卖市场理论构建20维状态,结合损失厌恶PPO,在未见数据上取得高收益低回撤。
地图使用者与地图绘制者:从习得表征出发的认知归因范围
提出五重归因框架,区分追踪、应用、习得与保持,论证应用能力不能确定习得能力,厘清认知归因的界限。
动态学习解决方案:面向个性化教育视频生成的系统
融合RAG、扩散模型与语音合成,将NCERT教材自动转为响应提问的个性化动画讲解视频。
SAILOR:求解器辅助的基于大语言模型的交互式优化恢复
SAILOR检测优化问题中缺失的数值,按影响排序向用户追问并更新模型,在1723个基准上验证可行。
LoRA微调模型用于控制系统课程问答:模型规模与秩效应的多维评估
微调Qwen2.5-3B/7B并比较LoRA秩4/8/16:微调提升答案相似度与结构化输出稳定性,7B-r16最优,r=8性能与参数效率更均衡。
营销研究中的合成数据:如何评估与何时可信
区分三类合成数据与四类准确度指标,提出无需真值的事前可答性诊断,R²>0.7筛选可提升个体相关性15%。
语义知识技术:语义网所忽视的,与其从未拥有过的
语义网虽提供知识基础设施,却缺失条件、操作与覆盖,本文提出语义知识技术七层架构与五项理解检验。
基于EEG信号的精神分裂症检测:一种采用频谱图表示的Transformer框架
提出基于STFT频谱图的Transformer精神分裂症检测框架,被试级评估,AUC达92.88%。
VeriDx:以疾病为中心的验证,赢得诊断资格
VeriDx以疾病为中心验证诊断推理,追踪假设应履行的临床义务,揭示漏检、未决鉴别、矛盾与过早闭合等错误。
MOSCOPT:面向LLM智能体的技能混合集体优化
MOSCOPT免参数联合优化N个技能池与门控技能,每步动态选K个,三阶段交错更新,5基准3模型持续领先。
问题开局:智能体深度搜索中第一步至关重要
首步检索模块将问题分解为线索、互补检索并重排,优化智能体初始上下文,答案准确率从83.1%升至90.5%。
闪电编织:通过能力组合提升推理模型的精度-效率前沿
以在线策略蒸馏组合独立后训练的精度与效率能力,精度提升、输出更短,达到最优精度-效率前沿。
以动作级粒度验证网络运维智能体的安全信号
为NetOps智能体构建动作级真值,发现内部信号可在执行前更可靠预测动作有害与进展,用于安全反馈。
超越场景描述:面向虚拟世界非视觉访问的多智能体编排
MetaBlind以八个专用智能体加可访问性编排器,按相关性与听觉负荷筛选信息,经语音、结构化音频或触觉输出,避免听觉过载,尚处设计阶段。
人工智能部署问责工程:面向安全关键社会技术系统中可问责 AI 的愿景
提出AI部署问责工程,将问责视作部署层属性,围绕失效发现、隐私测量、代理AI风险与失败转化展开。
OptoAgent:面向课堂环境机会性视力微筛查的可信多智能体框架
将课堂墙面显示内容嵌入校准视标探针,八智能体协同感知、质控与纵向累积,输出转诊级视力关切评分。