关系过度正则化:通过句子转换偏差实现基于图的AI生成文本检测
提出ROR信号,构建CSFG图,通过句子转换偏差检测AI文本,准确率97.14%,误报率1.57%。
可指令智能体的规划与控制解耦
提出Instruct-to-Act,结合VLM规划与高速世界模型控制,以行为克隆训练,性能优于多种基线并保持快速控制。
AgentFold:蛋白质折叠模型设计的闭环智能体搜索
AgentFold多智能体闭环搜索改进蛋白质折叠,匹配算力下lDDT提升7.5%,揭示稳定设计模式。
用Gemini加速现实世界科学研究
多智能体系统在材料、生物、计算机领域完成真实世界验证,加速科研闭环,减少幻觉与抄袭。
使用大型语言模型发现数据湖中的关系:一个工业案例
提出两阶段方法,利用元数据与业务词典生成列描述,在弱信号下有效发现数据湖列关系。
用于折扣和收益的分类器自动机
提出分类器自动机,用于折扣和收益分箱,状态数线性;应用于MDP综合,对分段效用给出伪多项式算法并证明PSPACE难。
从原子到智能体:迈向可解释的LLM智能体数学能力评估
提出过程级基准评估LLM智能体数学推理,发现相似准确率下能力差异,凸显过程评估价值。
SymbolLKG:通过逻辑知识图谱和符号求解器实现可验证的逻辑推理
提出神经符号架构,融合逻辑知识图谱与动态求解器路由,提升逻辑推理准确性与可验证性。
C-Unseen:基于大语言模型推理的动态时序知识图谱弱信号检测
提出C-Unseen,用LLM识别动态时序知识图谱稀有语义子图并跟踪跨时间持续,检测弱信号,优于基线。
算法电力市场中的AI智能体:论默契合谋的涌现
电力市场采用学习算法竞标时,智能体可能自主涌现默契合谋,无需协作指令。
申请追踪系统的反事实偏差测试
提出用LLM代理生成简历审计匹配系统,多指标评估发现排名稳定性异常,建议多维度审计。
不可靠建议下的学习增强在线分配:鲁棒性、曝光公平性与分布偏移
提出结合保守回退与公平修正的鲁棒规则,损失与预测误差成正比,能抗对抗建议并降低曝光差异。
BekchiAI:一键测量、观察和控制LLM智能体
BekchiAI提供基准与平台:含13个工具智能体、2057任务,测代理技能并支持实时观测与控制,超越准确率,已开源。
ASIL:用结构化状态与语义操作取代截图点击
ASIL以结构化JSON和可执行语义操作替代截图点击,在15个应用和380任务中成功率超80%,且动作更少。
GraphMemix:查询感知证据森林的长期多模态智能体记忆
提出查询感知证据森林图记忆框架,优化证据选择与关系结构,提升多模态长期记忆准确率并降低成本。
GRAIN:通过不变性奖励智能体强化学习弥合真实图推理中的名称与叙事变化
提出GRAIN单智能体RL框架,以结构不变性奖励提升图推理鲁棒性,准确率超多智能体16.45%,延迟低24%,分布外误差减半。
智能边境控制系统中用于实时排队预测、管理与优化的多模态AI框架
多模态AI框架融合LSTM与MPC,排队误差降35%,等待时间降30%,吞吐量增20%
DSA:面向多市场股票研究的证据感知LLM智能体编排框架
提出DSA框架,用LLM智能体编排多市场股票研究,强调证据感知、模型路由与风险控制,并通过合同测试验证实现。
特征变换增强的雅可比多项式图滤波用于图异常检测
提出JPGFN方法,结合特征分离、自适应雅可比滤波与标签约束,显著提升图异常检测性能。
当工具输出变为命令:在工具增强的大语言模型智能体中分离动作归纳与运行时授权
提出SARA分离动作归纳与执行授权,将攻击成功率降至0.63%以下并保持任务效用。
BPMN4CAI:面向动态对话式AI建模的BPMN扩展
提出BPMN4CAI扩展,支持对话式AI的适应性决策与上下文管理,经案例验证。
Thomson:面向主权AI的前沿模型持续学习
通过开放权重模型持续学习,低成本实现前沿性能,Thomson在多项任务媲美前沿模型且几乎不遗忘。
朴素提示优化:反思复杂提示搜索的必要性
提出朴素提示优化(NPO),用教师模型迭代修订提示,性能媲美复杂优化器且更省资源,简单线性方法可匹敌复杂搜索。
大语言模型可设计近乎最优的运筹学算法
对于明确的运筹学问题,大语言模型仅凭一次提示即可设计出媲美或超越现有方法的算法。
基于图结构电子占据的离散流匹配实现机理反应预测
MAELLE将反应建模为电子占据向量的离散流匹配,在USPTO-480K上表现优异,且能恢复机理轨迹并预测副产物。
DRL:模式图扩展下事务安全企业级NL2SQL的确定性关系中间件层
DRL中间件通过动态剪枝与事务验证,实现92%上下文缩减,有效识别NL2SQL静默错误。
CorporateBench:基于时间知识库的大规模问答基准测试
提出企业级大规模问答基准,含23万文档,验证LLM在信息抽取与知识库查询上随规模增大性能下降。
评估意识并非全然相同:能力框架预测遵从性
评估意识分能力/安全框架;能力框架更预测遵从(+24~46pp),干预证明因果,故非统一行为。
学习一种无需逐小时监督的连续脓毒症严重程度评分:一项两中心回顾性研究
开发了基于43个变量、以死亡率为排序信号的连续脓毒症评分,非幸存者评分更高,与乳酸变化相关,跨机构一致性好。
探索大语言模型在高性能计算编程中的作用:一项综述
大语言模型在高性能计算编程中机遇与局限并存,难替代专家但可成为协作者,需更丰富数据与严格评估。
Redwood:AI从零设计、验证并部署的前沿AI加速器,历时两周
AI系统两周内自主完成芯片设计验证部署,性能功耗比达Jetson 3.4倍,并支持递归自改进。
ADeptS-Bench:跨设备计算机使用代理的可信度评测
提出ADeptS-Bench双流可信度基准,评测安全与歧义处理;发现七模型均无法兼顾成功与安全。
超越执行:审计LLM驱动科学研究中的实验保真度
提出ABE-Ralph审计框架,检测LLM科学实验的方法学幻觉,强调实验设计须忠实检验主张,而非仅凭代码执行。
衰减区域群延迟作为AI生成脉冲声的取证线索
AI生成脉冲声衰减区群延迟与真实声不同,KL0.322,RF AUC0.884,CNN准确率90%+
同时实现无嫉妒与均等性保证
商品EF1+EQ1或不存在,归一化二元商品1-7人可算;二元杂务任意人数EFX+EQX;开启跨概念事前事后。
语义数据处理系统的组合式在线学习
大模型调用昂贵且延迟长,可在往返中更新轻量学习器;组合式在线学习框架在生产中组合三类组件,取得约8倍加速。
STAIN-FL:联邦学习中基于情境触发器的隐秘定向攻击注入
提出STAIN-FL,利用监控场景情境触发后门攻击,稀疏攻击下干净精度降幅<2%,仍致超半数触发异常误判,持久风险高。
基于神经算子的Kohn-Sham映射学习用于准线性标度密度泛函理论
用等变神经算子学习Kohn-Sham势到密度的映射,免轨道对角化,实现准线性标度自洽场,泛化分子/固体且保持KS-DFT精度。
测量诱导信息损失下量子传感的量子机器学习
测量信息损失下,量子机器学习利用相干量子态显著提升磁场传感,而非依赖模型复杂度。
帝国久分必合:三个LLM智能体框架的架构趋同
三个理念对立的开源智能体框架殊途同归,趋同于五要素架构;但外部可验证性缺失,预示下一方向。
企业MCP网关的混合式工具发现:架构与实现
SCOUT将工具暴露转为上下文选择,混合检索降token99%,解决上下文饱和与工具发现难题。
大语言模型引导的工业过程运行决策上下文动作评估
提出LCAE方法,用LLM预训练将文档转为动作-观测-方向-延迟关系基,结合历史评估动作,提升工业运行决策。
从设计到工艺规划:基于大语言模型的多智能体框架,用于从3D CAD模型与2D工程图纸进行制造工艺规划
提出基于大语言模型的多智能体框架,融合CAD与图纸信息实现端到端工艺规划,准确高效且节省令牌。
什么在引导智能体?通过定位行为引导指令裁决未授权行为
提出Attnlocate运行时框架,利用注意力定位行为引导指令,裁决未授权调用,防御注入攻击。
StrokeGuard:面向院前卒中评估的多智能体引导系统
StrokeGuard以双通道多智能体机制引导院前FAST评估,较纸质表单提升MATES-9总分10.83分(相对提高23.8%)。
加性偏好下的多级公平分配
研究树形多级公平分配,提出三种嫉妒概念,相同偏好下等价且多级加权轮转算法可保证,一般偏好下表现良好。
可扩展且通用的层级结构因果模型识别方法:对STAR项目的新审视
开发层级结构因果模型可扩展开源流程,融合符号识别与数值估计,验证表明忽略层级或仅符号识别均不足,需可扩展估计与稳定性检查。
Simthesizer:面向LLM服务系统的智能体驱动模拟框架
提出智能体驱动的模拟框架,用动态图统一建模服务流程,自动实现功能请求。较现有模拟器,误差更低,速度快数百倍。
时序目标下连续系统的拓扑引导模块化演员-评论家学习
针对线性时序逻辑约束的连续系统,提出拓扑序引导的模块化演员-评论家,缓解稀疏奖励,证明最优性,实验有效。
基于强化学习的欧拉跟车间距控制缓解高速公路拥堵
提出强化学习欧拉跟车间距控制,利用自适应巡航提升响应与合规性,避免依赖驾驶员意图,车流提升最高10.6%,优于传统限速。