归因盲区:检测语言模型何时依赖记忆而非检索上下文
提出计算现实监控,通过内部表示差异检测模型依赖记忆的盲点,弥补输出级监控缺陷。
是什么让思维链在探测时起作用?局部共现而非全局推导
思维链优势源于词汇激活与短程共现,非句子级逻辑推导。
多利益相关者LLM对齐:将估计从聚合中分解
DecompR分离效用估计与聚合,固定反事实权重,消除漂移和噪声。
Helicase:不确定性引导下基于自主多智能体LLM的供应链知识图谱构建
提出Helicase系统,基于不确定性引导的自主多智能体LLM,构建供应链知识图谱并推出SCQA基准。
开发用于最优一致性检查的全幺模线性规划:它何时以及为何补充A*算法
提出全幺模线性规划实现最优一致性检查,与A*互补,长轨迹大幅提速。
从规范到指标(N2I-RAG):一个用于法律指标计算的智能检索增强生成框架
N2I-RAG框架整合检索、代理与验证,自动化计算法律指标且可追溯,在法国海洋环境法上优于基线。
TADDLE:一种用于检测有缺陷的LLM生成同行评审的工具增强型智能体
提出TADDLE智能体,结合专家标注基准与多标签分类,有效检测LLM生成同行评审的缺陷类型。
Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)
中文标题:立场:人工智能安全需要有效的可控性
中文摘要:AI安全需以可控性为首要目标,现有对齐机制在运行时控制上存在缺陷,需构建显式控制架构。
压缩知识图谱假说:哪些图事实对科学假设生成至关重要?
研究发现知识图谱对假设生成的影响具选择性,紧凑子图可恢复主要信号,支持压缩KG假说。
广泛的生物医学知识能否情境化为基于场景的命题?
提出SCENE框架,通过迭代搜索将广泛知识转化为可验证的命题,在临床试验和L1000研究中有效发现亚组及生物反应。
移动GUI导航中视觉语言智能体的扩展、基准测试与推理
研究VLM智能体在移动GUI导航中的数据扩展、基准测试与推理,提出HyperTrack和GUIEvalKit,发现强化微调更优。
StepOPSD: 面向智能体强化学习的步骤感知在线偏好蒸馏
提出StepOPSD,以步骤为单位进行偏好自蒸馏,解决信用分配不匹配,在ALFWorld和Search-QA上取得领先结果。
中文标题
检测不等于解决:检索增强大语言模型中的监控控制差距 检索增强LLM存在监控控制差距:能识别矛盾证据却无法约束推荐,单轮评估高估安全性,需在行动选择上弥补。
反作用感知的多教师同策略蒸馏:领域保持下的通用能力恢复
CaMOPD以解耦交替训练和差距样本选择,克服恢复-保持反作用与弱信号,高效恢复通用能力并保持领域能力。
符号查询还是语义检索?面向半结构化问答的数据集与方法
提出DualGraph框架,结合语义与符号知识图谱,在SpecsQA基准上优于现有方法。
中文标题:建模代理技术债务与随机税:一个用于测量、模拟与仪表盘展示的独立框架
中文摘要:提出区分代理技术债务(存量)与随机税(流量)的框架,包含仪表盘、模型及实例验证。
工具模式压缩在受限上下文预算下实现代理RAG
压缩工具模式节省44-50% token,在受限上下文中恢复RAG功能,平均精确匹配提升20.5个百分点,是代理RAG必要基础设施。
MemMorph:通过记忆投毒劫持LLM智能体工具选择
提出MemMorph攻击,毒化长期记忆偏斜工具选择,仅3条记录达85.9%成功率,揭示记忆层新攻击面。
VISTA:面向视觉规格到Web应用编码智能体的端到端基准
VISTA基准评估LLM智能体从视觉规格生成Web应用,结合DOM匹配、浏览器测试和CLIP视觉相似度评估,发现视觉保真度与功能正确性部分解耦。
将偏见转化为漏洞:基于Bandit的样式操纵攻击针对LLM评审者
提出BITE框架,利用上下文bandit选择语义保持编辑误导LLM评审者,攻击成功率超65%。
增强工程:跨专业领域多工具AI编排的方法论
提出增强工程学科,以六阶段方法和可移植性指标,实现跨专业领域多AI工具编排,案例验证有效性。
自适应指导何时有效?部分可观测下自动驾驶的信念感知特权蒸馏
BA-GSAC自适应蒸馏在严重遮挡下失效,线性衰减调度更优。
芙琳娜:碎片化不确定性驱动的拒绝不稳定攻击
发现LLM安全行为存在不稳定区,小扰动引发随机拒绝;提出Furina攻击,用碎片化场景提示诱导该签名,实现高效越狱。
PitchBench:评估音频语言模型中的音高听觉能力
提出PitchBench套件评估音频语言模型的音高听觉,28个实验表明模型音高感知不可靠。
多模态呼吸衰竭预测的前瞻性评估:胸部X光能否超越电子健康记录信号?
结合EHR和胸部X光的门控多模态模型预测呼吸衰竭,AUROC达0.860,优于单独EHR模型和医生预测,显著提升敏感性和特异性。
AutoDFT:用于自主DFT计算的闭环多智能体框架
AutoDFT多智能体闭环框架自主完成DFT各阶段,动态规划与恢复,在34任务上达94.1%成功率,无需专家干预。
SetupX: 大语言模型代理能从过去的功能正确代码仓库配置失败中学习吗?
SetupX框架让LLM代理从失败中学习,实现92%仓库配置通过率,性能超最强基线19%。
基于检索增强生成和大语言模型的SDN地毯式轰炸DDoS攻击智能检测与缓解方法
提出RAG与LLM框架,无需训练实现高精度实时检测与缓解地毯式轰炸DDoS攻击,Gemma-4-31B-IT模型效果最佳。
通过治疗意图检测混杂因素:一种新的观察性研究设计
提出基于治疗意图的混杂因素检测新设计,通过询问专家比较配对单元来揭示未观测混杂变量,并在ICU中验证。
Structure-Adaptive Conformal Inference for Large-Scale Out-of-Distribution Testing
Uniboost:全局协调与价值对齐实现公平高效流量分配
Uniboost通过后验价值对齐与线性提升,优化流量分配效率与可解释性,兼顾微观性能与宏观迭代指导。
自主AI代理的时间一致反事实精算运行时基础
提出自主AI代理运行时精算层,每个动作附反事实风险费用,建立四个结构结果。
DGLD:域门控潜在扩散用于发现新型含能材料
DGLD方法发现12种DFT验证的新型含能材料,性能优异,远超现有方法。
Examining the Challenges of Intellectual Property in AI-Generated Productions
StreamSplit:基于不确定性引导的自适应分割的连续音频表示学习
StreamSplit提出不确定性引导自适应分割,在边缘设备实现流式对比学习,降低延迟、带宽和能耗,精度仅降2.2%。
ChainCaps:基于单调能力衰减的组合安全工具使用智能体
提出运行时规则通过预算交集传播解决权限洗钱,攻击成功率降至0-4.8%,良性完成率96-100%。
引导大型语言模型使用软件设计模式的策略:以单例模式为例
研究表明,迭代二值反馈能有效引导LLM遵循单例模式并提升代码功能,但最优策略因模型而异。
MatFormBench: A Benchmarking Evaluation Framework for Target-Driven Materials Formulation
CORDON-MAS:基于信息流控制的RAG知识投毒防御
指出RAG毒化防御的检测不足,提出CORDON-MAS框架隔离代理实现信息流控制,攻击成功率降低92.4%。
生成式人工智能与高等教育中少数群体知识的边缘化:以残障为例
生成式AI的西方中心数据集强化认知殖民,边缘化非主流知识,尤其加剧残障人士双重边缘化,算法修正仅为姑息策略。
学术研究中的持久AI代理:一位独立研究者的实施案例研究
持久AI代理工作流以缓存为主导,成本从每token转向每完成工件。
感觉调节网络:可停顿性作为对象导向现象学的架构基础
提出感觉调节网络(SMN),以可停顿性为架构基础,通过拮抗动态实现对象导向现象学,调和认知主义与4E分歧。
知识图谱:基于LLM的工业资产运维中缺失的数据层
知识图谱作为数据层显著提升LLM准确性,确定性图处理器达99%,远高于纯LLM的65%。
大型语言模型中的置信度校准
LLM普遍过于自信,但存在难易效应:难题过度自信,简单题欠自信。
多少思考才算够?量化与理解大语言模型推理中的冗余
发现LLM推理步骤冗余高达61%-93%,证明这是长度无关奖励的结构性结果,非模型缺陷。
探索开放性的要素:用大型视觉语言模型复现Picbreeder
用视觉语言模型复现Picbreeder,发现与人类驱动的差异,并探究噪声、多样性、记忆等因素的影响。
实现重构权威:自主智能体系统中的运行时构建、依赖解析与执行门控
提出运行时执行模型,通过动态依赖解析与恢复循环确保智能体仅在权威可构造时执行,保障安全与条件活性。
当正确信念崩溃:临床压力下LLMs的认知韧性
LLMs在临床压力下会放弃正确诊断,知识与鲁棒性分离;R-FT训练几乎消除信念变化。
BoxLitE:基于凸优化的忠实知识库嵌入
BoxLitE模型将知识库嵌入转化为凸优化问题,为DL-Lite^H提供弱忠实嵌入,保证可满足性。