用图神经网络近似系统发育树之间的SPR距离
研究用GNN近似SPR距离,训练后快速比较,解释87-90%方差,但外推至大树精度下降。
PRISM:面向高效神经网络加密的敏感性感知多项式剪枝
提出PSAP剪枝方法,联合优化权重、激活敏感性与旋转代价,在加密网络中大幅降低灾难性层数量,提升可靠性同时减少计算开销。
分布优先的人口模拟:非WEIRD LLM人物建模中的崩溃、校准与召回
独立LLM代理导致人群响应分布崩溃,分布优先法(VS)可校正但过度分散,提出一次性分布建模与预算路由器。
FSDBN: 通过动态脑网络实现前景感知的脑电-视觉对齐
FSDBN用动态脑网络和前景对齐实现脑电视觉解码,零样本检索top-1达69%。
利用扩散生成模型应对听觉注意解码中的数据不足问题
扩散模型合成EEG数据增强训练集,显著提升助听器听觉注意解码性能,缓解数据稀缺问题。
解码时文法:基于文法片段精化序的约束LLM生成
提出解码时文法,利用运行时环境动态约束LLM生成,消除未定义符号引用,保证语法语义正确且开销适中。
用AI查询多模态科学论文:盲人、低视力与明眼科学家的实践与偏好
采访盲人与明眼科学家,发现AI回答不全或错误致其放弃查询,并提供115条查询数据集。
钓鱼邮件检测的对抗鲁棒性:TF-IDF+逻辑回归与微调DistilBERT的比较研究
两种模型干净数据准确率超98%,对抗测试均降至约64%,表明干净数据准确率不能预测对抗鲁棒性。
HALLMARK:诊断大语言模型引用验证器的三种故障模式
HALLMARK基准发现,误报率而非召回率决定LLM引用验证器部署可行性,三种失败模式证实此点。
CPInj:揭示文本协作提示优化中的提示注入风险
提出CPInj攻击揭示TCPO的提示注入漏洞,现有防御无效,APAgg仅部分缓解。
波形的洞察:以透明优先的语音与音频智能平台Caption Studio
Caption Studio是透明优先的语音智能平台,采用三层架构实现转录、音频分析与集成,通过明确标注指标来源提高可靠性与可解释性。
基于主动加固的智能体应用数据泄露防护
提出预处理流水线,扫描加固验证多智能体系统,基本攻击100%消除泄露,压力攻击减少91%。
计算教育中团队问题解决练习的评估
比较聚类与LLM评估桌面演练团队表现,聚类可靠低计算量,GPT-5.2误差低。
MIRAGE:多尺度病灶信息表示与辅助引导的MRI对比增强
MIRAGE结合全局重建与病灶感知损失,在MRI对比增强中优于生成模型,但存在保真度与效用权衡。
连续步态识别中抗遗忘与抗推断的码分调制层
本文评估码分调制层在连续步态识别中的效果,可保持准确率并防御推断攻击,无需回放数据。
基于智能体的现实到仿真:使用视觉语言代理的物理世界建模
提出Agentic Real2Sim框架,用视觉语言代理自动将真实交互转化为可仿真场景,降低成本。
密集联想记忆的自由能景观
利用大偏差理论,得到密集联想记忆自由能泛函表达式,揭示了检索依赖初始状态并给出精确阈值。
RLHF偏好数据中的评估者状态偏差:一个审计框架
提出RLHF偏好数据中评估者状态导致的系统偏差,并构建审计框架与可检验预测。
仅需8个Token:弱到强离线策略RL的辅助分支方法
W2SPO通过插入短辅助段(8 token)实现弱到强学习,提升数学推理性能并加速训练3.55倍。
用于软毛绒伴侣情感触觉分类的轻量级1D CNN设计与验证
提出轻量1D CNN用于软毛绒伴侣情感触觉识别,公开数据集,模型达75%准确率,可20Hz实时运行。
Some Large Language Models Exhibit Consistent Risk Attitudes
PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统
揭示规划阶段注入攻击可级联放大,强模型更脆弱,同质管线存在盲点,推理模型可抵抗。
面向AI智能体系统的确定性重放
agrepl框架通过MITM代理实现AI智能体执行的确定性重放,保真度1.0,延迟降低98.3%。
生成式本体归纳:使用大语言模型从文档语料中发现领域无关的模式
提出GOI框架,自动生成结构化本体,在四个领域覆盖95-100%,优于通用模板。
用小型语言模型推动AI民主化:面向本地部署的结构化基准测试与参数高效微调
通过结构化基准测试和参数高效微调,证明子3B小型模型可作为本地专家胜任专业任务。
掩码扩散语言模型:智能体强化学习中强大且可操控的文本世界模型
提出MDLM作为可操控文本世界模型,双向锚点去噪超越大4倍LLM,零样本迁移获47%绝对提升。
JUMP:针对微调扩散语言模型的单次成员推断
提出JUMP方法,利用扩散模型并行解码特性,单次查询实现高效成员推断,AUC从0.82提升至0.90。
夏普利上下文剪枝:基于合作博弈的上下文重排序与剪枝方法
提出夏普利上下文剪枝框架,合作博弈视角,蒙特卡洛采样高效剪枝,多任务性能优异。
人机协作中的非均匀性原则
AI工作流中,人类监督需按非递减间隔放置,以提升满意度并减少重做和资源消耗。
LaCache:面向扩散大语言模型的精确缓存与精度自适应推理
LaCache通过无损缓存和混合精度量化,实现1.3~40.2倍加速,保持任务精度。
智能语音代理Jarvis
提出JarvisBench基准,验证实时语音中介可提升长期AI代理任务性能与用户理解,但效果依赖中介模型能力。
何时规划:学习在反应控制与深思熟虑规划之间选择
提出基于反应策略不确定性分数的强化学习方法,让智能体学会何时快速反应、何时需要规划。
FST.ai 2.5:面向奥运和残奥跆拳道决策支持、运动员数字孪生及联合会级分析的可解释与不确定性感知AI
提出可解释、感知不确定性的AI框架,整合运动员智能与竞赛分析,支持透明治理与个性化发展。
FUSAR-R1:用于SAR图像智能解译的大规模推理模型
提出FUSAR-R1模型,利用思维链推理与强化学习,在SAR解译任务中显著超越现有模型。
DL本体中认知保密策略下的易处理查询回答(扩展版本)
提出基于最小策略违反的CQE新语义,在DL-Lite_R中实现多项式时间查询回答并满足不可区分性。
约束锚定推理路径
提出CART框架,通过符号约束断言与回溯控制将错误雪球率从0.65降至0.14,提升多模态推理准确率。
基于语义-物理对齐的定制足矫形器闭环生成设计研究原型
提出TANS-FO原型,通过语义-物理对齐实现定制足矫形器闭环生成,快速合成可制造晶格鞋垫,压力预测高精度,初步观察显示短期舒适度改善。
RECON:对长上下文组合推理的智能体记忆进行基准测试
RECON基准评估长上下文组合推理,揭示系统在级联推理和回溯上的巨大局限,最强准确率仅22.4%。
TopoTuner:大语言模型的拓扑微调
提出拓扑引导的选择性微调框架,仅训练1-2%参数即达全微调性能,优于LoRA,可跨任务复用。
从超载到洞察:AI智能体如何助力科学家分析复杂数据
欧洲XFEL科学家开发AI智能体系统,应对大数据分析难题,提出知识检索与代码生成需求及设计建议。
当大型语言模型过度回答:测量与缓解基于LLM的硬件描述语言问答中的质量问题
LLM在硬件描述语言问答中常过度回答,提供冗余和冗长内容,多智能体框架可显著提升答案质量。
预期自由能作为ρ-POMDP的信念依赖效用
主动推理中预期自由能等价于信念依赖效用,自动平衡探索与利用,无需手动调参。
连续思维链模型训练:两种机制之比较
提出C-MTP直接监督压缩表示法,优于间接法,但长推理链任务性能下降65%,揭示连续思维链局限。
奖励驱动的大语言模型智能体工作流:融合POMDP路由与自我修正的自主决策
提出奖励驱动工作流,结合POMDP路由与自校正,在ALFWorld和WebShop上成功率提升24.5%。
PriorProof:形式化证明中技术新颖性的时点度量
PriorProof无需标注,通过证明依赖足迹和惊奇度评分,时点度量形式化证明新颖性,与专家一致性达69.7%。
Otap:面向智能体轨迹中规划与执行评估的结构感知最优传输
提出基于最优传输的轨迹评估方法,通过依赖图距离区分有效与无效规划,对重排序不变,容忍冗余步骤。
结合数值天气预报的傅里叶几何风电功率预测
提出融合SCADA与网格NWP的多模态框架,利用几何编码和傅里叶神经算子,显著提升风电预测精度。
证据接口如何塑造检索增强型阅读器对支撑信息的使用
证据接口揭示RAG中top-k分数隐藏的支撑链缺失或不兼容,检查完整支撑可解释性能差异。
AI代理行为诊断框架
提出分层归因框架,区分计算与行为调制层,强调行为来源归因对治理关键。
LoRA微调代码智能体时轨迹数据筛选的系统评估
系统评估轨迹数据筛选对LoRA微调代码智能体的影响,发现质量-数量权衡依赖规模,误差重试率是关键子维度。