科学论断能否从大型语言模型中移除?论断级遗忘的系统评估
现有遗忘方法仅表面抑制,无法有效删除大模型中的过时科学论断,新基准SciUnlearn揭示需专门方法。
跨材料刚度与几何形状的软组织变形及力预测泛化
提出经校准的等变图神经网络,实现跨刚度与几何的软组织变形和力预测,亚毫米精度,10毫秒推理。
深度学习模型也能回忆特征
提出“特征回忆”:线性投影按激活缩放检索存储信息,普适多种架构,为机制可解释性研究提供新方向。
只比较不求解:LLM智能体运行时干预的微型顾问
提出只比较的微型顾问COTA,通过成对比较决定干预,提升LLM智能体可靠性。
评估大型语言模型在国际海运危险货物规则合规中的表现
首个基准DGEval测评13个模型对IMDG规则的掌握,最佳模型超人类基线,但积载、隔离等安全关键领域薄弱,需人工监督。
社会化分工与协作:优化冲突下的类增量学习再思考
针对优化冲突下的类增量学习,提出社会化分工协作框架,基于自由能分配会话,协同演化推理。
混合边缘云数字孪生用于家禽生产福利约束控制
边缘云数字孪生结合混合模型与预测控制,温度误差降至0.4℃,氨气违规减90%,通信降低30倍。
本体支持的AI模型与数据集管理
提出基于本体的AI模型交换平台,管理数据集,消除语义鸿沟,应用于实时关键系统。
CLEAR:面向效用保持的LLM安全对齐的连续潜在适配器路由
CLEAR通过隐状态门控连续控制安全适配器,兼顾安全与效用,在降低有害完成率的同时减少性能退化。
从法规到实施:工业界大语言模型辅助法规合规的批判性评估
研究LLM生成合规文档:指南模糊时需高上下文提示;严格格式结果一致但易幻觉。
关于大型语言模型的六个误解:一个最小模型与诊断分类法
提出最小模型,用四组区分诊断LLM六大常见误解,应用于AI政策分析。
用于端到端计算材料发现的LLM智能体
MAESTRO智能体利用LLM自动完成MOF筛选全流程,从文献到数据库,发现常规方法难以识别的高性能材料。
基于边缘的智能体检索增强生成用于FHWA桥梁检查合规自主化
提出BridgeGuard:离线智能体RAG,融合向量检索与SQL,在边缘设备实现桥梁合规检查,准确率近100%,速度197座/小时。
机械滥用下锂离子电池热失控的红外热点引导预警
两阶段红外热点预警融合多传感器特征,提前四秒预警热失控,AUC达0.908
AEGIS:防止MCP中跨域资源滥用
提出AEGIS组件,利用大语言模型统一分析MCP工具调用,结合策略引擎与网关,检测并缓解跨域资源滥用。
同行投票式LLM智能体压力测试:信息流引发词汇趋同,但分布式来源无可靠匹配暴露优势
同行投票信息流使大模型智能体词汇趋同,但分布式来源无可靠匹配暴露优势。
面向多智能体系统的流量建模:协调拓扑的作用
多智能体LLM系统内部生成请求,协调拓扑决定调用时序。经验测量显示,扇出协调导致双峰分布,推理阶段符合对数正态,泊松模型被拒绝。
面向MR引导放疗的弥散加权成像处理与判读一体化平台
集成DWI处理与解读平台,融合深度学习和RAG,专家评分高(4.65/5)。
在Meta实现安全部署:面向持续变更安全的健康检查
Meta构建部署健康检查系统,平衡发布速度与可靠性,通过指标查询和自动回滚保障大规模服务安全变更。
军事指挥控制中智能体AI系统的测试与评估
梳理240项测试实践发现,智能体特性削弱八项假设,使测试结果不能支撑从测试到实战的推断。
氛围编程与Web应用安全:双提示研究
安全提示变体生成的Web应用漏洞更少(24对51),无高危问题,但样本小,属初步研究。
语音大模型会听见自己的观点吗?诊断并缓解流式情绪理解中的先前信念污染
流式情绪理解中历史标签污染当前感知,致准确率大跌。提出EmoUpdate免训练框架,经声学防火墙、因果过滤与反污染算子,显著提升八项评测表现。
ARQ:用于C/C++漏洞检测的智能体CodeQL查询优化
ARQ用合成程序执行证据自动优化CodeQL查询,提升C/C++漏洞检测,修复长期未解决官方问题。
BC-Bench:在ERP领域特定语言中评估智能体工程
提出BC-Bench基准,评估ERP领域AL语言智能体工程;101个真实任务,通用基准提升不迁移,凸显领域特定评估必要。
神经基元:基于基元模仿学习的自主飞行高效端到端局部规划器
提出基于基元模仿学习的端到端局部规划器,实现实时生成平滑安全轨迹,计算快、内存低,且仿真到实机迁移鲁棒。
ExploraTwin:数字孪生仿真的非营利研究平台
介绍开源非营利平台ExploraTwin,支持问卷与小组两种仿真模式,复现19项实验,首轮回答有效率达99.6%。
ClawSentry:守护自主LLM代理的渐进式多层级安全监控器
提出四环节渐进风险模型,构建三级决策引擎与防绕过机制,将攻击成功率从39.55%降至2.61%,且不干扰正常工具调用。
锚定正则化直接最小二乘法(ARDLS):整合既有优先排序算子用于层次分析法中的优先级提取
针对DLS多解与不稳定问题,提出ARDLS,整合既有优先算子作为锚点,保证唯一全局最优,降低RMSE。
SRL-MPC:形状感知的强化学习模型预测控制
提出SRL-MPC,用高阶控制障碍函数和强化学习实现异质群体形状感知的安全自适应导航,性能优于基线。
共形策略控制
利用安全参考策略校准新策略行为,无需假设模型类或调参,以有限样本保证风险容忍度,实现安全探索并提升性能。
从多智能体到单智能体:技能蒸馏何时有益?
将多智能体工作流蒸馏为单智能体技能,区分能力资源与流程指导,提出AdaSkill,兼顾性能与低部署开销。
面向复杂序贯决策任务的混合LLM增强强化学习智能体
融合LLM规划与RL动作优化,提升复杂序贯决策的样本效率和成功率,优于单独使用。
不完美感知智能体的区间POMDP屏蔽
基于有限数据估计感知不确定性,构建区间模型和保守信念集,提供有限时域安全保证,实验提升安全性。
基于约束贝叶斯优化的机器学习算法能耗自动最小化
用约束贝叶斯优化在保证性能前提下最小化机器学习训练能耗,回归分类任务均有效。
GRIP:基于信息受限前提的接地推理
提出GRIP,用信息瓶颈限制检索证据,解决查询主导,性能优于基线,幻觉降73%,互信息降30倍。
评估音乐情境保留:音乐编辑系统的多层面框架
提出首个音乐编辑情境保留评估框架,覆盖四类音乐属性,含精细指标与人类验证,可诊断系统优劣。
CausalProfiler:生成用于严格透明评估因果机器学习的合成基准
CausalProfiler随机生成合成因果基准,覆盖观察、干预、反事实三层,支持严格透明评估因果机器学习方法。
专业软件开发者不靠“感觉”而是“掌控”:2025年AI智能体编程应用
有经验的开发者把智能体当效率工具,但坚持掌控设计实现以保证质量,偏好协作而非完全委托。
用于Verilog代码生成的大语言模型:文献综述与未来之路
系统综述102篇文献,梳理LLM在Verilog代码生成中的应用、评测指标与方法,指出局限并规划未来研究方向。
中文标题
提出FHCR框架,通过压缩KV表示保留完整循环记忆,实现整曲训练;评估显示其保持长程上下文利用,同时降低内存成本。
野火抑制:复杂性、模型与实例
研究图表示下的资源分配抑制野火,证明强NP完全性,提出新MIP模型达最优,并生成物理基准实例。
通过脑机接口的感觉恢复:一项范围综述
脑机接口可恢复感觉运动功能,本文用侵入性×信号方向框架综述31项研究,指出非侵入AI语音解码进展迅速,提出融合路线图。
学习世界模型中用于反事实推演的低秩动力学有效潜在载体
低秩四维补丁即可驱动十二步自主反事实推演,但仅编辑成功不够,需动力学有效且具目标特异性。
不可训练元件决定物理学习记住的内容
不可训练元件使物理学习记住初始化尺度(破坏齐次性);守恒律不影响记忆,只影响解质量;二者是独立归纳偏置。
近似推测解码
提出近似推测解码(ASD),无训练,有界接受不匹配并重用后缀,吞吐量提升3%-15%。
AI拟人化的知识政治
批判AI拟人化框架出于制度优势而非认识权威,加重神经多样性用户负担,并提出公平研究承诺。
完整、可扩展且稳健的优先级规划:最大容量下多机器人有序存取
提出最大容量多机器人有序存取优先级规划:可扩展、无死锁、近线性加速,且对扰动稳健。
AutoOR:规模化后训练大语言模型以自动形式化运筹学问题
提出AutoOR,用合成数据与强化学习后训练LLM,自动形式化运筹优化问题,达领先效果。
ICICLE:通过上下文文档扩展检索
提出一种上下文索引框架,将新增文档作为推理时证据,结合复制机制与校准,提升新文档检索并保持旧文档性能。