用领域专用语言改进神经PDE求解器的自动设计
用领域专用语言重构搜索空间,聚焦有效设计决策,使神经PDE求解器自动设计效率提升52%以上。
智能体AI工作流的架构影响
研究发现智能体工作流碎片化异构、CPU成为关键路径,现有服务器架构不匹配,原型Agora通过动态资源调度提升利用率并保障延迟。
享有特权,却有偏:PI条件教师如何破坏自蒸馏
自蒸馏在困难任务中失效:教师受特权答案偏差影响,学生拟合低信息词,损失降而精度不升,目标与成败脱钩。
用金丝雀工具诊断LLM智能体的工具选择推理
金丝雀工具诊断工具选择推理,六类弱点分类,能力越强越不易受骗,但安全性不与等级挂钩,且测量推理而非关键词。
思维链监控在隐式影响场景下可能不可靠
显式影响下思维链监控检测率60-94%,隐式影响下大幅下降,系统提示进一步降低至5%,显式评估或高估可监控性。
当提示成为像素:多模态推理中的提示区域锚定
将问题嵌入图像使MLLM性能大降,提出提示区域锚定法,对齐区域与语义,VTS准确率从58.0提至66.3。
EviGraph:证据引导的自主研究智能体
提出证据图框架EviGraph,维护研究全程证据链,主张支持率提升40.19%,数据一致性达87.73%。
更少词元,更小缓存:奖励协调的高效推理
ReCo用过程奖励协调缓存压缩与生成,词元减少37%-65%,延迟降2倍以上,精度几乎不变。
NSF-HRPT:神经语义场与分层风险感知树用于安全关键场景评估
提出神经语义场与分层风险感知树融合框架,用于单目视觉定量风险评估,仿真达最优,实车接近最优。
欧盟《人工智能法案》要求下安全关键环境中的短期负荷预测:德国输电网总负荷41天实时挑战结果
符合欧盟人工智能法案的短期负荷预测系统在41天挑战中超过官方基线,轻量本地模型可媲美超大规模模型。
ABSeeker:基于答案回溯信用分配的长程搜索智能体训练
提出答案回溯信用分配法,将稀疏轨迹结果转为稠密步骤奖励,用8.5k样本训练,显著提升长程搜索智能体性能。
路径级定位与重写的LLM智能体层级图记忆
提出层级图记忆框架,以路径级定位与协同重写,减少检索噪声,提升长时问答与冲突记忆下的回答质量和效率。
WorldCycle:面向长时程视频世界模型的自验证强化学习
提出可逆动作循环验证世界模型,用双向闭合与时间一致性奖励强化学习,减少状态漂移44%,复合动作准确性提升近4倍。
TourSynbio-Search:面向蛋白质工程统一搜索方法的大语言模型驱动智能体框架
提出TourSynbio-Search智能体,基于多模态大模型,以自然语言检索蛋白质数据与文献,降低技术门槛,提升研究效率。
时间上下文感知:针对大语言模型多轮操纵攻击的防御框架
提出时间上下文感知(TCA)框架,通过分析语义漂移与跨轮意图一致性,有效检测多轮操纵攻击,增强大语言模型安全性。
AgentForge:沉浸式角色扮演平台,助力学习智能体软件工程
提出AgentForge平台,新手通过角色扮演学习智能体软件工程,完成任务率高,虽具挑战但显著提升协作与理解能力。
超越QBER阈值:基于时间QBER的机器学习框架用于BB84 QKD多攻击检测
提出时间QBER机器学习框架,提取63维物理特征,XGBoost达88.01%准确率,将漏报率从0.8477降至0.0198,有效检测隐蔽窃听。
智能交通系统中语言模型的内联控制架构
提出内联语义护栏架构,保障车联网大语言模型服务安全,降低入侵成功率并消除不安全输出,满足实时约束。
面向多模态意图理解的模态一致性与冲突感知原型超图学习
提出MACH原型超图框架,分离建模模态一致与冲突,样本自适应仲裁保留有效分歧,提升多模态意图识别精度。
棋局幻觉:LLM棋评的工具增强评估
提出ACT-Eval框架,用引擎工具与专家标注检验LLM棋评事实性,发现幻觉普遍,工具增强可提升准确性但策略覆盖仍有限。
行为技能重构:从LLM智能体技能中重建隐藏功能
提出SkillClone黑盒攻击,通过合法交互克隆隐藏技能,30个技能中实现部分或完全恢复,证明文件保密不足,需限制累积信息泄露。
可视化材料科学假设生成中图到答案的机制恢复
AI生成假设流畅但未必保留机制,用可视化诊断流程追踪模型各层,发现机制恢复集中在后期合成层而非早期。
病友相似:面向可解释临床预测的变分LM-GNN框架
提出PLM:融合语言模型与图神经网络,用变分EM训练,在MIMIC上超越SOTA,用相似患者做可解释预测。
基于模型合并的跨域克隆检测统一模型
模型合并利用现有检查点构建跨域克隆检测器TIES达多任务93%性能且对未知AI克隆泛化更佳
Eigenius:具备认知分层与制度中介推理的类型化知识图谱数据库管理系统
该库为类型化知识图谱数据库,以溯源和认知状态为不变式,支持制度中介与形式证明,重算《自然》论文发现4处差异。
AudioScape-TTA:面向细粒度文本到音频评估的结构化声景基准
提出结构化声景基准AudioScape-TTA,含2258对及25707条细则,细粒度评估TTA。
打破多语种诅咒:资源感知语音编码器混合实现多对多语音翻译
提出MSRT框架,用资源感知语音编码器混合+五阶段课程学习,45语言上超越大模型,提升低资源性能。
AFD-Ledger:注意力-前馈网络分离的部署配置
AFD-Ledger离线分析式配置,评估大减、预测准,同质AFD仅少数场景更优,异质AFD需硬件互补。
推理后端可改变大模型行为
基准分数受推理框架影响显著,即使贪心解码也变,建议披露后端与生成配置。
Scouting: 成本感知的编码代理路由:先侦察仓库再路由
先侦察仓库再路由编码代理,以约五分之一成本达到最优模型解决率;消融显示交接起主要作用,路由决策并非关键。
PURPOSE:通过代理事实锚定更新在RAG中投毒冲突消解
提出PURPOSE黑盒投毒攻击,以代理事实锚定更新最小化冲突,在45个设置中35个成功率最高,平均超强基线9.7点。
指南即预言机:零标注训练眼科电话分诊代理
用指南规则表零标注训练分诊模型,协议从61.7%提至74.1%,急症召回9.5%升至69%。
InsightEmb:为智能体洞察检索学习动作意图嵌入
提出InsightEmb框架,用数学推理数据学习进度导向的检索空间,跨域提升智能体洞察检索,无需环境特化训练。
RepoProbe:基于检查清单的架构感知仓库理解基准测试
提出RepoProbe基准,用GitHub讨论的开放式问答评估仓库架构理解,以检查清单协议客观验证,揭示LLM编辑偏差,提高评估可靠性。
A-SR:通过层级协调实现符号回归的自进化智能体大语言模型
提出自进化智能体框架A-SR,通过角色条件证据视图与层级协调提升符号回归,在多个基准上显著优于基线。
一环薄弱,全局皆输:AI系统集成审计的范围综述
综述58项AI集成审计,发现其零散、覆盖不足,提出三类集成场所及功能,呼吁优先系统集成以应对AI风险。
将Horn-ALCHI原子查询重写为GQL的一般充分条件
引入DL自动机刻画查询语义,识别可重写为UC2RPQ的自动机类,获得GQL可重写的Horn-ALCHI OMQ类。
潜在通信何时奏效?多智能体LLM中中继KV缓存的因果审计
因果审计表明缓存中继增益未必来自配对效应,须用错配缓存验证潜在思维传递。
微型Transformer中的原型推理
研究表明,微型Transformer可采用“原型推理”这种简单思维链,在约百万参数模型上研究逐步推理,其追踪内容显著缩小分布外泛化差距。
显示理性:从表示定理出发的无标签评估与正则化
利用决策论表示定理,通过公理合规检查实现无标签评估,惩罚可计算且必要充分,为AI理性评估提供新基础。
OneDayAgent:面向自主智能体的长时程管理框架
OneDayAgent是长时程自主智能体框架:分解子任务、维护执行记忆、校验修复最终交付,在AgentIF-OneDay上获0.821分,跨五后端通用。
ORACLE:基于多目标强化学习与大型语言模型引导探索的模拟电路设计优化器
ORACLE实现模拟电路向量值多目标优化,免重训,LLM引导探索,提速20-104倍,达标99.9%
芯粒与大语言模型时代的硬件设计与安全
分析芯粒系统与LLM驱动EDA攻击,综述防御(拆分制造、主动中介层)及LLM助力硬件安全。
浅层深度下基于共享经典随机性的酉与信道量子生成模型间的表示能力分离
共享经典随机性足使浅层信道模型严格超越浅层酉模型,产生其无法复现的长程关联,一维最坏需深度Ω(N)。
感知种族与性别对警察语言使用的影响:基于VR模拟的实验证据
研究发现警察对黑人男性角色说话更不恭敬,但白人及多种族女警例外;建议用加权的混合效应模型估算处理效应。
本地部署LLM的能效:消费级硬件上GPU功耗的初步定量基准测试
本地部署九款开源LLM的功耗基准显示,模型架构与量化策略比参数量更能影响能效,1B模型每token仅0.56焦耳,7B Mistral能耗高达其4.4倍。
AutoFOAM:自改进的自主OpenFOAM智能体
自进化大模型智能体AutoFOAM,凭自然语言自动创建、优化OpenFOAM模拟,加速CFD开发。
自改进LLM智能体的记忆奖励膨胀
自改进LLM智能体因存储评分偏误,偏好重复错误记忆,导致回报膨胀。去偏算法LUCID在文本转SQL任务上提升准确率至56.9%。
现实中的智能体编程:大规模生产环境下GitHub Copilot轨迹特征刻画
首次数百万级代码助手轨迹刻画智能体编程负载:轮内缓存命中高、跨轮失效,空闲预测优化调度。
更多辩论,同样证据:同质多智能体基于证据验证的结构性局限
多智能体辩论未必提升事实核查准确性,六基准测试中两升一降三不确定,收益受系统结构限制。