PerfReasoning:大语言模型在硬件性能推理上表现如何?
新基准评估大模型硬件性能推理:闭源超九成,开源八十二;建模生成难,多数不足十五;强化学习提升十五点七。
为何更优模型会催生风险更高的系统:来自金融市场LLM智能体的证据
提升单一模型能力可能反降系统表现:共享训练使更强模型行为趋同,产生不可分散的关联风险,形成能力悖论。
HarvestBench:衡量LLM智能代理是否愿花钱避免杀生
HarvestBench首个为副作用定价的农场模拟基准,测试LLM代理是否花钱绕开动物,杀生率因模型与提示词差异巨大,最低0.4%,最高98.8%。
数据优化的预想事故筛选:电力系统安全的机器学习方法
机器学习对电力系统预想事故做安全分级,结合过采样与主成分分析,随机森林最优,主成分贡献更大,可实时安全评估。
企业语言模型(CLM):将隐性且碎片化的企业知识转化为主权化、可审计、可执行的企业智能层
提出企业语言模型框架,以神经符号网格、技能图、数字孪生与安全层将隐性知识转为可执行可审计的智能层。
MaxKernel:面向TPU的智能体内核生成
多智能体系统自动生成TPU高性能内核,支持人机协同、自主优化及图搜索,性能媲美专家手工调优。
多环境强化学习学到了什么?编码智能体中的信用分配与可迁移性
多环境强化学习的分组规则不影响未见环境表现;评估环境主导,跨环境信用分配无迁移增益。
数据驱动发现数字材料超弹性和粘弹性的组分相关本构模型
提出数据驱动多材料本构框架,结合经典模型与神经网络,预测组分相关超弹/粘弹行为,保证热力学一致性。
从回答到解释:重新审视大语言模型中歧义引发的偶然不确定性估计
仅基于解释空间而非答案估计歧义性偶然不确定性,更准、更省,且与认知不确定性相关性更低。
量化破坏记忆:低精度时序推理中的循环状态回写
量化存储规则可破坏循环网络推断;4位状态回写致误差激增,误差反馈可恢复精度,需重视状态存储接口设计。
重新审视间接提示注入:将其视为测试时搜索问题
将间接提示注入建模为测试时搜索,代理攻击者可提升漏洞发现;策略管理与计算预算对评估至关重要。
BioSync:基于Transformer的跨模态融合用于多模态生理数字生物标志物
BioSync以注意力机制融合多模态生理信号,生成连续数字生物标志物,在合成队列中优于特征拼接。
减少Whisper幻觉转录:基于幻觉空间投影的方法
提出无需训练的推理时方法,将Whisper解码器激活向低秩幻觉子空间投影,抑制非语音输入幻觉。非语音基准下幻觉率从31.31%降至2.44%,语音识别性能损失可控。
自进化语言模型中奖励攻击的框架无关检测与免疫
提出监控器,经黑盒钩子检测自进化语言模型的奖励攻击;四重检验与免疫重选,使检测率提升且误报降低。
所选对象能否到达读者?对基于检索的语言模型管道中身份交接的审计
审计显示所选对象与数据集追踪对象常不一致,正文检索遗漏多而混合检索几乎不漏,对齐对象提升精确匹配。
向量数据库中用于私有检索的阴影查询
提出SHAQ方法,用生成模型将文档语义分解为多样阴影查询并替代原始嵌入存储,抵御嵌入反转攻击,兼顾隐私与检索效用。
当金融微调失灵:领域自适应语言模型中数字幻觉的三级可检测性分析
研究表明,金融领域微调显著加剧数字幻觉,数值监督反而放大问题,主因是模板注入削弱了数值约束,而非推理不足。评估需覆盖各可检测层级,部署应引入接地生成或弃权机制。
从交互轨迹到持久技能:面向计算机使用代理的在线进化
提出在线技能进化框架,将交互轨迹转为持久技能库,提升计算机使用代理性能,但收益与稳定性因域而异。
AutoLR:自动化工业推荐系统中从研究到发布评审的路径
AutoLR借助多专家评审与证据加权选择,自动完成工业推荐从研究到发布评审的闭环。
MZ-Rain: Moisture-Budget-Guided Zero-Inflated Model for Station-Level Precipitation Nowcasting
From Language Models to World-Acting Systems: Progress and Limits of Agentic AI across Digital, Social, Virtual, and Physical Environments
CHAMP: Cross-domain Hybrid Architecture for Matchmaking and Prediction in Online Multi-Player Games
从全局到局部:基于粒球的拓扑保持自适应图池化
提出一种拓扑保持自适应图池化方法,按粒球动态划分图,捕获局部与全局结构并提升图分类性能。
TROVE:基于轨迹验证与编辑的自适应智能体技能编排
TROVE通过在线验证和局部修正智能体执行路径,仅替换失效后缀,兼顾质量与效率,在代码、问答、数学任务上优于现有基线。
道德能力先于道德内容:为何LLM智能体缺乏连贯对齐的前提条件
四结构条件测LLM道德能力,九模型均不连贯;表面扰动致判断率变化达99个百分点,缺乏对齐前提。
MePo++:统一表示精炼与协调的通用持续学习
提出MePo++框架,通过表示精炼与协调弥合预训练与下游差距,增强通用持续学习中的可塑性与稳定性,实验验证广泛有效。
集成机器学习与深度神经网络的混合预测模型用于早期心血管疾病风险评估
融合机器学习与深度神经网络的集成框架,基于IoMT实时数据,经预处理与特征选择,提升心血管病早期预测精度,支持云端持续监测。
TruthInsightBench:基于证据的开放式科学发现智能体自动化评测基准
该基准评测开放式科学发现:智能体编码分析强,但科学判断弱,缺乏可信结论,真正发现仍遥不可及。
大语言模型(LLM)引导的程序演化用于圆填充:28美元打破10项Packomania纪录
提出轻量系统,以语言模型迭代进化算法,仅花二十八美元即破十项圆填充纪录。
SciDocBench:面向工作流的科学文档理解基准与数据管线
提出科学文档理解工作流基准,含124问、496实例,最优仅62.6分;配套证据图及数据集,用于诊断与提升模型能力。
以贝叶斯视角统一上下文学习、监督微调与KL正则化强化学习
提出贝叶斯视角,将监督微调、上下文学习、KL正则化强化学习统一为对后验的前向KL投影。
Trace2Tower:面向LLM智能体的转换感知特征迹多层次技能归纳
提出Trace2Tower框架,将原始轨迹蒸馏为层次技能,在ALFWorld和WebShop上显著提升任务成功率与经验复用效率。
感知底层环境的AI代理:执行上下文作为首要输入
忽略执行约束导致基质失明;代码生成时披露内存与时间契约,峰值内存降49-74%,耗时降35-64%,成功率大幅提升。
镜像智能体模型:一种用于可解释智能体行为的贝叶斯架构
提出镜像智能体模型,将观察者模型视为智能体镜像,生成可解释行为,并利用显著性方法提供解释能力。
在线策略蒸馏中什么最重要?数据效率与数据选择的视角
在线策略蒸馏中,困难样本更有效;增益源于长思维链而非高熵。仅选八个困难样本即可媲美完整基线。
CABAL:一种用于追踪同行评审中串通投标影响的多智能体仿真框架
CABAL仿真显示:串通投标使目标论文捕获率翻倍,共谋者评分高约2分,但会议整体影响有限,且检测器证据不足。
无审查开放权重模型:再分发作为持久层
无审查模型生态:3471个模型被再分发8164次,去中心化镜像使其难以删除,25%应用为恶意。
ACE:面向MoE大语言模型的自适应免校准专家跳过
提出ACE框架,免训练免校准,通过两种估计互补判断低贡献专家并自适应跳过,在MoE大模型上优于现有方法。
计算机视觉中的常识推理:基础、最新进展与未来方向
综述常识推理融入计算机视觉,涵盖知识图谱、场景图、神经符号与常识增强模型,评析局限并展望未来方向。
测试LLM智能体团队中的可互换性
替换智能体对任务分数影响小,但通信成本增加16-63%,形成历史越长,交换代价越大。
超越总体得分:评估基于参考的自动评估方法的行为正确性假设
提出行为正确性假设,通过控制响应变换测试评估器,发现无评估器满足所有假设,行为差异被聚合分数掩盖。
基于二叉决策图的量子电路合成中由大语言模型驱动的算法设计
提出QuantumEvo框架,用LLM生成QCC感知的BDD变量排序启发式,70.9%达到或优于最优基线。
CUA-Universe:面向混合GUI+CLI智能体的可扩展动态环境
提出可扩展混合环境生成流程,将桌面软件转为GUI+CLI任务,训练后9B模型在三个基准上成功率提升,步骤与令牌开销显著降低。
重复我:黑盒自适应视觉提示注入
视觉提示注入可诱导商用VLM泄露隐私或恶意调用工具,成功率超80%,并能在真实智能体中覆盖配置实现远程代码执行。
用于合成带标签无线信号的深度生成模型
提出IIns-GAN生成逼真带标签无线信号,适应多种环境,显著提升多种无线感知任务训练效果。
面向语音大语言模型服务的可扩展上下文编排
提出语音上下文编排中间件,显式建模语音,语速误差降52.4%,中断降至0.9%,成本降79.2%。
Atlas:在异构集群上优化复合AI工作流的部署
Atlas用马尔可夫精度预测器估计配置精度,以混合整数线性规划选择执行计划,满足SLO下优化异构集群部署,成本降低42%,精度接近最优。
必要还是充分?用行为证据评估大语言模型解释
基于行为证据检验大语言模型解释:必要或充分性与引用因子相关性低,前三因子不可靠,可作黑箱可靠性检查
无线基础模型:现状与开放挑战
综述无线基础模型在物理层五类任务中的预训练与适配,评估其可重用性,指出数据、评估、泛化及部署等挑战。
面向部署后物理AI的持续现场自适应模型(CFAMs)
提出CFAM:部署后免梯度持续学习,多实体测试成功率提升13.9%,反向迁移-0.5%。