睡眠智能体:要点式上下文压缩的损失与原因
要点压缩提升多跳/单跳事实问题,但损害时间问题;因丢弃日期时间,提示修改可恢复。
OEIS开放:语言模型能将多少猜想转化为定理?
构建OEIS Open基准,通用LM以50美元预算解决30%开放猜想,200美元下最优44%,表明可低成本自主证明。
面向高效测试时推理的声明级可靠性评估
提出声明级证伪原则,将测试时计算从采样转向验证,压缩错误空间,提升推理准确率并减少令牌消耗。
CTBench:评估AI代理在真实电信网络运维中的故障排查能力
CTBench评估AI代理电信运维排障,聚焦根因分析与路径恢复;结果显示根因分析欠佳,且缺证据支撑。
改善K-12教育中AI辅导质量的方法
AI辅导依赖大模型,需通过模型、提示、个性化等实验改进,提升质量与学生参与度。
模型排名取决于推理预算:LLM评估中的预算依赖排序
模型排名随生成预算变化,3-19%样本非单调,排名可反转;建议采用预算条件化评估协议。
GUIDE:企业环境中文档到工件生成的受治理统一智能
GUIDE多代理框架实现企业文档自动化,成功率达96%,规则提取与工件生成高效,处理时间从数天降至40-125分钟。
如何花费你的Oracle预算:蛋白质结构预测模型的实用指南
评测发现低预算用O3,高预算用FK-steering/DPO,为预算受限的蛋白质预测提供实用建议。
VAKRA:在工具使用策略下评估跨API和检索的多跳推理
VAKRA基准测试跨API和文档的多跳推理,发现最优模型性能随推理深度下降超50%,策略约束下严重失败,瓶颈在语言中介推理。
评估LLM生成的网络安全检测规则
提出开源框架,用保留集和三类指标评估大模型生成的检测规则,与人工规则对比,并以案例验证。
AI公平性背景下的变量选择
提出数学方法评估AI公平性,强调保留相关变量以减少隐性偏见,倡导跨学科合作,符合欧盟AI法案要求。
智能体安全应成为运行时契约
智能体安全应作为运行时契约,由执行环境强制,兼顾预防与证据验证,而非仅靠训练。
单周期智能体自我摘要下AI护栏的存活性
单周期压缩中,安全规则常以“看似规则却失效”的残留存续;仅查文本存在会误报安全,需外部基准验证,存留≠保护。
不确定性感知与可解释的集成深度学习框架用于多类皮肤病变分类
不确定性感知可解释集成框架,融合CNN与Transformer,MC Dropout估不确定性,Grad-CAM++可视化解释,准确率96%,AUC99%。
自演进网络验证器
提出让网络验证器以路由器软件为真值源自动演进,在反例循环中自主扩展协议支持并发现厂商特有行为。
社会二元性:人机交互的关系过程框架
提出社会二元性框架,刻画人机交互中的序列互惠关系,保留路径信息,并经实证校准。
金融科技中智能体AI的治理
金融科技智能体治理:约束在可验证性而非能力。缺口决定授权,复现性作治理画像,证据支撑授权。
超越记忆:面向长寿AI智能体的事务性连续性内核
提出连续性内核激活契约,解耦提交前评估与状态原子激活,仅提交权威分支头,超280万状态验证零违规。
神经符号安全卫士引导端到端自动驾驶
为已训练模型附加轻量安全卫士,按规则检查并替换不安全指令,成功率提升15%,碰撞减少53%,保持驾驶得分。
TRACES:大型语言模型科学推理的认知可靠性基准
TRACES:42篇问题论文测试,模型95%接受不可靠前提,多数失败率逾七成,认知可靠性差。
智能体网络安全的下一挑战:现实且无污染的逆向工程基准
提出首个现实且无污染的逆向工程基准,基于19个真实程序,前沿模型最高分仅61.4%,逆向工程仍未被攻克。
保留未来,免去推演:世界动作模型的RIFT
RIFT用前瞻令牌一次构建未来缓存,免去迭代展开,成功率近98.8%,延迟降低68%-89%
迈向AI时代智能制造的人力准备增强概念框架
提出九级人力准备度框架,基于四支柱评估智能制造能力,经89个实际项目验证,揭示网络物理与数据决策短板。
基于深度学习的多声源多麦克风相对传递矩阵估计
提出基于深度学习的相对传递矩阵估计方法,用三种网络框架,较协方差法更精准,且语音增强效果相当。
RoadWeaver:面向自动驾驶仿真的从零开始大规模车道级高清地图生成
RoadWeaver从零生成大规模HD地图,误差0.24米,较SOTA降94.4%,仅1.39-3.50秒。
迈向有意义的AI聊天机器人透明度:披露说服意图可降低说服效果
实验发现,仅披露AI身份不减弱说服力,额外披露说服意图使说服效果减半。
CoQui:坐标条件量子隐式生成对抗网络用于端到端图像生成
提出坐标条件量子隐式生成对抗网络,以坐标潜变量生成像素,解耦分辨率与量子位数,避免概率竞争,性能优于基线。
基于基准的印度基础模型比较评估:能力与评价成熟度框架
基于公开基准比较印度基础模型与全球模型,发现其MMLU等高分但新评测参与少,提出基准成熟度指数以区分能力与评测差距。
RealisticTritonBench:真实AI框架中的Triton内核生成基准
首个从真实AI框架PR提取Triton内核任务,支持端到端评估;评测发现大模型仍难以生成可用内核。
共同构建社会技术AI治理:基于算法注册表的参与式系统映射
算法注册表无法单独揭示社会技术系统风险;多方参与可识别福利拒绝等隐患,并反映治理政治性。
Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
提出哈密顿零基础模型,用约5亿参数的流形变分法优化任意二次量子比特哈密顿量基态,可扩展至8100比特。
从安全文档到安全知识支持:面向医疗器械的循证LLM框架
提出循证LLM框架,连接器械工件与知识库,生成候选安全项并支持专家审查,不替代安全决策。
从SMPC演示和稀疏离线到在线强化学习中学习移动操作
用SMPC演示生成离线数据,以稀疏奖励的离线到在线RL训练,超越专家并跨形态验证。
群污染结构化结果的因果推断:可观测商、无损约简与精确随机化推断
提出群污染结构结果的可观测商与无损约简,实现精确随机化推断;模拟与实例验证有效。
就绪队列:在LLM智能体控制中界定GPU机会并避免主机往返
提出就绪队列边界,量化GPU执行机会;设备端保留路由决策免主机往返,36种配置全部更快。
无人可责:构成性AI不可问责性框架
提出“构成性AI不可问责性”概念,认为某些系统配置使AI问责在概念上无法实现,并提供诊断工具识别问责空白。
智能压实:基于湖仓表元数据预测压实效用
开源模拟框架生成2376张Iceberg表,用17个元数据特征预测文件缩减率(R2=0.998),发现压实决策仅需分区文件数阈值,跨模式验证有效,但压实可能拖慢全扫描聚合。
Branch2Skill:通过推理树实现高效技能进化
Branch2Skill利用推理树生成密集监督,减少重复回放,显著提升技能进化效率。
PluginEval:函数调用中细粒度错误归因的诊断基准
提出函数调用错误归因基准PluginEval,两阶段框架生成测试,结合真实执行与人工校验。
SkillReason:面向隐含用户请求的推理增强型智能体技能检索
提出技能推理基准与两阶段推理增强检索框架,在三个基准上均达最优,弥合任务目标与技能能力语义鸿沟。
脚手架比接口更重要:跨七种代理脚手架、五种语言模型与一项软件任务对MCP和CLI工具使用的受控比较
成本主要取决于代理脚手架而非接口;MCP并非必需,CLI更便宜,不同脚手架间成本差异巨大。
一种QUBO启发的机场陆侧瓶颈诊断与动态调度优化计算框架
提出QUBO启发式框架,诊断机场陆侧瓶颈并优化动态调度,强高峰下显著减少两机场旅客排队。
EnergyBridge:家庭能源管理、用户参与及电网灵活性基准测试
提出EnergyBridge基准与智能体框架,模拟用户授权,提升电网灵活性响应的可靠性。
AquiLLM:支持研究组隐性知识捕获的架构
AquiLLM是开源模块化RAG-LLM框架,采用开放权重模型,通过本地嵌入、多模态、语义记忆等增强,支持科研组捕获隐性知识。
医疗IT的三代演进:从数字记录到可计算照护流程
以可计算信息单元划分医疗IT,定义第三代临床意图层及原子对象ACR,并给出可执行正确性评估框架。
面向全模态大语言模型的基于局部音视频动态的延迟音频剪枝
A-PACK延迟音频剪枝至查询交互后,用局部音视频动态压缩视频并渐进剪枝音视频token,性能最优,预填充计算降78%,解码吞吐提2.21倍。
PROSLEX:面向印度司法系统的专家标注法律条文预测新数据集
提出PROSLEX数据集,含1623份专家标注法律文书及7450条解释,评估多种提示策略,推动可解释法律NLP研究。
FitAQA:面向多模态大语言模型的健身动作质量评估基准
FitAQA含2219个视频、5512个问答,定义6维度38种错误,设感知、判断、时间定位三任务,揭示现有多模态大模型评估能力不足,视觉感知是关键瓶颈。
首届教学怪兽挑战赛结果:AI智能体教学内容知识的基准
教学怪兽挑战赛基准揭示:AI视频教学内容强、适配学习者弱,自动评分对顶尖排序失真,需双改进。
从量表到对话:用小型语言模型低负担获取每日经前症状评级
小模型用3个症状簇问题替代6项量表,kappa达0.913,问题减半。