5351 条条目 · 106 个活跃源
2026年8月13日
04:00
arXiv cs.AI

睡眠智能体:要点式上下文压缩的损失与原因

要点压缩提升多跳/单跳事实问题,但损害时间问题;因丢弃日期时间,提示修改可恢复。

04:00
arXiv cs.AI

OEIS开放:语言模型能将多少猜想转化为定理?

构建OEIS Open基准,通用LM以50美元预算解决30%开放猜想,200美元下最优44%,表明可低成本自主证明。

04:00
arXiv cs.AI

面向高效测试时推理的声明级可靠性评估

提出声明级证伪原则,将测试时计算从采样转向验证,压缩错误空间,提升推理准确率并减少令牌消耗。

04:00
arXiv cs.AI

CTBench:评估AI代理在真实电信网络运维中的故障排查能力

CTBench评估AI代理电信运维排障,聚焦根因分析与路径恢复;结果显示根因分析欠佳,且缺证据支撑。

04:00
arXiv cs.AI

改善K-12教育中AI辅导质量的方法

AI辅导依赖大模型,需通过模型、提示、个性化等实验改进,提升质量与学生参与度。

04:00
arXiv cs.AI

模型排名取决于推理预算:LLM评估中的预算依赖排序

模型排名随生成预算变化,3-19%样本非单调,排名可反转;建议采用预算条件化评估协议。

04:00
arXiv cs.AI

GUIDE:企业环境中文档到工件生成的受治理统一智能

GUIDE多代理框架实现企业文档自动化,成功率达96%,规则提取与工件生成高效,处理时间从数天降至40-125分钟。

04:00
arXiv cs.AI

如何花费你的Oracle预算:蛋白质结构预测模型的实用指南

评测发现低预算用O3,高预算用FK-steering/DPO,为预算受限的蛋白质预测提供实用建议。

04:00
arXiv cs.AI

VAKRA:在工具使用策略下评估跨API和检索的多跳推理

VAKRA基准测试跨API和文档的多跳推理,发现最优模型性能随推理深度下降超50%,策略约束下严重失败,瓶颈在语言中介推理。

04:00
arXiv cs.AI

评估LLM生成的网络安全检测规则

提出开源框架,用保留集和三类指标评估大模型生成的检测规则,与人工规则对比,并以案例验证。

04:00
arXiv cs.AI

AI公平性背景下的变量选择

提出数学方法评估AI公平性,强调保留相关变量以减少隐性偏见,倡导跨学科合作,符合欧盟AI法案要求。

04:00
arXiv cs.AI

智能体安全应成为运行时契约

智能体安全应作为运行时契约,由执行环境强制,兼顾预防与证据验证,而非仅靠训练。

04:00
arXiv cs.AI

单周期智能体自我摘要下AI护栏的存活性

单周期压缩中,安全规则常以“看似规则却失效”的残留存续;仅查文本存在会误报安全,需外部基准验证,存留≠保护。

04:00
arXiv cs.AI

不确定性感知与可解释的集成深度学习框架用于多类皮肤病变分类

不确定性感知可解释集成框架,融合CNN与Transformer,MC Dropout估不确定性,Grad-CAM++可视化解释,准确率96%,AUC99%。

04:00
arXiv cs.AI

自演进网络验证器

提出让网络验证器以路由器软件为真值源自动演进,在反例循环中自主扩展协议支持并发现厂商特有行为。

04:00
arXiv cs.AI

社会二元性:人机交互的关系过程框架

提出社会二元性框架,刻画人机交互中的序列互惠关系,保留路径信息,并经实证校准。

04:00
arXiv cs.AI

金融科技中智能体AI的治理

金融科技智能体治理:约束在可验证性而非能力。缺口决定授权,复现性作治理画像,证据支撑授权。

04:00
arXiv cs.AI

超越记忆:面向长寿AI智能体的事务性连续性内核

提出连续性内核激活契约,解耦提交前评估与状态原子激活,仅提交权威分支头,超280万状态验证零违规。

04:00
arXiv cs.AI

神经符号安全卫士引导端到端自动驾驶

为已训练模型附加轻量安全卫士,按规则检查并替换不安全指令,成功率提升15%,碰撞减少53%,保持驾驶得分。

04:00
arXiv cs.AI

TRACES:大型语言模型科学推理的认知可靠性基准

TRACES:42篇问题论文测试,模型95%接受不可靠前提,多数失败率逾七成,认知可靠性差。

04:00
arXiv cs.AI

智能体网络安全的下一挑战:现实且无污染的逆向工程基准

提出首个现实且无污染的逆向工程基准,基于19个真实程序,前沿模型最高分仅61.4%,逆向工程仍未被攻克。

04:00
arXiv cs.AI

保留未来,免去推演:世界动作模型的RIFT

RIFT用前瞻令牌一次构建未来缓存,免去迭代展开,成功率近98.8%,延迟降低68%-89%

04:00
arXiv cs.AI

迈向AI时代智能制造的人力准备增强概念框架

提出九级人力准备度框架,基于四支柱评估智能制造能力,经89个实际项目验证,揭示网络物理与数据决策短板。

04:00
arXiv cs.AI

基于深度学习的多声源多麦克风相对传递矩阵估计

提出基于深度学习的相对传递矩阵估计方法,用三种网络框架,较协方差法更精准,且语音增强效果相当。

04:00
arXiv cs.AI

RoadWeaver:面向自动驾驶仿真的从零开始大规模车道级高清地图生成

RoadWeaver从零生成大规模HD地图,误差0.24米,较SOTA降94.4%,仅1.39-3.50秒。

04:00
arXiv cs.AI

迈向有意义的AI聊天机器人透明度:披露说服意图可降低说服效果

实验发现,仅披露AI身份不减弱说服力,额外披露说服意图使说服效果减半。

04:00
arXiv cs.AI

CoQui:坐标条件量子隐式生成对抗网络用于端到端图像生成

提出坐标条件量子隐式生成对抗网络,以坐标潜变量生成像素,解耦分辨率与量子位数,避免概率竞争,性能优于基线。

04:00
arXiv cs.AI

基于基准的印度基础模型比较评估:能力与评价成熟度框架

基于公开基准比较印度基础模型与全球模型,发现其MMLU等高分但新评测参与少,提出基准成熟度指数以区分能力与评测差距。

04:00
arXiv cs.AI

RealisticTritonBench:真实AI框架中的Triton内核生成基准

首个从真实AI框架PR提取Triton内核任务,支持端到端评估;评测发现大模型仍难以生成可用内核。

04:00
arXiv cs.AI

共同构建社会技术AI治理:基于算法注册表的参与式系统映射

算法注册表无法单独揭示社会技术系统风险;多方参与可识别福利拒绝等隐患,并反映治理政治性。

04:00
arXiv cs.AI

Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型

提出哈密顿零基础模型,用约5亿参数的流形变分法优化任意二次量子比特哈密顿量基态,可扩展至8100比特。

04:00
arXiv cs.AI

从安全文档到安全知识支持:面向医疗器械的循证LLM框架

提出循证LLM框架,连接器械工件与知识库,生成候选安全项并支持专家审查,不替代安全决策。

04:00
arXiv cs.AI

从SMPC演示和稀疏离线到在线强化学习中学习移动操作

用SMPC演示生成离线数据,以稀疏奖励的离线到在线RL训练,超越专家并跨形态验证。

04:00
arXiv cs.AI

群污染结构化结果的因果推断:可观测商、无损约简与精确随机化推断

提出群污染结构结果的可观测商与无损约简,实现精确随机化推断;模拟与实例验证有效。

04:00
arXiv cs.AI

就绪队列:在LLM智能体控制中界定GPU机会并避免主机往返

提出就绪队列边界,量化GPU执行机会;设备端保留路由决策免主机往返,36种配置全部更快。

04:00
arXiv cs.AI

无人可责:构成性AI不可问责性框架

提出“构成性AI不可问责性”概念,认为某些系统配置使AI问责在概念上无法实现,并提供诊断工具识别问责空白。

2026年8月12日
04:00
arXiv cs.AI

智能压实:基于湖仓表元数据预测压实效用

开源模拟框架生成2376张Iceberg表,用17个元数据特征预测文件缩减率(R2=0.998),发现压实决策仅需分区文件数阈值,跨模式验证有效,但压实可能拖慢全扫描聚合。

04:00
arXiv cs.AI

Branch2Skill:通过推理树实现高效技能进化

Branch2Skill利用推理树生成密集监督,减少重复回放,显著提升技能进化效率。

04:00
arXiv cs.AI

PluginEval:函数调用中细粒度错误归因的诊断基准

提出函数调用错误归因基准PluginEval,两阶段框架生成测试,结合真实执行与人工校验。

04:00
arXiv cs.AI

SkillReason:面向隐含用户请求的推理增强型智能体技能检索

提出技能推理基准与两阶段推理增强检索框架,在三个基准上均达最优,弥合任务目标与技能能力语义鸿沟。

04:00
arXiv cs.AI

脚手架比接口更重要:跨七种代理脚手架、五种语言模型与一项软件任务对MCP和CLI工具使用的受控比较

成本主要取决于代理脚手架而非接口;MCP并非必需,CLI更便宜,不同脚手架间成本差异巨大。

04:00
arXiv cs.AI

一种QUBO启发的机场陆侧瓶颈诊断与动态调度优化计算框架

提出QUBO启发式框架,诊断机场陆侧瓶颈并优化动态调度,强高峰下显著减少两机场旅客排队。

04:00
arXiv cs.AI

EnergyBridge:家庭能源管理、用户参与及电网灵活性基准测试

提出EnergyBridge基准与智能体框架,模拟用户授权,提升电网灵活性响应的可靠性。

04:00
arXiv cs.AI

AquiLLM:支持研究组隐性知识捕获的架构

AquiLLM是开源模块化RAG-LLM框架,采用开放权重模型,通过本地嵌入、多模态、语义记忆等增强,支持科研组捕获隐性知识。

04:00
arXiv cs.AI

医疗IT的三代演进:从数字记录到可计算照护流程

以可计算信息单元划分医疗IT,定义第三代临床意图层及原子对象ACR,并给出可执行正确性评估框架。

04:00
arXiv cs.AI

面向全模态大语言模型的基于局部音视频动态的延迟音频剪枝

A-PACK延迟音频剪枝至查询交互后,用局部音视频动态压缩视频并渐进剪枝音视频token,性能最优,预填充计算降78%,解码吞吐提2.21倍。

04:00
arXiv cs.AI

PROSLEX:面向印度司法系统的专家标注法律条文预测新数据集

提出PROSLEX数据集,含1623份专家标注法律文书及7450条解释,评估多种提示策略,推动可解释法律NLP研究。

04:00
arXiv cs.AI

FitAQA:面向多模态大语言模型的健身动作质量评估基准

FitAQA含2219个视频、5512个问答,定义6维度38种错误,设感知、判断、时间定位三任务,揭示现有多模态大模型评估能力不足,视觉感知是关键瓶颈。

04:00
arXiv cs.AI

首届教学怪兽挑战赛结果:AI智能体教学内容知识的基准

教学怪兽挑战赛基准揭示:AI视频教学内容强、适配学习者弱,自动评分对顶尖排序失真,需双改进。

04:00
arXiv cs.AI

从量表到对话:用小型语言模型低负担获取每日经前症状评级

小模型用3个症状簇问题替代6项量表,kappa达0.913,问题减半。