5348 条条目 · 106 个活跃源
2026年8月18日
04:00
arXiv cs.AI

AI 智能体在科学团队中的角色应作为人机系统研究

现有研究忽略科学团队合作的社会性,主张以人机对为单位研究AI科学家,并通过案例证明人机互补,呼吁新框架促进科学发现中的人机协同。

04:00
arXiv cs.AI

多模态大语言模型在文本与音频模态下的灾害援助可及性评估

评估多模态大模型在文本与音频下的一致性,发现均不可靠,对特殊需求人群差距更大,需设计公平包容的灾害风险沟通工具。

04:00
arXiv cs.AI

大型语言模型在化妆品化学与皮肤健康中的准确性与可靠性:一项基准研究

对14个LLM基准测试,总体表现差,尤其在定量推理和结构识别上,存在误导风险,不可靠。

04:00
arXiv cs.AI

以人为中心的育儿建议大语言模型基准评测方法

用专家多维评分基准评测15个LLM在100个育儿场景中的表现,发现总分掩盖弱点、语言影响建议风格。

04:00
arXiv cs.AI

面向智能体服务的KV缓存管理:学习智能体执行

在线学习智能体执行语义,优化KV缓存管理,提升命中率,降低延迟,提高吞吐。

04:00
arXiv cs.AI

当不确定性不足时:代码生成中自我纠正的实证研究

不确定性信号与正确性相关性弱;基于不确定性的自我修正常降准,仅验证性修正可靠提升Pass@1。

04:00
arXiv cs.AI

基于因果机制监测的跨域工业故障检测

提出CMR-Mamba,通过因果正则化与kNN流形评分检测耦合故障,在机电、液压和网络物理系统上优于基线。

04:00
arXiv cs.AI

从错误到证明:最小核心引导的神经符号约束求解修复

用最小不可满足核心引导修复翻译错误,将不可行问题捏造率从79%降至7%,证明价值在于证书与不捏造。

04:00
arXiv cs.AI

超越正确性:迈向基于Lean 4的自动新颖性验证

提出AViD流水线,用Lean 4形式化并判定新颖性;发现三障碍:编译非语义保真、索引覆盖限召回、撤稿删源码伤复现。

04:00
arXiv cs.AI

同步Logit引导:现实世界的隐写术

提出同步Logit引导隐写,从输出推导代理提示,免共享提示,容量0.20比特/词元,隐蔽难辨。

04:00
arXiv cs.AI

语义不确定性引导的分层多智能体系统编排

提出HASSUM框架,用语义熵和密度估计不确定性,引导验证、重提示等编排决策,提升复杂推理任务的可靠性与鲁棒性。

04:00
arXiv cs.AI

超越Pass@k:衡量智能体代码生成的可靠性与安全性

指出现行指标误用,提出可靠性系数及安全调整版,正确衡量智能体代码生成的可靠性与安全性。

04:00
arXiv cs.AI

无干净参考的智能体数据清洗:能力与权衡的实验研究

研究无参考数据清洗,提出证据框架评估七配置,发现能力增强带来检测、修复、证据、成本权衡,无一致最优。

04:00
arXiv cs.AI

面向AI原生6G网络的无线基础模型综合综述

无线基础模型综述:统一架构、预训练与适配,赋能通信感知定位优化,并探讨数据、泛化、部署及标准化挑战。

04:00
arXiv cs.AI

检测与定位智能体执行故障:从遥测数据诊断运行时异常

提出AGENTCHAOSBENCH基准,从执行遥测中检测定位智能体运行时故障,含275条轨迹、10类故障,现有模型诊断准确率最高仅24.8%。

04:00
arXiv cs.AI

航空领域的高级建模与数据分析

运用机器学习与自然语言处理分析多源航空安全数据,结合主题建模和可解释AI揭示事故模式,助力航空安全决策。

04:00
arXiv cs.AI

面向大型低轨星座应急对地观测的任务驱动三层分布式调度

提出任务驱动三层分布式调度法,应急覆盖较分布式方法提升2.8%-17.1%,与集中式差距约7.1%,并显著减少常规覆盖损失。

04:00
arXiv cs.AI

CEDAR-GRPO:面向LLM通用溯因推理的过程感知强化学习

提出CEDAR-GRPO过程感知强化学习框架,以溯因奖励提升LLM可迁移推理,在11个未见任务上全面超越基线。

04:00
arXiv cs.AI

大语言模型知道该问什么、何时问吗?多轮信息寻求的评估

提出多轮信息寻求框架与基准,发现模型低估缺失信息、查询不充分且顺序影响结果;信息寻求独立于答案生成。

04:00
arXiv cs.AI

JarvisBench:人类与智能体之间的始终在线智能

提出JarvisBench基准,评估智能体与人类间双向注意力协调,涵盖45个任务,支持任意智能体运行时,确保用户可随时介入并获得及时反馈。

04:00
arXiv cs.AI

大语言模型能预测失败风险,但难以预测哪种协作协议值得投入:推理任务中的成本感知协议路由

多智能体可提升推理但成本高;模型能识别失败风险,却难预测具体协作协议的价值,成本感知路由仍待解决。

04:00
arXiv cs.AI

智能体评估何时结束?结果最终性与跨单元分离

当前评估仅看停止时状态,需满足结果最终性与跨单元分离,否则延迟操作会污染结果,需开放效应记录。

04:00
arXiv cs.AI

信任不够:代理强化学习中在线策略自蒸馏的影响校准

针对教师信任与目标效用错配,提出影响校准ICSD,调节蒸馏权重,减少反向token,显著提升ALFWorld等基准性能。

04:00
arXiv cs.AI

T-LLM 编译器:基于可信大语言模型的代码优化与验证框架

T-LLM编译器结合LLM变换、传统编译与验证,提升代码正确性,最高加速16.1%,平均26.7%。

04:00
arXiv cs.AI

汇聚而非准入:注意力如何将潜在变量带入可表述形式

无门控;注意力在中深度窗口按需汇聚潜在变量,形成可表述形式。

04:00
arXiv cs.AI

S2-MoE:实现边缘设备上混合专家模型的高效自推测解码

提出S2-MoE自推测解码框架,用于边缘设备MoE推理,减少冗余验证并提升专家重用,平均加速约2倍,最高达5.3倍。

04:00
arXiv cs.AI

SCOPE:面向视频世界模型的分数隔离式智能体优化

提出SCOPE框架,审计式推理时优化冻结视频世界模型;基准提升显著,但收益跨模型不均,需筛选更新。

04:00
arXiv cs.AI

Andy:用于严谨证明和自主研究的数学智能体

自主数学智能体可求解验证问题、提出新问题、构建严谨证明,并成功证明切换拓扑下时滞异构网络的全局指数同步。

04:00
arXiv cs.AI

通过LLM智能体进行列间约束发现的约束感知合成表格数据生成

提出LLM智能体发现并强制执行列间约束,后处理修复生成数据,实现零违规并提升下游效用。

04:00
arXiv cs.AI

超越阈值:面向冷链物联网系统的质量感知决策智能框架

提出面向冷链的质量感知决策智能框架融合质量表征混合建模与LLM推理提升保质期预测精度与决策最优性

04:00
arXiv cs.AI

使用CPMpy将有限域整数约束模型翻译为CP/SMT/ILP/PB/SAT求解器

提出将高层约束模型模块化转换为多种求解器(CP/SMT/ILP/PB/SAT)的框架,实现于CPMpy,线性化优化对ILP/PB至关重要。

04:00
arXiv cs.AI

机器智能的构成性先验:人工物理世界的合法性理论

物理AI有冷启动僵局,但人工物理世界有档案可循;先验合法性在于有意构成且留档,需四层结构。

04:00
arXiv cs.AI

SkillCommit:基于行为验证的范围扩展来演化智能体技能

提出SkillCommit,在线技能演化框架,将经验转为分层技能库,仅合并经行为验证的技能,提升多域性能并支持跨模型迁移。

04:00
arXiv cs.AI

LongRCA Bench:诊断长程智能体失败中的责任角色与根本原因

提出LongRCA Bench:1140条失败轨迹,基线根因步准确率仅13.2%;RCTA达角色51.1%、根因步24.1%。

04:00
arXiv cs.AI

面向人类状态转变的生理世界模型

提出生理世界模型,以事件为条件建模整个人体状态转变,含转换令牌及基准,助力个性化健康管理。

04:00
arXiv cs.AI

MoE路由器引导的异构联邦指令微调聚类

提出路由感知的联邦微调框架,利用混合专家模型的路由签名聚类客户端,提升异构个性化性能,保持通信成本。

04:00
arXiv cs.AI

物理信息约束的VAE-EVT尾部感知无线电图预测

提出物理信息与尾部感知VAE-EVT,分别建模SNR主体与GPD极端尾部,中断区RMSE 4.83dB,较GAN 21.90dB显著更优。

04:00
arXiv cs.AI

心智模型管理:基于操作符的LLM记忆框架

提出心智模型管理框架,用操作符整合新信息至概念表示,实现LLM紧凑记忆。

04:00
arXiv cs.AI

在LLM集成中实现自我意识与自我调节的元认知框架

首个LLM集成元认知框架,基于元认知状态向量实现自我监控与调节,自动切换System1/System2处理。

04:00
arXiv cs.AI

证明是那样证明的吗?——《几何原本》证明的忠实形式化

提出忠实形式化方法,以分治搜索生成形式证明,在《几何原本》前三卷胜过基线并揭示漏洞。

04:00
arXiv cs.AI

AI生成语音及其检测综述

综述AI语音生成与检测技术,涵盖基础与前沿,指出检测难点与未来研究方向。

04:00
arXiv cs.AI

OTel:为智能网络构建领域专用的电信大语言模型基础

OTel开放电信AI资源:30个后训练模型显著提升检索、重排与语言模型性能,下载超1600万次。

04:00
arXiv cs.AI

当熵不足时:在LLM输出长度预测中找回丢失的语义

针对熵忽略语义问题,提出ESTP,融合注意力重要性,低开销提升长度预测准确率与吞吐量。

04:00
arXiv cs.AI

从情境到价值:抽象论证中的情境依赖击败

用多项式时间判定情境依赖框架能否化为值排序表示,发现可表示性罕见且随情境数骤减,复杂度上界为ΣP3。

04:00
arXiv cs.AI

无答案准入:面向大语言模型优化建模的无标签认证与经验学习

提出无标签准入机制,基于校准外部证据,精确率0.927,毒化减少三倍,宏准确率58.4,野外转移失败