5943 条条目 · 106 个活跃源
2026年7月13日
04:00
ArXiv AI

OpenProver:基于Lean 4的智能体与交互式定理证明

开源LLM驱动定理证明系统,采用Planner-Worker-Verifier架构,支持人机交互与自动形式验证。

04:00
ArXiv AI

面向计算力网络上异构LLM具身智能体的通信高效数字孪生协调

提出LDT-Coord框架,利用轻量数字孪生和规则协调,大幅降低异构LLM智能体通信开销70倍以上。

04:00
ArXiv AI

ProofCouncil:求解开放数学问题的LLM代理

ProofCouncil采用作者-批评者架构,在10个数学开放问题中正确解决6个,表现最佳;在30个问题中5个完全正确。

04:00
ArXiv AI

SAGEAgent:一种用于多模态生存预测中成本感知模态获取的自进化智能体

自进化智能体SAGEAgent平衡预测准确性与临床侵入性,在胶质瘤数据中负担减少55%。

04:00
ArXiv AI

面向智能体LLM系统的共享选择性持久记忆

提出共享选择性持久记忆,保留四类可重用上下文并丢弃无关痕迹,任务完成率96%,大幅降低token消耗。

04:00
ArXiv AI

知识图谱与可解释AI:城市矿产的互补资源

提出四种KG-XAI集成模式,增强城市矿产拆解前评估决策的可辩护性。

04:00
ArXiv AI

超越固定表示:开放式AI中的词汇与验证器鸿沟

本文指出AI受限于固定表示框架,需创建新表示基元,提出词汇与验证器差距,并给出开放结局AI的发展方向。

04:00
ArXiv AI

最小决策动力学与上下文概率:一个量子拔河模型

量子拔河模型用最小内态表示决策上下文依赖,揭示上下文概率是决策动力学的资源特征。

04:00
ArXiv AI

量子逻辑:语境逻辑

自由正交模格分解为语境层与布尔内容,经典逻辑是语境演算六比一的信息丢失商。

04:00
ArXiv AI

EHR-MPC:利用生成式患者数字孪生进行脓毒症治疗的推理时控制

提出EHR-MPC框架,用生成式患者数字孪生实现推理时控制,优化脓毒症治疗,性能优于强化学习。

04:00
ArXiv AI

一种具有高效经典可模拟性的新型并行QCNN架构

提出层次化分区的新型并行QCNN,实现高效经典模拟,训练128量子比特模型,分区不降性能甚至改善。

04:00
ArXiv AI

TheBioCollection:面向生物学的统一预训练规模大语言模型语料库

整合分子、蛋白质、基因组等异构数据为52.6B token统一语料库,训练后模型评分翻倍,语言能力几乎不变。

04:00
ArXiv AI

SCATE:学习监督编码智能体以进行经济有效的测试生成

SCATE框架自适应监督编码智能体,替代人工干预,通过上下文赌博机优化测试动作,显著提升覆盖率并减少浪费。

04:00
ArXiv AI

科学发现中的进化智能:从进化计算到累积发现系统

进化智能以五维框架连接候选优化与经验保留,推动从进化计算到累积科学发现的跃迁。

04:00
ArXiv AI

用于健康的语言大模型:感知收益、风险、使用AI聊天机器人的意向以及在敏感健康话题上的自我披露意愿

AI健康聊天机器人使用意向和披露意愿主要取决于感知收益/风险及个体特征,而非话题类型。

04:00
ArXiv AI

ReGen:面向高效波形扩散模型的分层多提示表示生成

提出ReGen框架,联合估计向量场,提升12.5Hz高压缩潜表示波形生成质量,实现高效文本转语音。

04:00
ArXiv AI

超越元数据:CAPRA用于医学影像中缺失元数据下的隐藏子组分析

CAPRA框架通过校准图像语义轴,在缺失元数据下揭示隐藏子组差异,支持部署时故障分析与鲁棒学习。

04:00
ArXiv AI

生成式通信:概述、技术与趋势

生成式通信(GenCom)是6G新范式,利用大模型驱动语义理解与可控内容生成,实现超高效传输和语义鲁棒性。

04:00
ArXiv AI

你只需SAMPAT

三层可解释神经网络SAMPAT,可逼近任意光滑函数,解析表达,性能佳。

04:00
ArXiv AI

持续学习中的干扰与保留

通过几何分析直接建模干扰为遗忘原因,提出IGFA方法,实现任务可分离时无损保留,冲突时将不可逆遗忘转为可恢复塑性。

04:00
ArXiv AI

地缘政治对齐:大型语言模型中的背书效应

大型语言模型对政策评价受地缘政治背书影响,西方背书提升评分,中俄背书降低评分。

04:00
ArXiv AI

基于锚点检索与LLM推理的二进制函数源代码恢复实践

提出结合锚点检索与LLM推理的二进制源代码恢复方法,高质量数据库下指令覆盖率达95.2%,低质量环境仍有效。

04:00
ArXiv AI

当路由耗尽时:量子中继器网络中的对抗性协同学习与可解释鲁棒性

量子中继器网络中对抗性协同学习路由,保留率接近最优,瓶颈族零保留,非瓶颈族遵循1-1/N覆盖。

04:00
ArXiv AI

STEEL:面向AMD XDNA NPU的能效长序列推理的稀疏感知融合注意力机制

STEEL是首个面向XDNA NPU的开源FlashAttention,通过稀疏感知融合与数据流优化,能耗较CPU/GPU降低9.17倍/1.75倍,延迟显著减少。

04:00
ArXiv AI

将失败视为一个过程:对CLI编码代理轨迹的剖析

编码代理失败多由认知错误驱动,早期发生但隐藏至不可恢复,需早期验证干预。

04:00
ArXiv AI

语义帕累托-DQN:一种用于金融异常检测的多目标强化学习框架

提出语义Pareto-DQN多目标框架,用大语言模型编码交易特征,优化向量奖励,动态权衡误报漏报,提升少数类召回。

04:00
ArXiv AI

Lean-QIT:面向量子信息理论的形式化基础设施

LeanQIT提供量子信息理论的形式化基础设施,包括可重用组件,并形式化了量子信源编码和经典容量定理。

04:00
ArXiv AI

VEXAIoT:使用AI代理的自主物联网漏洞利用

提出VEXAIoT框架,利用LLM代理自动发现利用物联网漏洞,在测试中成功率高达95%。

04:00
ArXiv AI

超越思考的编程:高效稳健的多约束规划

提出SCOPE框架,分离推理与执行,实现高效鲁棒的多约束规划,成功率93.1%,降本增效。

04:00
ArXiv AI

面向超表面逆设计的自演进智能框架

提出自演进框架,通过技能文件演化将任务成功率从38%提升至74%,物理标准达标率从0.51升至0.87。

04:00
ArXiv AI

LLM增强调查中的修正难度与最优样本分配

提出修正难度与最优分配规则,无需试点数据即可提升调查效率11-79%。

04:00
ArXiv AI

PACE:911接线员培训的个性化自适应课程引擎

PACE系统通过个性化课程推荐,实现911接线员培训时间缩短19.5%、掌握率提高10.95%,与专家一致率95.45%,周转时间减少95%。

04:00
ArXiv AI

QAgent:基于大语言模型的多智能体系统,用于自主OpenQASM编程

QAgent是首个自主多智能体框架,集成规划、合成与校准,提升OpenQASM代码准确率47%-70%,多核工作流超88%,抗硬件漂移保持保真度。

04:00
ArXiv AI

RIS辅助下行夹捏天线系统:基于GNN的优化方法

提出RIS辅助多波导夹捏天线系统三阶段GNN优化,实时高效均衡速率与能效。

04:00
ArXiv AI

多智能体强化学习的异质信息瓶颈协调图

HIBCG基于信息瓶颈理论学习分组稀疏协调图,理论保证边存在与容量分配。

04:00
ArXiv AI

算子学习与通用逼近的投影方法

利用Leray-Schauder映射和正交投影,提出算子学习通用逼近新定理,给出L^p空间条件。

04:00
ArXiv AI

Transformer增强的演员-评论家强化学习实现序列感知服务功能链分割

提出Transformer-actor-critic框架,利用自注意力建模VNF依赖,高效实现序列感知SFC分割,提升接受率与资源利用率。

04:00
ArXiv AI

用简单向量表示解释人类选择概率

通过向量几何将人类隐藏与寻找任务中的选择行为分解为两种策略的线性组合,解释行为多样性。

04:00
ArXiv AI

AutoGraphAD:使用变分图自编码器的无监督网络异常检测

提出无监督AutoGraphAD,基于异质变分图自编码器,免标注训练,性能媲美Anomal-E,速度提升一个数量级。

04:00
ArXiv AI

Machine Learning for Network Attacks Classification and Statistical Evaluation of Adversarial Learning Methodologies for Synthetic Data Generation

04:00
ArXiv AI

偏好条件多目标强化学习:分解式多样性驱动策略优化

提出D3PO框架,通过分解学习信号与多样性正则化,克服优势抵消和模式崩溃,获得更优Pareto前沿。

04:00
ArXiv AI

高等教育中生成式社交机器人的基于知识的设计需求

通过访谈识别12项设计需求:涵盖自我、用户和上下文三类知识,确保辅导机器人可靠有效。

04:00
ArXiv AI

SWE-Milestone:评估AI代理在持续软件演化中的表现

新基准SWE-Milestone测试代理在持续任务流上的表现,发现性能从>80%骤降至38%,暴露长期维护与错误传播短板。