OpenProver:基于Lean 4的智能体与交互式定理证明
开源LLM驱动定理证明系统,采用Planner-Worker-Verifier架构,支持人机交互与自动形式验证。
面向计算力网络上异构LLM具身智能体的通信高效数字孪生协调
提出LDT-Coord框架,利用轻量数字孪生和规则协调,大幅降低异构LLM智能体通信开销70倍以上。
ProofCouncil:求解开放数学问题的LLM代理
ProofCouncil采用作者-批评者架构,在10个数学开放问题中正确解决6个,表现最佳;在30个问题中5个完全正确。
SAGEAgent:一种用于多模态生存预测中成本感知模态获取的自进化智能体
自进化智能体SAGEAgent平衡预测准确性与临床侵入性,在胶质瘤数据中负担减少55%。
面向智能体LLM系统的共享选择性持久记忆
提出共享选择性持久记忆,保留四类可重用上下文并丢弃无关痕迹,任务完成率96%,大幅降低token消耗。
知识图谱与可解释AI:城市矿产的互补资源
提出四种KG-XAI集成模式,增强城市矿产拆解前评估决策的可辩护性。
超越固定表示:开放式AI中的词汇与验证器鸿沟
本文指出AI受限于固定表示框架,需创建新表示基元,提出词汇与验证器差距,并给出开放结局AI的发展方向。
最小决策动力学与上下文概率:一个量子拔河模型
量子拔河模型用最小内态表示决策上下文依赖,揭示上下文概率是决策动力学的资源特征。
量子逻辑:语境逻辑
自由正交模格分解为语境层与布尔内容,经典逻辑是语境演算六比一的信息丢失商。
EHR-MPC:利用生成式患者数字孪生进行脓毒症治疗的推理时控制
提出EHR-MPC框架,用生成式患者数字孪生实现推理时控制,优化脓毒症治疗,性能优于强化学习。
一种具有高效经典可模拟性的新型并行QCNN架构
提出层次化分区的新型并行QCNN,实现高效经典模拟,训练128量子比特模型,分区不降性能甚至改善。
TheBioCollection:面向生物学的统一预训练规模大语言模型语料库
整合分子、蛋白质、基因组等异构数据为52.6B token统一语料库,训练后模型评分翻倍,语言能力几乎不变。
SCATE:学习监督编码智能体以进行经济有效的测试生成
SCATE框架自适应监督编码智能体,替代人工干预,通过上下文赌博机优化测试动作,显著提升覆盖率并减少浪费。
科学发现中的进化智能:从进化计算到累积发现系统
进化智能以五维框架连接候选优化与经验保留,推动从进化计算到累积科学发现的跃迁。
用于健康的语言大模型:感知收益、风险、使用AI聊天机器人的意向以及在敏感健康话题上的自我披露意愿
AI健康聊天机器人使用意向和披露意愿主要取决于感知收益/风险及个体特征,而非话题类型。
ReGen:面向高效波形扩散模型的分层多提示表示生成
提出ReGen框架,联合估计向量场,提升12.5Hz高压缩潜表示波形生成质量,实现高效文本转语音。
超越元数据:CAPRA用于医学影像中缺失元数据下的隐藏子组分析
CAPRA框架通过校准图像语义轴,在缺失元数据下揭示隐藏子组差异,支持部署时故障分析与鲁棒学习。
生成式通信:概述、技术与趋势
生成式通信(GenCom)是6G新范式,利用大模型驱动语义理解与可控内容生成,实现超高效传输和语义鲁棒性。
你只需SAMPAT
三层可解释神经网络SAMPAT,可逼近任意光滑函数,解析表达,性能佳。
持续学习中的干扰与保留
通过几何分析直接建模干扰为遗忘原因,提出IGFA方法,实现任务可分离时无损保留,冲突时将不可逆遗忘转为可恢复塑性。
地缘政治对齐:大型语言模型中的背书效应
大型语言模型对政策评价受地缘政治背书影响,西方背书提升评分,中俄背书降低评分。
基于锚点检索与LLM推理的二进制函数源代码恢复实践
提出结合锚点检索与LLM推理的二进制源代码恢复方法,高质量数据库下指令覆盖率达95.2%,低质量环境仍有效。
当路由耗尽时:量子中继器网络中的对抗性协同学习与可解释鲁棒性
量子中继器网络中对抗性协同学习路由,保留率接近最优,瓶颈族零保留,非瓶颈族遵循1-1/N覆盖。
STEEL:面向AMD XDNA NPU的能效长序列推理的稀疏感知融合注意力机制
STEEL是首个面向XDNA NPU的开源FlashAttention,通过稀疏感知融合与数据流优化,能耗较CPU/GPU降低9.17倍/1.75倍,延迟显著减少。
将失败视为一个过程:对CLI编码代理轨迹的剖析
编码代理失败多由认知错误驱动,早期发生但隐藏至不可恢复,需早期验证干预。
语义帕累托-DQN:一种用于金融异常检测的多目标强化学习框架
提出语义Pareto-DQN多目标框架,用大语言模型编码交易特征,优化向量奖励,动态权衡误报漏报,提升少数类召回。
Lean-QIT:面向量子信息理论的形式化基础设施
LeanQIT提供量子信息理论的形式化基础设施,包括可重用组件,并形式化了量子信源编码和经典容量定理。
VEXAIoT:使用AI代理的自主物联网漏洞利用
提出VEXAIoT框架,利用LLM代理自动发现利用物联网漏洞,在测试中成功率高达95%。
超越思考的编程:高效稳健的多约束规划
提出SCOPE框架,分离推理与执行,实现高效鲁棒的多约束规划,成功率93.1%,降本增效。
面向超表面逆设计的自演进智能框架
提出自演进框架,通过技能文件演化将任务成功率从38%提升至74%,物理标准达标率从0.51升至0.87。
LLM增强调查中的修正难度与最优样本分配
提出修正难度与最优分配规则,无需试点数据即可提升调查效率11-79%。
PACE:911接线员培训的个性化自适应课程引擎
PACE系统通过个性化课程推荐,实现911接线员培训时间缩短19.5%、掌握率提高10.95%,与专家一致率95.45%,周转时间减少95%。
QAgent:基于大语言模型的多智能体系统,用于自主OpenQASM编程
QAgent是首个自主多智能体框架,集成规划、合成与校准,提升OpenQASM代码准确率47%-70%,多核工作流超88%,抗硬件漂移保持保真度。
RIS辅助下行夹捏天线系统:基于GNN的优化方法
提出RIS辅助多波导夹捏天线系统三阶段GNN优化,实时高效均衡速率与能效。
多智能体强化学习的异质信息瓶颈协调图
HIBCG基于信息瓶颈理论学习分组稀疏协调图,理论保证边存在与容量分配。
算子学习与通用逼近的投影方法
利用Leray-Schauder映射和正交投影,提出算子学习通用逼近新定理,给出L^p空间条件。
Transformer增强的演员-评论家强化学习实现序列感知服务功能链分割
提出Transformer-actor-critic框架,利用自注意力建模VNF依赖,高效实现序列感知SFC分割,提升接受率与资源利用率。
用简单向量表示解释人类选择概率
通过向量几何将人类隐藏与寻找任务中的选择行为分解为两种策略的线性组合,解释行为多样性。
AutoGraphAD:使用变分图自编码器的无监督网络异常检测
提出无监督AutoGraphAD,基于异质变分图自编码器,免标注训练,性能媲美Anomal-E,速度提升一个数量级。
Machine Learning for Network Attacks Classification and Statistical Evaluation of Adversarial Learning Methodologies for Synthetic Data Generation
偏好条件多目标强化学习:分解式多样性驱动策略优化
提出D3PO框架,通过分解学习信号与多样性正则化,克服优势抵消和模式崩溃,获得更优Pareto前沿。
高等教育中生成式社交机器人的基于知识的设计需求
通过访谈识别12项设计需求:涵盖自我、用户和上下文三类知识,确保辅导机器人可靠有效。
SWE-Milestone:评估AI代理在持续软件演化中的表现
新基准SWE-Milestone测试代理在持续任务流上的表现,发现性能从>80%骤降至38%,暴露长期维护与错误传播短板。
AI整合模型用于评估农业韧性
开发AI工具整合GTAP与APSIM模型,通过自然语言问答分析农业供应链冲击,评估跨学科影响。
人类与大型语言模型的对抗性社会认识论
提出对抗性社会认识论,分析在密集交互传播中动因利用信任扭曲信息的机制,并提供审计与补救方法。
对齐临床需求与AI能力:面向医学推理的大语言模型综述
综述医学LLM推理进展,双视角评估18模型:专科诊断优,通用对话强,挑战包括数据限制与幻觉。
对齐合理性:确保医疗人工智能安全的新标准
提出对齐合理性概念,通过三层对齐机制确保医疗AI安全,类比生物合理性建立监管信任。
具体化命题提示解决大语言模型中的组合-知识二分法
针对LLM组合-知识二分难题,提出具体化命题提示(CPP),显式具体化命题,提升推理性能,可扩展至多种模型。
PolyUQuest:面向异构图的可验证结构感知网络RAG
基于异构图的可验证结构感知RAG,通过两层级路由与三种检索模式,提升答案正确性与可验证性,降低LLM令牌消耗。
ASMR:面向船舶维修报告撰写的代理式模式生成
提出ASMR代理框架,自动生成船舶维修报告的紧凑、信息丰富模式,提升报告完整性和一致性。