5469 条条目 · 106 个活跃源
2026年5月26日
04:00
arXiv cs.AI

面向可持续电动汽车充电与二氧化碳减排的排放感知强化学习:在不同可再生能源渗透率下

提出基于SAC的排放感知强化学习,在EV2Gym训练,50%风电下碳强度23.96g/kWh,减排87%,变压器过载低于7kWh。

04:00
arXiv cs.AI

AgentFugue:通过集体推理扩展智能体以应对长期任务

提出AgentFugue框架,通过共享推理中枢让并行智能体记录并利用彼此中间发现,无需集中规划,提升长期任务性能。

04:00
arXiv cs.AI

SPACE: 统一对称与非对称路径规划问题的通用神经求解器

提出SPACE框架,用空间枢轴对齐嵌入统一对称/非对称VRP,实现零样本泛化。

04:00
arXiv cs.AI

SAM:面向长程推理智能体的状态自适应记忆

SAM框架通过状态自适应记忆整合交互线索并保留原始轨迹,无需重训练即可提升长程推理性能。

04:00
arXiv cs.AI

Beyond Control-Flow: Integrating the Resource Perspective into Multi-Collaborative Process Modeling from Text

04:00
arXiv cs.AI

召唤神谕屠神:用大语言模型消除金融回测中的前视偏差

提出FinCAD方法,抑制模型对历史数据的记忆,消除前视偏差,提升回测可靠性。

04:00
arXiv cs.AI

PALoRA:用于保留大型语言模型推理能力的投影自适应LoRA

PALoRA通过投影自适应LoRA,在知识注入时保留推理能力,平均保留95%推理性能,参数开销低于0.006%。

04:00
arXiv cs.AI

越狱护盾:通过临时越狱实现大型语言模型安全微调的缓冲与强化

提出临时越狱缓冲有害更新、强化安全的新框架,兼顾安全与性能,无需额外安全数据。

04:00
arXiv cs.AI

AVBench:面向音视频生成模型的人机对齐自动化评估基准

AVBench提出面向人类中心的音视频生成全自动评估基准,含十维细粒度指标和偏好学习评估器,输出连续评分与人类判断对齐。

04:00
arXiv cs.AI

Hylos:面向模型原生空间智能的可操作性契约

Hylos通过空间事务契约维护场景可操作性,实现因果修复,主张空间AI评估应超越视觉质量。

04:00
arXiv cs.AI

GlobalDentBench:一项经专家校准的跨国牙科LLM临床推理评估基准

首个跨国牙科基准揭示LLM不安全率31.01%,4.51%致永久伤害,临床推理不足亟待严格验证。

04:00
arXiv cs.AI

Exploration of Perceptual Speech Features for Clinical Decision-Support in Mental Health Care

04:00
arXiv cs.AI

超越仅推理部署:基于权重的整合与级联压缩的比较

整合方法保留80.4%知识,较级联压缩提升43.6个百分点,实现持久个性化。

04:00
arXiv cs.AI

面向智能体不确定性量化的恰当评分规则

提出轨迹恰当评分(TPS)严格评估智能体不确定性,扩展至截断轨迹,实验显示与现有方法差异显著。

04:00
arXiv cs.AI

通过循环SG-MCMC和软标签学习进行主观NLP中的不确定性分解

提出cSG-MCMC与软标签学习结合,在主观NLP五轴评估中优于MC Dropout和Deep Ensemble,实现不确定性分解。

04:00
arXiv cs.AI

PRIMA:具有可验证身份和收敛反馈的弹性多智能体研究的操作模式

PRIMA提出三种操作模式,用于应对多智能体长时运行故障,实现弹性恢复、子智能体规范与多阶段应用。

04:00
arXiv cs.AI

PANDO: 通过在线技能蒸馏实现高效多模态AI智能体

PANDO通过在线技能蒸馏维护结构化技能库,在VisualWebArena上以更少token实现更高成功率。

04:00
arXiv cs.AI

CoRe-Code:面向代码生成的协作强化学习

采用规划器-编码器范式,通过协作强化学习提升多智能体代码生成的准确性和效率。

04:00
arXiv cs.AI

测试时深度思考以探索隐式规则

提出推理隐式规则框架,用稳定强化学习训练,提升基线14-19点。

04:00
arXiv cs.AI

用加权一阶模型计数求解组合计数问题

Cofola是一种类型化声明式语言,将组合计数问题转化为加权一阶模型计数实例,实现端到端自动化求解。

04:00
arXiv cs.AI

翻转护盾:从策略规范中系统生成安全测试

提出POLARIS框架,将非结构化策略形式化为一阶逻辑并构建语义图,系统生成高覆盖、可复现的安全测试。

04:00
arXiv cs.AI

聚类即推理:链式思维图学习的k均值解读

提出KCoT框架,揭示Transformer与k-means的数学对应,将推理视为迭代聚类,提升图学习性能。

04:00
arXiv cs.AI

公平性能量护盾

能量护盾是轻量自适应控制器,通过概率干预平滑保证运行时公平性,兼顾短期安全与长期活性。

04:00
arXiv cs.AI

TaBIIC2:使用加权自组织映射交互式构建本体分类体系

利用加权自组织映射交互式构建概念分类体系,平衡手动分析与自动聚类。

04:00
arXiv cs.AI

慢性皮肤病纵向数据检索中的隐私保护本地语言模型:在天疱疮患者中的实施

天疱疮患者中,本地隐私保护小语言模型从长期记录检索特征并生成摘要,准确率82.25%,医生评价高。

04:00
arXiv cs.AI

AION:时间序列的新一代任务与实用框架

AION框架以时间基础、知识推理与可靠性机制,推动时间序列任务从固定基准转向现实约束,生成更详细过程与审查。

04:00
arXiv cs.AI

DarkForest:少交流,高精度——多智能体大语言模型

DarkForest通过独立推理与结构化聚类,实现低通信高精度,性能提升达30.7%,token消耗降低至1/6.5。

04:00
arXiv cs.AI

信任但验证:面向选择性LLM预测的证明者-验证者协商机制

提出证明者-验证者协商机制,通过结构化辩论筛选高置信答案,在GPQA上实现30个百分点正确率差距。

04:00
arXiv cs.AI

无控制的表征:语言模型中实现效应的测试

测试语言模型实现效应发现,表征可解码但因果控制无效,行为依赖不可自动推断。

04:00
arXiv cs.AI

SimuWoB:模拟真实移动应用以实现快速可靠的GUI智能体基准测试

SimuWoB合成基准含120个挑战任务,自动生成环境与奖励,测试GUI智能体平均成功率仅27.92%,揭示复杂场景不足。

04:00
arXiv cs.AI

SpecAlign:面向SystemVerilog断言生成的语义对齐框架

提出SpecAlign,通过迭代对齐和自一致性投票提升断言语义对齐,无需黄金RTL。

2026年5月25日
04:00
arXiv cs.AI

PathCal:状态感知的反思标记校准以实现高效推理

PathCal通过区分反思标记类型并在局部不确定状态干预,无需外部验证即可平衡效率与性能,缩短生成长度。

04:00
arXiv cs.AI

BOHM:复合AI系统的零成本层级归因方法

BOHM从路由权重零成本提取层级归因,与SHAP互补,提供多分辨率分解。

04:00
arXiv cs.AI

SciAtlas:面向自动化科学研究的大规模知识图谱

SciAtlas构建多学科知识图谱,结合神经符号检索,实现低成本自动化科学研究。

04:00
arXiv cs.AI

ImProver 2:用于神经符号证明优化的迭代自改进语言模型

提出ImProver 2框架,结合专家迭代与轻量抽象,训练7B模型胜过超大模型,证明优化可学习。

04:00
arXiv cs.AI

中文标题:中介模糊逻辑:从一型基础到二型、三型及量子扩展

摘要:构建统一的中介模糊逻辑框架,涵盖一型到量子扩展,通过中介算子处理犹豫与矛盾,具有可靠性和保守性。

04:00
arXiv cs.AI

确定性视界:将不可能性结果作为可信AI系统的设计规范

AI存在架构决定的准确性上限(确定性视界),其他不可能性结果可作为设计规则。

04:00
arXiv cs.AI

重绘AI地图:智能体生态系统中的问责边界理论

智能体AI降低模块化成本,但问责边界仍需整合,提出组件、集成及双轨策略,并引入规则债务。

04:00
arXiv cs.AI

归纳演绎合成:使AI生成形式化验证系统

IDS联合增量合成实现与证明,学习失败策略,7/7规范成功,均6.8小时/$106,快200倍且性能提升3倍。

04:00
arXiv cs.AI

基础协议:智能体社会的协调层

提出FP协议,以图优先的协调层统一人、智能体与工具,支持多方协作与经济结算,确保可组合与可问责。

04:00
arXiv cs.AI

AutoResearch AI:迈向人工智能驱动的科研自动化以促进科学发现

综述AI驱动的科研自动化工作流,涵盖文献、假设、实验等环节,分析五条件与五维度,自主性受领域限制。

04:00
arXiv cs.AI

长周期LLM Agent服务的并行上下文压缩

并行压缩解决长对话上下文过长问题,提供细粒度控制,减少延迟,提高吞吐量。

04:00
arXiv cs.AI

本体知识块:可执行合规性与基于轮廓的验证,用于可信AI系统

提出OKB,将监管义务编译为可执行约束,通过SHACL验证和轮廓配置实现可信AI治理,延迟12.6-100.3ms,已开源。

04:00
arXiv cs.AI

DART:结构化工具代理的语义可恢复性

DART通过语义可恢复性认证,实现安全局部恢复,保留下游工作,正确恢复基线失败案例。

04:00
arXiv cs.AI

SPACENUM:重新审视视觉语言模型中的空间数值理解

SPACENUM框架评估发现,当前视觉语言模型在空间数值理解上接近随机猜测,依赖浅层线索,无法建立稳定坐标感知。

04:00
arXiv cs.AI

中文标题:当正确执行仍导致规划失败:论基于LLM的多智能体系统的认知校准

中文摘要:解决LLM多智能体系统因认知失调导致的规划失败,提出EPC-AW方法,通过信息一致性校准提升成功率9.75%。

04:00
arXiv cs.AI

CP还是DP?为何不两者兼得:以部分车间调度问题为例

本文结合动态规划与约束规划,以DP为主框架、CP子程序利用全局传播,解决部分车间调度问题,展示混合集成可行性。

04:00
arXiv cs.AI

Co-ReAct:将评分准则作为ReAct智能体的步骤级协作工具

Co-ReAct通过步骤级评分准则指导推理决策,优化秩相关奖励,显著提升搜索推理任务性能。

04:00
arXiv cs.AI

MemAudit:通过因果归因和结构异常检测对中毒智能体记忆进行事后审计

MemAudit通过因果归因与异常检测审计中毒记忆,将攻击成功率降至0%。

04:00
arXiv cs.AI

Agentic Proving for Program Verification