5394 条条目 · 106 个活跃源
2026年7月16日
04:00
arXiv cs.AI

基于Belnap有类型内涵一阶逻辑的神经符号AGI机器人的概率扩展

基于IFOL_B的神经符号AI,引入概率计算与对称变换,用神经网络基于最大熵计算概率密度,增强AGI认知能力。

04:00
arXiv cs.AI

干预性基础审计:通过谓词替换对LLM思维链进行黑盒前提依赖性测试

提出干预性基础审计,通过谓词替换检测LLM思维链前提依赖,ProntoQA上F1=0.806,发现66%正确解答含“正确答案、错误推理”信号。

04:00
arXiv cs.AI

EZSMT第三版,成熟版

EZSMTV3是可扩展SMT驱动的CASP框架,改进输入语言并支持优化,利用CVC5等求解器高效处理整数实数混合约束。

04:00
arXiv cs.AI

理论级自动形式化:从孤立陈述到统一形式化知识库

主张将自动形式化从孤立语句提升到理论级,构建包含依赖关系的结构化知识库,并指出挑战与未来路径。

04:00
arXiv cs.AI

基于归纳逻辑编程的强化学习智能体解释

提出可解释性度量量化强化学习策略逻辑规则,揭示单/多智能体学习动态与协调模式。

04:00
arXiv cs.AI

安全哨兵:通过执行-询问-拒绝路由实现上下文感知的人类干预

提出三路路由决策(执行/询问/拒绝),用轻量级模型实现上下文安全干预,优于基线且控制错误率。

04:00
arXiv cs.AI

AgentCompass:面向智能体能力的统一评估基础设施

AgentCompass是开源轻量的大模型智能体评估基础设施,解耦基准、引擎与环境三大组件,支持20+基准与容错轨迹分析。

04:00
arXiv cs.AI

中文标题:当机器人加入团队:机器人采用与开源软件项目的制度结构

中文摘要:AI机器人加入开源社区后,重复协作增加、冲突减少、输出更独特,机器人成为社会基础设施的契机。

04:00
arXiv cs.AI

CAVA:面向智能体AI系统运行时治理的规范动作验证与证明

CAVA将异构智能体活动转为规范动作对象,实现动作验证、审批绑定与可再现治理。

04:00
arXiv cs.AI

经验记忆图:智能体的一次性错误修正

提出EMG框架,将代理失败恢复转为图匹配,提取修正路径,实现一次性无试错执行,显著优于现有方法。

04:00
arXiv cs.AI

自我进化的纵向个人健康管理智能体

HealthClaw开源智能体实现自我进化记忆,纵向健康管理准确率提升至45.7%,隐私披露减少。

04:00
arXiv cs.AI

环境监测中最大化覆盖的自主无人机路径规划:系统文献综述

综述显示无人机路径规划集中于覆盖与能量优化,但天气、不确定性研究不足,仿真多,现实差距大。

04:00
arXiv cs.AI

智能体优化器的增益能否累积?基于Terminal-Bench 2.0的持续学习评估

仅当优化循环内置回归控制时,增益才可复合;RELAI-VCL因内置回归控制而持续提升,整体通过率达76.4%。

04:00
arXiv cs.AI

深度交互:一种面向大型推理模型的高效人机交互方法

提出深度交互方法,直接编辑响应纠正推理错误,提升成功率25%以上,减少40%令牌使用。

04:00
arXiv cs.AI

Earthquaker-AI:基于检索增强生成与量规评估的小学地震教育框架

融合机器人、RAG和量规评估,通过渐进式学习路径提升小学生地震应对能力,实验显示高准确低幻觉。

04:00
arXiv cs.AI

为公共卫生信息访问设计安全约束的LLM系统

针对母婴健康资源导航,设计安全约束LLM系统,采用多层架构确保安全与合规,平均响应5.3秒。

04:00
arXiv cs.AI

AI治理中的最终权威:前沿提供者主权与以行动为中心的部署者治理

论文主张AI治理最终权威应归部署者和后果承担者,而非前沿提供者单边控制。

04:00
arXiv cs.AI

高效且隐私感知的边云协同大语言模型推理

提出隐私保护边云协同推理框架,基于端点认证KV缓存,降延迟46.1%及下行负载67.4%,性能接近全云。

04:00
arXiv cs.AI

压缩即认知失败:自主LLM工具如何从被终止的进程中捏造确认结果

Claude Code将超时命令的部分输出误记为确认结果,导致错误跨会话传播,根源是混淆观察与持久化。

04:00
arXiv cs.AI

HRO:基于大语言模型的零样本物体目标导航层次化房间到物体框架

提出LLM驱动的层次化房间到物体框架,实现粗到细零样本导航,性能优于现有方法。

04:00
arXiv cs.AI

The Hitchhiker's Guide to Monoculture

04:00
arXiv cs.AI

企业编码代理的推理经济学:云与本地LLM案例研究

API缓存降低成本88.6%,本地模型节省总拥有成本但缺陷修复率高出2.6-4.9倍。

04:00
arXiv cs.AI

先架构,后基线:评估自主渗透测试的编码代理

在104任务基准上,普通编码代理基线表现强劲,专用辅助工具提升有限,新模型显著改进,评估应报告模型匹配基线。

04:00
arXiv cs.AI

通过累积行为规则实现自我改进的AI编码代理:一个闭环框架

将审核反馈编码为持久规则,AI编码代理闭环自我改进,消除重复错误,无需更新权重。

04:00
arXiv cs.AI

利用AI分析课程模式复杂性以提高按时毕业率

利用大语言模型分析课程模式并提出修订建议,减少毕业延迟和瓶颈。

04:00
arXiv cs.AI

网络心理学中的人工智能:通过AI分析受害者、攻击者与防御者心理增强网络安全的系统性文献综述

系统性综述34项研究,聚焦AI分析受害者、攻击者、防御者心理,应用于异常检测、漏洞预测、安全培训及身份验证四大网络安全领域。

04:00
arXiv cs.AI

主动非对角线可重构智能表面赋能异构边缘计算:一种分布式强化学习方法

提出DSAC-T算法解决主动BD-RIS异构MEC优化,实现最优能效延迟、81.67%可行性和0.0267秒快速决策。

04:00
arXiv cs.AI

隐私保护推荐系统:平衡个性化与隐私

本文提出联邦学习与差分隐私结合的推荐框架,在中等隐私预算下保持推荐质量,平衡隐私与效用。

04:00
arXiv cs.AI

赌臂问题中公平性的代价:一个紧极小极大刻画

本文证明严格公平性代价下界Ω(σ√(k^{max(1,q)}/T)),提出UCB-HARE算法匹配,实验验证优于均匀探索。

04:00
arXiv cs.AI

生物有机体中的具身世界模型与未来具身人工智能

生物智能以环境交互构建的具身世界模型为认知基础,语言附着其上;未来AI应转向主动社会化学习。

04:00
arXiv cs.AI

学习参与助手(LEA):跨课程可扩展性与课堂评估的代理式AI辅导系统

首次真实课堂部署LEA,跨课程测试发现忠实度随课程距离下降,模拟无法完全预测真实表现。

04:00
arXiv cs.AI

阿姆斯特丹的咖啡馆:当现有方案成为评判标准

计算重构需避免“基线捕获”——现有方案输出成为规范,需建立独立于现有方案的需求验证器。

04:00
arXiv cs.AI

学习物理引导的残差动力学用于可变形物体模拟

提出物理引导残差动力学混合框架,结合弹簧模型与残差网络,准确模拟可变形物体并应用于操控规划。

04:00
arXiv cs.AI

Can We Steer the Black-Box? Towards Controllability-Centric Evaluation of Recommender Systems with Collaborative Agents

04:00
arXiv cs.AI

针对AI安全评估的对抗性提示框架

本文提出对抗性提示框架,通过多种复杂度提示评估AI模型安全性,发现编码提示攻击成功率最高。

04:00
arXiv cs.AI

从预测到协作:交互式符号音乐分析

提出统一框架,结合强预测与交互式修订,复用预训练表示,支持完整分析、局部修正与缺失推理。

04:00
arXiv cs.AI

谱信息神经网络在高维偏微分方程中优于谱方法

改进谱信息神经网络用系数衰减与基嵌入,在中高维PDE中精度超越谱方法和PINNs。

04:00
arXiv cs.AI

面向野外环境的多技能敏捷感知四足机器人运动

提出APT-RL框架,实现四足机器人自主技能切换,在复杂户外环境高速敏捷运动,峰值速度达6米/秒。

04:00
arXiv cs.AI

社会模拟:从基于主体的建模到数字孪生

从经典主体模型到AI增强模拟,再演进为社会数字孪生,实现从抽象机制到具体系统高保真表示的转变。

04:00
arXiv cs.AI

Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities

04:00
arXiv cs.AI

从语言到导航目标:基于视觉-语言与RGB-D感知的移动机器人语义导航方法

提出语言驱动导航框架,整合自然语言理解与RGB-D感知,实现移动机器人自主导航至指定目标,实验验证可行性。

04:00
arXiv cs.AI

GitHub项目对智能编程工具的早期采用

智能编程工具在GitHub项目中采用尚早,多数项目PR量少,小项目参与率高,人机协作以单人监督为主。

04:00
arXiv cs.AI

验证干预分布的公式

形式化因果图模型验证,提出反证器与网关测试,解决观测公式识别干预分布问题。

04:00
arXiv cs.AI

面向LLM网络入侵检测的流量感知随机平滑

提出TA-RS方法,在攻击者可修改特征子空间注入高斯噪声,实现认证鲁棒性,在三个数据集上准确率达55-100%,比基线高72个百分点。

04:00
arXiv cs.AI

生成式编译:AI生成代码时的即时编译器反馈

提出生成式编译,通过轻量语法转换在代码生成中获取编译器反馈,减少错误并提升正确性。

04:00
arXiv cs.AI

重新思考面向AI赋能系统的渗透测试:从资源妥协到行为目标违反

提出AI系统渗透测试新范式:从资源攻破转向行为目标违反,定义AI渗透为诱导违反操作目标的行为,并给出测试工作流与实例。

04:00
arXiv cs.AI

基于证据的骨骼肌肉护理AI

OrthoPilot AI整合多源数据,在骨骼肌肉全流程管理中超越资深专家,提升10.6%成功率。

04:00
arXiv cs.AI

超博弈理论综述:为多智能体系统建模错位感知与嵌套信念

综述超博弈理论,建模主体感知错位与嵌套信念,分析动态多智能体系统应用与未来方向。

04:00
arXiv cs.AI

交互协议塑造多智能体辩论中的道德判断

多智能体辩论中,交互协议显著影响模型道德判断的修订率、价值观偏向和顺序效应。

04:00
arXiv cs.AI

思想策略:通过在线策略演进扩展大语言模型推理的测试时训练

提出PoT框架,将推理视为在线优化,用GRPO更新LoRA适配器,4B模型性能超越GPT-4o。