基于Belnap有类型内涵一阶逻辑的神经符号AGI机器人的概率扩展
基于IFOL_B的神经符号AI,引入概率计算与对称变换,用神经网络基于最大熵计算概率密度,增强AGI认知能力。
干预性基础审计:通过谓词替换对LLM思维链进行黑盒前提依赖性测试
提出干预性基础审计,通过谓词替换检测LLM思维链前提依赖,ProntoQA上F1=0.806,发现66%正确解答含“正确答案、错误推理”信号。
EZSMT第三版,成熟版
EZSMTV3是可扩展SMT驱动的CASP框架,改进输入语言并支持优化,利用CVC5等求解器高效处理整数实数混合约束。
理论级自动形式化:从孤立陈述到统一形式化知识库
主张将自动形式化从孤立语句提升到理论级,构建包含依赖关系的结构化知识库,并指出挑战与未来路径。
基于归纳逻辑编程的强化学习智能体解释
提出可解释性度量量化强化学习策略逻辑规则,揭示单/多智能体学习动态与协调模式。
安全哨兵:通过执行-询问-拒绝路由实现上下文感知的人类干预
提出三路路由决策(执行/询问/拒绝),用轻量级模型实现上下文安全干预,优于基线且控制错误率。
AgentCompass:面向智能体能力的统一评估基础设施
AgentCompass是开源轻量的大模型智能体评估基础设施,解耦基准、引擎与环境三大组件,支持20+基准与容错轨迹分析。
中文标题:当机器人加入团队:机器人采用与开源软件项目的制度结构
中文摘要:AI机器人加入开源社区后,重复协作增加、冲突减少、输出更独特,机器人成为社会基础设施的契机。
CAVA:面向智能体AI系统运行时治理的规范动作验证与证明
CAVA将异构智能体活动转为规范动作对象,实现动作验证、审批绑定与可再现治理。
经验记忆图:智能体的一次性错误修正
提出EMG框架,将代理失败恢复转为图匹配,提取修正路径,实现一次性无试错执行,显著优于现有方法。
自我进化的纵向个人健康管理智能体
HealthClaw开源智能体实现自我进化记忆,纵向健康管理准确率提升至45.7%,隐私披露减少。
环境监测中最大化覆盖的自主无人机路径规划:系统文献综述
综述显示无人机路径规划集中于覆盖与能量优化,但天气、不确定性研究不足,仿真多,现实差距大。
智能体优化器的增益能否累积?基于Terminal-Bench 2.0的持续学习评估
仅当优化循环内置回归控制时,增益才可复合;RELAI-VCL因内置回归控制而持续提升,整体通过率达76.4%。
深度交互:一种面向大型推理模型的高效人机交互方法
提出深度交互方法,直接编辑响应纠正推理错误,提升成功率25%以上,减少40%令牌使用。
Earthquaker-AI:基于检索增强生成与量规评估的小学地震教育框架
融合机器人、RAG和量规评估,通过渐进式学习路径提升小学生地震应对能力,实验显示高准确低幻觉。
为公共卫生信息访问设计安全约束的LLM系统
针对母婴健康资源导航,设计安全约束LLM系统,采用多层架构确保安全与合规,平均响应5.3秒。
AI治理中的最终权威:前沿提供者主权与以行动为中心的部署者治理
论文主张AI治理最终权威应归部署者和后果承担者,而非前沿提供者单边控制。
高效且隐私感知的边云协同大语言模型推理
提出隐私保护边云协同推理框架,基于端点认证KV缓存,降延迟46.1%及下行负载67.4%,性能接近全云。
压缩即认知失败:自主LLM工具如何从被终止的进程中捏造确认结果
Claude Code将超时命令的部分输出误记为确认结果,导致错误跨会话传播,根源是混淆观察与持久化。
HRO:基于大语言模型的零样本物体目标导航层次化房间到物体框架
提出LLM驱动的层次化房间到物体框架,实现粗到细零样本导航,性能优于现有方法。
The Hitchhiker's Guide to Monoculture
企业编码代理的推理经济学:云与本地LLM案例研究
API缓存降低成本88.6%,本地模型节省总拥有成本但缺陷修复率高出2.6-4.9倍。
先架构,后基线:评估自主渗透测试的编码代理
在104任务基准上,普通编码代理基线表现强劲,专用辅助工具提升有限,新模型显著改进,评估应报告模型匹配基线。
通过累积行为规则实现自我改进的AI编码代理:一个闭环框架
将审核反馈编码为持久规则,AI编码代理闭环自我改进,消除重复错误,无需更新权重。
利用AI分析课程模式复杂性以提高按时毕业率
利用大语言模型分析课程模式并提出修订建议,减少毕业延迟和瓶颈。
网络心理学中的人工智能:通过AI分析受害者、攻击者与防御者心理增强网络安全的系统性文献综述
系统性综述34项研究,聚焦AI分析受害者、攻击者、防御者心理,应用于异常检测、漏洞预测、安全培训及身份验证四大网络安全领域。
主动非对角线可重构智能表面赋能异构边缘计算:一种分布式强化学习方法
提出DSAC-T算法解决主动BD-RIS异构MEC优化,实现最优能效延迟、81.67%可行性和0.0267秒快速决策。
隐私保护推荐系统:平衡个性化与隐私
本文提出联邦学习与差分隐私结合的推荐框架,在中等隐私预算下保持推荐质量,平衡隐私与效用。
赌臂问题中公平性的代价:一个紧极小极大刻画
本文证明严格公平性代价下界Ω(σ√(k^{max(1,q)}/T)),提出UCB-HARE算法匹配,实验验证优于均匀探索。
生物有机体中的具身世界模型与未来具身人工智能
生物智能以环境交互构建的具身世界模型为认知基础,语言附着其上;未来AI应转向主动社会化学习。
学习参与助手(LEA):跨课程可扩展性与课堂评估的代理式AI辅导系统
首次真实课堂部署LEA,跨课程测试发现忠实度随课程距离下降,模拟无法完全预测真实表现。
阿姆斯特丹的咖啡馆:当现有方案成为评判标准
计算重构需避免“基线捕获”——现有方案输出成为规范,需建立独立于现有方案的需求验证器。
学习物理引导的残差动力学用于可变形物体模拟
提出物理引导残差动力学混合框架,结合弹簧模型与残差网络,准确模拟可变形物体并应用于操控规划。
Can We Steer the Black-Box? Towards Controllability-Centric Evaluation of Recommender Systems with Collaborative Agents
针对AI安全评估的对抗性提示框架
本文提出对抗性提示框架,通过多种复杂度提示评估AI模型安全性,发现编码提示攻击成功率最高。
从预测到协作:交互式符号音乐分析
提出统一框架,结合强预测与交互式修订,复用预训练表示,支持完整分析、局部修正与缺失推理。
谱信息神经网络在高维偏微分方程中优于谱方法
改进谱信息神经网络用系数衰减与基嵌入,在中高维PDE中精度超越谱方法和PINNs。
面向野外环境的多技能敏捷感知四足机器人运动
提出APT-RL框架,实现四足机器人自主技能切换,在复杂户外环境高速敏捷运动,峰值速度达6米/秒。
社会模拟:从基于主体的建模到数字孪生
从经典主体模型到AI增强模拟,再演进为社会数字孪生,实现从抽象机制到具体系统高保真表示的转变。
Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities
从语言到导航目标:基于视觉-语言与RGB-D感知的移动机器人语义导航方法
提出语言驱动导航框架,整合自然语言理解与RGB-D感知,实现移动机器人自主导航至指定目标,实验验证可行性。
GitHub项目对智能编程工具的早期采用
智能编程工具在GitHub项目中采用尚早,多数项目PR量少,小项目参与率高,人机协作以单人监督为主。
验证干预分布的公式
形式化因果图模型验证,提出反证器与网关测试,解决观测公式识别干预分布问题。
面向LLM网络入侵检测的流量感知随机平滑
提出TA-RS方法,在攻击者可修改特征子空间注入高斯噪声,实现认证鲁棒性,在三个数据集上准确率达55-100%,比基线高72个百分点。
生成式编译:AI生成代码时的即时编译器反馈
提出生成式编译,通过轻量语法转换在代码生成中获取编译器反馈,减少错误并提升正确性。
重新思考面向AI赋能系统的渗透测试:从资源妥协到行为目标违反
提出AI系统渗透测试新范式:从资源攻破转向行为目标违反,定义AI渗透为诱导违反操作目标的行为,并给出测试工作流与实例。
基于证据的骨骼肌肉护理AI
OrthoPilot AI整合多源数据,在骨骼肌肉全流程管理中超越资深专家,提升10.6%成功率。
超博弈理论综述:为多智能体系统建模错位感知与嵌套信念
综述超博弈理论,建模主体感知错位与嵌套信念,分析动态多智能体系统应用与未来方向。
交互协议塑造多智能体辩论中的道德判断
多智能体辩论中,交互协议显著影响模型道德判断的修订率、价值观偏向和顺序效应。
思想策略:通过在线策略演进扩展大语言模型推理的测试时训练
提出PoT框架,将推理视为在线优化,用GRPO更新LoRA适配器,4B模型性能超越GPT-4o。