5442 条条目 · 106 个活跃源
2026年6月16日
04:00
arXiv cs.AI

神经符号人工智能用于法律AI-TRISM:可信、可靠、可解释、安全模型

提出TRISM框架,整合神经符号AI与检索增强生成,提升法律大模型的可信、可靠、可解释与安全性。

04:00
arXiv cs.AI

问题出在哪里?基于语义状态追踪的Web智能体过程级评估

提出WebStep基准,通过语义状态追踪进行过程级分析,揭示智能体性能差异并定位改进方向。

04:00
arXiv cs.AI

大语言模型能否可靠识别失语症语篇中的正确信息单元?

少样本提示下LLM可辅助失语症语篇CIU识别,但准确率不足全自动,适合人机协作。

04:00
arXiv cs.AI

基于AI的自适应供水管网管理框架及概念验证实施:解决约旦的无收益水问题

本文提出集成EPANET、数字孪生、SCADA和LLM的智能框架,概念验证实现自动异常检测与AI报告,响应<2分钟、零API成本,精准定位爆管。

04:00
arXiv cs.AI

通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉

提出检索增强的可靠性推理框架,利用外部证据和可靠性指标减少视觉幻觉,提升预测准确率。

04:00
arXiv cs.AI

TrustedARI:面向代理型AI的信任原生代理路由基础设施

首个信任原生的代理路由基础设施,通过三方TLS握手、隐私查询和可验证计费实现高效安全,无需修改服务商。

04:00
arXiv cs.AI

AIChilles:自动揭示AI演化系统中的隐藏弱点

AIChilles自动搜索AI演化程序相对原程序在正确性、性能等方面的回归,发现49个隐藏弱点,可辅助开发流程。

04:00
arXiv cs.AI

UrbanWell:面向时空城市福祉分析的多模态大语言模型基准测试

构建UrbanWell基准,评估多模态大语言模型在时空城市福祉分析中的推理能力,实验显示模型表现差异显著。

04:00
arXiv cs.AI

STRIDE:通过判别性估计实现策略轨迹推理的可验证强化学习框架

STRIDE对比成功与失败轨迹,判别n-gram模式偏好并结合推理显著性熵,实现细粒度可验证奖励分配,显著提升多种模型推理能力。

04:00
arXiv cs.AI

基于上下文学习的深度学习工作负载迁移智能体框架

提出结合上下文学习与自调试的智能体系统,实现PyTorch到JAX自动迁移,数值等价性达91%。

04:00
arXiv cs.AI

SciText2Eq:评估大语言模型在科学创造力中生成可解释方程的能力

本研究评估LLMs从科学文本生成可解释方程,发现语义准确性差,且与人类评估一致性有限。

04:00
arXiv cs.AI

深海韵律:抹香鲸双重模式的计算语言学检验

抹香鲸叫声存在韵律驱动的双层组合结构:下层按节奏而非顺序组合咔哒声,上层叫声序列具有依赖性。

04:00
arXiv cs.AI

Mind-Studio:面向部分可观察游戏的可执行世界模型与前瞻评估

使用LLM从交互轨迹合成可执行游戏世界模型,K步前瞻评估实现48.7%预测准确率和5/8子目标验证。

04:00
arXiv cs.AI

RecourseBench:可复现算法追索评估的模块化框架

首个通过自动定量测试强制方法级可复现的算法追索评估框架,集成28种方法。

04:00
arXiv cs.AI

视觉锚定思考

提出视觉锚定思考,让模型在语言推理中显式标注图像区域,通过合成数据与强化学习,提升计数与空间推理,4B模型性能匹敌27B。

04:00
arXiv cs.AI

VibeThinker-3B:探索小型语言模型可验证推理的前沿

VibeThinker-3B以3B参数通过课程微调、多域强化学习等优化,在AIME26达94.3分,媲美更大模型。

04:00
arXiv cs.AI

质量-效用悖论:为什么高奖励数据反而损害小模型数学推理

高奖励数据因分布漂移损害小模型推理,保持风格一致可提升效用。

04:00
arXiv cs.AI

TimeVista: 探索与利用视觉语言模型作为时间序列预测的评判者

提出TimeVista基准,利用视觉语言模型评判时间序列预测,实现更符合人类偏好的评估。

04:00
arXiv cs.AI

Measuring Whether LLM Tutors Teach or Solve: A Diagnostic for Educational Impact

04:00
arXiv cs.AI

基于场景相关观测商的传感器条件化表示学习

提出场景相关观测商,开发OQ-TSAE框架,提升传感器条件化表示正确性诊断。

04:00
arXiv cs.AI

SpecAlign:通过合成数据实现高效规范驱动的大语言模型对齐

SpecAlign提出规范驱动对齐范式,直接从规范文档合成偏好对,提升规则合规性并保持通用能力。

04:00
arXiv cs.AI

相位感知引导注入:面向装配线中断恢复的循环MAPPO

提出相位感知引导注入框架,通过决策时利用异构恢复知识减少异常恢复时间并保障准时交付。

04:00
arXiv cs.AI

人工智能推荐哪家酒店?对LLM辅助选酒店中声誉信号的算法审计

AI推荐酒店时评分与价格主导,但过度重视环保认证、忽略管理回复,列表位置(无内容)价值约12美元/晚。

04:00
arXiv cs.AI

看≠选:LLM代理工具选择失败的注意力-片段解析

LLM代理选错工具并非因没看到正确工具,而是决策读出环节失灵,注意力显示正确工具被关注却未被选中。

04:00
arXiv cs.AI

引导艺术治疗的情感动态:基于分层LLM智能体的可控叙事脚本生成

EC-Script框架分层控制情感轨迹生成叙事脚本,显著提升情感一致性,支持AI情感疗愈。

04:00
arXiv cs.AI

ARB4WM:面向连续控制中世界模型的对抗鲁棒性基准

提出ARB4WM基准评估世界模型对抗鲁棒性,发现攻击值、动态与策略破坏相当,早期扰动更危险,需多维度安全评估。

04:00
arXiv cs.AI

事后合并不够:基于损失差距平衡的多轮模型合并

提出METIS迭代多轮合并方法,通过损失差距加权和共识掩码,有效缓解任务干扰与信息擦除,显著提升最差任务性能。

04:00
arXiv cs.AI

Tensor-Coord:无冲突多智能体LLM规划的联合规划张量代数分解

提出Tensor-Coord框架,以张量分解度量协调复杂度并定位冲突,迭代重规划实现无冲突,实验收敛高效。

04:00
arXiv cs.AI

Kairos:面向物理AI的原生世界模型栈

Kairos原生世界模型栈通过预训练、统一架构和系统协同设计,使物理AI高效获取知识、维持长时状态并实时部署,性能领先。

04:00
arXiv cs.AI

ROSA-RL:基于强化学习的不确定性感知环岛优化速度建议

ROSA-RL利用Transformer预测冲突概率,结合强化学习实现环岛入口的不确定性感知速度建议,提升混合交通的安全与效率。

04:00
arXiv cs.AI

MR-GVNO:面向不规则域上Mindlin-Reissner板的几何感知变分物理信息神经算子

提出几何感知变分神经算子MR-GVNO,无需标签数据,实现不规则域上板结构快速预测。

04:00
arXiv cs.AI

LLM策略优化的第一性原理推导:从期望奖励到GRPO及其结构扩展

基于第一性原理,以轨迹与奖励两侧为轴统一分析LLM策略优化算法,揭示设计选择及复合失败,为下一代算法奠定基础。

04:00
arXiv cs.AI

AgentFairBench:LLM智能体在行动时是否存在歧视?

提出AgentFairBench基准,通过反事实匹配集检测LLM代理行动歧视,发现统计维度不匹配会夸大偏差2.4倍,并提供开源工具。

04:00
arXiv cs.AI

Skill-to-LoRA:从使用技能到学习行为——面向令牌高效的大语言模型智能体

提出Skill-to-LoRA方法,用技能特化LoRA适配器替代运行时文本指令,通过率提升5.2%,令牌成本降低6.6%。

2026年6月15日
04:00
arXiv cs.AI

基于深度强化学习的Transformer方法求解开放车间调度问题

Transformer策略从小训练泛化至大规模开放车间调度,优于SPT/LPT,与EST差距12.89-15.12%。

04:00
arXiv cs.AI

形式化数值分析:超越内核接受的智能体流水线与质量审计

提出三维质量评估框架,揭示编译通过掩盖的不忠实形式化模式,用于自动形式化系统评估。

04:00
arXiv cs.AI

扑克竞技场:大语言模型中战略推理与记忆的多轴剖析

多轴评估揭示LLM战略推理能力结构,标量排行榜系统误判。

04:00
arXiv cs.AI

超维计算用于表格数据嵌入的结构化查询

超维计算为表格嵌入提供可解释相似度阈值,实现结构化查询,优于基线并支持零匹配检测。

04:00
arXiv cs.AI

MA-ProofBench:针对数学分析中定理证明的大语言模型双层评估

首个数学分析形式化定理证明基准,200题分两级别,LLM表现差,最佳仅16%和5%通过率。

04:00
arXiv cs.AI

Capability Minimization as a Safety Primitive: Risk-Aware Causal Gating for Least-Privilege LLM Agents

04:00
arXiv cs.AI

Sorries Are Not the Hard Part: An Expert-Review Case Study of a Semi-Autonomous Formalization

04:00
arXiv cs.AI

对抗性概念搜索:基于特征几何预测组合错误

利用表征几何中概念编码的正交性预测LLM组合失败,接近则干扰失败,无需评估具体输入。

04:00
arXiv cs.AI

治疗性药物-疾病关系的适用条件提取

提出从生物医学文献中提取药物-疾病适用条件的新任务,构建首个手工标注数据集,并改进LoRA方法,效果优于基线。

04:00
arXiv cs.AI

CSPO:用于安全强化学习的约束敏感策略优化

CSPO通过约束敏感修正实现快速安全恢复和高回报,优于现有对偶和惩罚方法。

04:00
arXiv cs.AI

SkillAudit:通过配对轨迹审计实现的无真实标签技能演化

SkillAudit通过配对轨迹审计实现无真实反馈的技能演化,在89个任务中达73.9%平均奖励,超越静态专家技能。

04:00
arXiv cs.AI

跨域动作序列的抽象化为可解释工作流

利用大语言模型将低层动作序列抽象为高层活动,在三个跨域任务中验证了鲁棒性和效率。

04:00
arXiv cs.AI

用于蒙特卡洛树搜索规划的因果对象中心模型

COMET是一种模型强化学习算法,通过对象中心编码和因果注意力在潜空间进行树搜索,早期训练性能优于基线。

04:00
arXiv cs.AI

GitOfThoughts:版本控制的推理与可回放、差异比较及合并的智能体记忆

GitOfThoughts将推理树存为git仓库,实现可审计合并;但实验表明记忆仅对近重复问题有效,且增益是答案检索而非方法迁移。

04:00
arXiv cs.AI

从聊天机器人到数字同事:迈向持久自主AI的范式转变

LLM从对话生成演进为持久自主的AI系统,实现推理、行动、记忆与自我改进,迈向数字同事范式。

04:00
arXiv cs.AI

当工具决定一切:LLM智能体盲目服从图神经网络工具,且更强的基座模型服从更多

LLM智能体使用GNN工具时盲目服从(97-99%),能力越强服从越多;即使替代工具更好也盲从;选择性调用需设计而非自发涌现。