5298 条条目 · 106 个活跃源
2026年9月10日
04:00
arXiv cs.AI

面向自然语言到PDDL问题生成的基于真实语义的评估与修复

LLM生成的PDDL问题虽可通过解析规划,却可能偏离原意;需结合校验与迭代修复,且操作成功与基准重建不一致。

04:00
arXiv cs.AI

面向潜在思维链推理的结构化过程监督

提出PMPS,用可学习推理原型为潜在思维链提供结构过程监督,压缩输出长度并提升准确率。

04:00
arXiv cs.AI

OntologyAligner:面向生物医学本体归一化的本体对齐检索与层级引导大语言模型重排序

提出三阶段框架OntologyAligner,结合本体对齐检索与大模型重排序,HPO归一化达SOTA,并具跨本体可移植性。

04:00
arXiv cs.AI

ConvMem:用于长上下文推理的卷积记忆

ConvMem把长上下文推理重构为分层卷积,以查询为卷积核并行压缩文本,无需训练即可稳健捕获证据。

04:00
arXiv cs.AI

Kernel-Managed Shared Memory for System-Wide Personalization

04:00
arXiv cs.AI

超越表面模仿:面向多模态上下文学习中推理路径对齐的对比建模

提出融合对比示范建模与自精炼的多模态ICL框架,显式引导推理路径对齐,显著提升MLLM性能。

04:00
arXiv cs.AI

智能体应当忘记什么?区分存储内容与使用内容

免训练框架RD-Forget分离存储与使用:保留历史归档,按查询构建记忆视图,抑制过时事实、恢复历史证据。

04:00
arXiv cs.AI

幸运回忆:面向大语言模型持久连贯性的本体驱动记忆生命周期管理

FR按行为本体分类个人事实,实施差异化衰减、替换与检索路由,幻觉率减半,时序消歧准确率76.9%。

04:00
arXiv cs.AI

计算受限的安全保障——资源约束下的覆盖、验证与响应

资源受限框架区分重复成功、唯一覆盖、证据采纳与运行防护,指出相关性不必然压低覆盖上限,提出评估协议。

04:00
arXiv cs.AI

临界初始化使宽标量输入网络中的高阶输入导数失稳

宽标量输入网络临界初始化时,一阶导数方差稳定,二阶导数方差随深度线性增长;残差网络可保证各阶导数方差有界。

04:00
arXiv cs.AI

固定 rollout 预算的 pass@k 评估能识别什么

固定n次采样仅识别前n阶矩;k≤n可识别pass@k,k>n外推不可识别,需报告识别集与模型预测。

04:00
arXiv cs.AI

天下没有免费的校验器:机器人策略验证器综述

综述机器人策略验证器:可用性与可信度此消彼长,无免费校验器,验证器亦需验证。

04:00
arXiv cs.AI

声音还是刻板印象?解耦语音到语音模型中的声学性别与内容性别

S2S模型输出音色无刻板漂移,但性别归因由内容而非声音决定,冲突时误判率最高达90%。

04:00
arXiv cs.AI

针对大语言模型的任意密码攻击无需微调

前沿大模型无需微调,仅靠提示与上下文学习即可掌握密码通信,加密有害内容绕过安全对齐与有害性分类器。

04:00
arXiv cs.AI

高维线性回归中基于SGD的合成数据学习

研究合成数据对高维线性回归SGD泛化的影响:混合训练致崩溃,两阶段可避免,取决于数据质量与协议。

04:00
arXiv cs.AI

未经核验的水印:欧盟《AI法案》之后的AI文本水印

争议双方主张皆无从验证,此不可验证性才是治理失败;实测开源水印散文无碍、代码微损、检测近随机。

04:00
arXiv cs.AI

多QPU系统中保真度感知的量子线路调度

提出GNN的多QPU保真度感知调度框架,编译前预测线路保真度,权衡保真度与并行度,接近穷举且省算力。

04:00
arXiv cs.AI

CS-Guard:面向代码生成安全的LLM护栏基准评测

首个代码生成安全护栏基准:评测9款护栏,越狱与虚构场景攻击下防护薄弱,成功率最高近100%。

04:00
arXiv cs.AI

A-JIT:智能体化即时软件构建

A-JIT 用内嵌AI智能体替代静态二进制,让软件运行时按需合成实现、生成新能力并持续适应用户。

04:00
arXiv cs.AI

面向OT系统的入侵响应策略学习

以POMDP建模OT入侵响应,用PPO学习自动响应策略,仿真验证可有效抵御多种MITRE攻击。

04:00
arXiv cs.AI

基于时序逻辑因果图的强化学习

提出基于时序逻辑因果图(TL-CD),捕捉环境时序因果关系,减少探索并加速强化学习收敛。

04:00
arXiv cs.AI

MOONWALK:在动画/视效前期制作的初级—主管评审流程中,以意图—证据—行动对齐协调运作

MOONWALK系统对齐创作意图、证据与行动,使前期评审决策可追溯、任务可执行,优于纯聊天AI。

04:00
arXiv cs.AI

Show-Harness:仅一个 VLM 智能体就能“玩转”机器人

Show-Harness 以语义动作接口让 VLM 直接操控机器人,支持零样本控制与低成本微调,泛化性优于 VLA 等范式。

04:00
arXiv cs.AI

MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction

04:00
arXiv cs.AI

Reinforcement learning for Quantum Tiq-Taq-Toe

04:00
arXiv cs.AI

ROTATE: Regret-driven Open-ended Training for Ad Hoc Teamwork

04:00
arXiv cs.AI

Non-Stationarity Breaks Permutation Surrogates in Multi-Agent Reinforcement Learning: Diagnosis and Remedies

04:00
arXiv cs.AI

Zero-shot World Models Are Developmentally Efficient Learners

04:00
arXiv cs.AI

CoGReV: A Confidence-Gated Post-Hoc Non-Monotonic Belief Revision Framework for Phishing Website Classification

04:00
arXiv cs.AI

Dear Algo: A Precision-First Agentic Intent Layer for Unified Search and Recommendation

04:00
arXiv cs.AI

EVOQUANT: Self-Evolving Verifier-Guided Strategy Optimization for Robust Quantitative Trading

04:00
arXiv cs.AI

Physics of Agents: Statistical Mechanics Predicts Collective Behavior of AI Agents

04:00
arXiv cs.AI

Influence-Oriented Personalized Federated Learning

04:00
arXiv cs.AI

Incentives to Offer Algorithmic Recourse

04:00
arXiv cs.AI

Safe Learning Under Irreversible Dynamics via Asking for Help

04:00
arXiv cs.AI

Query Brand Entity Linking in E-Commerce Search

04:00
arXiv cs.AI

A Taxonomy of Architecture Options for Foundation Model-based Agents: Analysis and Decision Model

04:00
arXiv cs.AI

Efficient Diversity-based Experience Replay for Deep Reinforcement Learning

04:00
arXiv cs.AI

EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering

2026年9月9日
04:00
arXiv cs.AI

SciLitBench:面向大语言模型系统文献综述的基准与设计原则

提出SciLitBench多阶段基准,涵盖筛选与数据提取。纳入排除标准提升筛选性能,但最强模型仅恢复30%评估证据,揭示筛高召回与提取完整性边界。

04:00
arXiv cs.AI

视觉与语言Transformer的损伤感知多臂老虎机剪枝

将结构化剪枝建模为损伤感知多臂老虎机,逐次屏蔽注意力头和多层感知器组;实验表明通常比预算贪心法退化更小。

04:00
arXiv cs.AI

ARC-Bench:冻结JEPA世界模型中闭环重规划掩盖了失效的动作排序

冻结JEPA潜空间动作排序严重失败,但高频闭环重规划掩盖了缺陷,导致成功率虚高。ARC-Bench提出无泄漏固定候选协议来直接审计。

04:00
arXiv cs.AI

面向推理感知的压缩:识别并保护脆弱推理电路以实现节能LLM部署

发现INT4量化可能因延长推理链而增加能耗,按模块扰动识别脆弱电路并选择性恢复FP16,实现帕累托最优的节能压缩。

04:00
arXiv cs.AI

EdgeMem:基于证据保留多锚超图的免大模型智能体记忆构建与检索

EdgeMem通过多锚超图组织原始交互,检索直接返回证据,无需生成式大模型调用,实现高效准确的智能体记忆问答。

04:00
arXiv cs.AI

智能体过度信任工具:衡量对不可靠工具的依赖

对14个LLM:智能体过度信任工具,采纳率超三分之一,搜索最高68%;察觉冲突仍报错误,干预作用有限。

04:00
arXiv cs.AI

超越“AI辅助人类”:智能体时代人机团队的决策导向评估设计

提出TEAM-Design方法,通过为任务分配两种重放概率,在有限预算内最优判断人机协作是否优于单独人类或智能体。

04:00
arXiv cs.AI

EnvCraft:为类爪智能体的智能体强化学习合成可执行环境

提出EnvCraft框架,自动合成交互环境与任务轨迹,缓解训练环境稀缺,类爪基准提升11.9%,通用工具提升8.0%。

04:00
arXiv cs.AI

深度信念网络是精确的

证明任意严格正概率分布可由有限参数sigmoid信念网络精确表示,用Brouwer不动点定理将近似改进为精确。

04:00
arXiv cs.AI

控制流不确定性下的业务流程规划与调度

针对控制流不确定性,提出机会约束优化规划调度,集成方案优化工期但难扩展,分解方案可扩展。

04:00
arXiv cs.AI

失败先于漂移:大语言模型智能体社会中的价值观社会动态

多数角色初始无法表达指定价值观,少数漂移;模拟价值分布偏离指定画像,作为人类价值观代理仍有限。