5268 条条目 · 106 个活跃源
2026年9月30日
04:00
arXiv cs.AI

ARCagent:面向临床问答的自适应检索校准智能体

针对ME/CFS指南矛盾,提出自适应检索校准智能体ARCagent,冲突感知重排证据,准确率达95.3%。

04:00
arXiv cs.AI

工程化简洁:简单的机制接口引导LLM智能体

比较拍卖与匹配界面发现,顺序界面显著减少出价偏差;说明收益与真实性可改善选择,但语言解释未必同步提升。

04:00
arXiv cs.AI

将推理路径重新思考为阶段结构化轨迹

提出PAIR:视推理路径为题内阶段结构化轨迹,按进度对齐阶段,仅同题同阶段比较成败轨迹,提取质量方向。

04:00
arXiv cs.AI

人格剂量:用于分级特质控制的校准激活引导

通过特质描述与请求强度,校准激活引导实现分级人格控制,提升核心特质表达并降低目标误差。

04:00
arXiv cs.AI

关系型基础模型在上下文学习中的支持集目标泄漏:影响、检测与缓解

关系型上下文学习中,支持集目标泄漏致性能下降;目标表泄漏最明显,积分梯度可检测并部分缓解。

04:00
arXiv cs.AI

关系型基础模型在上下文学习中的支持集目标泄漏:模型依赖性与评估可靠性

关系型上下文学习中支持集目标泄漏损害评估,效应依任务与模型而变并可反转结论,检测去除难恢复洁净评估。

04:00
arXiv cs.AI

安全算子:通过谱优化调节安全指令的表达

上下文token可吸收为乘性算子;其主特征值可连续调节安全指令影响,权衡攻击成功率与过度拒绝,实现帕累托改进。

04:00
arXiv cs.AI

ZK-LLM 下的比特:面向可验证隐私大模型推理的零知识友好量化评估

LLM零知识友好量化研究:激活精度比权重敏感,非线性查表易致效用退化;降位宽未必成比例节省证明开销。

04:00
arXiv cs.AI

MemEvo:流式视频记忆机制的自动发现

提出LLM驱动的MemEvo框架,自动搜索可执行记忆程序,发现免训练的有界记忆机制,提升流式视频理解性能与效率。

04:00
arXiv cs.AI

超越状态到达:为内在动机的选项发现学习抽象表示

提出一种选项发现算法,为每个子目标仅选取相关特征子集,学得可广泛泛化的抽象选项,加速稀疏奖励环境中的探索。

04:00
arXiv cs.AI

人机协作:从悖论到模式

本文从自主性与主动性两维度,用悖论视角分析人机协作张力,提炼出指令、委托、辅助与共创四种模式。

04:00
arXiv cs.AI

MAADBench:面向多智能体系统异常检测的可刷新范式

首个可刷新的多智能体异常检测基准,自动生成步骤级标签,评测25种方法揭示其依赖监督、鲁棒性不足。

04:00
arXiv cs.AI

视觉敏感性不等于断言可撤回性:面向多模态强化学习的持续性感知信用分配

提出持续性感知信用门控,抑制异常顽固的视觉断言正信用,提升多模态强化学习准确率并增强断言可撤回性。

04:00
arXiv cs.AI

在再生公地中学习不崩溃地收获:一个拉格朗日框架

把再生公地建模为枯竭预算约束博弈,用非平稳拉格朗日框架从无约束解构造策略序列,实现可行性与近似最优。

04:00
arXiv cs.AI

分而注入:智能体能否从碎片中重构间接提示注入?

AdaLCPI把攻击目标拆成碎片藏入长上下文,用重构线索与自适应搜索,攻击成功率达61.4%。

04:00
arXiv cs.AI

AVIO:学习在视听场景中添加和移除发声对象

提出 AVIOBench 数据集与 AVIO 模型,实现视听场景中发声对象的添加与移除编辑。

04:00
arXiv cs.AI

SafeCoEvo:在测试时为LLM智能体协同演化安全约束与守卫

提出SafeCoEvo,在测试时协同演化安全约束与守卫,利用累积经验同时提升安全与任务成功率。

04:00
arXiv cs.AI

DualTrack:通过预训练先验对称耦合的同步语音-手势生成

DualTrack耦合预训练语音与动作先验,在共享时间轴上双向同步生成语音与手势,多语言评测优于基线。

04:00
arXiv cs.AI

神经结构推理器:一种面向结构化知识推理的类脑架构

NSR受脑启发,在神经元连接中保留关系结构,可解释地完成结构化知识推理与链接预测。

04:00
arXiv cs.AI

事实核查强化学习智能体中来源信任捷径的多通道缓解

TrustSwap 揭示来源信任标签会改变判决,TSA 在 4B 降低翻转并保持性能,8B 无效。

04:00
arXiv cs.AI

智能体系统的蒸馏:跨越模型、制品与执行框架的路线图

定义智能体蒸馏,按知识留存位置分为模型、制品与执行框架,并建立关联因果贡献与部署效用的评估框架。

04:00
arXiv cs.AI

无需共享门控或跨智能体梯度的自监督协作视觉专家群体中的涌现专业化

无共享门控与跨智能体梯度,自监督视觉专家群体仍能涌现有用分工,语义路由优于单一通才。

04:00
arXiv cs.AI

AI科学家会改变想法吗?合成宇宙中的先验—证据冲突

提出合成宇宙基准,配对经典与扭曲孪生世界;发现预测充分性与机制恢复相分离,须分别检验。

04:00
arXiv cs.AI

EASE:面向自进化智能体的行为自适应技能策管

EASE让智能体按执行器行为在线自适应策管技能,跨执行器共享强化学习,技能更精、检索更准、开销更低。

04:00
arXiv cs.AI

面向 AI 辅助工程的 CAD 原生 Transformer 算子

提出 CANTO:免网格 Transformer 神经算子,从连续 CAD 预测物理场,气动基准领先且支持逆设计。

04:00
arXiv cs.AI

陈旧度在哪里累积?面向大语言模型后训练中异步RL的池感知有效陈旧度控制

将轨迹陈旧度分为生成与等待陈旧,提出池感知PACE控制,提升异步RL精度并省47% GPU时间。

04:00
arXiv cs.AI

IronLLM:为实时具身智能锻造紧凑的端侧原生语言模型

IronLLM-0.6B为6.54亿参数端侧语言模型,融合混合注意力与X-MTP多token预测,解码提速1.48倍,性能媲美更大模型。

04:00
arXiv cs.AI

WEFT:面向通用智能体的工具使用后训练规模化

WEFT提出全系统演化框架,协同扩展交互系统、执行驱动自演化与稳定后训练,多基准超越同规模基线。

04:00
arXiv cs.AI

当上游消息覆盖正确答案:多智能体LLM协作的受控研究

错误上游消息可使下游在32%情况下覆盖正确答案,94%为答案替换;通信应依据上游可靠性有选择地进行。

04:00
arXiv cs.AI

超越次高斯检测器得分:面向人机文本分割的鲁棒加权轮廓损失变点检测

提出RWCP,以截断权重、Huber增益和可靠度坐标搜索稳健定位人机文本作者切换点,WindowDiff降17.6%。

04:00
arXiv cs.AI

驾驭框架演化即学习:自我改进型个人智能体的近似、泛化与优化极限

将驾驭框架演化视为学习问题,从近似、泛化与优化误差解释个人智能体自改进的局限。

04:00
arXiv cs.AI

从差距中学习:面向GRPO的差分感知优势剪枝与自适应展开采样

提出FastRL框架,用优势感知剪枝和自适应采样提升GRPO等方法的训练效率与精度。

04:00
arXiv cs.AI

CADOC:面向长时程智能体的缓存感知动态对象上下文

CADOC批量替换上下文对象为卡片,保留按需检索,输入成本降约40%,性能接近全上下文。

04:00
arXiv cs.AI

首个面向交通信号控制的视觉-语言-动作模型

首个基于视觉-语言-动作模型的端到端交通信号控制方法,直接从多视角路侧视频映射为协调信号动作。

04:00
arXiv cs.AI

CoEM:以证据确认记忆赋能长上下文推理

CoEM暂存原文证据,随新上下文决定提升、保留或丢弃,经验证器校验,强化学习训练,提升长上下文推理。

04:00
arXiv cs.AI

SCA:面向GUI智能体强化学习的空间信用分配

提出SCA,用点击坐标细化组相对信用,提升GUI智能体定位与动作预测,部署策略不变。

04:00
arXiv cs.AI

REALHOP:以行为审计重新审视多跳推理评估

提出行为必要性率(BNR):答案正确≠多跳推理;REALHOP将BNR从27.4%升至94.4%。

04:00
arXiv cs.AI

ImbalancE:应对链接预测中度数不平衡的推理时隐空间搜索

提出推理时隐空间搜索,缓解链接预测中度数不平衡偏差,提升最不平衡三元组预测。

04:00
arXiv cs.AI

面向医院患者流优化的物理信息多智能体协调

提出物理信息多智能体协调框架,将BCMP排队先验嵌入去中心化强化学习,协同优化患者流并降低系统延迟。

04:00
arXiv cs.AI

从可行失败前缀中学习:面向长时程LLM智能体的里程碑可行性潜力策略优化

提出MVPO,从可行失败前缀学习并修复零信用优势,显著提升长时程LLM智能体表现。

04:00
arXiv cs.AI

ACTR:对齐思维与响应,提升推理型大语言模型的多语言安全性

ACTR框架通过定位安全思维神经元并优化推理与响应一致性,提升推理大模型多语言安全性。

04:00
arXiv cs.AI

观看-思考-交互:用强化学习自举长时程多轮流式视频推理

提出WTI闭环框架,以记忆与选择性回忆实现多轮流式视频推理,在基准上取得最佳性能。

2026年9月29日
04:00
arXiv cs.AI

SMARtCARE:面向有限自主临床决策支持的隐私保护智能体AI系统

四态架构融合六通道有损指纹,触发医生审查与授权检索,经MIMIC数据验证决策可追溯。

04:00
arXiv cs.AI

稀疏重叠下的LLM评审验证:从推断到设计

重叠稀疏致LLM评审验证错判:5%重叠时错判率达25%。提出最小重叠量ρ≥0.25及零成本分层分配,可使错误拒绝率减半。

04:00
arXiv cs.AI

DriveHierarchy:从开环理解到闭环执行诊断VLM驾驶能力的基准

提出分层基准DriveHierarchy,覆盖感知、记忆、推理与闭环执行,评估15个VLM,贯通开环理解与闭环驾驶,助力诊断优化。

04:00
arXiv cs.AI

IndustryLLM:面向工业采购的失败驱动大语言模型训练

提出失败驱动训练的工业大模型IndustryLLM,融合国标与真实交易语料,线上GMV增4.25%,延迟由6-7秒降至1.5秒。

04:00
arXiv cs.AI

Metro-WM:基于可实现子目标的长时程潜空间规划

Metro-WM用经验真实状态构图,生成可实现子目标,完成长时程潜规划,成功率更高、速度更快。

04:00
arXiv cs.AI

Choir:面向分布式多智能体自动形式化的开放协议

Choir 开放协议将形式化项目拆为独立任务,贡献者各用自有 LLM 智能体、经 GitHub 协作,合并前由确定性门禁校验,支持 Lean 4 等。

04:00
arXiv cs.AI

利用嵌入式编码提升大语言模型的医学计算能力

MedCode训练LLM生成嵌入式代码执行医学计算,准确率提升20–30个百分点。

04:00
arXiv cs.AI

面向分布式多智能体协调的LLM智能体符号引导

提出符号引导分类法调节LLM智能体自主性,发现中等自主性在分布式多智能体协调中表现最佳。