5884 条条目 · 106 个活跃源
2026年8月26日
04:00
ArXiv AI

严格因果流式视频异常检测:基于理论支撑的状态空间核心

提出严格因果流式SSM异常检测器,固定状态O(1)更新,理论推导延迟与可捕捉异常时长,实测M3 Pro 1300+FPS,精度待提升。

04:00
ArXiv AI

FedV-KGQA:面向垂直划分知识图谱的多跳问答

提出FedV-KGQA框架,实现跨垂直分割知识图谱的多跳推理,无需集中访问与运行时通信,性能接近集中式。

04:00
ArXiv AI

REFINE:一种基于证据引导的多智能体LLM代码重构方法

提出多智能体LLM重构方法,结合静态分析减少代码异味,但需人工审查编译测试后再采用。

04:00
ArXiv AI

SPO++:面向异步智能体强化学习的流对齐策略优化

针对异步智能体强化学习,提出SPO++:按动作令牌度量标准化终端优势,按策略事件组织证据,提升在线学习效率。

04:00
ArXiv AI

识别代码的潜在声明式表示以辅助仓库迁移

用注释数据流图显式化代码潜在语义,提升仓库级迁移覆盖率与可靠性,测试通过率85.6%。

04:00
ArXiv AI

ToolRobustBench:面向工具调用智能体的分阶段扰动评估与故障诊断

提出面向工具调用智能体的分阶段扰动诊断基准,揭示输出扰动为主要瓶颈及失败非叠加模式。

04:00
ArXiv AI

适得其反的反馈:小型语言模型智能体为何会重复刚刚失败的调用

失败反馈适得其反:小模型重复失败调用的概率大增,根因在任务框架而非模型理解。

2026年8月25日
04:00
ArXiv AI

KVBoost:块级键值缓存重用与偏差引导重计算的高效大语言模型推理

KVBoost通过块级KV缓存重用与偏差引导重计算,首token延迟降低4.49倍,精度无损。

04:00
ArXiv AI

隐藏规则游戏中的AI学习与概念迁移

总结GOHR研究:用Transformer-A2C智能体从试错中推断隐藏规则,分析表示设计、规则难度、迁移与伪机器人辅助人类学习。

04:00
ArXiv AI

文献综述竞技场:基于对战式同行评审平台评估文献综述智能体

提出LitReview Arena对战评估平台,专家评判显示最强AI综述仅胜人类23%,新评估器LitJudge对齐专家达0.78。

04:00
ArXiv AI

RIACT:面向大学生个性化学习习惯追踪与早期倦怠信号检测的负责任AI系统

RIACT结合日志与混合AI,用透明规则检测早期倦怠,LLM生成建议,遵循负责任AI原则。

04:00
ArXiv AI

基于Spyre加速的IBM LinuxONE检索增强生成:面向安全高吞吐企业AI推理的云原生架构

在IBM LinuxONE上运行RAG,Spyre加速推理,数据不离开硬件,延迟低于2秒,较平台外推理性提升20倍。

04:00
ArXiv AI

面向制造知识图谱的可组合信任基础设施:跨系统溯源、时间推理与决策可追溯性

提出由四个信任能力组合成的基础设施,通过共享关联标识实现跨系统溯源与决策追踪;实验证明四者缺一不可。

04:00
ArXiv AI

面向CPU部署的安全分类:一种可复现且许可感知的蒸馏方法

可复现许可感知蒸馏法:9.7万提示训小模型,CPU毫秒级分类,性能近教师且少误报,核心在逐类重平衡。

04:00
ArXiv AI

从关联到因果:利用因果关系和注意力机制提升检索增强生成的检索精度

针对检索增强生成中相似度检索易受关键词干扰的问题,提出基于因果图与注意力机制的免训练重打分方法,显著提升目标文档排名。

04:00
ArXiv AI

从掌握度画像到模拟响应:用于忠实LLM学生模拟的随机学生知识图谱(SSKG)

现有LLM模拟学生难分水平,提出随机学生知识图谱(SSKG),基于知识图谱采样决定正确性,生成忠实理由,产生单调掌握度梯度。

04:00
ArXiv AI

K-Bench:在真实科学智能体请求上度量模型性能

用真实科学请求评测九模型,1602次运行,多裁判八维评分,无模型达阈值,过度声称为主因。

04:00
ArXiv AI

在图中生成,而非在边界上:LTN-GAN中硬约束的函数符号落地

将逻辑公理作为函数符号而非谓词落地,在可行域内构建坐标系,使样本天然有效并学习余量分布,避免边界钳制失真。

04:00
ArXiv AI

上下文即环境:面向长时程智能体的程序化上下文管理

提出Scroll,将会话视为可执行环境,用事件日志与Python内核管理上下文,大幅超越现有记忆系统。

04:00
ArXiv AI

SAEM:思维链推理中面向内存高效MoE推理的阶段感知专家管理

提出阶段感知专家管理SAEM,利用思维链阶段级激活一致性,减少数据传输,吞吐量提升1.3-1.5倍。

04:00
ArXiv AI

物理知识引导的混合神经学习用于北极海冰密集度演变与短期预测

提出物理信息混合冰模型,按海冰连续性方程组织网络,显式建模动力输运与热力过程,提升冰缘保持与短期预测技能。

04:00
ArXiv AI

GameXpert-Bench:编程智能体离专家级游戏开发还有多远?

提出游戏开发全流程基准GameXpert-Bench(生成/修复/优化三轨);当前智能体缺陷发现与运行时验证能力不足。

04:00
ArXiv AI

HIRA:监管行业中用于文档分类的人机协同检索增强级联方法

监管场景下文档分类受数据驻留、标签稀少限制。HIRA免训练本地部署,仅需6.4%人工修正,F1从0.6218升至0.8548,可替代重复训练。

04:00
ArXiv AI

提示、批评者与教师:视觉-语言数学推理中稀疏奖励强化学习的先验注入

稀疏奖励下先验需有效触达策略;评估切片会误导跨域迁移,最难切片预测最佳;提示引导探索有效,高斯交叉熵损失提升显著。

04:00
ArXiv AI

提问还是回答:多轮健康错误信息干预的决策框架

提出RO-PnR框架,在提问与纠正间决策,权衡收益与交互成本,用更少轮次达到更高效用。

04:00
ArXiv AI

VisAdj:从节点链接图像学习邻接矩阵

VisAdj框架用注意力稀疏采样与线图变换器联合推断边依赖,从节点链接图像恢复邻接矩阵。

04:00
ArXiv AI

超越成败:面向GUI智能体的长度感知对比学习

提出LACL-GUI框架,在对比RLVR中加入轨迹级质量信号,区分成功与失败轨迹,提升GUI智能体性能与优化稳定性。

04:00
ArXiv AI

ESCRAG-R1:用于情感支持对话的检索增强强化学习

提出ESCRAG-R1框架,将检索增强引入强化学习,构建偏好数据集,实现专业指导与共情表达的自然融合。

04:00
ArXiv AI

HiMA-MDD:面向临床访谈的可解释多模态抑郁检测分层多智能体框架

提出分层多智能体框架HiMA-MDD,梳理症状证据至PHQ-8评分,可审计且优于现有方法。

04:00
ArXiv AI

LLM4LLM:通过闭环智能体优化弥合内核基准测试与实际部署之间的差距

LLM4LLM闭环优化弥合基准与部署差距,真实推理验证A100/H100端到端加速3.91/6.98倍。

04:00
ArXiv AI

从求解器反馈到忠实规划:面向符号规划的多角色强化学习

仅用求解器反馈训练语言模型生成PDDL,多角色强化学习提升成功率至70.8%,忠实度66.3%,语义漂移降至6.4%。

04:00
ArXiv AI

GuardianBench:面向具身AI潜在情境风险的同场景指令对比基准

构建同场景指令对比基准,揭示具身AI潜在情境风险;主流模型判别准确率仅24.1%,VLOS后训练提升。

04:00
ArXiv AI

更准确还是更高效?本地部署紧凑开放权重语言模型的数学推理评估

评估三款本地部署小模型数学推理:无模型全面占优,高准确率模型能耗更高,说明选型须兼顾准确与效率。

04:00
ArXiv AI

SSDi8:面向状态空间对偶性的精确高效8位量化

首个SSD后训练量化框架,解耦乘法和自适应量化,保持FP16精度,实现1.4倍加速。

04:00
ArXiv AI

记忆全胜:利用社交媒体信息流实施的间接偏见注入攻击

个人AI代理摄取外部内容时,攻击者通过评论伪装、水印和类别锚定注入偏见至记忆,操纵后续行为;攻击成功率91.2%,防御后降至80.6%。

04:00
ArXiv AI

GenCoord:私有信息下的技能路径承诺

GenCoord将私有信息转化为可执行承诺,协调成功率从50%升至100%,通信量减少92.8%。

04:00
ArXiv AI

从SQL生成到工具选择:面向MCP服务器的领域导向模式

提出领域导向工具模式,以意图分类替代SQL生成,显著提升小模型准确率并降低成本。

04:00
ArXiv AI

可验证黑客终端基准:评估终端任务中的奖励黑客行为

将可验证黑客环境方法应用于终端基准,自动可靠检测奖励黑客,评估前沿模型及提示信息能否缓解该行为。

04:00
ArXiv AI

广泛搜索,双向取证,审慎判定:面向纵向临床事件验证的证据可采性图RAG

提出MedEventGraph-RAG,用图表示事件并链接证据,双向检索后经契约过滤评估,在多个数据集上提升临床验证准确率,减少无依据结论。

04:00
ArXiv AI

剖析神经符号质量保障在合成肿瘤学数据生成中的应用

模式验证是主要过滤,本体次之,逻辑验证仅作条件保障;检索增强依模型而异;符号验证提升有效性而非词汇丰富度。

04:00
ArXiv AI

任务驱动的3D可打印性辅助:基于几何与知识支撑的大语言模型推理

利用LLM结合几何与知识推理的打印前辅助,实测可打印性75%,任务适配88.9%,选材准确率90%。

04:00
ArXiv AI

乳腺癌多学科团队会议的边缘AI医疗器械系统开发与可行性评估

开发了全本地运行的人工智能系统,用于乳腺癌多学科会议,转录并生成治疗建议,保护隐私,可行性评估良好。

04:00
ArXiv AI

结构化扰动下语言模型稳定性与失效行为的测量

提出分级扰动测试框架,揭示失败具族特异性,冲突指令与不可能前提为共性弱点,传统准确率掩盖此失效。

04:00
ArXiv AI

AUDITA:自主多智能体系统中不良后果的认证审计与因果归因

该审计层以防篡改记录和分级因果归因,实现不可操纵的责任判定,归责误差降至约三分之一。

04:00
ArXiv AI

多语言医学VQA中跨语言性能下降的分析与缓解

提出MedVL-XLRepE,无训练对齐英语表示,缓解八语医学VQA跨语言退化,最高提升6.33%。

04:00
ArXiv AI

结构化锚定思考:面向图表与视觉表格的感知强化学习

提出结构化锚定思考框架,将多步推理与微裁剪内化为单次前向,减少时延并提升图表等精细感知能力。

04:00
ArXiv AI

HERO:面向长期智能体记忆的人类画像增强检索优化框架

HERO框架将对话转为记忆图保留原文,以人类画像引导图遍历激活关键信息,减少压缩损失与语义漂移,提升推理。

04:00
ArXiv AI

WAM-OPD:面向世界动作模型的在策略蒸馏

提出面向世界动作模型的在策略蒸馏,教师冻结,用学生历史产生目标,无需稀疏奖励强化学习即可修复加速学生。

04:00
ArXiv AI

世界模型何处崩溃:自然输入故障发现

世界模型预测失败危及控制,现有评测忽视罕见崩溃;提出盆地透镜法,以引导搜索和局部替换发现可复现持续故障。

04:00
ArXiv AI

LLMs用于调查文本分析——人类与GPT-5在归纳内容分析上的性能比较

研究比较人类与GPT-5归纳编码开放题,一致性接近内部水平,LLM可辅助定性分析。