5891 条条目 · 106 个活跃源
2026年8月19日
04:00
ArXiv AI

GxP-Agent:基于流程DAG拓扑的LLM智能体可靠临床试验编程

提出GxP-Agent用DAG拓扑编码监管流程,使LLM智能体在临床试验编程中达100%结构匹配,优于所有基线,证明图拓扑是关键。

04:00
ArXiv AI

FedPref:面向结构化放射学报告提取的联邦偏好学习

联邦偏好学习提取放射学报告,仅共享模型更新,提升低数据站点F1,优于孤立训练,接近集中训练。

04:00
ArXiv AI

一种可解码性判据预测大语言模型中隐藏状态选择何时优于多数投票

提出CASE选择法,用可解码性指标预测隐藏状态选择何时优于多数投票,难题准确率最多提升19点。

04:00
ArXiv AI

问题即问题:迈向可扩展的数学发现

提出FAR范式:按研究方向自动筛选文献问题并多级过滤,组合学实验从五千余篇论文中发现多个新成果。

04:00
ArXiv AI

SkillEffect:面向内存受限智能体工具的受检降级

提出受检降级运行时,以审计插件实现内存受限工具调用,降低峰值内存,提升固定上限完成率,统一架构支持多执行模式。

04:00
ArXiv AI

DiSCO:基于分布引导的对比提示优化实现文生图防御

提出零样本黑盒防御机制,通过分布引导的对比评分优化提示词,显著降低不安全图像生成率,并保持语义一致。

04:00
ArXiv AI

KernelArc:面向GPU内核优化的多智能体框架

多智能体框架并行协同策略代理,优化GPU内核,在H100/B200上多项基准夺冠。

04:00
ArXiv AI

PlanPO:面向多轮智能体大语言模型的群体规划感知策略优化

PlanPO用粗到细优势信号解决优势塌缩,多轮基准平均提升27.2%。

04:00
ArXiv AI

对基准测试进行基准测试:评估小型语言模型的自动化安全基准

评估26款小语言模型和5套安全基准,发现模糊判断主导,大模型安全基准不可靠,能力与安全混淆。

04:00
ArXiv AI

合成特征提取器:面向算法选择的智能体方法

大语言模型智能体自动合成可解释的特征提取器,算法选择优于人工特征与Transformer方法。

04:00
ArXiv AI

LiveHouse-TS:时间序列基础模型的开放世界实时基准

首个面向时间序列基础模型的开放世界实时基准,以连续未来数据评估,揭示静态排名在动态环境下剧烈变化。

04:00
ArXiv AI

SignalReasoner:评估3B模型在信号数学推理上的上限

探讨3B模型在无线信号数学推理中的强化微调策略,最佳准确率39.12%,较基线提升三倍以上。

04:00
ArXiv AI

医学咨询大语言模型的评估为时过晚:预构差距

现有评估晚于问题明确后,忽略模糊主诉。指令可改顺序与记录,未必获取关键事实,应直接评估首诊行为。

04:00
ArXiv AI

仅用开放权重模型的LLM式PDDL领域修复

开放权重LLM纯提示修复PDDL,F1达.87超符号基线,但测试通过率仅.82,无法保证可靠自动修复。

04:00
ArXiv AI

用于可信知识图谱推理的结构内化规则语言模型

提出SIRLM,用结构规则生成耦合结构学习与推理可信性,使LLM锚定知识图谱证据,显著优于现有方法。

04:00
ArXiv AI

SAGE:通过归因引导的规则演化实现自我进化的分镜技能

SAGE从专家示范中演化导演知识,效果接近专业导演,制作时间减少83%,并发布首个分镜数据集。

04:00
ArXiv AI

面向多轮用户交互的更优智能体:下一轮用户输入不仅是上下文

提出反馈感知信用分配(FACA),利用下一轮用户反应作为局部信用,在8B/14B上显著提升多轮交互智能体性能。

04:00
ArXiv AI

SGHA:基于证据的本地语言模型研究问题发现

SGHA基于本地模型构建证据图,识别研究空白,生成可追溯问题,无需专有API。

04:00
ArXiv AI

Agent Lightning v1.0:迈向托管式智能体强化学习

提出托管式智能体强化学习范式及轻量框架,仅用六千训练样本使软件工程基准提升十四点六个百分点。

04:00
ArXiv AI

利用多样性剖面评估AI生成内容的多样性

提出多样性剖面,以曲线化、条件感知方式评估AI生成内容多样性,避免单一标量的歧义,提升比较的透明性与鲁棒性。

04:00
ArXiv AI

图手术与do算子:非循环结构因果模型中的精确对应

证明确定性无环结构因果模型中,do算子替换机制等价于图手术删除依赖边,并给出含多余边时等价的充要条件。

04:00
ArXiv AI

GraphWake:LLM智能体社区中经记忆介导的极化级联引发群体极化

提出记忆介导极化级联威胁:攻击者利用智能体记忆与公共讨论传播观点,GraphWake显著加剧群体极化。

04:00
ArXiv AI

混合专家模块蕴含强幻觉检测信号

利用MoE路由与专家分歧信号实现逐词幻觉检测,性能优于现有方法

04:00
ArXiv AI

数据扰动下模型级联的准确性与鲁棒性

模型级联在数据扰动下会失效:静态损坏破坏路由或使模型失效,序列扰动致稳定但不可靠预测。

04:00
ArXiv AI

超越可疑步骤:长时程智能体中的本体信任

提出本体信任与RGE监测器,按角色/目标/证据分解轨迹前缀,确定性更新,有效检测长时程漂移。

04:00
ArXiv AI

D²ACCI:保留证据的智能体记忆双循环诊断协议

提出双循环诊断协议D²ACCI,实现记忆失败定位与统计可靠评估,在三个基准上显著提升。

04:00
ArXiv AI

StartupBench:对经市场验证的端到端工作流上的通用智能体进行基准测试

StartupBench以市场验证工作流测通用智能体,最强模型仅完成30%,瓶颈在复杂指令与领域知识。

04:00
ArXiv AI

基于后果编译为可微电路的 OWL 2 DL 神经符号学习

提出Baobab,将SROIQ本体编译为SDD训练感知网络,并用基于查询论证的混合模型消除推理捷径,达到贝叶斯最优后验。

04:00
ArXiv AI

论自我改进智能体的脆弱性:方差、任务顺序与欠规格化

再评估记忆型自我改进智能体,发现结果受噪声和任务顺序影响,欠规格化是脆弱性根源,需更严评估与人类监督。

04:00
ArXiv AI

大语言模型能否解释飞行安全事件?基于先验引导的语义LLM方法

提出FlightLLM方法,融合统计专家与语义离散化,以先验引导LLM解释飞行事件原因,兼顾分类与可解释性。

04:00
ArXiv AI

编码代理的工作集:仓库规模任务中的一致性债务

事实可用性决定成败,缺失导致虚构;不同配置的消耗差异超十倍,读取无法预测成功。

04:00
ArXiv AI

CityReal:基于大规模LLM智能体的人类对齐城市行为与城市动态模拟

提出CityReal框架,用意图驱动智能体模拟城市行为,通过文本适配器对齐人口统计,实现微观与宏观层面真实模拟。

04:00
ArXiv AI

ComNetX:动态社区检测的局部层次化自适应

提出求解器无关的层次化局部更新框架,经受影响社区闭合与压缩,在保持质量的同时大幅降低动态更新耗时。

04:00
ArXiv AI

基于LLM引导强化学习的有效个性化AI导师

通过强化学习自适应出题,利用聊天交互信号个性化辅导,显著提升考试成绩与参与度。

04:00
ArXiv AI

以教育为中心的AI批判性政策分析:加纳AI战略案例

分析加纳人工智能战略:教育议程重国家准备、轻学校实施,教师、课程、保护等不足,需教育中心政策。

04:00
ArXiv AI

静态大规模图的平均距离近似

评估随机游走与地标法,EW算法精度高(误差0.02%),内存高效,可扩展,适用于静态无向无权图。

04:00
ArXiv AI

CARA:认知自适应推荐智能体

提出CARA框架,将推荐建模为决策过程,分阶段结合情感与理性,性能最优提升达10.15%

04:00
ArXiv AI

面向情境强化学习的任务特化微调

提出任务特化微调框架,用参数模型预测性能,整数规划分配预算,提升情境强化学习任务覆盖率。

04:00
ArXiv AI

先授权后上下文:针对智能体系统中跨受众记忆泄漏的模型无关受众边界

提出“先授权后上下文”规则,在记忆转上下文时按受众过滤,确保禁止事实不进入上下文,防止跨受众泄漏。

04:00
ArXiv AI

没有记者,就没有新闻业:生成式人工智能在媒体中的社会维度

综述AI介入媒体二十年:平台依赖挑战编辑独立,记者权衡威胁与解放,受众不察自动文本质量差异;发展需社会维度。

04:00
ArXiv AI

基于世界模型的Q学习

提出QWM:基于世界模型进行Q学习测试时搜索,仅用真实转移训练,避免复合偏差,性能显著优于SOTA。

04:00
ArXiv AI

确认点即系统:面向AI审计证据的持久化策略决策收据

以确认点为系统核心,签名收据声明同步边界状态,实测展示耐久-延迟权衡而非免费异步。

04:00
ArXiv AI

Co-RL:多智能体强化学习中多样群体催生无监督推理

Co-RL通过多智能体协同训练,同伴互评实现无监督推理,群体多样性防崩溃,超越无标签方法,媲美有监督。

04:00
ArXiv AI

ORPA:基于人类反馈的机器人操控在线残差策略自适应

提出ORPA框架,用轻量反馈模块在线预测残差修正,无需重训即可提升操控成功率与扰动恢复能力。

04:00
ArXiv AI

SPACE:用于多元时间序列预测的样本云预测自适应共形椭球

提出一种共形方法,从当前预测样本云估计协方差并动态选窗校准半径,改善多元时序预测的覆盖与效率。

04:00
ArXiv AI

用于波散射逆问题的可归纳扩展单步神经代理模型

动态采样训练单步神经代理,突破波散射逆问题规模限制,可归纳扩展至百万变量,实现快速光子系统设计。

04:00
ArXiv AI

MobileWorldSafety:针对安卓应用中环境注入攻击的GUI智能体安全基准测试

提出MobileWorldSafety基准,含142个风险任务,评估6款GUI智能体,攻击成功率40.4%-66.9%,揭示其对环境注入攻击高度脆弱。