5877 条条目 · 106 个活跃源
2026年8月31日
04:00
ArXiv AI

LLM增强的因果发现:边存在性与方向的概率融合

融合贝叶斯网络与LLM,概率表示边存在与方向,F1提升22/26网络,互补增效。

04:00
ArXiv AI

知识系统中广义层级评估的上下文定位

研究知识系统广义层级评估的上下文定位,证明过滤与局部化等价的充要条件为上下文单调性与约简性质。

04:00
ArXiv AI

基于类别的启发式选择求解飞行积木谜题

提出CBHA*算法,按类别自适应启发式,成功率93.4%,节点扩展减少87.98%,高效求解空间规划难题。

04:00
ArXiv AI

假设、评估、改进:面向未知空间系数场的偏微分方程发现科学智能体

提出HER-PDE智能体,联合识别PDE结构与非参数空间系数场,噪声下恢复算符,相关系数约0.85。

04:00
ArXiv AI

检索关系,检测谬误:政治辩论分析中的RAG方法

通过论证关系引导检索增强,外部知识显著提升政治辩论谬误检测与分类性能,最高F1达0.864。

04:00
ArXiv AI

挑战性真实场景中通用移动助手的基准测试

提出GMA基准,覆盖7应用300任务,评估8模型,发现复杂度越高性能越差,合理设计能提升表现。

04:00
ArXiv AI

物联网与深度学习在茶园高地活木白蚁检测与严重度评估中的有效性

提出物联网声学监测与深度学习框架,检测茶园白蚁并评估严重度,CNN准确率81.5%,助力精准防控。

04:00
ArXiv AI

人人可用的智能体:分布式策展社区构建Agentic AI能力的研讨会框架

通过云环境与培训,降低门槛,逐步提升策展人智能体能力,促进社区共建。

04:00
ArXiv AI

Nemotron 3.5 内容安全审核器:紧凑型多模态、多语言且支持推理的内容安全审核器

提出4B多模态安全审核器,跨12语言分类用户提示、图像和回复,支持自定义策略推理,兼顾覆盖与效率。

04:00
ArXiv AI

CareGraph:基于证据的可审计混合AI框架,用于个性化纵向健康智能

可审计混合AI框架,基于证据将异构记录转为个性化趋势与问题,不诊断不决策,安全可控且可追溯。

04:00
ArXiv AI

RealSWE:现实用户请求下编码智能体的组合式评估

真实请求简短随意且缺乏上下文,使编码智能体解决率降6.4个百分点;明确陈述期望行为和动机可显著提升性能。

04:00
ArXiv AI

PCFBench:产品碳足迹估算的诊断性基准

首个诊断基准PCFBench将产品碳足迹估算分解为六项任务,用614个专家标注项测试,发现逐步生成性能下降并发布数据。

04:00
ArXiv AI

Credo:面向智能体工作流的可复用声明式原语

Credo从搜索代码中提取声明式原语并加元数据编目,编译器复用生成新任务执行框架,免从头搜索。

04:00
ArXiv AI

AcCoRD:在现实用户偏好动态下评估用户-智能体协作

AcCoRD基准评估用户-智能体协作中偏好动态变化,发现前沿模型难处理交互中涌现演变的偏好,仅靠提示不够。

04:00
ArXiv AI

跨城市兴趣点推荐的大规模基准实证评估

在Trip World大规模基准上重新评估跨城市POI推荐,发现现有方法依赖目的地先验、效率低、语义整合无效,需任务专属设计。

04:00
ArXiv AI

从不确定性到临床风险:面向交互式医疗诊断的严重性感知共形规划

提出严重性感知共形临床规划,将交互诊断建模为风险敏感决策,校准风险并用于MCTS,减少提问、提升重症诊断质量,降低高危错误。

04:00
ArXiv AI

智能体AI系统中的资源约束与性能

比较两智能体系统,任务完成率无显著差异,但资源消耗悬殊;评估需结合能力、资源与执行记录。

04:00
ArXiv AI

从评分标准到代码的强化学习信用分配

提出评分标准到代码的信用分配方法,将功能反馈转为局部训练信号,提升网页生成性能,超越多个强模型。

04:00
ArXiv AI

HyQuant:面向LLM注意力机制的混合精度量化

提出混合精度量化方案,对注意力多数状态低比特量化,仅保留关键标记和局部窗口高精度,近无损且高效。

04:00
ArXiv AI

当教师指引误导时:奖励对齐的在线策略蒸馏

提出RA-OPD,过滤与结果奖励不一致的轨迹,提升大模型数学与代码性能,无需额外计算成本。

04:00
ArXiv AI

SEPO:基于证据的结构化编辑提示优化

SEPO通过结构化编辑和证据追踪实现提示优化,在14项任务上超过最强基线,且更高效。

04:00
ArXiv AI

GOD:治理、观察与指挥——智能体社会的实时控制室

GOD为智能体社会提供实时控制室,支持提问与干预,统一命令与回放证据,可移植包分离数据,干预目标命中率93%。

04:00
ArXiv AI

我应该使用这个合成数据集进行训练吗?如何用最少的真实数据测试

提出自适应符号翻转检验,用最少真实数据判定合成数据增强是否提升模型性能,并控制错误率。

04:00
ArXiv AI

PhenoIntel:生命周期对齐的多智能体Web应用,实现可验证、易访问的植物表型分析

多智能体平台PhenoIntel分阶段校验植物表型分析,输出带不确定性结果,无需GPU,浏览器运行。

04:00
ArXiv AI

覆盖,而非信用:零阶扰动预算的失败信用路由无法提升LLM智能体的池内样本效率

失败信用路由不提升LLM智能体池内样本效率;均匀分配等效,覆盖才是关键。

04:00
ArXiv AI

WeAgent-MMSearch:多模态搜索智能体的原生文本-视觉交互

提出多模态搜索体WeAgent-MMSearch,以原生图文交互和故障恢复提升搜索,后训练后平均分涨19.22,媲美十倍参数模型。

04:00
ArXiv AI

学习面向激励广告的离线模型强化学习奖励分配策略

针对激励广告中的奖励分配问题,提出离线模型强化学习框架,实现成本可控的序贯决策,并经线上测试验证优于现有方法,提升净收益。

04:00
ArXiv AI

String:一个将每个应用视为 Markdown 文件的智能体操作系统

String 以 Markdown 定义应用,分层披露+权限控制,性能不变,令牌减33.5%,界面开销恒定。

04:00
ArXiv AI

基于多智能体大语言模型的多语种气候-健康文献自动分析框架

多智能体大模型框架实现气候-健康多语文献自动分析,含四层防幻觉,3.2万篇测试F1=0.92。

04:00
ArXiv AI

权力的形态:对话中社会权力推理的多语言框架

提出多语言社会权力推理框架及语料库,发现模型在跨文化关系与意图推理上弱于人。

04:00
ArXiv AI

投机探测:以投机解码成本实现LLM监控

将投机解码模块复用为分类器,几乎零开销,性能超越零样本GPT,媲美专用安全分类器。

04:00
ArXiv AI

CrabOS:人机共栖操作系统

提出人机共栖操作系统 CrabOS:以自然语言文本对象共享任务状态,供人机直接读写,无需桥接即可无缝交替执行任务。

04:00
ArXiv AI

床垫下时间传感用于痴呆病房次日激越风险评分

痴呆病房中,床垫下无感信号可中等预测次日激越风险,分钟级时序模型优于夜间汇总(AUC 0.692)。

04:00
ArXiv AI

RECAST:流式生物信号测试时自适应中的近期与上下文感知采样

RECAST依据时间近度、上下文相似性和预测可靠性挑选样本,提升血压估计精度与趋势跟踪,开销极低。

04:00
ArXiv AI

找到责任所在:一种基于自动失败归因的多智能体协作反思框架

多智能体协作常因特定智能体失误而失败。新框架DoCtOR先自动归因定位关键错误智能体,再让其定向反思,显著提升成功率。

04:00
ArXiv AI

GRACE:梯度引导的核心集选择用于大语言模型去学习

提出GRACE梯度引导核心集选择法,为LLM去学习构建遗忘集与保留集,提升效用并保持遗忘质量。

04:00
ArXiv AI

忆阻友好型哈达玛储层计算:大规模结构化无乘子递归

用结构化正交算子替代稠密矩阵,无乘子储层计算,参数少、运算快,性能匹敌稠密正交储层,内存占用低。

04:00
ArXiv AI

AGENT-O:面向可互操作且受治理的医疗AI代理的语义代理卡片框架

提出医疗AI代理本体框架,支持语义卡片及报告完整性评估,发现运行时、治理、可复现性报告不足。

04:00
ArXiv AI

MAIL:记忆驱动、自适应、增量且基于文献的化学假设生成框架

提出MAIL框架,通过记忆驱动推理自动生成化学假设,在多个数据集上取得最优质量与专家评分。

04:00
ArXiv AI

实值超维度序列表示:Hadamard积绑定与移位等变

提出三种实值位置编码,正弦变体支持精确移位等变,性能媲美分数幂编码且计算高效。

04:00
ArXiv AI

学习使用工具:面向工具集成数学推理的强化学习

研究计算器工具调用提升数学推理,通过SFT与多种强化学习方法,工具集成带来约10个百分点提升,Tool-DAPO最佳,pass@1达66%。

04:00
ArXiv AI

COVER:联盟路由的可识别评估

COVER提出可识别联盟路由评估法,固定信息边界与团队族;实证显示暴露选择空间,但不制造路由优势,是可审计测量方法。

04:00
ArXiv AI

InstructMesh:面向制造的生成式3D模型选择性精修

提出交互式工具InstructMesh,通过区域选择与定向操作修复生成3D模型几何缺陷,支持自然语言和滑块控制,供新手无需专业技能即可完成制造相关修复。

04:00
ArXiv AI

基于层重配置训练通信高效的专家混合语言模型

提出通信高效专家混合模型通过层重构减少专家通信在同等性能下降低训练成本并提升吞吐

04:00
ArXiv AI

FISGuard:通过固定输入子空间防御成员推理攻击

FISGuard用公共数据构建固定低维子空间,限制梯度暴露,使成员推理攻击AUC降至0.5,且保持模型效用。

04:00
ArXiv AI

生物学AI模型的高效自动可解释性

提出可解释性流水线:交叉稳定性、入侵检测、可证伪预测;效率提升数倍,但偏重结构特征。

04:00
ArXiv AI

Gen-TAS:面向FPGA-GPP异构系统的生成式AI辅助软硬件任务分配框架

提出Gen-TAS,基于知识增强LLM的任务分配框架,结合RAG生成可解释策略,在CNN和SDR上实现最高2.45倍和92.53倍加速。

04:00
ArXiv AI

基于多智能体强化学习的低空流体天线网络

提出电磁数字孪生辅助的多智能体强化学习框架,联合优化天线位置与波束,显著提升低空流体天线网络吞吐量。

04:00
ArXiv AI

AI辅助定性数据分析中的反模式:软件工程研究者的诱惑与陷阱目录

提出AI辅助定性数据分析的反模式目录,分三类警示研究误区,保障分析严谨性。