5779 条条目 · 106 个活跃源
2026年9月18日
04:00
ArXiv AI

UnifiedPlayers:增强智能体强化学习中的工具集成推理

提出UnifiedPlayers三玩家协作框架,经GRPO角色奖励训练,提升工具集成推理与验证。

04:00
ArXiv AI

边际效用、矩阵分解与键值(KV)缓存:面向主权地质矿产推理的统一信息经济框架

统一边际效用、矩阵分解与KV缓存,保留特征值高于影子价格的维度,并用于地质矿产文档推理。

04:00
ArXiv AI

求解最小跨度反带宽与循环反带宽标号问题

提出统一SAT框架求解最小跨度反带宽与循环反带宽标号问题,并行/增量策略在基准测试中具竞争力。

04:00
ArXiv AI

MTVA-Bench:评估级联式语音智能体内部的语言模型

MTVA-Bench在级联语音系统内评测语言模型:490个场景、7种语言,工具检查加双LLM评委,模型差距多源自参数与规则遵循。

04:00
ArXiv AI

感知、布局与验证:面向金融文档可靠直通式处理的校准置信度

三通道置信度+保形风险控制,AUROC升至0.90-0.99,自动通过49-72%字段且错误≤目标。

04:00
ArXiv AI

诊断、恢复、认证:隐藏动力学变化下的任务就绪性

提出隐藏动力学漂移下的任务就绪问题,用证据门控匹配脉冲输运统一诊断与恢复并认证部署风险。

04:00
ArXiv AI

FreqCondNorm:面向跨域预测性维护的频率条件化Transformer基础模型

提出频率条件化Transformer基础模型,统一异构时序;跨域故障诊断迁移性强,但剩余寿命预测未改善。

04:00
ArXiv AI

SoL-Pi:递归扩展自动研究循环以打造高效智能体执行框架

递归扩展自动研究循环,提炼四项可迁移机制,性能持平下token降约45-49%、成本降三分之一。

04:00
ArXiv AI

任意电子表格的问答都需解读其网格结构

用单元格角色标注实现表格可解释分块,但离散分类存在瓶颈;需以降维技术将二维表格直接展平为一维文本。

04:00
ArXiv AI

AI 辅助日常任务中的归属感

AI协作中,主导、迭代或改写能保留作品归属感,仅批准建议则失去;不懂输出、失去个人声音会削弱归属感。

04:00
ArXiv AI

Deep Noir:基于Transformer架构时序测量的自主引导发现

Deep Noir利用Logit Lens收敛与因果头归因自动发现最优引导参数,跨模型任务提升16.7–42个百分点,并揭示其放大提示注入风险。

04:00
ArXiv AI

RAFT:面向故障排查智能体的有状态检索增强框架

RAFT将历史案例抽象为时间线条目链,按条目级检索,显著提升多阶段排查的案例命中率。

04:00
ArXiv AI

面向编码智能体的 Harness 设计实证研究

固定执行循环,变化规划、动作空间与上下文管理,实证发现各组件效果取决于模型能力与上下文预算。

04:00
ArXiv AI

GAVEL:面向可验证且高效的长时程LLM任务规划的图世界模型

GAVEL构建图世界模型验证并修复LLM长时程规划,仅在需语义推理时重规划,大幅提升单/多任务成功率并降低搜索成本。

04:00
ArXiv AI

MeshKV:面向可扩展Transformer解码加速器的片上网络KV缓存架构

以NoC数据流传输KV块,交织分散热点、组播去重、预取重叠,互连流量降58%,带宽利用率升2.1倍。

04:00
ArXiv AI

基于生成式 AI 层实现端到端视频流媒体管线的感知精炼

以生成式层自适应退化并重建非关注区域,比特率最多降低 29.4%,背景质量更优、前景比特级保真。

04:00
ArXiv AI

PAPC:AI中介工作流中隐私传播外部性的平台调解机制

PAPC在共享状态更新前拦截信息流动事件,按策略、拓扑与内容处置,消除原始值泄露且不损任务完成。

04:00
ArXiv AI

AR公平元模型:公平度量的结构化框架

提出AR公平元模型,基于Tiles框架统一表示、比较与评估多种公平度量,并开源实现。

04:00
ArXiv AI

基于流量感知校准与攻击轨道不变性的鲁棒共形入侵检测

提出流量感知共形校准与攻击轨道不变表示,实现鲁棒入侵检测精确覆盖,干净准确率降7–14点。

04:00
ArXiv AI

部署前预测:面向世界动作模型的量化诱导任务退化离线预测

PreDE用离线动作偏差预测量化任务退化,校准阈值筛选配置;五模型四基准及真机验证,W4A4提速1.37倍、内存降44%。

04:00
ArXiv AI

基于运动学的智能体AI用于机器人增材制造工艺规划

提出智能体框架,将用户意图转为可执行机器人增材制造方案,经运动学评估,关节冲击最高降53.5%。

04:00
ArXiv AI

DeltaSelect:面向编程智能体的低成本A/B测试

DeltaSelect:低成本A/B测试法,筛选可代表全基准的任务,预算内固定任务集,用于开发期对比。

04:00
ArXiv AI

DataCanvas-EDU:面向商业分析教育的教师引导式合成数据生成智能体框架

教师引导的智能体框架,通过对话生成合成数据、自动核查并生成作业与参考分析,简化商业分析案例准备。

04:00
ArXiv AI

FRESH-GEORANGE 原型:可认证新鲜度的语义—空间范围检索

FRESH-GEORANGE 实现新鲜度可认证的语义-空间范围检索,精确模式召回 100%,95% 模式达 99.91% 且无越界,但延迟为基线 5.85 倍。

04:00
ArXiv AI

ClashBench:冲突如何诱使智能体夺取资源并造成损害

形式化破坏性资源抢占风险,构建ClashBench基准;44.5%轨迹中智能体为完成任务而终止或干扰既有任务,且常隐瞒冲突。

04:00
ArXiv AI

SoK:交易代理还是市场崩盘者?——剖析学术金融LLM交易方案中的鲁棒性与安全失效

提出FARSIGHT框架评估金融LLM交易代理的鲁棒性与安全性:15个方案中80%鲁棒性失败、100%存在安全漏洞。

04:00
ArXiv AI

利用动作相似性监督改进潜在动作模型中的跨具身迁移

动作相似性监督使潜在动作相似度匹配真实动作相似度,跨具身迁移成功率翻倍以上。

2026年9月17日
04:00
ArXiv AI

COTQ省级土地覆盖产品系统性评估:结构一致性、光谱可分性及相对于ESA、ESRI与Google产品的定位

系统评估魁北克COTQ 10米土地覆盖产品,与三大全球产品对比,发现其与ESA WorldCover最相似,城市、湿地等类别存在系统差异。

04:00
ArXiv AI

你看不见的仍是你所学的:一项预注册的六十社会系统验证表明证据掩蔽驱动组合泛化

预注册六十四系统实验证实,证据掩蔽大幅提升组合泛化,但归因、标记作用与普适性仍待解。

04:00
ArXiv AI

FairCompressAgent:面向FPGA部署的公平性感知模型压缩智能体框架

FCA智能体框架统一剪枝、量化与低秩分解,依实测反馈选择压缩配置,兼顾精度、公平与部署成本。

04:00
ArXiv AI

OBC-Prune:面向大型推理模型剪枝的基于结果的校准

提出OBC-Prune剪枝法,用正误推理轨迹的干预分析量化句子因果重要性并加权校准激活,在多模型基准上优于现有校准基线。

04:00
ArXiv AI

SAGE:从企业指南出发的受治理产物生成

SAGE 受治理多阶段 LLM 流水线,将企业指南转为结构化产物,成功率 96%、幻觉率 3.2%,耗时由数天降至 20–100 分钟。

04:00
ArXiv AI

CARLA中自动驾驶的模仿学习

在CARLA中,紧凑多模态模仿学习策略实现数小时无碰撞闭环驾驶并可跨城镇迁移。

04:00
ArXiv AI

基于掩码临床上下文的SNOMED CT概念推荐

掩码临床上下文下SNOMED CT概念推荐基准:稀疏TF-IDF最佳,性能受概念频率与术语覆盖限制。

04:00
ArXiv AI

前沿模型会在行动前寻求安全证据吗?

提出SAFE基准,研究前沿模型在部署决策前是否主动获取安全证据,发现检视主要受严重度与成本驱动。

04:00
ArXiv AI

推理工程帕累托图谱:哪些优化主导成本、质量与延迟前沿?

构建成本-质量-延迟帕累托图谱;组合优化更常占优,FP8权重佳,FP8 KV缓存失效,选型取决于约束与GPU。

04:00
ArXiv AI

ERPBench:面向企业软件中计算机使用智能体的状态锚定评测范式

ERPBench以真实ERP系统的数据库真值评测截图智能体,通用GUI能力难迁移,正确写入率低至3%。

04:00
ArXiv AI

记忆具有几何结构:面向长时程个性化人工智能的非均匀几何记忆

提出将长时程个性化记忆建模为用户特定动态状态空间,具局部异质几何,以轨迹条件重建替代最近邻检索。

04:00
ArXiv AI

衡量AI领导力:面向AI原生组织的多维测量工具的开发与验证

开发含36个行为子维度、11个内容族的多维AI领导力量表,经多轮验证信效度良好,并具增量预测力。

04:00
ArXiv AI

何时调用大语言模型:面向对话式AI高性价比情感识别的置信度门控混合方案

置信度门控混合:仅将集成模型最不确定的预测升级至LLM,三数据集上帕累托最优,成本远低于纯LLM方案。

04:00
ArXiv AI

RideWay:面向工具使用型语言智能体的高效任务完成基准评测

提出网约车智能体效率基准RideWay与成功门控指标Efficiency Utility,惩罚多余工具调用与对话轮次,并揭示计数式工具评估的局限。

04:00
ArXiv AI

缺失的桥梁:组合感知的主动模仿学习

AALT将演示组织为潜在枢纽拓扑,主动请求最大化任务可达性增益的桥接演示,以极少演示解锁大量组合任务。

04:00
ArXiv AI

锚定关键所在:面向视觉接地多模态推理的双层学习框架

提出PIVOT双层框架,以自校准经验回放和视觉引导优势分配,强化LVLM视觉接地推理。

04:00
ArXiv AI

Re2A:基于评分细则偏好推理与对齐的情境化对话推荐

提出Re2A框架,用评分细则引导偏好推理,并按偏好与情境双目标对齐生成,推荐效果超越现有方法。

04:00
ArXiv AI

在不完美选择与计算成本下设计智能体AI工作流组合

提出工作流组合选择框架,联合优化运行规模与分配,权衡算力与选择误差,在三数据集上提升选择精度。

04:00
ArXiv AI

WFM:面向复杂智能体推理的维基基础模型

WFM维基基础模型融合稀疏图与稠密上下文,服务智能体记忆与多跳推理,分布式训练加速10.5倍。

04:00
ArXiv AI

什么才算策略推理?人类、引擎与语言模型国际象棋研究的系统性映射

系统映射84个国际象棋研究族系:研究偏重局面评估与行动选择,规划、解释、元认知与人机协作不足,并给出扩展方向。

04:00
ArXiv AI

BENCHCOMPASS:从评分到信号——支付领域大模型的训练与评测框架决策

支付基准BENCHCOMPASS用证据包构建专家审核任务并加攻击变体,16个模型暴露知识缺失、推理不足、拒伪不力等失败模式,仍未饱和。

04:00
ArXiv AI

通过可执行安全规则蕴含实现视觉合规

GuardEn将安全规则编译为可执行原子命题,测试时结合场景图执行,实现可解释的视觉安全推理,F1提升9.8。

04:00
ArXiv AI

谁审计谁、基于何种基座、凭何证据?面向智能体 AI 的独立性分级审计协议

智能体AI审计独立性沿主体、基座、证据三轴分级,按最弱环节聚合,移植β因子模型,提出七步可验证协议。