5273 条条目 · 106 个活跃源
2026年9月25日
04:00
arXiv cs.AI

PAWS:政策驱动的智能体世界仿真

PAWS是政策驱动的智能体世界仿真数据集,涵盖36个美国金融政策事件,将利益相关者行动关联新闻与市场收益,支持政策响应仿真评估。

04:00
arXiv cs.AI

预测智能体何时应当推理?可靠性路由的行为压力测试

预测智能体何时应推理?证据源可靠性决定路由;更多推理未必更好,路由策略需可审计地自适应。

04:00
arXiv cs.AI

超越表面风格:让多轮用户模拟器对齐行为一致性

TRACER两阶段训练对齐多轮用户模拟行为,提升转化F1与轨迹一致性,并发布动态营销基准。

04:00
arXiv cs.AI

BaseCamp——面向DNA测序数据流水线自动化的智能体AI框架

BaseCamp用六个专用AI智能体自动化DNA测序流程的决策层,本地运行、人在环路。

04:00
arXiv cs.AI

Pistis 技术报告

Pistis多模态大模型含27B/9B,提出IDRL后训练,分思考与智能体版,搜索强,PAH免调参提升性能。

04:00
arXiv cs.AI

TWIST:面向对话记忆干预质量的拟议基准,附经人工验证的草稿对齐

TWIST基准评估对话记忆的干预质量,四条赛道配防过度干预对照,揭示召回与误报间的权衡。

04:00
arXiv cs.AI

世界模型中客体永久性的训练

构建WROP客体永久性数据集(含150万样本),训练16B模型PWM-WROP,视频模型续写评测中夺冠。

04:00
arXiv cs.AI

DEEPO:面向多模态大语言模型幻觉的双熵增强策略优化

DEEPO提出双熵增强策略优化,以专家前缀和Renyi预处理纠正高熵与自信错误,降低多模态大模型幻觉。

04:00
arXiv cs.AI

面向小型搜索智能体的可验证奖励强化学习

0.8B小模型经GRPO结合检索训练,无需蒸馏即提升3.8倍;奖励设计关键,稀疏精确匹配奖励最差。

04:00
arXiv cs.AI

用 AI 智能体驱动流行病模型:Epydemix 智能体框架

为 Epydemix 流行病建模库添加 AI 智能体层,支持模型发现、场景验证、执行与结果审查;多数任务降本,兼顾可复现。

04:00
arXiv cs.AI

RECLAIM:智能体能否复现机器学习论文的结论?

RECLAIM以百篇NeurIPS论文分三档评测智能体复现,最佳成功率仅41%、27%、15%。

04:00
arXiv cs.AI

回归定义:基于轨迹图估计智能体强化学习中的步级优势

提出GRAFT:将轨迹拼接为图,经贝尔曼迭代估计节点值以分配步级优势,多轮智能体任务超越GRPO。

04:00
arXiv cs.AI

欧洲电力交易市场的功能架构:监管约束下对AI支持交易系统的要求

提出监管约束下欧洲电力交易AI功能架构,含决策状态、敞口核算、权限门控与故障闭锁,识别跨境协调瓶颈。

04:00
arXiv cs.AI

MeshHeal:去中心化LLM智能体网络中灰度故障的双时间尺度自愈

MeshHeal以快慢双时间尺度同伴评审自愈,隔离退化智能体并支持恢复重入,效率与准确率双优。

04:00
arXiv cs.AI

从自蒸馏到自实践:多轮智能体的特权信息

指出在线自蒸馏令多轮智能体盲目自信;提出PSP,把特权信息从损失移至采样提示,在两大基准上超越GRPO。

04:00
arXiv cs.AI

AlphaDiverse:面向 Alpha 因子挖掘多样化探索的本地量化研究智能体后训练

针对外部API依赖和路径坍塌,提出AlphaDiverse,融合多路径采集、本地智能体后训练与GRPO,兼顾预测与多样探索。

04:00
arXiv cs.AI

面向WeBe Band的机器学习模型快速训练与部署流水线

面向WeBe Band的边缘机器学习自动化流水线,支持AutoML、硬件感知量化、固件生成和OTA部署,便于快速迭代与在设备评估。

04:00
arXiv cs.AI

硬预算重复评估中诚实不确定性的尖锐极限

硬预算重复评估中,刻画区间宽度随任务覆盖与复制的取舍,新设计大幅降低估计误差与区间宽度。

04:00
arXiv cs.AI

IndicBankBench:评估印度零售银行场景中语言模型助手的安全性与可靠性

推出799例印度零售银行基准,四阶段评测安全与工具使用,11款模型严格通过率仅43.7%–58.2%。

04:00
arXiv cs.AI

熵三角方法(ETM):一种预防心律失常的新型框架——附逾万例患者回顾

提出熵三角方法框架,含特征工程、熵三角过采样与预测三步,基于10,646例12导联心电数据,非窦性心律预测准确率超85%。

04:00
arXiv cs.AI

基于强化学习的分类算法正确选择以预测非酒精性脂肪肝

提出强化学习四阶学习法自动选择分类算法,预测原发性胆汁性肝硬化,准确率从63%升至98%。

04:00
arXiv cs.AI

当诚实不足以应对 AI 辩论时

结论正确不等于诚实:辩论智能体可借表达自由度隐蔽传递信息。本文提出SIO框架,量化任务与披露的权衡。

04:00
arXiv cs.AI

ALOE:面向知识编辑的语义寻址低秩算子

ALOE 学习语义地址,将门控低秩算子嵌入 MLP,单次前向即可精准编辑知识且保持局部性。

04:00
arXiv cs.AI

策略即代码:面向 CAR-bench 快速推理可靠性的协程桥接测试框架

协程桥接框架让模型仅输出可阻塞恢复的Python程序,解耦模型调用与工具往返,以60% Pass^3夺冠。

04:00
arXiv cs.AI

认知概率模型:面向受保护多智能体LLM协作

提出EPLA神经符号架构,以符号守卫控制LLM动作,用认知概率模型协调不确定性下的多智能体。

04:00
arXiv cs.AI

当判断无人所属:人机协作中贡献消解下的问责

提出"无主判断":以AI辅助评审与创作隐瞒为例,指出披露规则局限,主张区分AI角色、明确人类担责判断。

04:00
arXiv cs.AI

SkinAgent AI:面向非诊断性护肤支持的安全锚定多模态智能体框架

安全约束的非诊断护肤多模态智能体SkinAgent AI:视觉路由表现佳,系统任务完成有限,仍需独立验证与临床评估。

04:00
arXiv cs.AI

从文本决策到像素:Jev 式视觉选择模型研究

PixelJev将图像、指令与候选集映射为选择及概率;少量适配令Pets准确率升至92%并可迁移。

04:00
arXiv cs.AI

最后的人类关卡:面向治理自动化的前线部署工程

提出数字治理任务替代框架:明确智能体替代人工审查关卡的条件,并以基准验证其可行性。

04:00
arXiv cs.AI

超越简单的输入-输出评估任务:利用自动化编程评估应对非平凡课程

将机器学习问题构建为输入-输出评估任务,使自动化编程评测工具有效支持AI教学,促进理论与实践结合。

04:00
arXiv cs.AI

Baszta:面向数据的波兰语多标签安全分类器微调

微调波兰语多标签安全分类器:微F1略优,但基准97%为犯罪类,宏F1才具判别力;OOD实为校准问题。

04:00
arXiv cs.AI

用于胸部X光器械推理的临床知识图谱

构建不确定性感知临床知识图谱,表征胸片器械实例、尖端估计与置放评估及证据溯源,奠定可复现AI推理基础。

04:00
arXiv cs.AI

面向复杂肺癌开放性决策的可审计条件策略框架

MCE将肺癌决策的候选路径、关键未知与安全约束组织为可审计条件策略,显著提升医生策略的临床适用性。

04:00
arXiv cs.AI

只需问Jev:面向校准决策的强化学习作为AI对齐失败的零样本检测器

Jev单次调用输出校准概率,零样本检测十类对齐失败,中位AUROC 0.886,成本低63倍。

04:00
arXiv cs.AI

SWE-Prometheus:衡量真实世界代码仓库中的工程治理改进

提出SWE-Prometheus基准,从六维度衡量代码仓库工程治理改进,兼顾行为保持与证据质量。

04:00
arXiv cs.AI

BiGraph-Diffuse:面向心理健康咨询的图结构检索双向扩散语言模型

提出心理咨询扩散语言模型BiGraph-Diffuse与图检索BiGraph-RAG,强化双向理解与临床推理,实验和理论验证有效。

04:00
arXiv cs.AI

过时并不意味着不安全:基础设施状态竞态下工具调用型LLM智能体的守卫精度

区分失效竞态与无关竞态:新鲜度守卫误挡92-95%良性竞态,仅语义谓词守卫零误挡,模型自评不可替代。

04:00
arXiv cs.AI

推理总是有用吗?重新审视通用多模态嵌入中的推理效用

研究发现推理增强的多模态嵌入常出现"假有益":推理反而拉近难负样本;据此提出SURE路由,免重训即提升检索性能。

04:00
arXiv cs.AI

面向物理智能体的技能安全退役

技能退役若仅凭任务基准,会漏审安全条件,导致未授权物理与隐私效应;须用双门控证书审计权威契约。

04:00
arXiv cs.AI

顺序知识编辑会破坏模型辨别证据好坏的能力,却不损失准确率

顺序知识编辑不损准确率,却削弱模型辨别证据可信度的能力,并拖累检索与选择性预测

04:00
arXiv cs.AI

PEEL:面向CT成像中可辨识不确定性的物理赋能证据学习

以物理噪声确定NIG似然不可辨识纤维,冻结网络后用蒙特卡洛教师学偶然方差,CT不确定性预测相关0.83–0.95。

04:00
arXiv cs.AI

摄取期事实编译:面向修订语料库的低成本可靠问答

摄取期编译事实、一次性解决修订与来源规则,查询时读取编译记录,低成本模型更准且读取成本降约13倍。

04:00
arXiv cs.AI

解码想象语音:一种严格独立于被试的EEG方法

严格跨被试框架下比较EEG想象语音解码的时域统计与频域谱功率流程,后者平均准确率显著更高(49.03%对37.97%)。

04:00
arXiv cs.AI

像我们一样公平吗?审计资源分配中大语言模型的对齐

提出评估大模型公平推理的通用方法,发现其比人类更严苛自利、受信息框架影响,且难以微调对齐人类判断。

04:00
arXiv cs.AI

面向请求的预算约束阈值激励通用框架

提出请求驱动的预算阈值激励通用框架,含四阶段七模块,短期试点校正,显著提速并降后悔。

04:00
arXiv cs.AI

幻觉神经元在哪里:对幻觉神经元存在性的探究

幻觉神经元检测可复现且因果显著,但定位不唯一,稀疏预测结构不等同于唯一神经元定位。

04:00
arXiv cs.AI

《PUBG Ally:作为AI队友的对话式具身智能体》

提出具身AI队友PUBG Ally,融合大模型推理与实时游戏控制,经3.9万局实战数据训练,玩家推荐正向反馈高出25.1个百分点。

04:00
arXiv cs.AI

推进 AgentX 中的模型研究:面向工业推荐系统的长时程自主性

AgentX-Model 以双智能体实现工业推荐长时程自主研究,多轮实验闭环,线上 A/B 显著提升。

04:00
arXiv cs.AI

Qwen-Planner-Agent:面向真实世界移动规划智能体的闭环 AI-for-AI 框架

提出 AI-for-AI 闭环框架,贯通数据、训练与模型-框架协同演化,移动规划智能体整体性能最佳。