PAWS:政策驱动的智能体世界仿真
PAWS是政策驱动的智能体世界仿真数据集,涵盖36个美国金融政策事件,将利益相关者行动关联新闻与市场收益,支持政策响应仿真评估。
预测智能体何时应当推理?可靠性路由的行为压力测试
预测智能体何时应推理?证据源可靠性决定路由;更多推理未必更好,路由策略需可审计地自适应。
超越表面风格:让多轮用户模拟器对齐行为一致性
TRACER两阶段训练对齐多轮用户模拟行为,提升转化F1与轨迹一致性,并发布动态营销基准。
BaseCamp——面向DNA测序数据流水线自动化的智能体AI框架
BaseCamp用六个专用AI智能体自动化DNA测序流程的决策层,本地运行、人在环路。
Pistis 技术报告
Pistis多模态大模型含27B/9B,提出IDRL后训练,分思考与智能体版,搜索强,PAH免调参提升性能。
TWIST:面向对话记忆干预质量的拟议基准,附经人工验证的草稿对齐
TWIST基准评估对话记忆的干预质量,四条赛道配防过度干预对照,揭示召回与误报间的权衡。
世界模型中客体永久性的训练
构建WROP客体永久性数据集(含150万样本),训练16B模型PWM-WROP,视频模型续写评测中夺冠。
DEEPO:面向多模态大语言模型幻觉的双熵增强策略优化
DEEPO提出双熵增强策略优化,以专家前缀和Renyi预处理纠正高熵与自信错误,降低多模态大模型幻觉。
面向小型搜索智能体的可验证奖励强化学习
0.8B小模型经GRPO结合检索训练,无需蒸馏即提升3.8倍;奖励设计关键,稀疏精确匹配奖励最差。
用 AI 智能体驱动流行病模型:Epydemix 智能体框架
为 Epydemix 流行病建模库添加 AI 智能体层,支持模型发现、场景验证、执行与结果审查;多数任务降本,兼顾可复现。
RECLAIM:智能体能否复现机器学习论文的结论?
RECLAIM以百篇NeurIPS论文分三档评测智能体复现,最佳成功率仅41%、27%、15%。
回归定义:基于轨迹图估计智能体强化学习中的步级优势
提出GRAFT:将轨迹拼接为图,经贝尔曼迭代估计节点值以分配步级优势,多轮智能体任务超越GRPO。
欧洲电力交易市场的功能架构:监管约束下对AI支持交易系统的要求
提出监管约束下欧洲电力交易AI功能架构,含决策状态、敞口核算、权限门控与故障闭锁,识别跨境协调瓶颈。
MeshHeal:去中心化LLM智能体网络中灰度故障的双时间尺度自愈
MeshHeal以快慢双时间尺度同伴评审自愈,隔离退化智能体并支持恢复重入,效率与准确率双优。
从自蒸馏到自实践:多轮智能体的特权信息
指出在线自蒸馏令多轮智能体盲目自信;提出PSP,把特权信息从损失移至采样提示,在两大基准上超越GRPO。
AlphaDiverse:面向 Alpha 因子挖掘多样化探索的本地量化研究智能体后训练
针对外部API依赖和路径坍塌,提出AlphaDiverse,融合多路径采集、本地智能体后训练与GRPO,兼顾预测与多样探索。
面向WeBe Band的机器学习模型快速训练与部署流水线
面向WeBe Band的边缘机器学习自动化流水线,支持AutoML、硬件感知量化、固件生成和OTA部署,便于快速迭代与在设备评估。
硬预算重复评估中诚实不确定性的尖锐极限
硬预算重复评估中,刻画区间宽度随任务覆盖与复制的取舍,新设计大幅降低估计误差与区间宽度。
IndicBankBench:评估印度零售银行场景中语言模型助手的安全性与可靠性
推出799例印度零售银行基准,四阶段评测安全与工具使用,11款模型严格通过率仅43.7%–58.2%。
熵三角方法(ETM):一种预防心律失常的新型框架——附逾万例患者回顾
提出熵三角方法框架,含特征工程、熵三角过采样与预测三步,基于10,646例12导联心电数据,非窦性心律预测准确率超85%。
基于强化学习的分类算法正确选择以预测非酒精性脂肪肝
提出强化学习四阶学习法自动选择分类算法,预测原发性胆汁性肝硬化,准确率从63%升至98%。
当诚实不足以应对 AI 辩论时
结论正确不等于诚实:辩论智能体可借表达自由度隐蔽传递信息。本文提出SIO框架,量化任务与披露的权衡。
ALOE:面向知识编辑的语义寻址低秩算子
ALOE 学习语义地址,将门控低秩算子嵌入 MLP,单次前向即可精准编辑知识且保持局部性。
策略即代码:面向 CAR-bench 快速推理可靠性的协程桥接测试框架
协程桥接框架让模型仅输出可阻塞恢复的Python程序,解耦模型调用与工具往返,以60% Pass^3夺冠。
认知概率模型:面向受保护多智能体LLM协作
提出EPLA神经符号架构,以符号守卫控制LLM动作,用认知概率模型协调不确定性下的多智能体。
当判断无人所属:人机协作中贡献消解下的问责
提出"无主判断":以AI辅助评审与创作隐瞒为例,指出披露规则局限,主张区分AI角色、明确人类担责判断。
SkinAgent AI:面向非诊断性护肤支持的安全锚定多模态智能体框架
安全约束的非诊断护肤多模态智能体SkinAgent AI:视觉路由表现佳,系统任务完成有限,仍需独立验证与临床评估。
从文本决策到像素:Jev 式视觉选择模型研究
PixelJev将图像、指令与候选集映射为选择及概率;少量适配令Pets准确率升至92%并可迁移。
最后的人类关卡:面向治理自动化的前线部署工程
提出数字治理任务替代框架:明确智能体替代人工审查关卡的条件,并以基准验证其可行性。
超越简单的输入-输出评估任务:利用自动化编程评估应对非平凡课程
将机器学习问题构建为输入-输出评估任务,使自动化编程评测工具有效支持AI教学,促进理论与实践结合。
Baszta:面向数据的波兰语多标签安全分类器微调
微调波兰语多标签安全分类器:微F1略优,但基准97%为犯罪类,宏F1才具判别力;OOD实为校准问题。
用于胸部X光器械推理的临床知识图谱
构建不确定性感知临床知识图谱,表征胸片器械实例、尖端估计与置放评估及证据溯源,奠定可复现AI推理基础。
面向复杂肺癌开放性决策的可审计条件策略框架
MCE将肺癌决策的候选路径、关键未知与安全约束组织为可审计条件策略,显著提升医生策略的临床适用性。
只需问Jev:面向校准决策的强化学习作为AI对齐失败的零样本检测器
Jev单次调用输出校准概率,零样本检测十类对齐失败,中位AUROC 0.886,成本低63倍。
SWE-Prometheus:衡量真实世界代码仓库中的工程治理改进
提出SWE-Prometheus基准,从六维度衡量代码仓库工程治理改进,兼顾行为保持与证据质量。
BiGraph-Diffuse:面向心理健康咨询的图结构检索双向扩散语言模型
提出心理咨询扩散语言模型BiGraph-Diffuse与图检索BiGraph-RAG,强化双向理解与临床推理,实验和理论验证有效。
过时并不意味着不安全:基础设施状态竞态下工具调用型LLM智能体的守卫精度
区分失效竞态与无关竞态:新鲜度守卫误挡92-95%良性竞态,仅语义谓词守卫零误挡,模型自评不可替代。
推理总是有用吗?重新审视通用多模态嵌入中的推理效用
研究发现推理增强的多模态嵌入常出现"假有益":推理反而拉近难负样本;据此提出SURE路由,免重训即提升检索性能。
面向物理智能体的技能安全退役
技能退役若仅凭任务基准,会漏审安全条件,导致未授权物理与隐私效应;须用双门控证书审计权威契约。
顺序知识编辑会破坏模型辨别证据好坏的能力,却不损失准确率
顺序知识编辑不损准确率,却削弱模型辨别证据可信度的能力,并拖累检索与选择性预测
PEEL:面向CT成像中可辨识不确定性的物理赋能证据学习
以物理噪声确定NIG似然不可辨识纤维,冻结网络后用蒙特卡洛教师学偶然方差,CT不确定性预测相关0.83–0.95。
摄取期事实编译:面向修订语料库的低成本可靠问答
摄取期编译事实、一次性解决修订与来源规则,查询时读取编译记录,低成本模型更准且读取成本降约13倍。
解码想象语音:一种严格独立于被试的EEG方法
严格跨被试框架下比较EEG想象语音解码的时域统计与频域谱功率流程,后者平均准确率显著更高(49.03%对37.97%)。
像我们一样公平吗?审计资源分配中大语言模型的对齐
提出评估大模型公平推理的通用方法,发现其比人类更严苛自利、受信息框架影响,且难以微调对齐人类判断。
面向请求的预算约束阈值激励通用框架
提出请求驱动的预算阈值激励通用框架,含四阶段七模块,短期试点校正,显著提速并降后悔。
幻觉神经元在哪里:对幻觉神经元存在性的探究
幻觉神经元检测可复现且因果显著,但定位不唯一,稀疏预测结构不等同于唯一神经元定位。
《PUBG Ally:作为AI队友的对话式具身智能体》
提出具身AI队友PUBG Ally,融合大模型推理与实时游戏控制,经3.9万局实战数据训练,玩家推荐正向反馈高出25.1个百分点。
推进 AgentX 中的模型研究:面向工业推荐系统的长时程自主性
AgentX-Model 以双智能体实现工业推荐长时程自主研究,多轮实验闭环,线上 A/B 显著提升。
Qwen-Planner-Agent:面向真实世界移动规划智能体的闭环 AI-for-AI 框架
提出 AI-for-AI 闭环框架,贯通数据、训练与模型-框架协同演化,移动规划智能体整体性能最佳。