多智能体推理中的旁观者效应:量化协作交互中的认知懈怠
多智能体协作会因模拟社会压力诱发旁观者效应与认知懈怠,导致独立推理退化。
概念瓶颈模型作为决策支持系统是否有效?
两项研究(705人)表明,概念瓶颈模型仅在任务较难、概念易识别且用户主动交互时提升人机团队准确率。
HOL 中的一元二阶逻辑:深嵌入与浅嵌入及自动化忠实性(扩展预印本)
在 Isabelle/HOL 中为 MSO 构建三种深/浅嵌入,机械化双排序替换与忠实性,证明向下 Löwenheim-Skolem 定理。
在主干网络中规划:DiffAdapterVLA 面向驾驶视觉语言模型的原生连续轨迹生成
将轨迹标记注入驾驶VLM后层,使其在主干计算中递归精炼,仅训练轻量模块即实现低延迟高质量闭环规划。
MemCalib:大语言模型智能体记忆使用的基准测试与优化
提出 MemCalib 基准,揭示 LLM 智能体常过度或不足使用记忆;提出 MemCalib-RL 双向反事实信用分配,平衡记忆使用并提升性能。
真实场景中的 ChatGPT Images 2.5:发布期数据集与检测器评估
发布后51小时内采集8源3478图,评估六检测器:误报差异大,来源影响归因与检测。
量化前沿大语言模型智能体的过度宣称倾向
智能体常虚报未做的工作:67.9%运行未读完文件,八成误导用户,虚报完成者漏检缺陷率高1.8倍。
离散与连续:大型音频语言模型中统一音频理解的综合研究
系统评估语音、声音、音乐的连续与离散表示,发现语义约束分词关键,扩大骨干难补音频信息损失。
ActGov:通过策略约束验证管控大语言模型智能体动作
ActGov在运行时校验LLM智能体的每次工具调用,自动构建并经SMT验证策略,有效降低间接提示注入攻击成功率且保持任务效用。
Touch2Robot:人类演示环路中的机器人触觉
Touch2Robot框架让人类演示时同步预览目标机器人手的接触情况,提升真实机器人重放完成率至72.1%,显著提高数据采集质量与效率。
合成人设能预测真实受众反应吗?一项仿真到真实研究:无人物设定基线优于基于人设的文案模拟
以真实A/B点击数据检验发现,LLM合成人设的预测效度反低于无人物设定基线,角色扮演引入偏差与噪声。
AI神经科学家:用于神经影像分析的交互式智能体界面
AI神经科学家智能体将大语言模型与神经影像工具结合,支持自然语言查询数据质量、设定分析参数并完成质控、建模与可视化。
澄清并非纠正:大语言模型难以放下早期解读
模型在歧义未解时过早固化任务状态,后续澄清仅被当作补充上下文而无法推翻旧状态,编码任务尤甚。
学习型企业数据理解:面向数据智能体的压缩与路由
提出潜在等价学习,分离任务身份与数据实现,以原型匹配与查询路由组织证据,在企业数据智能体基准居首。
中文标题:推理大语言模型强化学习中的Rollout效率:分类体系与未来方向
系统综述推理大模型强化学习的rollout效率:按机制与瓶颈分类方法,分析技术组合冲突与评估缺口。
基于Transformer机器学习的OpenXR实时手势识别
利用OpenXR手部追踪数据,基于Transformer实现实时手势识别,提升跨手型与朝向的分类准确率。
语音数据集中的酷儿包容性:实践张力的审计与分类
审查语音数据集酷儿包容性,代表性仅0–1.4%;对比社区共建数据,揭示AI语音采集实践张力并分类。
行为特质渗入偏好:诊断LLM用户模拟器中的特质干扰
LLM用户模拟器中活跃度特质干扰偏好、虚高评分;PQA以个性化质量锚点提前退出低质页,提升可靠性。
评估编码智能体生成内核漏洞利用原语的能力
提出KEX-bench基准:45项Linux/Windows内核利用原语任务;无参考PoC时最强配置仅解1/20个Windows、14/25个Linux任务,有PoC解31/45,瓶颈不在触发崩溃而在构造原语。
自动定理证明中面向搜索的生成器直接优化
将计算对齐训练扩展至树搜索,提出搜索感知与均匀分配损失,在Lean基准上超越交叉熵并随测试算力扩展。
结肠镜检查中假阳性计算机辅助检测提示的注视反应:一项配对视频与实时眼动追踪研究
假阳性CADe提示常吸引内镜医师注视,占位中位约1秒,远超提示时长,注意负担应纳入评估与设计。
《Transformer 注意力头在寻找顺序》
证明检测比特序列是否有序:单头单层Transformer不可为,双头单层可为,模型含输出MLP。
灵兰:基于多模态数据的中医诊断进阶大语言模型
提出UFMD框架统一舌脉多模态数据,构建中医大模型LingLan-14B,诊断准确率相对提升103.5%。
优化了分数,却迷失了任务:跨权重、选择与提示的奖励作弊
高分未必模型更优:优化会利用评估器缺陷,在权重、选择、提示三类载体上出现奖励作弊,需独立验证任务质量。
预测并非检测:评估纵向临床人工智能中的识别前主张
事件式评估易将识别介导信号当捷径,虚增表现与提前量;须定义识别前转变、独立参照标准使主张可检验。
AgenticSizing:基于大语言模型的多智能体模拟电路尺寸优化框架
提出大语言模型多智能体模拟电路尺寸优化框架,拓扑分解与知识复用协同搜索,8电路验证,LDO成功率60%。
对抗性行动方案生成:面向COA匹配与COA生成的博弈论多智能体算法
发布COA-Bench离线基准,以自博弈比较行动方案生成策略,用蓝红优势与纳什差距评分,并修复基准设计缺陷。
CQ4OE:评估LLM辅助从能力问题生成本体的基准
提出CQ4OE基准,系统评估LLM从能力问题生成本体;含溯源与两项任务,实验显示术语恢复优于本体构建。
FIRE:面向可靠语言模型智能体的故障知情运行时工程
在失败前状态施加指令与动作拒绝,不改权重即显著提升智能体重复成功率与交付可靠性。
MAC-RRG:面向X射线放射报告生成的迭代式多智能体协作
提出MAC-RRG多智能体迭代框架,融合多源知识闭环优化X射线报告生成,减少医学幻觉并提升可解释性。
基于DWI时序深度学习的新辅助化疗病理完全缓解早期预测
仅用基线与首周期后DWI,时序深度学习预测乳腺癌新辅助化疗pCR,AUC达0.90。
DTOC:面向AI智能体自适应上下文管理的动态工具输出压缩
DTOC将工具输出存于外部记忆,上下文留可逆占位符,按需还原,省token降本提效。
FairMon:一种监控与可视化算法公平性的工具
FairMon面向高风险决策系统的运行时公平性监控,扩展RTLola条件概率算子,并实时可视化中间值。
基于治疗前弥散及对比增强磁共振成像与临床变量的新辅助化疗反应预测
治疗前ADC、DCE-MRI联合临床变量深度学习预测乳腺癌新辅助化疗反应,融合HR/HER2后AUC达0.86。
无需说服的一致:单轮辩论抹去验证所需的分歧
一轮辩论即让评审团趋同却未提高准确率,抹去验证所需分歧;应先验证,勿把辩论后一致当可靠证据。
通过在线序贯检验识别智能过程
将识别大语言模型形式化为外层探针设计与内层序贯识别,用加权集合覆盖选探针,并界定识别所需评估次数。
守恒的代价:精确支撑生成的协调—记忆定律
加性守恒下精确支撑生成中,协调成本由守恒差游走谱决定,在线记忆可替代前置协调。
基于目标导向智能体AI的泛在机器人用户自助维修探索
提出目标导向智能体AI,将自然语言转为分层目标,助非专家用户自助维修泛在机器人,完成率达95%。
当验证器在裁决替换下反向投票:相关自洽性中的有符号枢轴值
裁决替换下验证器会反向投票;关键增益符号由状态准确率决定,强验证器受益、角色反转受损。
用于增强短期径流预测的多时间步LSTM集成回归器
提出多时间步LSTM集成回归器,经PSO优化预测阿吉柴河日径流,R²达74.95%~91.42%。
RCShift:认证部分链接何时足以支持有限样本决策
RCShift在观测契约下认证部分链接足以支持有限样本决策,并将存储转化为决策校准的测量设计。
面向学业指导的混合AI框架:融合基于集成的成绩预测与规则专家系统
融合分簇堆叠集成成绩预测与规则专家系统,为学业指导提供实时预警与选课建议。
编程智能体是强大的提示优化器
编码智能体仅凭静态轨迹语料,一次离线分析即可合成优化提示,平均提升16.6个百分点,成本约1.6美元。
可复现的 AI 需要可复现的随机性
PRNG完整内部状态跨库迁移未必保证复现;PyTorch的Philox与参考算法不兼容,危及AI可复现性。
JEV 作为评判者:自信时接受,不确定时升级
JEV决策评判成本仅0.36%,精度差3个百分点内;级联接受高置信判断、升级存疑项,低成本保99%精度。
委托盲点:从智能体选择审计产品决策
提出基于智能体选择的决策审计,发现执行准确率无助于产品价值判断,确定性提取可减少模型报告引入的不确定性。
类型安全并不等于无错误:受约束的决策头跟随的是选项名称,而非绑定其上的评分标准
类型安全不保语义正确:改选项名可致决策反转,类型错误率仍为0%。
增长框架,而非上下文:从无策略脚手架到可复用专家智能体
让任务反馈将重复控制固化为可复用代码,仅语义推理调用LLM,成功率最高,调用与成本大幅下降。
REFLEX 与 Jev:LLM 智能体中的高效选择性控制
REFLEX以Jev为快速决策层,仅低置信度时调用强LLM,省72.7%强模型调用、成功率95%。