DynSTEER:面向智能体的动态分阶段轨迹评估与执行时审查
DynSTEER按关键动作分段评估轨迹,结合容多解里程碑图与多级裁判,在线终止失败执行,区分度提升85.2%。
一个模型,两种物理叙事:审视多模态世界建模中的错位
多模态世界模型存在内部与外部错位:语言预测常正确,视频却与物理不一致。
AppliedScientist:通过迭代式AI评审实现论文自动修订
AI科学家与评审闭环迭代修订论文,评审引导修订优于固定提示自改,能解决实验问题但难改创新性缺陷。
从外部看贝叶斯智能
贝叶斯智能可从外部行为解释:报告不矛盾即可;提出信息更优智能序,并指出聚合粗报告极其困难。
AI说服对人类控制的威胁
系统分析AI说服对人类控制的威胁,提出评估框架与五个场景,初步调查显示研究者风险判断分歧大,需后续研究。
加密资产会计基准:评估前沿与开放权重模型在加密资产会计任务上的表现
提出加密会计基准CAB,含118项任务,评估12个模型;最佳均分77.43%,Pass@3为56.78%,主要挑战是账户选择与完整分录构建。
墙里的又一张蓝图:如何像孩子一样向前沿AI提问?
以学校口吻提示六类前沿模型,架构想象趋同;去除框架则分化,两款GPT蓝图相似,或存趋同与跨模型传播。
ANASSA:面向空间智能的智能体AI编排框架
ANASSA:面向空间智能的智能体AI编排框架,整合空间推理、多智能体工作流、验证与治理。
浅层信念:合成文档微调无法免疫奖励黑客引发的涌现性失准
合成文档微调仅塑造表层信念,无法防止后续强化学习经奖励黑客引发涌现性失准,还会意外引导泛化。
OpenAI4S:代码即行动,科学即会话
开源科研智能体OpenAI4S以持久化执行与会话级溯源,提升长周期计算科研的可靠性与可复现性。
面向预测时域的光伏功率预测专家融合
按时域凸权重融合时序网络、历史相似日、气候态与梯度提升树并校准偏差,光伏短时误差4.315%,但优势依数据而定。
四本账,而非一个分数:生物医学机器学习中 LLM 评审校准的负责任沟通
合成扰动不可当作人工真值;单一流程审计揭示评分被误读,提出溯源审计、存储契约与最低校准门槛。
语言模型模拟农业决策中的“平均农民”幻觉
语言模型农民智能体可匹配群体均值,却难再现个体差异,此即“平均农民”幻觉。
BusMA:面向多智能体系统的总线通信基座
BusMA提出总线式多智能体通信框架,支持共享寻址、四种交互意图与Chair协调,13项任务上优于HMW/RMP。
赋能氛围设计智能体的创意探索
设计方向作为显式中间决策:生成带典型性评分的结构化规范,采样后再固定设置生成,兼顾多样探索与稳定实现。
ER-EDF:面向大型音频语言模型语音共情对话生成的心理学基础情绪调节框架
提出ER-EDF,解耦情绪感知与调节,显著提升大型音频语言模型语音共情对话质量。
生成式AI写作辅助中的议题偏见:瑞典2026年大选中的政治议题与大语言模型
六种LLM在瑞典2026大选写作任务中立场各异,无明显政党偏好,但立场因议题和任务而异。
ProIQA:面向细粒度数学题目质量评估的基于过程的框架
提出ProIQA框架,以结构化推理树结合GNN编码过程语义,融合题干实现数学题多维度质量评估。
STHMoE:面向大语言模型城市交通数据预测的超图增强异构依赖协同
提出STHMoE超图增强混合专家框架,解耦交通多域异构依赖,10个真实基准验证其有效性。
CWM:面向自适应检索增强生成与推理能力的可控白盒元提示
提出CWM白盒元提示,无需外部模块或多采样,在自适应RAG基准上达最优,并泛化至推理任务。
从想法到行动:贯穿创业生命周期的公共数据决策支持工具链
公共数据决策支持工具链,覆盖创业前后:投前评估创意与市场壁垒,投后以可审计事件链分析融资与运营进展。
面向ESG领域的检索增强生成中开源大语言模型的实证评估
评估7个开源大模型在ESG报告RAG中的表现:检索稳定,生成差异大,事实正确性低,需领域微调。
只推理关键之处:面向通用多模态嵌入的检索锚定推理
ReWAM 以检索反馈引导推理的信用分配与计算,兼顾检索质量与效率,推理吞吐提升达 5 倍。
安全强化学习的评估指标
提出安全RL评估指标与安全分级体系,跨任务与安全边界评测,主张联合报告三类结果,并开源评测套件。
MAPS:面向大语言模型服务的内存感知预测调度框架
MAPS借助设备端预测输出长度与不确定性校准,分层调度降低端到端时延42.6%、尾延迟84.8%。
SkillLift:从稀疏评估信号中学习密集评分准则,实现高效技能演化
提出SkillLift,以排序替代绝对评分为监督目标,学习与评估对齐的评分准则,双层交替优化解耦技能搜索与评估成本,token消耗降低40%–70%。
当工具调用成功但工作流失败:智能体—工具边界处的异常
智能体经工具执行工作流,重试并发等致外部状态异常;共享接口语义不足,需工具边界事务契约。
谁来教哪个Token?面向科学推理的验证器门控多专家同策略蒸馏
提出VG-OPD:按验证增益为每个token定位专家监督并加权,科学推理七项基准中五项第一。
GLARE:基于对抗奖励估计的生成学习用于社会动态预测
提出会议动态预测基准MDFB与GLARE对抗奖励估计模型,实用性、拟人度胜率达0.66/0.70。
Occamy-1.0:面向协同工作的开放帕累托前沿 35B 智能
分阶段后训练打造低成本协同工作模型,在四项基准上处于成本-性能帕累托前沿低开销拐点,并开源权重与部分数据。
语言不足以支撑定量推理,高风险领域需要大型定量模型
语言描述是有损编码,无法支撑定量推理;高风险领域需可复现、可溯源、校准不确定性的定量大模型。
读懂完整心脏:用于多模态心脏表征学习的潜在注意力掩码自编码器
LAMAE在潜在空间进行多模态自监督预训练,统一学习患者表征并容忍缺失模态,多项任务优于基线。
是运行框架还是模型?在污染受控的私有测试套件中隔离智能体编程的运行框架效应
在污染受控私有套件中,同模型对比未发现框架平均优势,任务类型效应相反,成本完成度也不同。
事件预测中语言模型与先验的能力门控池化
提出能力门控池化语言模型与先验,按结果估计领域权重并收缩重校准,提升事件预测;言语置信不可靠。
DU-NO:一种面向相位解析波浪建模的参数高效双U形神经算子
提出双U形神经算子DU-NO,仅浅层接入卷积分支,364万参数下误差较U-FNO降低14.9%。
从科学文献中挖掘:材料科学中原子层沉积与刻蚀的工艺模式
提出四个经专家评审的ALD/ALE实验与模拟JSON Schema,规范材料、工艺与结果,助力文献抽取与ORKG发布。
草拟—验证—修订流水线中的大语言模型能否消解指示语歧义?
跨阶段语境可致指示语漂移,模型消解能力差异悬殊,需各阶段显式指定指称。
当成功的知识图谱编辑挤掉正确答案:超越参数支持的排序级局部性
知识图谱编辑提升目标答案会挤掉正确答案;局部性须超越参数支持,审计排名位移,并报告纠正成功与损害。
面向原型概念的软符号接地
提出Soft-PNet,用原型引导的缓存采样与统一KL目标,免手工损失实现原型概念软符号接地。
从示例中学习符号约束表示:一种神经符号方法
提出神经符号自动约束获取框架,学习神谕模型模拟用户响应,结合符号引擎生成可解释约束网络,显著减少人工交互。
面向小样本传感器故障诊断的鲁棒原型网络
提出多回合原型网络MEPN,聚合多支持回合原型均值降低方差,传感器故障诊断显著优于单回合基线。
影响力推导的数据扰动能否实现机器遗忘?对三种可能角色的受控研究
修正DPL实现后,其在CIFAR-10直接删除任务中失败,效用效应不稳定,且逊于简单热启动基线。
面向大语言模型的鲁棒个性化对齐:缓解多轮对话中的人设漂移
提出CORE,分离单轮证据与持久人设修订,选择性更新真实偏好;发布PERSIST基准,提升对齐鲁棒性。
BlueLM-GUI 技术报告:面向自我改进移动 GUI 智能体的真机中心飞轮
35B-A3B移动GUI智能体以真机飞轮三原则自我改进,两基准达87.4与84.9。
基于独立腿部控制器的六足机器人步态去中心化演化
提出去中心化演化方法,独立优化六足机器人各腿控制器,生成稳定自适应步态并涌现协调行为。
从协作到能力:将路由式LLM专家内化为紧凑推理器
以专家增强强化学习与轨迹内化,使控制器在移除专家后仍能推理和写代码,数学基准显著提升。
TripPattern:一种基于模式的大语言模型文本水印方法
提出三组词表水印框架TripPattern:模式组交替嵌入,中性词保留自然性,统计检验可解释,兼顾生成质量与鲁棒检测。
AI 何时增强工作?一个面向人与智能体协作的工作流级框架
提出AI增强工作的六条件定义,主张超越任务自动化,聚焦人机协作重塑未来工作流,并以社会调查为例。
多智能体大语言模型预测中的信息专业化与受约束综合:2026年国际足联世界杯的前瞻性实时研究
2026世界杯56场研究显示:新闻专家预测最优,媲美博彩市场,但智能体预测高度重合,综合环节无增益。
面向代码重排序的置信度门控直推式测试生成
提出CoTT:仅当归纳置信度低时启用直推式测试生成,提升代码重排序效果并降低成本。