从装饰性到承重性:任务难度塑造思维链的因果作用
思维链的承重性随任务难度变化:简单任务被绕过,困难任务中错误逐步传播,为思维链监督带来结构性挑战。
鲁棒失败,保守修复:从跨模型失败中进行文本知识蒸馏
提出RFCR蒸馏法,从跨模型失败中提取规则并收紧适用边界,在BBH上准确率提升2.75个百分点。
异构批处理的高效迭代检索
Orthrus在统一推理循环中异构批处理嵌入与生成,吞吐提升1.28–4.52倍,p99延迟降55.8%。
从离线代理到在线决策:对话式AI的分层参与度评估框架
提出分层离线代理框架,可实验前预测对话AI在线参与度;冻结后113组F1达81.1%,原始仅34.3%,无误判。
ShowTellArena:从演示中评估业务工作流理解
推出ShowTellArena基准与数据集,含50项业务流程任务和502道题,评估智能体对演示讲解的理解。
Spectra:面向自动化KYC文档处理的规则驱动LLM流水线
规则引擎结合LLM自动处理KYC文档,分类准确率100%、抽取89.4%,人工复核降96%。
恢复智能体主权:通过对比认知解码缓解共识悖论
提出对比认知解码(CED),零样本抑制LLM从众偏见,缓解共识悖论,准确率最高提升30.75%。
RAG-NAROK:基于来源特定反驳的检索感知型RAG知识语料投毒
提出RAG-NAROK,利用RAG检索透明性提取来源身份,动态生成针对来源的反驳文档,借时效与权威偏见操纵生成。
迈向参与式语音数据集策管:酷儿案例研究与概念框架
酷儿案例表明,需参与式语音数据集策管,并提出社区界定、项目构思、参与方式与个人自主框架。
SMTB:带紧界的快速结构映射
提出SMTB算法,较SME快5–15倍,大嵌套域映射能力提升约50%,适用于任意关系图。
弱监督量子误差缓解
无需理想标签,以启发式信号和概率标签模型反演读出误差,在IBM五比特电路上显著优于最强解析基线。
基于测试驱动的LLM智能体轨迹早期结果预测可靠性审计:目标特定校准迁移在单一基准内持续存在
审计显示,LLM智能体轨迹早期预测仅在两个特定目标组合出现持续校准迁移误差,跨基准未复现。
基于零空间基LoRA的强化学习后大模型推理保持微调
提出NB-LoRA,将LoRA更新经推理激活的近似零空间重参数化,微调后RL大模型时保持其推理能力,适配性能不降。
ArticleMiner:本体引导的科学出版物知识图谱构建
提出ArticleMiner:任务模块定义领域语义,融合多解析器与LLM证据构建知识图谱,163篇论文上优于同LLM基线。
思维之梯:逐步简化推理轨迹的自进化课程
LoT框架融合渐进式问题重写与自进化课程,显著提升中小模型数学与多跳推理,优于知识蒸馏。
ChatT2:一种用于开发面向天然产物领域研究的大语言模型智能体的自适应框架
ChatT2是基于大语言模型的多智能体框架,面向细菌II型聚酮等天然产物研究,助力专家与新手。
所见非所感:合成消费者何时能、何时不能预测试视觉营销
合成消费者预测试视觉营销效应复现差,且低估消费者异质性,需校准干预部署协议。
ToolCompass:引导工具试用,而非抑制试用
提出后训练框架ToolCompass,按功能组织工具调用表示,引导试用并迁移至相似未见工具,实验显著提升。
有品味的智能体:长时程任务中品味的度量与提升
提出Taste-Bench评测长时程决策品味,顶尖模型仅59.7%;品味可蒸馏训练,提升未见任务表现。
任务状态对 LLM 智能体的影响应有多强?
四种状态传递强度对比:展示状态不可靠,自写台账反优于清单;指令效果取决于模型服从度;强制执行无需服从,却受状态与匹配正确性所限。
OmniFysics-Nano-V2 技术报告:跨模态理解物理世界
提出紧凑全模态模型,结合物理感知数据管线与两阶段强化学习,21项基准中17项领先,提升物理世界理解。
TCMaster:面向多源中医药知识图谱的置信度感知查询与工作负载引导物理设计
TCMaster实现多源中医药知识图谱的置信度感知查询与负载引导物理设计,显著加速查询并提升问答准确率
模拟社会的局限:后训练与调查微调如何抹除跨文化差异
后训练使LLM模拟社会出现"共识坍塌",压缩群体意见离散度,以多样性换共识,点准确率不足为评判标准。
部分可观测性下的神经符号动作模型学习
提出NeSyAM神经符号建模范式,实现部分可观测下的动作模型学习,并在六个视觉规划域验证其有效。
迈向全维度GUI智能体导航:掩码轨迹预测
提出MaP框架,以掩码轨迹预测与角色感知适配器统一多任务GUI导航,显著优于直接混合训练。
聚合智能体轨迹何时可诊断?流量支配的解释与校准弃权
研究聚合智能体轨迹的可诊断性:以参考与运行时双重门控确立暴露,再评分,无法支撑时弃权。
VideoX-Qwen:以数据为中心的指令驱动视频编辑
构建超120万条视频编辑数据,提出统一Qwen-Wan编辑器,11项指标中9项最优。
CausalLoss-Fin:将金融智能体的损失归因于决策与基础设施故障
只归因智能体动作会漏判基础设施故障,损失被全额记到决策上;本文对决策与故障双重干预,精确三分解损失。
编码部分—整体层级结构的规范锁
提出规范锁原语,以高维相位差编码部分—整体层级,用自底向上/自顶向下神经场达热平衡,并关联心理旋转。
ChainUQ:面向大语言模型的推理一致性感知不确定性量化
ChainUQ通过推理链一致性校准,提升LLM响应级不确定性估计,AUROC平均提升3.1%,ECE最高降低45%。
RankCert:模拟学习者何时能安全选择AI导师?结构不确定性下的稳健决策认证
多准则一致时RankCert才认证八种辅导策略,否则弃权;仅3.75%稳定场景通过,安全仅限基准内决策。
面向隐私感知多智能体LLM工作流的选择不变通信编译器
提出选择不变通信编译器,消除多智能体LLM工作流授权后选择通道泄漏并保持协议效用。
FusionMMT:面向核聚变的统一多模态多任务学习框架
构建EAST-VTD640数据集,提出首个统一多模态多任务框架FusionMMT,用于核聚变诊断。
架构师、对抗者与评审者:大规模闭环生成符合标准的评估题目
CLAIM闭环生成标准对齐评估题,通过率97.8%,但评审相对、一致性弱;选择题饱和,填空题难。
当大数据变成诅咒:空间异质性与被动声学监测数据学习的局限
被动声学监测数据空间异质、部署聚集,随机窗口验证高估跨站点迁移,需依赖感知验证和独立空间采样。
VACS:面向多智能体推理的价值对齐组合式屏蔽
提出VACS四层框架,对齐智能体价值、组合安全防护与冲突消解,提升准确率并降低逻辑不一致。
EADC:大语言模型高级与深层合规性评估
提出EADC基准,基于合规知识图谱与专家构建4435+问答,揭示大模型深层合规盲点。
自由配方极限:每个配方效应都在度量理想化学习者的哪条前提失效了
微调显示:配方搜索受可达集直径与分辨率限制,顺序效应不稳健,一致性是系统变量,规模是唯一可靠收益。
TREND-10K:基于偏好驱动媒体的下一代视频质量评估综合数据集
提出TREND-10K,含1万视频,覆盖趋势与静态内容,支持技术、美学与AIGC痕迹三维VQA评估。
FISSION:面向机器人检测的标签增强
FISSION将账号活动拆为正标签子账号生成标签,训练模型检测,在维基傀儡与X机器人上超越先前方法。
干扰的来源至关重要:自适应调节中的外部、内部与控制生成噪声
干扰来源与时机决定暴露和调节负担:持续内部干扰影响最大;控制干扰成本升高致非单调响应并抑制纠正。
双前沿:智能体何时能信任其世界模型?
提出“双前沿”原则:仅当预测优势超过世界模型误差认证界时才采纳决策,否则转为模型验证,保证回报不降。
解耦不是识别:下一词预测中的监督式证据学习
审计下一词预测中的证据学习:解耦不识别集中度,隐式训练无计数信号,显式监督可泛化但校准与效用仍失败。
面向伯努利奖励的改进型多人多臂老虎机算法
用KL散度界替代Hoeffding界,为三类信息不对称伯努利多人多臂老虎机提出更优算法,遗憾更紧。
可靠性理论在AI控制中的应用
运用可靠性理论分析AI控制防御,揭示失效域决定罕见故障抑制效率,指引组件优先改进与隔离。
AI研究智能体的递归自我改进
AIDE^2自主改写自身代码并择优保留,8天连获七项改进,迁移至多领域且减少奖励黑客。
SWE-Serve:面向生产推理服务的智能体工程基准测试
SWE-Serve 基准含 53 个 SGLang 生产推理任务,揭示本地通过而生产出错的差距。
面向NOMA网络资源分配的中性原子量子优化
中性原子量子优化求解NOMA上行最大接入问题,重构为最大独立集,用里德堡原子阵列编码验证可行性。
量子辅助的能量采集共生无线电网络中的活跃设备检测
提出能量采集NOMA共生无线电系统,用Grover量子搜索检测活跃设备,复杂度较最大似然二次降低。
CliffCompaction:面向长周期编程智能体的低成本上下文压缩
仅截断丢弃、不改写重述,忠实压缩使成本降低50%,长周期编程智能体性能反升。