MTAC-IFBench:多轮智能体编程中的指令遵循基准评测
提出MTAC-IFBench多轮编程指令遵循基准,含6大类18子类约束,平均7轮91项,揭示长交互下遵循力骤降。
四十度蓝:通过模式条件强化学习实现质量—多样性对齐
MoDA:模式条件强化学习对齐质量与多样性,配合质量门控,兼顾通用能力与开放探索。
能否在没有人工参考译文的情况下对古典文本中的大语言模型翻译错误进行分诊?——以巴利语到英语翻译为例的源文新颖性、GEMBA评分与预算化审校
研究以巴利语英译测试无参考错误分诊;更强模型GEMBA评分最优,审前10%捕获81.6%主要错误,并提出预算化审校流程。
语料库对齐的奥斯曼体—标准体《古兰经》词语映射与确定性诵读校验器
发布2290对奥斯曼体—标准体词映射与归一化流程,构建无大模型的确定性诵读校验器,准确率98.4%
超越深度与宽度:流式测试时计算中的信息-松弛困境
证据顺序改变策略:早算余量多但证据不全,等待信息全却压缩余量,即信息松弛困境;资源约束下可信按时响应
SALUTE:面向国防领域的大语言模型基准评测与适配
提出SALUTE框架,构建国防语料、指令与偏好数据集及基准,经多阶段后训练提升国防领域LLM能力。
魔镜,魔镜:小型指令语言模型中的提示复读现象
研究多个家族小模型发现,提示复读主要源于模型归纳头机制,而非训练数据泄漏。
Salesforce Koa:面向智能体工具使用的企业级语言模型
以GRPO强化学习后训练开源模型,借模拟到奖励流程提升多轮工具调用与企业智能体能力,无需客户数据。
CITECHOICE:文档呈现方式如何在智能体搜索中重新分配引用信用的因果审计
因果审计显示,结构化呈现使目标每答案引用增0.5次,集中引用信用,但不增加总引用或可靠来源准入。
DA-DLM:在扩散语言模型中显式建模词元依赖
提出DA-DLM,用位置导向DAG为扩散语言模型显式建模词元依赖,提升连贯性,少步去噪更优并保持并行。
翻译“翻译器”:拆解英语强制的智能体间通信成本
多智能体LLM强制英语通信时准确率较母语管道低13–30.6个百分点,即“英语强制税”,翻译损耗为主因。
通过推理过程错误分类提升大语言模型的数学推理能力
人工分析大模型数学推理错误,归为21类并找出高频类型,设计聚焦8类错误的提示词可提升推理性能。
当错误的键胜出:理解与检测大语言模型中的幻觉
大模型幻觉源于预训练关联竞争;提出关键词扰动检测法,AUROC达0.910,并归纳四类幻觉机制。
MoME:面向上下文感知稀疏查找的混合记忆嵌入
MoME 以多记忆槽门控按语境检索词元,缓解多义合并,提升多种预训练效果并具语义可解释性。
EMR:基于经验挖掘与复用的自进化医疗多智能体系统
EMR通过分层经验库挖掘复用临床经验,模拟多学科会诊并持续自更新,性能超越现有医疗多智能体基线。
无损投机解码有多无损?数值精度在 Orthrus 中的作用
Orthrus 无损性依赖数值精度:BF16 仅约 45% 轨迹完全匹配,FP32 全匹配;下游指标未必退化。
MUSE:面向氛围叙事的理论驱动故事引擎
MUSE将故事理论原子化为创作决策指南,以智能体编排贯穿构思到修改,四模型上写作与一致性均显著提升。
SlopShape:识别AI生成的商业网页内容
仅凭结构特征即可识别AI商业文本,改写后准确率仍达98%,并能溯源生成模型。
中文标题:面向大语言模型高效潜在空间推理的动态语义压缩
提出DSEI:动态压缩文本为潜在语义,实现片段级推理,困惑度降48%,提速2.5倍,内存降90%
当智能体放缓:通过每Token Elo分析理解LLM智能体的测试时策略
提出每Token Elo分析,发现LLM智能体测试时增益递减、低于独立采样;按拐点并行分配可提升Elo。
土耳其语MMLU Pro:可追溯的选项增强及其在土耳其语多项选择评估中的效度局限
构建可追溯的土耳其语MMLU Pro:加选项虽降分,但未必提升评估效度。
温度脆弱性与截断采样的条件性收益
高温令部分模型准确率骤降17-38点;截断采样仅当高温显著损害性能时有益,温度稳定时无增益。
什么限制了我们?分析NLP研究中自我报告的局限性
大规模分析ACL与EMNLP论文的局限性章节,用新型人机混合编码框架揭示自报局限趋势与写作模式。
人工创业认知:定位并因果性地调控大语言模型内部的“机会识别旋钮”
在多个大语言模型内部定位并因果调控“机会识别”表征方向,首次对创业构念的内部表征实施干预。
符号学关系与证明方法:基于大语言模型的跨体裁论证结构研究
受四大修辞格启发,四种符号学关系对应四类证明方法;大模型跨体裁分析发现,数学用全四种,法律与日常几乎仅用推理。
三思而后行:基于内部归因信号的事实性解码
提出DescaPE解码框架,利用模型内部信号抑制幻觉生成,在三个大模型上提升事实性,延迟仅1.10倍。
AI诗歌的作者归属与美学评价:以俳句为例的案例研究
大模型生成俳句的人类识别率近随机;美学评分预测“像人”判断,却与真实作者识别相分离。
我们能信任评判者吗?通过答案扰动验证事实性评估方法
提出元评估框架,用受控扰动测试事实性指标,发现流水线式方法比LLM评判更敏感,并提出更经济的新指标。
不要数编辑次数,只看结果:基于奖励的语法纠错评估
提出源文条件奖励评估器SURE,经同源偏好训练,联合学习整体奖励与多准则监督,改写过纠错表现更优。
精神病涉及连贯言语中的信息压缩缺陷
精神病患者连贯言语信息压缩不足,与语法组织有关,大模型显示惊讶度差减小、内在维度降低。
融合大语言模型知识用于自动语音识别
提出模型合并法:将外部语言模型融入LLM-ASR参数,推理无额外开销,域适应任务一致提升性能且不损速度与内存。
为每种语言定制分词器:面向高效多语言大语言模型的模块化分词器
提出模块化分词器框架,为语言子集提取专用分词器,采样批次并限制词汇,降低内存加速推理。
以观者之眼:多模态性别歧视检测的生物特征与人口统计条件化
VANGUARD以人为本,融合标注者心理与人口统计特征,构建多模态性别歧视检测框架。
RESKILL:面向交互式语言智能体的显式失败归因与结构化修复
RESKILL将失败归因、补丁选择与重测反馈显式联动并跨轮更新,六项基准平均成功率提升3.7个百分点。
共情可调控但具多轴性:大语言模型中的机制几何与人设效应
激活引导可调控大模型共情,但方向部分可分且有串扰;人设影响大,机制子空间仅解释3%,显示共情多轴可调。
被迫流离失所与FCV文档中的数据集提及抽取:基于大语言模型标签精炼的弱监督框架
弱监督框架用LLM精炼标签,从被迫流离失所与FCV文档抽取数据集提及,精确率74.1%、召回率70.5%。
什么算错误?标注《古兰经》背诵转写中的诵读事件
标注100例《古兰经》背诵转写、162个事件;六次智能体试跑显示检测近乎饱和,难点在跨度与标签惯例。
R2VC:融合检索、验证与置信度校准的模块化事实核查
R2VC融合检索、验证与置信度校准的模块化事实核查框架,FEVER准确率提升13.74%。
Chopthin共识幂采样:一种保持多样性的LLM解码方法
提出CCPS方法,通过Chopthin重采样和语义多数选择保持推理路径多样性,提升LLM推理准确率。
通过声学掩蔽量化辅音对词可懂度的贡献
提出用声学掩蔽与ASR识别率量化辅音贡献,验证其与音素频率、功能负载相关,且贡献因语言而异。
人群层面的感知食物可及性测量揭示地理邻近之外的障碍
利用2.5万条谷歌评论测量食物可及性五个维度,揭示地理邻近之外的障碍。
压缩的代价:事实性幻觉的率失真极限
事实幻觉除源于覆盖缺失外,还因有限记忆压缩使已观察事实只能有损存储,并受率失真下界约束。
局部编辑,全局涟漪:面向工作流合成的回放信息驱动策略适配
提出RIPPLE,分离编辑位置与组合安全,回放筛选安全编辑,工作流合成验证成功率提升23.1%。
先修复再强化:面向多跳问答的上下文增强知识图谱推理
为知识图谱三元组附加支持上下文,提出上下文增强训练框架,结合自适应修复与低跳强化学习提升多跳问答。
GAUGE:任务型智能体的用户模拟评估中何时不应信任LLM裁判
GAUGE:LLM裁判与任务成功脱节,强智能体间排序失效;先校准后信任,无裁判完成位预警截断退化。
基于表示的掩码扩散模型
提出基于表示的掩码扩散模型RMDM,用全局语义表示指导并行词元更新,显著提升生成质量,尤其少步采样。
ESTS 在 WMT26:面向模型压缩的路由感知专家剪枝
ESTS提交六个基于GPT-OSS-20B的压缩系统,采用路由感知专家剪枝、恢复微调与MXFP4量化。
气候相关文档中社会临界点证据的自动检测与结构化:一个模块化AI框架
提出模块化AI框架,段落级检测并结构化气候文献中的社会临界点证据,融合分割、分类、改写、评分与检索,性能优于基线。
打破Token上限:蒸馏更小更强的字节模型
蒸馏显示:字节模型初期落后Token模型,但随算力增长反超,数据效率高6倍,下游性能上限更高。
HypoKG:超越端点知识的证据约束型生物医学假设生成
整合三大生物数据库构建知识图谱;完整机制路径引导大模型证据约束推理,仅给端点所得假设高分却证据薄弱。