CypherTurn:对话式Text-to-Cypher评估的多轮基准与自主性分化
首个对话式Text-to-Cypher多轮基准,涵盖721会话5927轮;最佳执行准确率64.7%,会话正确率不足5%,并揭示自主性分化。
Chinese-Jev:将 System One 模型引入中文任务
提出 Chinese-Jev,统一中文数据处理与训练,覆盖通用及医疗、法律、金融,准确率超 Jev,最高提速 20 倍,支持端侧部署。
后训练在多语言推理中改变了什么?
多语言后训练中,SFT恢复目标语言推理但降准确率,RL仅当奖励含语言项才能兼顾正确与终止。
重复而非长度:分离神经文本到语音中的计数失败
重复而非长度:神经语音合成在重复短语时计数失败,匹配对照近乎全对,重复句k≥6仅18.2%完全正确。
AMU:个性化对话的准入与记忆更新——SLM引导控制的结构化记忆
AMU:SLM引导的结构化写入记忆控制,过滤准入、管理存储并去重融合,实验显示个性化记忆更干净可检索。
SRJudge:以选择性推理赋能大语言模型实现细粒度知识概念标注
提出选择-推理-评判三阶段SRJudge框架,缩小候选空间,提升细粒度知识概念标注性能。
通过在线策略蒸馏学习思维模式优势
提出ThinkOPD,通过轨迹-响应差异路由监督,在数学与代码任务上超越基线。
LatCom:面向高效多智能体协作的跨智能体潜在压缩
提出跨智能体潜在压缩框架LatCom,两阶段训练,在Qwen3-4B上推理提速2.46倍、输出token降70.3%且精度相当。
在自然语言自编码器中选择最具信息量的词元
470万解释表明,仅按聊天结构选位常优于计算信号;解释5%位置即可接近全量成功率,预训练语言化器还能揭示微调隐藏词。
Traverse:学习在长视野网络搜索中何时记忆、重置与重定向
提出自主搜索框架,含三状态与记忆工具,以强化学习训练并解决崩溃问题;35B模型BrowseComp得分72.83。
学习为长期记忆问答检索缺失证据
MERA分离全局记忆与问题证据状态,用强化学习训练轻量规划器检索缺失证据,0.6B规划器超越30B。
将学习问题编译为语言模型的适配程序
提出适配编译:预测候选程序多重效果并预选,跨五类任务接近穷举、优于默认,可摊销适配搜索。
双语音素 BabyLM 中的跨语言效应
训练音素输入的双语BabyLM,发现语法学习轨迹的母语差异强于正字法输入,早期词汇差异与音素库相似度一致。
用于端到端组合优化的VLM微调
提出视觉语言求解器,以视觉增强文本,经微调与强化学习训练,多任务解质量提升,复杂大规模问题增益显著。
看看你让我们聚类成什么样了:从Reddit话语中提取仇恨叙事
提出LLM实体-评价对叙事抽取,经Leiden聚类与LLM细化,识别Reddit仇恨叙事。
通过生成上下文知识融合弥合RAG中的语义鸿沟
提出KASB框架,融合生成与检索知识对齐查询与文档语义,提升段落选择质量,在三个开放域问答数据集验证。
大语言模型去品牌化:抹除商业身份并保留通用效用
提出大模型去品牌化任务,构建基准,指出遗忘模型不足,提出推理时MUTE方法,保留通用能力并消除文本品牌特征。
跟随实体:面向智能体搜索的语料地图
提出语料地图,以重复实体为锚构建实体-文档图,离线链接跨查询复用,提升证据发现和答案质量,且更省词元。
CredWise:面向可解释与可审计信用风险评估的可控智能体决策智能框架
CredWise整合风险预测、概率校准、可解释AI、政策检索、SQL分析与可控智能体流程,支持可解释可审计信用评估并保留人工终审。
SemOPT:通过奖励引导搜索修复基于大语言模型的优化建模中的语义错误
SemOPT用语义奖励模型与分层奖励引导搜索修复LLM优化建模语义错误,复杂基准准确率提升7.6%。
面向证据门控问答的机制边界对齐
将同一问题的支持与缺失证据变体配对训练,使模型仅在证据充分时作答,不支持回答率降低逾60个百分点。
你的基准并未饱和:用答案池化重振多项选择评估
提出答案池化:把同上下文各题选项合并成池,令模型为每题指定答案,无需新题即提升难度,揭示靠排除选项所得的虚高分。
相关性并非充分证据:在RAG生成前检测证据缺口
提出RINSE,生成前融合覆盖、可答性与小模型判断,检测RAG相关但不足的证据,六数据集领先。
RunyaNER:Runyankore命名实体识别中的辅助语言选择
首个Runyankore NER基准(23.7万标注词);辅助语言选择显著影响迁移,嵌入度量比类型学特征预测力更强。
Larry 让车停下,模型却毫无察觉:Transformer 对 M-启发式的盲视
研究表明,DeBERTa 等模型默认不运用 M-启发式,无法区分使役句式,仅在显式提示下可用。
谁让档案变暖了?大语言模型高估历史温暖程度
六个大模型从德国五百年文献提取温度指数时均出现随年代增强的暖偏误,相关性高不足以证明其可靠。
罗生门式维基百科:分歧历史叙事的数据视角主义分析
分析五语维基中罗马尼亚争议事件叙事分歧,发现引用隔离与地缘政治波动,提出Peace-Maker和解流程。
从失调到编排:同策略蒸馏中的教师干预
提出MAESTRO,用局部策略分歧自适应教师接管与生成时长,在八个数学推理基准领先,训练长度降67.3%。
E-MoE:面向非因子化扩散语言模型的增强型混合专家
基于MoE路由的离散共享隐变量,将反向过程建模为因子化分布混合,提升少步生成且不增参。
评估受监管智能体AI中的有限自主性:一个带有宪法奖励、升级标签与运行时治理的诊断测试装置
提出诊断框架,用六类信号与运行时治理评估受监管智能体有限自主性;小规模试验显示配置方差可压倒调参效果。
共语言学:AI增强的语言学理论构建
AI作为共同科学家参与语言学理论构建与评估,加速理论显式化、比较与提出,但人类仍居核心。
哪种莎草纸文献HTR才够好?希腊语文本四项纸草学任务的字符错误率容忍度
以1–50%字符错误率测试希腊纸草文献四项任务:分类容忍20%,定年仅3%,含错重训可缓解性能下降。
正交却耦合:面向模型合并的几何分量解耦
DiGA以预训练权重为参考,将任务向量正交分解并分组件聚合重组,缓解跨组件耦合,提升模型合并性能。
语料库引导的双路径传播用于图检索增强生成
提出NexusRAG,用语料级实体邻域结构引导语义与结构双路径传播,提升多跳检索证据召回率。
System One 模型 Jev 的评估与基准测试
零样本评测 Jev:37 个数据集多数优于 Qwen/Gemma,概率校准良好,支持选择性预测。
读者熟练度塑造逐层惊奇度特征
词汇熟练度影响LLM惊奇度的分层预测深度:低熟练读者首遍注视的预测深度更深,总注视时长亦然。
配对难度至关重要:重新审视成对式LLM评判评估与一致性
现有评判指标多受近秩差配对主导,不一致实属必然;排序信号来自大秩差配对,故应按秩差条件化评估。
要纠正,不要删除:用纠正性监督缓解涌现性失准
微调有害数据可致涌现性失准;将中毒样本改为纠正答案比删除更能降低失准,并提升医疗回答。
Billiger.de 产品:双语实体匹配基准
发布德英双语实体匹配基准,覆盖13类商品,含难例,验证显示其比现有基准更难。
问题接力中的魔鬼:源条件接力引导缓解音视频大语言模型幻觉
揭示音视频大模型中问题接力致源混淆定位幻觉,提出免训练源条件接力引导,显著缓解源混淆定位幻觉。
E-CONAN(蕴含、矛盾与中立)诊断数据集:探究阿拉伯语自然语言理解中的语言现象
提出阿拉伯语NLU错误分析层级及E-CONAN诊断数据集,评测14个模型,发现大模型常识强、句法弱。
学会从上下文学习:基于扰动公共文档的合成训练
用扰动公共文档合成训练数据,免人工标注,显著提升大模型从上下文学习能力。
考问翻译:一种基于证明器的自然语言→一阶逻辑评估指标
提出SIV,用定理证明器生成正反探针评估NL→FOL翻译,检测漏译与多译,评分贴合错误严重度并定位错误。
ManiEdit:从流形视角出发的语言模型序列化非结构化知识编辑
从流形视角重构编辑,提出ManiEdit,通过枢轴定位与流形感知保持,显著提升序列化非结构化编辑效果。
Tsubame:基于扩散的推测解码中的树重放
Tsubame采用两遍树推测解码:先冻结上下文感知拓扑,再重放采样节点,结合扩散草稿,无损提升接受长度与吞吐。
Jev 在语音神经假体重评分中媲美 7B 语言模型
Jev将重评分转为单次类型化决策,无需GPU,在ALS语音神经假体上词错率7.5%,媲美7B模型。
安全重构:通过掩码扩散生成式建模构建强大安全护栏
LLaDA-Guard用掩码扩散按标签重建文本,安全基准领先、校准更优,可定位并改写不安全提示。
重置不等于恢复:通过谄媚迟滞评估虚假对话上下文中的可恢复性
受用户错误压力后,普通重置难以消除谄媚偏差;仅删除/截断压力历史或引入可信证据可有效恢复。
一个模型不成众:多LLM与方面条件化的多样化评论生成
多模型与方面条件生成能更贴近人类评论多样性分布,在预训练与下游任务中均有效,但人类多样性仍难企及。
弥合跨方言鸿沟:以查询计划作为Text-to-SQL的可移植接口
让模型生成方言无关的关系代数查询计划而非SQL,可近乎一致地恢复跨方言可移植性,微调后效果优于SQL监督。