Edu-QuRating:基于蒸馏成对判断的多维教育数据整理
提出多维教育数据评分与整理流程,蒸馏大模型成对判断评分器,改善预训练并提升GRPO后训练效果。
跨数据库查询与网页搜索的混合深度研究基准
首个融合网页搜索与SQL查询的深度研究基准,含380个任务,顶尖模型通过率仅50-54%,方向性推理尤难。
机器言论的嬗变
本文追踪算法输出的三重演变——搜索引擎、社交媒体到生成对话系统,揭示机器言论嬗变与法律的建构作用。
SWORD:基于维基数据的扭曲揭示大语言模型在拒绝事实错误时的隐藏跨语言不一致性
SWORD借维基数据扰动评估LLM跨语言拒错,发现模型更信语义合理错误,亚洲语言差距达28个百分点。
超越高频词:基于可解释单义特征的主题建模框架 MonoTM
MonoTM 将主题推断与语义解释解耦,借助稀疏自编码器提取的单义特征构建主题描述,比单个词更具语义价值。
为检索增强应用还原日本新闻中省略的时间表达
提出规则流水线jaROTE,借助发布日期还原日本新闻中省略的时间表达,提升时间约束检索性能。
利用并行解码扩展电商属性抽取
两阶段LLM先挖掘购买区分属性,再用微调Qwen3-4B并行解码抽取,准确率85%、成本降92%。
SEA-SpeechBench:面向东南亚地区的大规模多任务语音理解基准
首个覆盖11种东南亚语言的大规模语音理解基准,含9类任务近10万样本,暴露时间理解与情感识别短板。
X2-NativeCursor:面向增量文本流式编解码 TTS 的原生 Token 文本进度跟踪
提出 X2-NativeCursor,基于原生 Token 在解码前跟踪流式 TTS 文本进度,低误差、高实时性。
哪些医学问题值得配推理解释?面向鲁棒问答的扰动敏感选择
提出RMS-RSP,按推理解释词扰动敏感度筛选医学QA样本做解释监督,提升格式扰动鲁棒性而非普遍准确率。
当审计者开始捏造:大语言模型检测植入式文档污染时的批次规模退化与自信幻觉
LLM审计文档时检测能力随批次增大而崩溃,模型不弃权反而自信编造虚假污染项。
BuzzASR:100多个单语语音识别模型组成的集群
BuzzASR为102种语言微调单语Whisper模型,77种语言超越Whisper-large-v3,字符错误率平均降低逾2.8倍。
面向引用图的自动演化树生成
EvoTree解耦概念骨架与时间细化,自动生成引用图演化树,发布首个11个AI子领域标注基准,指标领先。
循环 GPT-BERT:小规模语言建模中以参数换计算
循环 GPT-BERT:4×12 仅 1218 万参数,BabyLM 小规模评测媲美 10M 基线。
ROAM:通过语义关系为智能体实现原子记忆的鲁棒组织
ROAM以语义关系分类原子记忆,按主证据角色组织并融合,仅检索主视图,答准率最高提升29.8个百分点。
利用细粒度纠错提升咨询服务中的韩语语音识别
构建首个韩语对话级ASR纠错数据集,提出DCSC文本后编辑框架,取得最优性能。
SocialRL:通过多轮强化学习与奖励设计提升大语言模型社交智能
SocialRL多轮强化学习,借PPO回传延迟奖励和六维过程奖励,社交目标达成率提升9.2个百分点。
CARRE:面向可解释流失干预处方的反事实行动检索与理由评估
提出三阶段CARRE,融合检索、成本感知反事实评分与大模型推理,实现可解释流失处方并优于SHAP。
SymbolicLight V2:面向低能耗语言推理的混合神经形态架构与稀疏执行
混合神经形态与稀疏执行在FPGA/ARM降低语言推理能耗、提升吞吐,但质量不及同预算密集模型。
HyperTrace:基于假设的在线大语言模型个性化偏好追踪
HyperTrace免训练,以自然语言假设追踪短期意图与长期偏好,SMC式重加权更新,提升个性化对齐。
StreamAlign:流式文本对齐语音分词
StreamAlign实现流式文本对齐语音分词,融合字符与词级对齐并预测词边界,延迟降至270ms,识别与语音生成性能领先。
MUCnoHARM@GermEval 2026共享任务:基于检索的上下文学习用于侮辱性犯罪检测及其局限
检索式上下文学习检测侮辱罪:少样本优于零样本,检索示例收益甚微,模型选择最关键;仅适合辅助筛选。
S³-Bench:评估语音交互模型作为科学语音助手
提出S³-Bench,覆盖10学科的科学语音问答与多轮对话评测,揭示识别、推理与响应生成的局限。
被告陈述何时起作用?LLM模拟陪审员中的偏见与说服研究
提出JuryBench,20个LLM模拟陪审显示:情绪说服有害,背景契合与意识形态显著影响裁决。
MedDeID 支持基于真实或合成训练数据的本地可控临床文本去标识化
MedDeID支持本地部署,用真实或合成病历训练,标识信息召回最高98.9%,实现机构自主去标识化。
面向重音感知的句子级菲律宾语G2P:基于弱监督ByT5微调
弱监督微调ByT5实现句子级菲律宾语G2P,音素错误率降至0.54%,重音分类多数正确,malumi词仍难。
语言模型中的深层与浅层偏见
提出偏见深度分数区分深层与浅层偏见:仅约四分之一偏好经重构仍存,深层偏见源于预训练且更难消除。
通过加入少许 SALT 提升跨语言词元表示
提出轻量级后训练法SALT,向句编码器注入跨度级监督以提升跨语言词元表示,多项基准最优。
多功能嵌入模型用于科学出版物记录中资助机构名称消歧
提出多语言多功能资助机构名称消歧框架,微调嵌入模型准确率超0.90,优于通用大模型,应用于生物多样性保护。
对比投影:用差分 Logit Lens 解读 Transformer 内部
提出对比投影:差分 Logit Lens 读取 Transformer 内部,发现同一区别的 token 表征随网络而异。
VLX-VR:一种具备智能体意识的视频推理模型
提出具备智能体意识的视频推理模型VLX-VR,基于思考-记忆-观察循环与强化学习,在MINERVA达78.79%。
答案稳定,推理未竟:为何自洽共识不是安全的提前退出信号
预注册扫描3520条自洽停止规则无一通过:答案一致不等于推理终止,提前退出会截断后续修正。
SalamandraTA 在 WMT 2026 术语共享任务:难例是更好的老师
只保留模型译文与术语表冲突的样本微调,术语准确率由78.7%升至89.9%,WMT26达94.2%。
5-Dialects-BN:揭示转写对孟加拉语方言大语言模型的影响
首个孟加拉语五方言多标注基准,对齐罗马转写、标准语、英语和主观标签,支持方言识别、翻译与LLM微调。
YallaMorph:评估大语言模型阿拉伯语形态生成的基准
提出YallaMorph基准,含超60万条目,评测大模型阿拉伯语形态生成;黏附、未见及罕见形态仍难。
面向偏好后训练中多样化成功轨迹的直接多样性优化
提出DDO离线后训练法,融合分歧树收集与参考相对目标赔率,提升成功率与成功策略覆盖,优于对比方法。
Φ-Bench:大型语言模型能否工程化其赖以运行的基础设施?
提出Φ-Bench,覆盖LLM基础设施栈,评估从内核到端到端的长周期工程能力,揭示前沿模型局限。
ProbPlug:面向LLM二分类可靠置信度的插件式不确定性网络
ProbPlug用冻结LLM的token特征与自注意力预测输出正确性,无需修改模型即提供可靠置信度。
以数据为中心的金融推理后训练:挖掘、蒸馏与可验证学习
提出以数据为中心的流水线,挖掘蒸馏生成金融推理数据并筛选后训练;普通SFT下降,保留式适应提升。
谁在论证什么?政治辩论中的论据-实体联合检测与分类
构建实体增强数据集DNE-ElecDeb,提出JAET生成框架,联合检测辩论论据与命名实体,F1相对提升超27%。
从检索到权重:基于个体文本语料的小语言模型参数化个性化
用DoRA适配器将个体文本语料写入小模型权重,实现个性化;但通用知识测试中仅改善对数损失匹配,准确率未提升。
主动适应而非静态防御:对抗性微调中预防性引导的时间动态
预防性引导靠主动适应而非静态防御;提出渐进强度调度PIS,提升安全鲁棒性并减少有害特质。
情感政治:美国国会中的情绪表达与立法效能
分析美国国会170万篇演讲发现,情绪表达日益增强;热情与自豪提升立法效能,愤怒则相反。
透过镜子:直接读写Transformer
无需训练,直接读写Transformer参数与激活,少量组件承载预测,可安装关联并定向编辑注意力。
基础模型能否审核在线内容?评估指令驱动与示例驱动的策略操作化
在Bluesky新基准上,基础模型审核F1达0.60,远超平台的0.22,指令与示例驱动效果相当。
知识图谱问答中大语言模型的答案路径与依据指令
图检索增强问答中,答案路径是否入提示词最关键,接地指令次之,语法、顺序与子图规模无可测影响。
面向VLM幻觉检测的双词元特征与大小模型集成
提出双词元特征小模型与400B零样本大模型集成的VLM幻觉检测系统,融合OCR与合成数据,排名靠前。
DiSCo:一种分布优先的引导与文化先验评估框架,用于衡量大语言模型中的文化偏好偏差
DiSCo分布优先框架隔离LLM默认文化先验;测评显示英美占约35%选择,提示引导反而扩大文化差距。
语义瓶颈:利用语义表征进行非侵入式语音解码
提出Brain2Semantics2Text,将MEG信号映射到语义空间再还原文本,绕过词级对齐,提升非侵入式语音解码的句子级效果。
GANDR:面向可验证法律答案生成的主张审计
GANDR以双智能体逐条审计法律答案的主张与引用,185项基准严格准确率70.8%,领先基线11.3分。