LOCKR:一种用于检测与修复扩散语言模型中“稳定但错误锁定”的隐藏状态轨迹引导规划器
扩散语言模型易早期锁定错误答案,LOCKR以隐藏状态轨迹引导选择性推理修复,准确率提升2.21–5.37个百分点。
超越重叠:估计基准测试暴露的因果效应
LeakScale框架量化基准测试暴露因果效应,暴露使准确率提升7.17–27.31个百分点。
相遇、比较或弃答:面向知识格上确定性多跳问答的 LatWeave
将知识组织为多维知识格,把多跳问答编译为 meet、compare、abstain 三个确定性算子,答案生成零 LLM、可逐步复算审计。
用户生成文本的音素化:基准、分类体系与组合方法
发布首个英越韩用户生成文本G2P基准UGTPhon及分类法,用规范形式组合解码缩小性能差距。
Transformer 语言模型中的序列计算蒸馏
用轻量合并模块将多词元压缩为代理嵌入,推理时缩短序列最多40%,精度损失小且无需重训。
AraGenre 2026:分层定义引导的阿拉伯语体裁分类共享任务
AraGenre 2026设分层定义引导阿拉伯语体裁分类,零样本标签泛化,最佳分层宏F1为0.7352,细粒度分类仍难。
注意力路由早期即趋稳定:面向循环语言模型的工作集推理
注意力路由在循环深度中早期稳定;WISE前期全局注意力、后期复用稀疏工作集,基本保持质量并提速。
规划式测试时扩展与协同推理路径
提出PTTS,以规划器生成大纲引导分支走向不同推理路径,替代独立采样,显著提升数学推理性能。
面向越南劳动法的跨语言法律问答:检索、翻译与验证器引导的纠正
构建越南劳动法双语问答评测集,发现密集检索优于稀疏与混合,验证器引导纠正仅提升引用保真度。
沉默与重叠皆非失败:全双工语音对话模型中话轮转换的意图条件化评估
提出TACT基准,按说话人意图评估全双工话轮转换,与人类判断相关性0.81,优于二值指标。
MORSE:基于逆向评分的多上下文排序,实现证据保留压缩
提出MORSE方法,通过逆向评分调整上下文顺序,缓解信息抢占,提升证据保留与多跳问答效果。
基于混合RAG与本地部署大语言模型的处理活动记录(RoPA)自动提取
为越南RoPA合规,提出混合RAG与本地LLM自动提取系统及基准,端到端覆盖过半,本地模型与云端相当。
一个适配模型能否包揽一切?客服大语言模型的微调策略选择
基于13个模型、8个客服数据集训练超200个检查点发现:多任务全量微调是各规模下最稳健的默认方案,专家模型跨任务易失效,LoRA顺序微调与模型合并可缓解。
Ruby-ASR:面向正字法与词汇读音联合识别的证据保留式监督
Ruby-ASR将日语ASR目标细化为书写片段与词汇读音绑定序列,提升读音恢复且不损正字法转写。
引发行动的引导:多模态网页智能体中引导与行动互增强的离线研究
提出WebMRE离线基准,证实引导与行动互增强,引导是因果指令通道,微调模型超GPT-5.5等。
PRISM-VLM:面向紧凑型视觉语言模型的多轴判别性基准
提出多轴基准PRISM-VLM,沿七轴评分紧凑视觉语言模型并合成PScore,比单轴基准更可靠区分模型,揭示谄媚等行为差异。
路径至关重要:在知识图谱问答中超越答案准确率评估小语言模型
小模型在知识图谱问答中导航能力差异大,答案准确率与路径保真度有时偏好不同模型,需超越终点准确率评估。
当并行草稿模型遇上并行投机解码
提出DPara并行投机解码框架,复用并行草稿器,使扩散骨干预计算与验证重叠且无需猜测回退,在Qwen3-8B/14B上平均加速3.21×和3.52×。
不可作弊评测:基于动态压缩的语言模型评估
动态收集新文本,以压缩率评测基座模型以规避数据污染;压缩率随模型规模呈一致缩放趋势,并与MMLU准确率强相关。
EviStreams:面向医学系统综述的人在回路AI数据提取
EviStreams:人在回路AI平台,用于医学系统综述数据提取,含字段规范与盲法双审;字段规范比模型选择更关键。
ThaiTrees:跨领域泰语句法依存树
泰语跨领域依存树库,含3.42亿词元,覆盖新闻、维基、口语与社交媒体,附频率词典及CoNLL-U解析数据。
MWE-ECL:可恢复的长程上下文并不总能覆盖局部词汇先验
长程上下文可恢复不等于有行为影响;MWE-ECL显示检索成功仍难覆盖局部词汇先验。
Jev 能评判放射学报告吗?评估 System One 模型的临床事实性
Jev低成本判定放射报告事实一致性,优于开放NLI评判器,但复杂临床误差仍待精细评估。
当上下文误导时:大语言模型中的管辖式上下文学习
提出FakeContextBench并设计J-ICL,在提升上下文学习能力的同时增强抗误导性。
脑到语言解码:任务、信号、方法、评估、实际应用与未来
综述脑到语言解码,涵盖任务、信号、方法及评估,展望五级发展轨迹。
基于过滤机制改进LLM自主网页代理
针对原始HTML冗余干扰LLM代理的问题,提出基于DeBERTa和T5的检索过滤策略,将LLaMA-2-70B在WebArena成功率从1.97%提升至2.96%。
学会何时不理会:语言模型的选择性抗干扰预训练
SPAR选择性抗干扰预训练,用充分性门控与门控KL稳定局部预测,减少无关前缀干扰,提升长上下文鲁棒性。
相同分数,不同决策:评估 JEV 与语言模型在法律文档理解中的表现
比较 JEV 与九个语言模型在 ContractNLI 上成本、响应时间及重复请求正确率;总分排名不同于逐项判定正确性排名,需兼顾成本与稳定性。
SkillGym:将人类技能内化至大语言模型以解决真实世界问题
构建可验证技能训练环境,微调后35B智能体在技能基准上超越Claude Sonnet 4.6等强模型。
困难负样本揭示简单负样本所掩盖的问题:困难负样本下跨语言有害性表征随资源层级退化
改用困难负样本后,跨语言有害性表征迁移在低资源语言中大幅崩塌,此前简单负样本的近乎完美迁移不成立。
LabourCrew:面向可信对抗性审议与劳动法成文法推理的多智能体RAG框架
LabourCrew以法条图谱、证据交换协议与校准信任门实现可信劳动法问答,误纳率降至0.081。
合成研究验证中的后果性行为与代表性公平
合成研究验证框架:声明与人类数据对应程度、四类诊断及实验效应,报告子群有效性,操作化三种正义维度。
“AI正变得过于像人”:青少年如何在日常生活中体验与协商AI
青少年AI讨论激增,聚焦真实性、控制权、人际关系与人类角色,体现对AI边界的协商。
超越不安全检测:面向多轮LLM安全失效的反事实锚定证据归因
针对多轮LLM安全失效,构建分层证据监督数据集,训练轻量归因模型定位责任轮次与词元,F1达0.988,误报低于1%。
委托式错位:多智能体结构如何放大LLM安全风险
多智能体委托使个体安全对齐失效,责任扩散与角色顺从将拒绝转为危害,显著放大LLM安全风险。
基于参考的开放式文本生成连贯性与多样性分析
提出基于参考的框架,从轨迹对齐、摘要比较与参考似然考察连贯性和多样性,发现其可反映但不等同质量。
少六层:Whisper 编码器剪枝与无标签恢复
Whisper编码器剪去6层,免定制推理;无标签蒸馏恢复,四语WER从21.9%降至20.1%。
从情感分类到可行动且负责任的反馈:2015—2026年NLP在学生评教中的范围综述与证据图谱
范围综述421项显示,NLP学生评教从情感分类转向反馈,但可行动性断层:A2+达61.3%,A3+仅11.6%;情感分析主流,公平指标稀缺。
审讯对话的可控属性特定摘要生成
提出CASPER,以思维链属性提示和迭代评估提升审讯对话摘要的事实一致性与完整性。
风险可控的 KV 缓存淘汰:从内存预算到风险目标
将KV缓存淘汰建模为部署风险控制,按目标风险与置信要求认证保留策略,未过则回退全KV;同一合同可致不同淘汰或回退。
评估大语言模型生成的学生写作反馈中的反馈焦点与教学适应性
研究LLM写作反馈焦点与教学适应性,发布FeedType基准;其类型覆盖广,但分布和适应性不及教师。
你被告知了多少?测量同行评审中的外部信息
提出自条件化信息论估计器,测量评审外部信息,高精度区分代写与润色。
基于自监督语音模型的二语发音偏差母语参考坐标几何
提出母语参考坐标几何,以自监督模型音素类均值构建参考空间,用距离评估二语发音,距离与熟练度负相关。
TEMPS:面向时间信息检索的时间句子嵌入
提出时间文本相似度任务与TEMPS模块,以时间锚定和高斯匹配增强检索时间对齐,提升时序检索性能。
在检索与硬件约束下评估面向土耳其语领域文档的开放权重大语言模型
6GB显存评测5个7B-8B模型,土耳其语文档问答49%-75%;检索未显著优于字符基线,三者需分评
激活记忆与参数记忆在少样本学习中的互补作用
激活记忆擅长事实回忆,参数记忆未必更优;复合任务需两者协同,模型调用不同且叠加的神经元。
大语言模型能识破被操纵的回测吗?一个干净对照校准基准
96组配对回测基准含干净对照;高召回模型仍误报93.8%干净代码,加干净感知提示后误报归零、召回不变。
基于梯度归因的上下文感知机器翻译注意力头规模化分析
提出基于梯度的注意力头归因,支持大模型大规模因果分析;在上下文机器翻译消歧中揭示通用头与冗余。
迈向高效推理:为扩散语言模型学习因果捷径
提出因果捷径学习框架CSL:提取因果捷径并优先掩码训练,提升扩散语言模型推理准确率与收敛速度。
面向翻译的大语言模型微调:通用遗忘缓解无法保持机器翻译特有指令遵循
翻译微调提升质量却致遗忘;通用缓解法难保机器翻译指令遵循,仅数据混合可保控制但不泛化。