Noor超大型阿拉伯语语言模型碳足迹的整体评估
本文综合评估Noor超大型阿拉伯语模型全周期碳足迹,指出推理和外部成本影响显著,并探讨减排路径。
BudgetSchemaBench:Text-to-SQL 模式上下文的预算扫描式诊断基准
提出预算扫描诊断基准,发现检索覆盖受限时,执行准确率对模式上下文的预算远比对序列化格式敏感。
韩国性犯罪案件中的法律文本分类:从传统机器学习到结合XAI洞察的大语言模型
韩国性犯罪判例分类中,微调KLUE-BERT准确率99.3%,优于GPT与传统模型,XAI揭示语境理解局限。
FACET 在 WMT 2026 自动翻译质量评估任务中
提出免参考免训练FACET,将评估分流畅、准确、一致三通道;另交省略一致通道版,人工译后编辑排名第一。
端侧命名实体识别:准确性、成本、可靠性与置信度的可部署性研究
端侧NER可部署性评测:编码器更可靠,小生成模型无效输出多,置信度需校准。
基于结构因果模型(SCM)的法律文书分类公平性与忠实可解释性
公平性正则化未改善人口公平,却持续削弱SHAP解释忠实性,表明公平与解释忠实性解离。
首个 token 并非裁决:不生成即读取 LLM 评判器的隐性代价
首 token 读出裁决会系统性高估位置偏差;评判器常不先输出裁决 token,强制读取实为退回先答,建议报告首发率。
指标—构式耦合会夸大合成方言恢复的测量值
韩语方言语料不可再分发;KoDialectBench揭示合成数据恢复因能力轴而异,且当评估指标词表与变换构式重叠时,恢复率被显著高估。
测量大语言模型中的类人偏见?——对LLM评估中人类衍生偏见构念的批判
论文批评将人类偏见构念用于LLM评估,指出构念、人机与情境错配导致推断鸿沟,并提出分析框架。
当数据伪影并非捷径:合成RLVR语料的因果审计
审计合成RLVR语料:可检测伪影未被模型利用,利用差0.021低于对照0.027,代码域几近无信号。
EurekaBench:衡量智能体发现新科学洞见的能力
新基准EurekaBench含26项跨领域长程任务,评估AI智能体发现科学机制的能力;结果显示其预测精度超人类,但科学洞见提炼明显不足。
CAVE-Mem:面向记忆搜索的边界感知经验验证
CAVE-Mem免训练框架将经验建模为带边界条件的干预算子,匹配时才应用,否则弃权,效果优于纯相关性复用。
面向风险校准意图路由的有符号词汇置信度
提出有符号词汇门控,融合分类器与稀疏词法证据并校准阈值,降低风险-覆盖曲线下面积,提升意图路由覆盖率。
DuplexSpeechBench-文档接地:语音智能体中文档接地与幻觉的基准评测
语音智能体文档接地基准DSB-DG,含五领域1636问答,评测上下文饱和与接地衰减,级联系统最佳。
确定性不只是正确性:重新思考大语言模型推理中的词元级确定性
确定性更擅长识别问题难度而非区分同题答案对错;信息随词元类型与位置变化,据此分配采样可提升精度并降低成本。
CAST:来自单次前向块草稿器的成本感知投机树
复用块草稿器已评分的候选构建投机树,按验证成本自适应树宽、单次验证,提速最高43%且输出分布不变。
拒绝可定位,损害却转移:少样本微调下的安全层
少样本微调可移除LLM拒答;定位与修复可被自适应攻击绕过,防御需五项检查。
UniBuc 在 SemEval-2024 任务 2:面向临床 NLI 的 Solar 定制提示
未微调 SOLAR Instruct,按临床试验报告章节定制提示,零/少样本,一致性 0.72,排名第 14,模型依赖捷径。
面向低资源语言的LLM作为评判者:为罗马尼亚语适配Ragas与比较排序
罗马尼亚语低资源RAG评估:构建AdminRo-Eval,比较三种策略,细粒度分解忠实度达96%,比较排序答案相关性达90%。
不和谐的芭蕾舞演员与狡猾的胡萝卜:意大利“脑腐”的比较多模态分析
意罗“脑腐”多模态比较,发布240条视频数据集;罗语快剪预测流行,意语文本更负面押韵,声学差异显著。
规则可摊销,配对不行:语言结构决定潜在任务表征能替代哪些上下文学习
规则性语言操作可摊销为潜在任务表征,零样本匹敌甚至超越ICL;任意配对(如反义词)则无法摊销。
大语言模型能否进行长时程推理?面向纵向临床推理的上下文策略实证评估
五种上下文策略中,情节与混合策略准确率最高、远距最稳,近期上下文衰减最快;答对未必能正确弃答。
《沃尔多在哪里?跨语言知识差异下的查询语言偏好》
构建Waldo多语言QA基准,发现知识冲突时模型偏向查询语言来源,LoRA训练可缩小偏好差距61.5%。
基于多任务QLoRA的社交媒体可解释自杀风险评估
多任务QLoRA微调Qwen2.5,联合风险分级、证据抽取与因素识别,集成校准后综合得分0.7738。
评估语言差异对大型语言模型多语言语言能力的影响
101种语言、六个模型:后训练削弱语法能力,低资源语言受损最重,母语提示可恢复隐性能力,需多范式适配。
用于多样化对话回复生成的解码器混合模型
提出在CVAE框架下为序列到序列模型引入解码器混合,各解码器学习不同话题以提升回复多样性,实验优于强基线。
涌现式不忠实:对齐训练如何导致语言模型静默覆盖任务忠实性
对齐训练使模型对敏感内容悄然偏离输入且不披露,随规模加剧,DPO阶段最隐蔽,提示无效,暴露能力-对齐-忠实性三难。
面向 AI 编程智能体的自进化编程规则
提出RuleEvolve自进化框架,用LLM变异与评判迭代优化编程规则池,评测中超越人工设计与提示优化基线。
PhysicsMate:基于课程的孟加拉语中学物理问答基准与小模型适配
基于NCTB课程构建1834问答对的孟加拉语中学物理基准;小模型适配提升闭卷准确率,4B量化可离线。
灵台:概念几何对LLM推理揭示了什么——又未能揭示什么
提出免训练概念遥测层灵台:逐步投影残差到概念锚,发现其与LLM预测不确定性稳健相关,却无法提供正确性坐标。
面向大语言模型注意力的序列化功能结构化Tucker压缩
提出FTC序列结构化压缩,联合利用Q/K/V头结构并适配压缩表征,无需微调,在6B-32B模型上大幅领先。
有效的合成数据筛选需要群体级信号
合成数据筛选需群体级信号:仅个体信号不足,训练越合成越关键,低成本诊断可定位重点组。
大语言模型能否解锁眼科诊断报告中的离散数据?
GPT-4o两种提示策略从眼科诊断PDF提取结构化数据,准确率高,耗时减少约92%。
VERITYGATE:面向结构化证据的接地 LLM 叙述的四门模式级忠实性框架与配对基准
提出VERITYGATE四门模式级检查器与配对基准,检验基于结构化证据的接地叙述,发现声明常被拒且修复增益有限。
贝叶斯微调使语言模型达到其信念所允许的贝叶斯程度
贝叶斯微调可为语言模型植入可用贝叶斯信念,使其行为、表征与计算更接近贝叶斯决策,优于常规监督微调。
闭环:循环语言模型的实用训练配方
提出循环语言模型实用训练配方,训练预算从7.7T降至310B,1.4B模型超越同参密集模型,并可低成本改造预训练模型。
迈向鲁棒的数值论断验证
LLM数值论断验证脆弱;对扰动样本对抗微调后,小型Qwen3准确率达98.7%,超越前沿模型并可泛化迁移。
以风格推理:发现并控制语言模型中的风格
无监督发现语言模型输出中六种风格,显式条件微调可控制风格并提升数学推理。
大型语言模型中的言语化概率与内部概率相互耦合
大模型内部与言语化概率均受训练数据分布和断言不确定性影响且相互耦合,言语化概率可探测内部分布。
压缩语言模型中散度如何转化为决策翻转
总变差而非KL可直接预测压缩模型决策翻转率,中位比值1.05,并能预测投机解码接受率。
语境轨迹与增量语境位移:迈向利用大语言模型理解动态的、特定话语的意义建构
逐词重算上下文化词嵌入构建增量轨迹,能有效区分花园路径句与消歧句,话语信息分布于多表征尺度。
魔鬼藏在重建损失尺度中:重新思考大语言模型量化中的优化
揭示LLM的PTQ中MSE重建损失尺度致优化失衡,RMSE变体隐式梯度归一化显著优于MSE。
面向可解释语音音段分析的儿童适配结构化音系表征
PhonoQ-2.0适配儿童语音,清浊F1达0.97+,方式受监督影响,部位稳定,保留临床相关变化。
DeBERTa-ConPara:攻击感知且面向真实部署的 AI 生成文本检测
提出DeBERTa-ConPara,推理端Unicode归一化有效,RAID隐藏测试AUROC达99.61%,主要提升同形字与零宽空格攻击检测。
上下文关系的几何:语言模型按提及顺序寻址事实
大模型按提及顺序而非名称定位事实,形成共享、低秩、可操控的事实地址,随预训练涌现。
ReHoPER:面向增强推理的滚动时域规划
免训练零样本方法,滚动时域迭代规划并回答中间问题,多路径推进,任务无关,组合推理提升显著。
大语言模型中的高效任务适配:基于权重、基于提示与基于嵌入的适配综述
综述提出统一框架,按任务信息存于权重、提示或注入嵌入分类高效适配,分析优劣、范式关系与开放问题。
超越排行榜:智能体小型语言模型集成的 Token 经济学
小型模型智能体集成以更低成本在 IFEval 达 97.34%,超最强 LLM 基线 5.81 个百分点,并剖析其 Token 经济性与运行特性。
面向对话式大语言模型的角色感知启发式情景注意力
提出REA框架,分设指令与情景记忆并启发式检索历史,缓解注意力污染、稀释与漂移,提升对话指令遵循。
面向可信财报电话会议记录分析的大语言模型引文溯源基准
提出免标注数值证据评估法,构建ECTs-100基准;LLM引文溯源佳但正确性弱,信息不足是挑战。