鲁棒性作为任务性能的涌现属性
任务表现与鲁棒性强正相关,掌握任务后鲁棒性自然涌现,主因任务能力而非模型固有属性。
MiCRo:面向个性化偏好学习的混合建模与上下文感知路由
MiCRo用两阶段框架,以上下文感知混合建模与在线路由,无需细粒度标注,捕捉多样偏好并提升个性化。
稀疏注意力中的路由吸收:为何随机门控难以被超越
稀疏注意力中,模型与掩码共适应导致路由吸收,使学习门控难显著优于随机门控。
IndicQE-APE:面向印度语系语言的质量评估与自动译后编辑统一基准
整合印度语质量评估与译后编辑数据,发布含12.6万实例、九语向、四类标签的统一基准,并评测六种大模型与三种指标。
思考更深,而非更长:面向组合泛化的内存高效深度循环 Transformer 测试时推理
深度循环 Transformer 以共享权重迭代实现常数内存、线性延迟的测试时推理,步数匹配任务复杂度可提升组合泛化并外推。
CVSS-X:面向28种语言的多语言语音到语音翻译语料库
发布CVSS-X语料库,将英译扩展至28种语言,约24万对语音、超1.6万小时,规模为CVSS八倍,含两种变体,质量相当。
锥形束CT报告生成中部分可观测目标下的临床推理
CBCT颌面报告生成中,复合目标仅词法项可见;优化复合目标提升事实蕴涵,词法指标偏爱听写惯例。
面向生物医学与临床文本抽取式摘要的混合分层一维CNN-BiLSTM框架
提出分层1D-CNN-BiLSTM抽取式摘要,直接选句避免幻觉,提升生物医学与临床文本事实可靠性。
RFCLLM:评估大语言模型对网络协议状态机的推理能力
通过4类任务、1482条查询覆盖16种协议,评估大模型将自然语言规范映射为有限状态机的能力与偏差。
PhysMent:面向物理问题中大语言模型推理的交互式方法
PhysMent 让 LLM 通过 MuJoCo 模拟器交互实验推理物理;定性任务达80%,多步定量任务多低于30%,瓶颈在工具使用而非概念。
全双工语音大模型中伪起音的因果分析与缓解
全双工语音LLM静音下虚假发声源于条件概率骤增,提出因果反事实抑制法实时剔除伪起音,不损真实响应。
临床时序推理中的后见之明偏差:未来数据暴露如何影响大语言模型判断
配对基准测量临床时序推理的后见偏差:完整时间线暴露使大模型产生偏差,时间遮蔽可降低偏差而不损准确率。
面向大语言模型的词汇级提示压缩:一种免训练、确定性的流水线及跨十一类任务的实证帕累托分析
提出免训练、确定性的词汇级提示压缩流水线,40.3%压缩下保真度0.876,并刻画各任务帕累托前沿。
多语言语音识别中的Token合并:跨模型规模与微调的系统研究
系统评估Whisper的Token合并,覆盖16种语言和3种规模;提效且几乎不损准确率,微调后仍有效。
TestHallVQA:探索科学考试冗余上下文下 LVLMs 的文档级推理
提出 TestHallVQA 多图基准与 F1-R² 指标,评测 LVLM 在科学考试冗余上下文中的文档级推理与证据检索鲁棒性。
基于抽象语义表示的完整医院出院摘要生成
提出证据驱动的出院摘要框架,用语义图和深度学习实现跨文档对齐,确保每句有据可查,减少幻觉。
当编辑定位放大相对选择偏差:梯度几何、目标不匹配与重要性加权
编辑定位放大相对选择偏差,方向由梯度几何与目标不匹配决定;重要性加权可校正,实验显示相对偏差升而绝对偏差降。
同一患者,不同医嘱:重复运行下临床 LLM 智能体的动作级可靠性
临床 LLM 智能体相同输入重复运行会开出不同医嘱,单次评分掩盖动作级不稳定,需重复运行与动作稳定性评估。
从词元概率到语义约束:迈向语言模型的声明式概率评估
提出ModelLog声明式概率框架,将评估目标设为词元预测的符号约束,评估分数可作损失,连接评估与学习。
盲选之中:为机器翻译评测构建伪参考译文
七模型多提示翻译全文,无参考QE评分选优并由GPT-5.5后编辑,加语言识别惩罚消除错语种。
墨尔本大学 WMT 2026 CreoleMT 投稿:一种面向低资源太平洋克里奥尔语机器翻译的领域均衡方法
面向太平洋克里奥尔语机器翻译,先领域不平衡预训练再均衡微调,性能超开源基线3+ chrF++。
并非所有否定线索都相同:词缀否定能带来更好的否定理解
构建180万样本、200余种线索的NegCue;预训练显示词缀否定增益最大,单字否定有限,继续预训练可提升模型否定理解。
LayerRoute:面向高效LLM推理的自适应跳层与LoRA质量保持
提出LayerRoute,以逐层硬门控结合LoRA联合微调实现自适应跳层;10次训练均定位9个中间可跳层,提速约1.04倍且质量不降。
危害性传播动力学:大语言模型中对抗意图的逐层轨迹
发现有害提示的危害投影随层数单调上升,据此构建轻量分类器HERALD,越狱检测F1达98.4。
大型语言模型中的领域特定术语:通用模型与专用模型的比较分析
通用LLM医学术语任务反超医学微调模型;机制分析揭示误校准,重加权弥合差距,术语组件可跨域迁移。
HyperProve:面向多跳问答的答案引导超图扩展
结合问题分解与答案引导超图扩展,以中间答案和支持超边为检索状态,多跳问答准确率平均提升6.2%。
通过自动前群超标注扩展印地语量子自然语言处理
印地语前群超标注改为词级分类,380句上上下文回退达64.56%,符号修复使大模型达64.08%。
PolicyMem:面向大语言模型治理的几何策略记忆
将自然语言策略外化为可复用的低秩子空间几何记忆,以投影能量支撑检测-改写-验证闭环,五个基准取得最优检测效果。
ForeSight:通过早期安全信号蒸馏增强风险监控
提出ForeSight框架,仅用首token隐藏状态蒸馏早期安全信号,实现高效准确的风险预测。
深入VLM图表阅读:追踪垂直条形图中跨空间与深度的数值读取
激活修补显示,VLM读柱状图时柱顶、图例与提示序列状态跨层传递,共同支撑精确定值。
甜言蜜语者:提问表述如何塑造恋爱关系建议中的谄媚行为
研究以2400条恋爱提问测评两模型:语气影响小,视角框架影响更大,多轮谄媚递增,某模型更抗道德谄媚。
SyRHM:面向零样本有害模因检测的符号语言增强推理与联想检索
SyRHM将有害模因检测分解为语义检索与符号语言增强的多阶段推理,在多个数据集上超越多模态与推理基线。
DARE:面向结构化知识事实核查的辩证智能体推理
DARE多智能体框架以检索-推理-反思迭代,结合辩证双向验证与置信度元反思,8B模型事实核查准确率达88.12%。
当一致性不等于可靠性:评估本地大语言模型评判者与人类评分的一致性
本地开源LLM评判者自洽率超92%,但与人类评分相关性仅0.275/0.340,一致性不等于可靠性。
理解智能体化 ICD 编码的局限性
按稀有度评估:神经模型稀有码差0.43,工作流难处理损伤码,工具智能体提升0.34,无全能系统。
Phorecaster365:面向混合式药品销售预测与规划决策支持的人工监督参考架构
提出Phorecaster365人工监督参考架构,以预测上下文与证据包连接ERP数据与药品销售预测,并给出滚动评估与分阶段验证协议。
米赞:面向伊拉克阿拉伯语与伊拉克公民语境的大语言模型评估国家基准
伊拉克发布方言基准Mizan,含六维评测;27系统测试显示标准语饱和、方言区分度高,专用模型反逊。
ShopEase:基于生成式AI的多智能体框架,利用混合检索增强生成实现智能企业客户支持
ShopEase用FAISS+BM25混合检索,纯FAISS准确率85.37%最优,重排序未增益。
孟加拉语句子功能分类:语料库构建、模型基准评测与可解释性
构建1万句孟加拉语四类功能标注语料,TF-IDF双层集成模型准确率与宏F1均达0.95。
衡量多语言机器翻译评估中语言变体混同的代价:将莫桑比克希昌加纳语、尼亚尼亚语和塞纳语加入FLORES+
FLORES+新增莫桑比克三种班图语,参考变体选择显著影响评分,变体感知微调可提升目标变体表现。
LLM与规则标注在推理性叙事特征上的评分者间信度:基于土耳其语语料库的三项研究
土耳其语叙事语料:五种LLM与规则标注对“具象隐喻”的人评一致性近乎随机,高一致率系类别失衡假象。
North Small Translate:先进的高性价比翻译(Cohere CAT+)
开源MoE翻译模型,五步训练,支持50语种,1T参数内领先,推理无需昂贵思考。
思维缺乏系统性?评估推理模型在规则归纳任务上的表现
推理模型常能解原任务,却在结构等价变体上失败,缺乏系统性,难稳健评估其认知能力。
SHIFT-M3:面向多模态心电记录完整性的融合前对齐一致性筛查
提出SHIFT-M3,以融合前文本对齐筛查心电记录跨患者错配,78万条数据高精度检出互换与硬负例,纵向跨访视仍误报。
CRITICS——无国界的批判性科学:语言模型促进科学教育中的批判性思维
融合大模型机器翻译与教育科技,提供科学内容母语翻译,破除语言壁垒,促进科学知识普及与批判性思维。
解锁不可解:面向数据高效RLVR的教师引导式课程学习
借助教师模型部分推理轨迹构建难度课程并逐步撤除引导,仅用128道无解难题即达2000题GRPO水平,数据效率约提升16倍。
评估前沿大语言模型在自动化研究中的创造力
提出价值与新颖性两类指标评估前沿大模型自动化研究的创造力,发现变量级新颖性与研究表现关联最强。
面向大语言模型的演化式上下文参数化
提出MUSE任务与基准,并设计免训练方法PLUME,在序列演化场景下显著提升上下文参数化更新效果。
检索增强生成中的归因—压缩前沿
压缩减少生成器输入,却严重损害引用归因;提取式选择归因较稳,但答案质量下降。
当工具成为阻碍:不必要的工具可用性对LLM作答的影响
无关工具可用会使LLM答题率从98.2%降至63.5%,即便不调用;一句范围提示即可恢复大半。