Token原生存储:以智能体的语言读写
用令牌ID存文本,免去每次重新分词,比UTF-8省2.25倍,解码可快7倍;呼吁统一共享词汇表。
行为金丝雀:审计强化学习微调中的私有检索上下文使用
行为金丝雀机制:偏好触发器与风格反馈检测RL微调未授权文档训练,1%注入率AUROC=0.756。
分布偏移下基于分阶段偏好优化的视觉语言模型幻觉缓解
提出分阶段偏好优化框架,构造幻觉偏好对训练DPO,减少视觉语言模型幻觉,提升视觉一致性。
在线推理校准:测试时训练实现可泛化的共形大语言模型推理
提出在线推理校准,结合共形预测与测试时训练,逐输入元学习校准采样,保证偏移下置信度,提升效率泛化。
MoDAl:面向语音神经假体的基于去相关的自监督神经模态发现
通过对比与去相关损失发现互补神经模态,将词错误率从26.3%降至21.6%,并利用布罗卡区信号提升解码。
基于语料驱动的词汇剪枝实现高效多语言神经机器翻译:英阿案例研究
提出词汇剪枝与微调框架,词表从12.8万减至1万,节省60%内存且性能无损,媲美双语模型。
解耦语言建模与边界
字节级模型可解耦下一字节与边界两种分布,从而无需分词器即可迁移能力、重塑边界。
ConlangBench:以多样人造语言探究大语言模型的语言知识与学习
构建21种人造语言基准,发现模型在词汇源自自然语言的人造语上表现更好,学习曲线因构建方式而异。
ChronoLens:跨时间、跨语言与多层面的语言变化测量
新框架分析海量跨语言语料,发现各层变化幅度相近,但时机、幅度、方向随语言不同,揭示语言变化多维结构。
Hi-TTRL:利用提示调控测试时强化学习的共识
提出一种基于提示的测试时强化学习共识调控方法,应对低共识不可靠和高共识梯度消失,提升性能。
超越初始化损失:大语言模型词汇扩展中词元嵌入初始化策略的系统性研究
20余种初始化策略:子词组合最优,非对称最佳,CPT步骤降至1/6;初始化损失不可靠,50步轻量CPT可选优。
大语言模型中的跨语言偏见:英语与斯瓦希里语的比较分析
大语言模型偏见跨语言转化而非迁移,英/斯语差异大,纯英语偏见审计不足以覆盖多语言部署。
在错误的灯柱下寻找:论自动翻译质量评估的局限性
自动翻译质量评估存在结构缺陷,无法独立用于实际翻译流程;片段级评分忽视连贯风格,且有泛化失败、偏差、过拟合等问题,未来应聚焦基于MQM的自动化人工评估。
非结构化生物医学文本标注的一致性度量
非结构化生物医学标注软一致性:语义度量可行,嵌入区分弱,大模型扩展受限,推荐自然语言推理。
SFT冲突,RL共存:大语言模型多任务学习的理论与实证分析
SFT任务冲突,RL可共存;因RL梯度更新稀疏正交,干扰受方差限制,故提出Parallel-RL。
语言专用多教师在线策略蒸馏用于多语言大模型语音识别
提出LS-MOPD方法,通过语言专用教师解耦训练并蒸馏至多语言学生,减少跨语言冲突,超越所有教师基线。
LoopMTP:一种由潜在多令牌预测引导的循环变压器
循环变压器利用潜在多令牌预测,软对齐循环状态与未来令牌嵌入,减少过度思考,提升推理准确性,稳定训练至15次循环。
MDLMPE:掩码扩散语言模型的分布感知位置编码
提出一种位置编码,感知掩码扩散的动态遮显分布,优于传统方法。
预算约束下忠实摘要的生成与选择解耦
提出生成与选择解耦框架,在预算约束下平衡相关性、事实性和冗余,无需重训即可提升摘要事实性和来源依据。
大语言模型评审与人类同行评审的契合度如何?
LLM评审与人类相比,能区分录用与否,但无法区分口头/海报,评分和关注点也有差异。
从早期训练遥测预测深度神经网络训练结果
利用前五轮遥测数据,梯度提升树可高精度预测训练结果,单轮即有效,助力计算分配决策。
齐奥尔科夫斯基档案(俄罗斯科学院档案馆555全宗)的机器可读目录及手写体可读性测量方法
建立齐奥尔科夫斯基档案机读目录(2019文件/51008扫描),并提出无真值手写识别评估法。
VetScore:带引用的兽医长文问答的风险加权事实核查
VetScore采用多步风险加权法,按危害潜力核查兽医长文问答的引用忠实度,与专家高度相关且可解释。
阿拉伯语伊斯兰问答中的幻觉检测与验证答案恢复
微调Gemma模型,检测阿拉伯伊斯兰问答中的幻觉并选出验证答案,综合得分0.912。
GPTKB 2.0:从大型语言模型直接构建消歧知识库
GPTKB2.0:从LLM构建消歧知识库,产出百万实体/3840万三元组,首个百万级LLM原生库。
逻辑先于语言:基于形式推导的预预训练促进技能获取与可压缩性
提出逻辑预预训练,用形式推导加速语言技能获取,并提升模型可压缩性。
VIBE:一种基于VAD信息的大型语言模型输出实体中心情感画像基准
提出VIBE基准,区分好感度与VAD,验证效价可交叉验证,唤醒度和支配度仅方向估计,强调情感报告需附上下文元数据。
高效大语言模型知识蒸馏:离线Top-K Logits与融合分块KL损失
离线缓存教师Top-K logits可匹配在线蒸馏,提速29%;融合分块KL损失降低内存,支持更长上下文。
敏感性、因果性与修复相分离:扰动鲁棒性的逐层分析及其缩放
敏感、因果、修复三者逐层分离;敏感性-因果性负相关,因果层适配器反而有害,且随规模增强。
M-GATE:大语言模型的多语言语法、翻译准确性与效率基准
提出M-GATE基准,覆盖30种语言,发现流畅性与语言能力脱节,翻译质量与预训练数据占比强相关。
MultiGlobeQA:面向地理空间推理的多语言全球多样化基准
提出多语言地理空间推理基准MultiGlobeQA,含46k问答覆盖201国,发现LLM计算是瓶颈,尤其网格索引与形状计算。
SciRet:面向科学检索增强生成的计算感知检索与重排序实证研究
计算感知多尺度评估科学RAG,混合检索稳健,交叉编码重排序因领域失配降精度,忠实度随规模升。
DS@GT-ARC 在 eRisk 2026 任务3:基于稀疏、语义及大语言模型重排序的ADHD症状句检索
采用BM25检索与语义/LLM重排序的零样本方法,有效提升ADHD症状句相关性排名。
ANNOTARES:从德国成文法文本中提取逻辑结构的数据集
提出德文法条法律要件与后果的识别分割任务,构建ANNOTARES数据集,BERT与LLM模型效果最佳。
超越表征相似性:源条件描述长度增益用于生成式抄袭检测与候选源重排序
SCDG以源条件描述长度增益检测生成式抄袭,PAN F1=0.94,nDCG@10=0.83,最优。
世界杯竞技场:现场赛事中前沿大语言模型的前瞻性无泄漏评估
前瞻性无泄漏评估:六模型预测世界杯104场,准确率63.9%,与博彩热门持平,但过度趋同,缺乏区分度。
搜索、检查、获取:利用结构感知布尔检索赋能深度研究智能体
Sieve用布尔查询按网页结构筛选,仅取所需片段,提升精度并节省20.7%-50.6% token。
HalluTruthQA-4K:面向阿拉伯语幻觉检测与真实性验证的细粒度语料库及标注流程
构建含4000条阿拉伯语问答的细粒度幻觉检测语料库,标注错误片段、原因及类型,用于幻觉检测与事实核查。
TurnSight:面向工具集成推理的回合级事后自我蒸馏
提出TurnSight,回合级事后自蒸馏,用执行条件事后视角,跨视界一致选可靠信号,自适应调节RL优势。
当注意力失明:ALiBi位置编码中的数值失效
发现ALiBi位置编码因浮点下溢致注意力权重归零,损害检索;提出对数距离缩放等策略,效果最佳。
PAST-Bench:个人智能体递归自我改进基础的基准测试
提出PAST-Bench基准,评测智能体利用经验实现递归自我改进,并开发Hermes+增强此能力,奠定评测诊断基础。
单一规范提示词低估LLM安全的表面形式敏感性
仅用单一规范提示词会低估LLM安全风险:同义改写后,不安全合规率显著上升,且因模型而异。
SocietyBench:反事实社会演化预测
新基准用反事实时间线测试大模型预测社会事件的能力,双轴评分,最强模型仅75分。
string2string Studio:字符串到字符串算法的交互式浏览器内平台
交互式浏览器字符串算法平台,集成六模块(比对、搜索等)。无安装,本地运行,评分附证据,显著提速。
dots.tts.edit:基于连续自回归模型的精确控制语音编辑
提出带结构化标签的精确语音编辑接口,模型在指令跟随与局部保留上领先。
基于自蒸馏奖励塑形的智能体强化学习
提出ADRS框架,借自蒸馏奖励塑形为多轮语言智能体构建令牌级信用,提升长时任务性能,且无需额外技能推理。
基于证据的多模态知识图谱构建用于多讲座教育推理
提出证据支撑的多模态流程,从讲座中提取概念与关系构建知识图谱,检索准确率高。
EduClaw-Bench:面向教学大语言模型智能体与模拟学习者的长时程基准
提出三十天模拟学习者教学智能体基准,评测十种适配器,发现教学质量取决于基座与框架,且几乎无法全程保持优秀。
可达性并非实现:追溯LLM基准测试提升的来源
基准提升≠能力增强。区分已实现与可达:随机路由需答案辅助,抑制MLP修复故障,训练未扩可达上限。
GROW:自回归-扩散文本到语音模型的组相对优势加权在策略强化学习
提出GROW组相对优势加权在策略RL优化流匹配TTS,WER降低,说话人相似度提升,训练快2.9倍。