9985 条条目 · 106 个活跃源
2026年8月6日
04:00
arXiv cs.CL

基于语料驱动的词汇剪枝实现高效多语言神经机器翻译:英阿案例研究

提出词汇剪枝与微调框架,词表从12.8万减至1万,节省60%内存且性能无损,媲美双语模型。

04:00
arXiv cs.CL

解耦语言建模与边界

字节级模型可解耦下一字节与边界两种分布,从而无需分词器即可迁移能力、重塑边界。

04:00
arXiv cs.CL

ConlangBench:以多样人造语言探究大语言模型的语言知识与学习

构建21种人造语言基准,发现模型在词汇源自自然语言的人造语上表现更好,学习曲线因构建方式而异。

04:00
arXiv cs.CL

ChronoLens:跨时间、跨语言与多层面的语言变化测量

新框架分析海量跨语言语料,发现各层变化幅度相近,但时机、幅度、方向随语言不同,揭示语言变化多维结构。

04:00
arXiv cs.CL

Hi-TTRL:利用提示调控测试时强化学习的共识

提出一种基于提示的测试时强化学习共识调控方法,应对低共识不可靠和高共识梯度消失,提升性能。

04:00
arXiv cs.CL

超越初始化损失:大语言模型词汇扩展中词元嵌入初始化策略的系统性研究

20余种初始化策略:子词组合最优,非对称最佳,CPT步骤降至1/6;初始化损失不可靠,50步轻量CPT可选优。

04:00
arXiv cs.CL

大语言模型中的跨语言偏见:英语与斯瓦希里语的比较分析

大语言模型偏见跨语言转化而非迁移,英/斯语差异大,纯英语偏见审计不足以覆盖多语言部署。

04:00
arXiv cs.CL

在错误的灯柱下寻找:论自动翻译质量评估的局限性

自动翻译质量评估存在结构缺陷,无法独立用于实际翻译流程;片段级评分忽视连贯风格,且有泛化失败、偏差、过拟合等问题,未来应聚焦基于MQM的自动化人工评估。

04:00
arXiv cs.CL

非结构化生物医学文本标注的一致性度量

非结构化生物医学标注软一致性:语义度量可行,嵌入区分弱,大模型扩展受限,推荐自然语言推理。

04:00
arXiv cs.CL

SFT冲突,RL共存:大语言模型多任务学习的理论与实证分析

SFT任务冲突,RL可共存;因RL梯度更新稀疏正交,干扰受方差限制,故提出Parallel-RL。

04:00
arXiv cs.CL

语言专用多教师在线策略蒸馏用于多语言大模型语音识别

提出LS-MOPD方法,通过语言专用教师解耦训练并蒸馏至多语言学生,减少跨语言冲突,超越所有教师基线。

04:00
arXiv cs.CL

LoopMTP:一种由潜在多令牌预测引导的循环变压器

循环变压器利用潜在多令牌预测,软对齐循环状态与未来令牌嵌入,减少过度思考,提升推理准确性,稳定训练至15次循环。

04:00
arXiv cs.CL

MDLMPE:掩码扩散语言模型的分布感知位置编码

提出一种位置编码,感知掩码扩散的动态遮显分布,优于传统方法。

04:00
arXiv cs.CL

预算约束下忠实摘要的生成与选择解耦

提出生成与选择解耦框架,在预算约束下平衡相关性、事实性和冗余,无需重训即可提升摘要事实性和来源依据。

04:00
arXiv cs.CL

大语言模型评审与人类同行评审的契合度如何?

LLM评审与人类相比,能区分录用与否,但无法区分口头/海报,评分和关注点也有差异。

04:00
arXiv cs.CL

从早期训练遥测预测深度神经网络训练结果

利用前五轮遥测数据,梯度提升树可高精度预测训练结果,单轮即有效,助力计算分配决策。

04:00
arXiv cs.CL

齐奥尔科夫斯基档案(俄罗斯科学院档案馆555全宗)的机器可读目录及手写体可读性测量方法

建立齐奥尔科夫斯基档案机读目录(2019文件/51008扫描),并提出无真值手写识别评估法。

04:00
arXiv cs.CL

VetScore:带引用的兽医长文问答的风险加权事实核查

VetScore采用多步风险加权法,按危害潜力核查兽医长文问答的引用忠实度,与专家高度相关且可解释。

04:00
arXiv cs.CL

阿拉伯语伊斯兰问答中的幻觉检测与验证答案恢复

微调Gemma模型,检测阿拉伯伊斯兰问答中的幻觉并选出验证答案,综合得分0.912。

04:00
arXiv cs.CL

GPTKB 2.0:从大型语言模型直接构建消歧知识库

GPTKB2.0:从LLM构建消歧知识库,产出百万实体/3840万三元组,首个百万级LLM原生库。

04:00
arXiv cs.CL

逻辑先于语言:基于形式推导的预预训练促进技能获取与可压缩性

提出逻辑预预训练,用形式推导加速语言技能获取,并提升模型可压缩性。

04:00
arXiv cs.CL

VIBE:一种基于VAD信息的大型语言模型输出实体中心情感画像基准

提出VIBE基准,区分好感度与VAD,验证效价可交叉验证,唤醒度和支配度仅方向估计,强调情感报告需附上下文元数据。

04:00
arXiv cs.CL

高效大语言模型知识蒸馏:离线Top-K Logits与融合分块KL损失

离线缓存教师Top-K logits可匹配在线蒸馏,提速29%;融合分块KL损失降低内存,支持更长上下文。

04:00
arXiv cs.CL

敏感性、因果性与修复相分离:扰动鲁棒性的逐层分析及其缩放

敏感、因果、修复三者逐层分离;敏感性-因果性负相关,因果层适配器反而有害,且随规模增强。

04:00
arXiv cs.CL

M-GATE:大语言模型的多语言语法、翻译准确性与效率基准

提出M-GATE基准,覆盖30种语言,发现流畅性与语言能力脱节,翻译质量与预训练数据占比强相关。

04:00
arXiv cs.CL

MultiGlobeQA:面向地理空间推理的多语言全球多样化基准

提出多语言地理空间推理基准MultiGlobeQA,含46k问答覆盖201国,发现LLM计算是瓶颈,尤其网格索引与形状计算。

04:00
arXiv cs.CL

SciRet:面向科学检索增强生成的计算感知检索与重排序实证研究

计算感知多尺度评估科学RAG,混合检索稳健,交叉编码重排序因领域失配降精度,忠实度随规模升。

04:00
arXiv cs.CL

DS@GT-ARC 在 eRisk 2026 任务3:基于稀疏、语义及大语言模型重排序的ADHD症状句检索

采用BM25检索与语义/LLM重排序的零样本方法,有效提升ADHD症状句相关性排名。

04:00
arXiv cs.CL

ANNOTARES:从德国成文法文本中提取逻辑结构的数据集

提出德文法条法律要件与后果的识别分割任务,构建ANNOTARES数据集,BERT与LLM模型效果最佳。

04:00
arXiv cs.CL

超越表征相似性:源条件描述长度增益用于生成式抄袭检测与候选源重排序

SCDG以源条件描述长度增益检测生成式抄袭,PAN F1=0.94,nDCG@10=0.83,最优。

04:00
arXiv cs.CL

世界杯竞技场:现场赛事中前沿大语言模型的前瞻性无泄漏评估

前瞻性无泄漏评估:六模型预测世界杯104场,准确率63.9%,与博彩热门持平,但过度趋同,缺乏区分度。

04:00
arXiv cs.CL

搜索、检查、获取:利用结构感知布尔检索赋能深度研究智能体

Sieve用布尔查询按网页结构筛选,仅取所需片段,提升精度并节省20.7%-50.6% token。

04:00
arXiv cs.CL

HalluTruthQA-4K:面向阿拉伯语幻觉检测与真实性验证的细粒度语料库及标注流程

构建含4000条阿拉伯语问答的细粒度幻觉检测语料库,标注错误片段、原因及类型,用于幻觉检测与事实核查。

04:00
arXiv cs.CL

TurnSight:面向工具集成推理的回合级事后自我蒸馏

提出TurnSight,回合级事后自蒸馏,用执行条件事后视角,跨视界一致选可靠信号,自适应调节RL优势。

04:00
arXiv cs.CL

当注意力失明:ALiBi位置编码中的数值失效

发现ALiBi位置编码因浮点下溢致注意力权重归零,损害检索;提出对数距离缩放等策略,效果最佳。

04:00
arXiv cs.CL

PAST-Bench:个人智能体递归自我改进基础的基准测试

提出PAST-Bench基准,评测智能体利用经验实现递归自我改进,并开发Hermes+增强此能力,奠定评测诊断基础。

04:00
arXiv cs.CL

单一规范提示词低估LLM安全的表面形式敏感性

仅用单一规范提示词会低估LLM安全风险:同义改写后,不安全合规率显著上升,且因模型而异。

04:00
arXiv cs.CL

SocietyBench:反事实社会演化预测

新基准用反事实时间线测试大模型预测社会事件的能力,双轴评分,最强模型仅75分。

04:00
arXiv cs.CL

string2string Studio:字符串到字符串算法的交互式浏览器内平台

交互式浏览器字符串算法平台,集成六模块(比对、搜索等)。无安装,本地运行,评分附证据,显著提速。

04:00
arXiv cs.CL

dots.tts.edit:基于连续自回归模型的精确控制语音编辑

提出带结构化标签的精确语音编辑接口,模型在指令跟随与局部保留上领先。

04:00
arXiv cs.CL

基于自蒸馏奖励塑形的智能体强化学习

提出ADRS框架,借自蒸馏奖励塑形为多轮语言智能体构建令牌级信用,提升长时任务性能,且无需额外技能推理。

04:00
arXiv cs.CL

基于证据的多模态知识图谱构建用于多讲座教育推理

提出证据支撑的多模态流程,从讲座中提取概念与关系构建知识图谱,检索准确率高。

04:00
arXiv cs.CL

EduClaw-Bench:面向教学大语言模型智能体与模拟学习者的长时程基准

提出三十天模拟学习者教学智能体基准,评测十种适配器,发现教学质量取决于基座与框架,且几乎无法全程保持优秀。

04:00
arXiv cs.CL

可达性并非实现:追溯LLM基准测试提升的来源

基准提升≠能力增强。区分已实现与可达:随机路由需答案辅助,抑制MLP修复故障,训练未扩可达上限。

04:00
arXiv cs.CL

GROW:自回归-扩散文本到语音模型的组相对优势加权在策略强化学习

提出GROW组相对优势加权在策略RL优化流匹配TTS,WER降低,说话人相似度提升,训练快2.9倍。