10213 条条目 · 106 个活跃源
2026年6月23日
04:00
arXiv cs.CL

BioMatrix:迈向覆盖序列、结构与语言模态矩阵的全面生物基础模型

首个原生多模态单一解码器模型,统一处理分子与蛋白质的序列、结构及语言,80项任务中77项达最优。

04:00
arXiv cs.CL

何时涌现共识为真实?LLM智能体社会的可测量耦合增益与有效性诊断

提出耦合增益γ测量与有效性诊断,揭示LLM社会共识依赖于目标交互耦合,可区分真实动态与模型伪迹。

04:00
arXiv cs.CL

知识图谱增强仅在训练外知识上帮助大模型:临床问答的对照研究

知识图谱增强仅在模型训练外知识上提升准确率(从随机到100%),对已知事实无帮助。

04:00
arXiv cs.CL

BabelJudge:跨语言与智能体轨迹的LLM裁判可靠性评估

BabelJudge通过退化标注检测LLM裁判的位置、冗长等偏差,发现跨语言可靠性显著下降(如斯瓦希里语仅0.48顺序一致性)。

04:00
arXiv cs.CL

评估大语言模型在豪萨语和丰贝语机器翻译中的表现:基准测试、失败案例与指标可靠性

豪萨语翻译质量可接受,丰贝语差;模型排名因语言而变;自动指标可靠性低,建议多指标评估及至少2500句样本。

04:00
arXiv cs.CL

MixedPEFT: 结合多种参数高效微调方法与混合目标的无监督域适应

提出MixedPEFT,结合可逆适配器与LoRA,仅用7%参数超越全微调方法,无监督域适应提升1.41个百分点。

04:00
arXiv cs.CL

中文标题:从语音到文本语料库:评估基于ASR的低资源丰贝语和豪萨语数据采集

中文摘要:研究评估ASR为两种低资源西非语言采集文本,丰贝语WER降低78%,豪萨语转录质量接近可用,但丰贝语仍需改进。

04:00
arXiv cs.CL

以适当的速度学习:自适应数据调度提升大语言模型强化学习

提出ADS框架,通过语义聚类与边界样本调度,提升LLM强化学习后训练,平均准确率提高5.2%。

04:00
arXiv cs.CL

研究如何演进?通过基于声明的类型化引文追踪NLP、ML和CV中的跨域轨迹

提出SciTraj语料库,首个基于声明的类型化引文图,覆盖NLP/ML/CV 2015-2024,含32K论文、573K边、6种关系,支持跨域轨迹分析。

04:00
arXiv cs.CL

好奇心作为语言干预:利用LLM辅导对话影响探索性学习行为

基于270场对话,好奇心导向干预使探索性学习行为提升2.4倍,表明语言可塑造探索认知。

04:00
arXiv cs.CL

ORBIT:基于正交子空间旋转的无训练多属性行为引导

ORBIT通过正交子空间旋转和多属性联合引导,无需训练即可平衡控制多个行为属性,优于现有基线。

04:00
arXiv cs.CL

第一个令牌广播器:Transformer中语言身份与分布式鲁棒性的机制起源

LIHA干预揭示首令牌广播器头,指令调优将语言身份电路集中至第0层,补偿呈前馈层级级联。

04:00
arXiv cs.CL

ROMEVA:罗马乌尔都语语言模型的几何保持词汇扩展

ROMEVA用子词平均初始化与PCA锚点损失稳定嵌入,但稳定性与下游性能脱节,强适应更优。

04:00
arXiv cs.CL

词为差异制造者:大语言模型如何判定文本因果结构

LLM通过差异制造逻辑从海量文本归纳因果结构,原理类似实验控制变量法。

04:00
arXiv cs.CL

亚十亿参数,超级前沿:小语言模型在通用与文学关系抽取中媲美零样本前沿大语言模型

最佳子十亿小模型在关系抽取中超越GPT-5.4等大模型,任务适配实现高效、私密且硬件友好的方案。

04:00
arXiv cs.CL

机器中的CASPER:探究LLM生成故事的角色多样性

通过叙事学八维度分析,LLM生成故事与人类故事在角色塑造上既有相似也有差异,但多样性仍显不足。

04:00
arXiv cs.CL

交错式语音语言模型隐式地作用于文本

交错式语音语言模型隐式转录语音为文本,在文本空间预测后转回语音,揭示模态交互机制。

04:00
arXiv cs.CL

打破似然陷阱:面向大语言模型解码的方差校准调制

提出VCM方法,通过PMI与自适应自去偏动态重塑分布,以低开销提升生成多样性、连贯性与推理准确性。

04:00
arXiv cs.CL

并非所有声明风险相同:面向事实的长文本生成中的自适应验证方法FACTOR

提出FACTOR模型,根据声明不确定性自适应验证,降低验证成本同时提高长文本事实性。

04:00
arXiv cs.CL

面向Text2DSL的上下文感知蒸馏与消融研究

上下文感知蒸馏构建验证语料库,消融实验揭示结构化上下文为关键机制,词汇表对语义质量影响最大。

04:00
arXiv cs.CL

LLM推理中强化学习更新的关键因素是什么?

理论揭示离策略程度影响RLVR更新,提出自适应裁剪策略ACPO,优于强基线。

04:00
arXiv cs.CL

轻看深思:多模态思维链推理的能与不能

多模态思维链在感知任务中效果不佳,推理任务有效;视觉反思持续减弱是瓶颈,开源模型提升有限。

2026年6月19日
04:00
arXiv cs.CL

揭示未言之隐:通过随机路径聚合可视化大语言模型隐藏偏见

TreeTracer通过扰动聚合与对比推理可视化LLM隐藏偏见,降低认知负荷,有效检测系统性偏差。

04:00
arXiv cs.CL

DeepSeek-V4:迈向高效百万Token上下文智能

DeepSeek-V4系列MoE模型支持百万token上下文,混合注意力等创新实现极高长上下文推理效率,性能SOTA。

04:00
arXiv cs.CL

量化上下文学习的偶然不确定性以实现对LLM预测置信度的鲁棒度量

提出自函数向量量化ICL偶然不确定性,设计受控评估协议,更可靠度量LLM置信度并用于幻觉检测。

04:00
arXiv cs.CL

在跨语言迁移中区分语言相关性与任务对齐

微调大模型零样本评估闪语族,改进来自任务对齐而非跨语言知识。

04:00
arXiv cs.CL

基于摘要的大语言模型集成方法用于识别PubMed中EQ-5D研究

提出大语言模型集成框架自动识别PubMed中EQ-5D研究,加权集成F1和准确率均达0.74,优于单个模型。

04:00
arXiv cs.CL

中文标题

大模型在硬件RTL编码中表现存在不可解功能错误导致的上限(90.8%通过率),对齐技术仅能教模型编译,无法突破预训练知识瓶颈。

04:00
arXiv cs.CL

查询放在哪里?通过解码动态揭示并缓解扩散大语言模型中上下文学习的位置偏差

本文揭示扩散LLM中查询位置导致的位置偏差,提出平均置信度与Auto-ICL策略优化查询放置。

04:00
arXiv cs.CL

通过因果归因进行剪枝保持大型语言模型的推理性能

CAP通过因果归因测量注意力头重要性指导剪枝,20%稀疏度下ARC-Challenge准确率比Wanda提升61%,更好保持推理性能。

04:00
arXiv cs.CL

面向基于大语言模型的知识图谱推理的幻觉检测

提出LUCID方法,融合LLM注意力、KG语义与结构,检测知识图谱推理中的幻觉,在9个数据集上达最优。

04:00
arXiv cs.CL

大规模手语数据集:资源、基准和标注标准的全面综述

综述涵盖35种手语120个数据集,分析模态不平衡等挑战,提出设计建议与标准化文档。

04:00
arXiv cs.CL

Characterizing Narrative Content in Web-scale LLM Pretraining Data

04:00
arXiv cs.CL

创建多语言心理健康对话数据集:基于国籍和语言的人格本地化方法的局限性

仅修改国籍语言参数生成多语言心理健康对话存在局限,导致临床不一致及评估不准确,需文化响应数据生成。

04:00
arXiv cs.CL

信度而非效度:LLM作为评判模型在一致性、稳定性和偏见上的系统性大规模评估

LLM评判范式存在信度与效度脱节,精确匹配高估能力,需更严谨验证协议。

04:00
arXiv cs.CL

LaViSA:语言与视觉结构歧义基准

LaViSA基准评估视觉语言模型利用场景解决句法歧义的能力,七类歧义测试显示模型仍有局限。

04:00
arXiv cs.CL

基于BART的分层策略的越南语抽象式多文档摘要方法

提出黄金摘要驱动文档缩短的BART分层摘要法,提升相关性,性能优异并公开额外数据。

04:00
arXiv cs.CL

标签之前:数据集构建如何塑造临床文本中的自杀倾向检测

临床NLP数据集隐含设计偏见,需审视标签背后的假设,而非直接当作金标准。

04:00
arXiv cs.CL

社会推理从何而来?语言模型中的能力溯源

训练数据归因揭示,语言模型的社会推理与STEM推理源自不同语料区域,且推理层面的差异比知识层面更显著。

04:00
arXiv cs.CL

MiqraBERT:基于回归的Sentence-BERT微调用于圣经希伯来语平行检测

MiqraBERT回归微调Sentence-BERT,分布分离度提升2.7倍,重叠降至6%,叙事平行召回率87.1%。

04:00
arXiv cs.CL

粒度调控的自适应计算效率:测试时扩展中的最优验证

提出GRACE框架,揭示最优验证粒度随难度与预算的相变规律,自适应策略提升准确率3.1%。

04:00
arXiv cs.CL

可信多智能体系统:使用Argent信令协议缓解语义漂移

Argent信令协议通过质量信号区分可修复与不可修复失败,提升通过率并阻止无根据输出传播。

04:00
arXiv cs.CL

SAGE-OPD:面向多轮在策略蒸馏的选择性智能体引导干预

提出SAGE-OPD方法,通过选择性干预和置信度加权解决多轮蒸馏错误累积,在ALFWorld上相对提升13.3%。

04:00
arXiv cs.CL

从5万到820万:24小时内,佛得角门将沃齐尼亚的算法加冕与世界杯可见性的多语言建构

多语言分析揭示沃齐尼亚粉丝激增中的叙事框架差异:葡萄牙语动员、西班牙语危机、英语民族建构及平台指标奇观。

04:00
arXiv cs.CL

聚类即所需:利用语言模型语义聚类预训练可解释的Tsetlin机器

提出用语言模型语义聚类预训练Tsetlin机器,无需嵌入,性能媲美BERT且保持可解释性。

04:00
arXiv cs.CL

代码切换揭示多语言大模型中的语言锚定

通过语法强制代码切换发现语言锚定偏差,提出CANVAS方法可有效缓解多语言模型推理性能下降。

04:00
arXiv cs.CL

CacheWeaver: 缓存感知的证据排序实现高效检索增强生成

提出CacheWeaver,通过前缀树贪心排序证据,降低首次令牌延迟20-33%,接近最优排序效果。

04:00
arXiv cs.CL

TerraMARS:针对火星改造文献的领域自适应小语言模型管道

TerraMARS利用领域自适应小语言模型,从火星科学文献中提取结构化信息,支持改造研究。

04:00
arXiv cs.CL

FineREX:针对人口走私知识图谱的微调NER-RE

微调LLM的FineREX在实体和关系F1上分别提升15.50%和31.46%,噪声减半,处理时间降低50%。

04:00
arXiv cs.CL

NRITYAM:语言模型与舞蹈艺术遗产的交汇

NRITYAM基准评估语言模型全球舞蹈文化理解力,含9260问答对、12种语言。