9956 条条目 · 106 个活跃源
2026年8月11日
04:00
arXiv cs.CL

规模化固有可解释语言模型

将可解释性作为训练约束,随规模提升;其模型支持概念归因与干预,以少算力媲美大模型。

04:00
arXiv cs.CL

马马虎虎还是流利?——介绍 PoVisLE:波兰语视觉-语言评估基准

提出波兰语文化视觉语言基准PoVisLE,含千余图像与两千余问答,评估文化情境下的深层多模态理解。

04:00
arXiv cs.CL

WuYuEval: 大语言模型在固体废物管理中的多层级基准

提出固体废物管理多层级基准WuYuEval,含基础与专家模块,评估33个模型,表现差异大;推理模式需锚定工程约束,否则易偏离答案边界。

04:00
arXiv cs.CL

Search-G1:基于表征的内在奖励实现有据可依的搜索智能体

Search-G1用基于表征的内在奖励衡量答案对证据的依赖,无需过程标注或LLM评判,优化搜索问答的落地性与成本权衡。

04:00
arXiv cs.CL

中文标题:多语言NMT中未见低资源语言的嵌入初始化:以林布姆-英语翻译为例研究

中文摘要:多语言嵌入平均初始化用于NLLB-200微调未见语言,在Limbum-英语翻译中媲美最佳代理,超从头训练32chrF2++,但无法保留声调。

04:00
arXiv cs.CL

SurveyReview:面向综述评估者的审稿人对齐基准

构建审稿人对齐的综述评估基准,含675篇论文与1630份评审报告;微调模型使评估与人工评审一致性显著提升。

04:00
arXiv cs.CL

DocAtlas:长文档理解作为可变状态交互

DocAtlas将长文档理解视为可变状态交互,动态更新工具与环境,超越人类基线并显著提升小型VLM。

04:00
arXiv cs.CL

训练德拉威语专用单语与联合多语因果模型评估

比较泰米尔、泰卢固、卡纳达、马拉雅拉姆语的单语与多语GPT-2模型,单语模型在分类和分词效率上优于mGPT。

04:00
arXiv cs.CL

无意义谬论:古典阿拉伯语中任意符号的结构性不可能

数学模型证明古典阿拉伯语词义由词根模式决定,相对任意性可判定且小于一,反驳后现代语义无限不确定论。

04:00
arXiv cs.CL

Archer:扩散语言模型中缓存隐藏状态的自适应重用以实现高效回滚

提出Archer免训练KV缓存法,非对称重用提示状态,加速扩散模型回滚,兼提质量与速度。

04:00
arXiv cs.CL

论基础模型在认知科学中的应用

基础模型作为认知模型需经四阶段推断框架评估,行为拟合不足,须结合理论承诺、诊断性任务与对比评估才有科学意义。

04:00
arXiv cs.CL

立法听证证词中的自我介绍检测

用机器学习检测立法证词自我介绍,XGBoost加BERT特征最优,F1达0.9782。

04:00
arXiv cs.CL

努力思考而非聪明思考:推理模型无法跨问题分配测试时计算

推理模型在共享算力预算下无法按难度和分值跨题分配,只会按顺序贪心解题,且忽略分值,规划提示也无效。

04:00
arXiv cs.CL

APEX-VW:医疗领域文档级英西译后编辑数据集

构建首个医疗文档级英西译后编辑数据集,含4个MT系统、专业译者人工修正,支持术语规范与纠错传播研究。

04:00
arXiv cs.CL

提示嵌入探针(PEP):从隐藏状态检测大语言模型的幻觉

提出提示嵌入探针,从冻结模型隐藏状态检测幻觉,优于标准线性探针,预生成与跨模型有效,跨数据集迁移难。

04:00
arXiv cs.CL

SurakshaEval:面向多语言大语言模型的印度语言安全基准

新基准覆盖十种印度语言及英语,发现LLM在印度语安全上存在过度拒绝、漏检,亟需地区化评估。

04:00
arXiv cs.CL

DialectS2S:面向低资源中文方言的端到端语音对话建模

提出自对齐语音监督的两阶段训练,用于低资源中文方言端到端语音对话,提升方言一致性、响应质量和可懂度。

04:00
arXiv cs.CL

"我名众多":稀疏自编码器下助手及其人设的剖析

稀疏自编码器揭示:角色扮演保留助手核心但逐层分化,故事角色无此核心;默认设置下助手也会漂移入沉浸模拟。

04:00
arXiv cs.CL

承诺先于实现:掩码扩散语言模型中无分类器引导何时变得不必要

无分类器引导并非始终必要:多数提示无需即可成功,部分有害;收益集中于早期,承诺视界后切回基础模型不影响成功率。

04:00
arXiv cs.CL

思维与无思维:借助稀疏自编码器解读大语言模型的推理机制

本研究用Top-K稀疏自编码器分析7B模型,发现思维模式依赖稀疏高烈度特征,无思维模式则采用自适应扩散模式;抑制关键特征会破坏推理结构、引发补偿性生成,表明推理与语法紧密耦合。

04:00
arXiv cs.CL

团结中的智慧:多语言训练在谚语比喻识别中的作用

仅需50%多语言数据即可近最优识别谚语比喻;多元比喻框架中文化特定形式增益最大。

04:00
arXiv cs.CL

引导向量的安全成本可分离且可降低

安全退化源于引导向量中可分离成分,移除它可在保持引导效果同时恢复安全性,且代价极小。

04:00
arXiv cs.CL

LLM智能体能遵循剧本吗?交互式叙事中长程一致性的基准

提出NCP挑战与NCP-Bench基准,测试LLM在交互叙事中保持长程一致性,发现语言质量高不代表承诺保持佳,最佳模型20轮存活率仅42%。

04:00
arXiv cs.CL

焦点粒子与人类和语言模型中的标量推理

测试人与大语言模型对“甚至”“仅”等焦点粒子的标量判断,结果相似但机制可能不同。

04:00
arXiv cs.CL

STEMMA:评估大语言模型自我身份一致性的对抗式多智能体框架

STEMMA多智能体对抗提示评估显示,蒸馏模型习得教师身份行为,多数自我身份不一致。

04:00
arXiv cs.CL

NeuPAT:用于保持语言能力的多模态大语言模型的神经元感知可塑性分配调优

NeuPAT用神经元级可塑性分配约束保护语言敏感神经元,维持多模态性能同时恢复94.5%语言退化。

04:00
arXiv cs.CL

AraSSM:面向阿拉伯语掩码语言建模的双向状态空间编码器

提出AraSSM,首个阿拉伯语双向Mamba编码器,消费级GPU训练,在多数NLU任务上媲美或超越Transformer基线。

04:00
arXiv cs.CL

评估指标能否检测文言文到英文翻译中的错误?

现有评估指标在文言文英译中有盲区,MetricX24最佳,需更鲁棒可解释的指标。

04:00
arXiv cs.CL

基于事实且分解的抽象式摘要关系级幻觉评估框架

提出依赖感知关系抽取算法和归一化RHI指标,实现关系级幻觉的稳定区分测量,推进摘要忠实度评估。

04:00
arXiv cs.CL

从语音到交互:鸡尾酒会场景中的多模态系统分析

分析鸡尾酒会多模态系统,三大策略互补降误57%,发现高重叠非性能瓶颈主因。

04:00
arXiv cs.CL

推理大语言模型中的隐藏语言一致性现象

推理模型语言一致性随难度变化,存在崩溃效应;仅凭准确率不够,需结合一致性与难度评估。

04:00
arXiv cs.CL

大型语言模型中专家混合架构的演进:路由、拓扑、负载均衡与专家并行

专家混合架构综述:路由、拓扑、负载均衡、专家并行,趋势为解耦语义路由、计算预算与物理执行。

04:00
arXiv cs.CL

识破虚张声势:利用有序推理链正则化检测不断变化的有害聊天对话

提出BRACE,基于有序推理链正则化检测多变有害对话,四阶段监督与特征增强,跨领域宏F1达0.934。

04:00
arXiv cs.CL

超越表格:Doc2DB-Bench——面向关系忠实的文档到数据库构建

提出Doc2DB-Bench基准,将长文档构建为关系数据库,含42模式、203实例,检验关系忠实性。

04:00
arXiv cs.CL

缓解英语到罗马尼亚语机器翻译中的性别偏见

结合LLM性别分类与NMT,用性别标签提升英罗翻译性别准确率超40个百分点,引入三个数据集。

04:00
arXiv cs.CL

OpenVisTool:合成指导性视觉工具使用轨迹的开放方法

提出新框架,以结果正确与因果效用筛选轨迹,生成有效监督,提升视觉工具使用能力。

04:00
arXiv cs.CL

北非缺失的框架:NLP驱动的阿尔及利亚心理健康护理及对低资源环境的启示

首个阿尔及利亚NLP心理健康框架:识别语言、地理、污名、基础设施四障碍,提出低资源环境路线图。

04:00
arXiv cs.CL

VectraYX-Vision-1B:面向西班牙语/拉美网络安全的亚20亿参数视觉语言模型,具备结构化视觉推理与原生工具使用能力

首个西语拉美网络安全视觉语言模型小于2B,支持结构化视觉推理与工具调用,但视觉定位失败B6约0,已开源。

04:00
arXiv cs.CL

利用大语言模型增强科学命名实体识别:一种类型驱动的多任务学习方法

提出类型驱动的科学命名实体识别方法,利用实体类型过滤、多任务学习和示例选择,性能媲美全监督模型。

04:00
arXiv cs.CL

LibraSpec:基于边际增益驱动的动态扩散投机解码

提出LibraSpec,通过边际增益优化动态选择投机长度,无需训练即插即用,显著提升推理速度。

04:00
arXiv cs.CL

大型音频语言模型中的多语言情感神经元

首次揭示大型音频语言模型跨语言情感神经元,提出CR-Fusion识别,跨语言干预更精准,低资源语言获益更多。

04:00
arXiv cs.CL

OmnilingualGAIA2:评估前沿AI代理的多语言差距

AI代理跨语言差距8.8-18.4分,主因模型而非翻译,不随规模缩小;非拉丁语系易词形线索丢失和歧义

04:00
arXiv cs.CL

能否优化性能与碳排放的盈亏平衡点?探索更绿色的LLM

将碳代理纳入微调目标,发现碳项因任务结构起干扰或正则作用,存在模型相关的盈亏平衡区。

04:00
arXiv cs.CL

不确定但确定:揭示扩散语言模型中的表示-置信度差距

扩散模型内部能准确检测错误,但外部置信度虚高致排序下降;轻量工具用隐藏状态改善排序,零额外生成。

04:00
arXiv cs.CL

LLM预预训练的不稳定性:并非总有帮助——一项多语言调查

预预训练并非总提升效率;收益依赖设置和随机种子,仅小模型+Llama分词器+128-Dyck稳定,需多次运行。

04:00
arXiv cs.CL

可部署的逐实例多层激活引导用于大语言模型

提出逐实例多层激活引导:按输入选层,无需标签即可部署,恢复大部分收益且不损伤流畅性。

04:00
arXiv cs.CL

IDRAAK:从多智能体NLP到少样本提示的技术需求语义漂移检测

提出IDRAAK框架,用语言无关语义表示和少样本提示检测技术需求语义漂移,单次LLM调用达F1=0.983,优于复杂多智能体方法。

04:00
arXiv cs.CL

Tevatron-Elastic:训练弹性检索器与重排序器的统一抽象

提出统一抽象,涵盖少层、少词元、短嵌入三种弹性压缩,一次训练支持多规模,覆盖检索/重排和编解码模型。

04:00
arXiv cs.CL

基于证据校准的跨异构编码智能体技能运行时重建

提出证据校准的运行时重建系统,按证据等级重建异构编码智能体技能生命周期,保留未知阶段,区分事件与诊断。

04:00
arXiv cs.CL

序数分类中的位置偏差:系统评估

系统评估:大语言模型在序数分类中对标签顺序、示例顺序和位置均敏感;修正方法不可靠,需兼顾性能与稳定性。