9975 条条目 · 106 个活跃源
2026年8月7日
04:00
arXiv cs.CL

使用Whisper的波斯语语音情感识别中ASR适配与表示降维研究

波斯语情感识别中,Whisper编码器特征经PCA降维有效提升性能并降低开销,ASR微调收益有限。

04:00
arXiv cs.CL

英语源多语言RAG中隐私风险何在:跨五种查询语言的分阶段审计

英语源RAG中,仅输出过滤时英语泄露最高;加输入审核后阿语和斯瓦希里语仍残留,附加原文可堵住15/17。

04:00
arXiv cs.CL

大语言模型中的条件性认知偏差:有偏用户轮次如何调节上下文推理

提出三条件框架评估多轮交互偏见,8个模型中6个偏差增强,并识别两种竞争机制。

04:00
arXiv cs.CL

DREAM:基于事件感知记忆图的LLM动态角色扮演

DREAM用事件记忆图构建动态双粒度角色画像,提出TCM基准,在多个测试中达最优,增强角色一致性与可解释性。

04:00
arXiv cs.CL

ConWriter:转换约束下的有状态长篇故事生成与轻量级神经符号一致性控制

ConWriter是无需训练的框架,通过场景级增量生成、符号状态推理和风险信号,维持长故事一致性,避免错误累积。

04:00
arXiv cs.CL

CNM-BERT:基于表意文字描述序列的汉字即插即用结构嵌入

CNM注入汉字IDS树结构至BERT,不改主干,OOV准确率+9.8,F1+7.7,多项任务提升。

04:00
arXiv cs.CL

LLM翻译中的数值本地化分析

分析五款可本地运行的LLM对时间、数字、日期的本地化能力,发现将本地化原则嵌入提示词显著提升准确率。

04:00
arXiv cs.CL

立场:是时候针对自洽性优化大语言模型了

提出以自洽性为框架理解大模型失败:根源于单输出评估假设,多种技术属一致性优化特例,优化可提升能力。

04:00
arXiv cs.CL

大语言模型中类人回指消解

探究五个大语言模型对回指消解多个因素的反应,发现其与人类认知存在选择性对齐,对语义干扰不敏感。

04:00
arXiv cs.CL

模型趋同与人类分殊:开放生成中分布多元性的覆盖框架

提出覆盖框架与两个指标,测LLM生成内容的分布广度,发现其集中于人类响应中心、狭窄但合理。

04:00
arXiv cs.CL

DBLAST:面向随机投机解码的依赖块草拟

提出依赖块草拟器,用低秩潜混合与面向接受的训练,提升随机投机解码的接受长度,尤其在高熵场景。

04:00
arXiv cs.CL

语调与词汇声调的交互:汉语方言中的边界现象

探讨汉语方言语调与声调的交互,聚焦边界现象,及其在传达疑问/陈述和态度信息中的作用。

04:00
arXiv cs.CL

承诺前锁定证据:冻结接口削弱LLM裁判评估

将证据冻结为下一轮输入会降低LLM裁判与人类偏好一致性(降4-6点),加剧顺序偏差(增8-10点),不如单次结构化判断。

04:00
arXiv cs.CL

FOCUS:解耦大语言模型中的专家人设以增强领域专家能力

提出FOCUS:正交分解解耦专家人设,门控模块自适应激活,提升金融、法律、医疗等跨领域任务准确率。

04:00
arXiv cs.CL

不同扰动,不同机制:理解持续预训练对零样本方言鲁棒性的影响

系统比较六种扰动持续预训练,发现字符噪声法显著提升零样本方言鲁棒性,且不同方法机制各异。

04:00
arXiv cs.CL

SkillZip:可扩展智能体技能库的契约保持图压缩

SkillZip用契约保持图压缩技能库,提升12.2点,压缩3.46倍,依赖保持99.2%。

04:00
arXiv cs.CL

语气至关重要:句法敏感性如何削弱安全对齐

非祈使句法形式可绕过安全对齐,拒绝受句法特征影响,源于数据偏差,增加句法多样性可缓解。

04:00
arXiv cs.CL

基于示例引导的文档级文本简化提示

示例引导提示通过检索平行语料中的简化示例,提升大模型文档级简化质量,优于仅提示及监督/规划系统。

04:00
arXiv cs.CL

接力而非路由:面向成本高效LLM驱动进化的自适应种群交接

LLM进化前期收益高、成本模型可替代强模型。提出训练无关框架,用廉价模型探索、强模型精炼,按种群交接分配预算,12设

04:00
arXiv cs.CL

先答后思:扩散大语言模型中的承诺顺序

扩散LLM自由承诺顺序致推理失败,有序承诺+思维链提升34.8个百分点,门控干预恢复性能。

04:00
arXiv cs.CL

用于改进随机索引嵌入的稀疏互信息图平均

在稀疏PPMI图上加权平均可修复弱随机索引嵌入,童话语料类比准确率从19.4%升至30.7%,但不如神经基线。

04:00
arXiv cs.CL

M³R-Bench:基于证据的多模态隐喻理解统一基准

提出M3R-Bench证据基准揭示跨模态错配 M3R-Reasoner以8B参数超越大模型

04:00
arXiv cs.CL

通过随机数生成缓解LLM-as-a-Judge的评分偏差

提出一种通过随机数生成测量并校准LLM潜在数字偏差的方法以缓解评分偏差并在四项评估任务上优于基线

04:00
arXiv cs.CL

一次响应,始终响应:通过潜在提示恢复检测LLM生成文本

提出EchoPrompt:恢复潜在提示并测量似然增益以检测LLM生成文本,无需训练,零样本检测达到最优且鲁棒。

04:00
arXiv cs.CL

任务条件流匹配用于平衡的多语言文本嵌入适配

提出任务条件流匹配,按任务分派优化目标,均衡多语言嵌入适配,在Indic基准上创最佳并泛化。

04:00
arXiv cs.CL

如何识别新词:上下文偏置方法与语音大语言模型的比较

对比上下文偏置与语音大模型识别新词:偏置法使目标词错误率降88%,大模型读稿优但泛化差且易受干扰。

04:00
arXiv cs.CL

语言模型的层次潜在预测

提出HiLP,用高层抽象潜在减少潜空间误差累积,增强长程推理与编码效率。

04:00
arXiv cs.CL

面向多语言数学推理的同策略差值蒸馏

OPD²以师生概率差为信号,多语言数学推理优于原法,韩日语提升显著缩小英韩差距;纯英语训练易偏向英语

04:00
arXiv cs.CL

面向事实性检查与幻觉检测的分解式蕴含

提出HallDetect轻量级无参考黑盒框架,分解内容为原子声明,用编码器蕴含模型验证,多数基准上优于基线。

04:00
arXiv cs.CL

利用合成查询探测映射嵌入模型间的相似性空间

提出合成查询探测法,学习跨嵌入模型分数映射,对齐相似性空间,提升阈值可移植性,等渗回归效果最佳。

04:00
arXiv cs.CL

MoCA:隐式社会情境分析

提出隐式社会情境分析任务与基准,发现大模型依赖显式线索表现不足,提出CoDAR框架显著提升推理。

04:00
arXiv cs.CL

FormBharo:在印度农村用于对话式填表的语音代理的设计与评估

为印度农村设计语音填表代理,混合大模型与规则控制,端到端评估显示需权衡准确率、成本与延迟,并发布基准。

04:00
arXiv cs.CL

通过分层推理与话语级目标奖励提升大语言模型的社交智能

提出TSR分层与LHRL-VGR,动态奖励提升社交智能,SOTOPIA上超GPT-4o 7.32%。

04:00
arXiv cs.CL

MACRO:Transformer层的马尔可夫链路由

MACRO框架将层路由建模为上下文相关的马尔可夫策略,无需修改权重即可实现跳过、重复等操作,在多个大模型上平均提升5.0%准确率,路由搜索时间缩减9.4倍。

04:00
arXiv cs.CL

基于LLM生成合成数据训练的临床沟通处理:结构化综述与新应用案例研究

综述LLM合成临床沟通数据的生成与应用,13个案例证明无需真实标注即可启动系统,但真实数据迁移验证仍有限。

04:00
arXiv cs.CL

MameLoshnLM:意第绪语语言模型与评测基准

首个开源8B意第绪语模型,构建语料与基准,超越同类模型,为低资源语言提供模板。

04:00
arXiv cs.CL

EpiBench:大语言模型能否理解抗体药物发现中的表位?

提出EpiBench基准,基于序列和功能数据评估大语言模型表位推理,覆盖五项相关任务,发现当前模型能力有限。

04:00
arXiv cs.CL

面向反馈驱动智能体修复的因果情景记忆

免训练MERIT以因果情景记忆优化Text-to-SQL:Spider69.79%,BIRD48.44%。

04:00
arXiv cs.CL

通过选择性上下文偏好优化学习何时信任

提出选择性信任问题,构建MIST基准与SC2W指标,发现模型普遍易受误导。SCOPE方法平衡优化各条件,降低误导翻转率,同时保持上下文准确。

04:00
arXiv cs.CL

基准的基准:对话智能体基准评估

提出无参考框架,用LLM评估对话基准的一致性、复杂度和策略覆盖,可区分质量并为人工基准提供诊断。

04:00
arXiv cs.CL

面向LLM个性化共写的免训练词元级引导

提出SteerWrite,免训练、词元级引导个性化共写,无需微调,适配小数据,显著减少人工编辑,达SOTA。

04:00
arXiv cs.CL

路由在最宝贵之处最难学习:Web智能体表示路由的界限

逐任务选观察模式的收益被噪声夸大;路由策略不优于固定模式,因监督受制于智能体成功率。

04:00
arXiv cs.CL

去殖民化自动语音识别中的语言政策:跨文化胜任语音AI框架

语音识别失败实为殖民语言等级,须以社区为共同设计者,经三害分类与七层模型实现跨文化胜任。

04:00
arXiv cs.CL

NeSy-RAG:用于可解释问答的神经符号RAG

提出神经符号RAG框架,生成可溯源的Prolog查询,自动检测缺失用户事实,ShARC准确率达61.1%,优于基线42.8%。

04:00
arXiv cs.CL

RP-OPSD:推理枢轴引导的同策略自蒸馏用于多语言推理迁移

提出RP-OPSD,用推理枢轴引导同策略自蒸馏,强化优质推理信号,提升多语言数学推理性能。

04:00
arXiv cs.CL

面向国家标准文件规则密集型审查的大语言模型基准评测与增强

提出标准审查基准,评测14种大模型,最优分数由0.328提至0.509,仍低于专家0.664。

04:00
arXiv cs.CL

工具调用的苦涩教训

程序化工具调用在基准上评测14个模型,多数匹配或超越JSON调用,并行与上下文退化下更稳健,是可行替代方案。

04:00
arXiv cs.CL

超越序列顺序:面向 Transformer 的语法感知位置嵌入

提出SiPE(语法感知位置嵌入),将依存句法先验注入位置编码,在SyntaxGym上提升10.3%、GLUE上提升8.2%,困惑度降9%,推理成本不增。

04:00
arXiv cs.CL

Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts

04:00
arXiv cs.CL

无CVE的漏洞:管理AI编码智能体中任务授权与权限之间的持续差距

提出APV概念,管理AI编码智能体任务授权与权限间持久差距,区别于CVE,提供模式、生命周期等。