10133 条条目 · 106 个活跃源
2026年7月7日
04:00
arXiv cs.CL

PAST-TIDE:基于原型锚定的语句调优与主题不变归一化的立场检测方法

采用语句调优、原型对比和主题不变归一化,低资源立场检测取得0.75/0.74宏F1。

04:00
arXiv cs.CL

意大利流行音乐中的语义同质化:一项历时分析

研究揭示意大利圣雷莫歌曲歌词语义多样性下降,开发新方法,证实全球语义同质化趋势。

04:00
arXiv cs.CL

评估语言关联性对大型多语言自动语音识别中跨语言迁移的影响

大型多语言ASR中,语言关联性预适应对低资源语言无实质提升,不能可靠预测迁移增益。

04:00
arXiv cs.CL

LP-SFT:基于多模态熵结构的局部保持有监督微调

提出LP-SFT,通过局部保持预训练熵结构,缓解微调能力退化,平衡准确率与多样性。

04:00
arXiv cs.CL

奥塞梯语COT:设计形态标注语料库与形态分析器

首个铁奥塞梯语形态标注语料库,基于BERT分析器准确率达95.60%。

04:00
arXiv cs.CL

评估大型语言模型用于反犹事件分类

LLM分类反犹事件有潜力但需改进,提供定义和示例可提升性能,可辅助早期监测。

04:00
arXiv cs.CL

DuplexChat:大规模构建说话人分离的全双工对话语音用于口语对话建模

提出DuplexChat语料库及流水线,从播客生成双通道对话语音,含英日共41.5万小时,支持全双工对话模型训练。

04:00
arXiv cs.CL

你框架它:概念表征如何影响LLM对反犹主义的检测与推理

概念表征影响LLM反犹检测:细粒度提升召回但降精度,大资源无额外收益,模型存在局限。

04:00
arXiv cs.CL

不失文本智能的统一音频智能

Audex统一音频文本LLM,多任务达SOTA且不损原文本LLM的推理、对齐等能力。

04:00
arXiv cs.CL

超越独立标签:基于施瓦茨几何的解码用于人类价值观检测

提出施瓦茨几何解码器,使价值观检测标签集更符合理论连续统,不牺牲F1,且仅对真实排序有效。

04:00
arXiv cs.CL

幕后黑手是谁?从德国Telegram帖子中标注与提取阴谋论行动者

针对德国Telegram帖子开发标注指南与语料库,用Transformer模型自动提取阴谋行动者,准确度合理,支持大规模分析。

04:00
arXiv cs.CL

MIRAGE:防御长篇RAG免受虚假信息污染

MIRAGE通过跨文档声明图与防御门控,无需训练即有效抵御检索污染,恢复长文本RAG事实性。

04:00
arXiv cs.CL

Rating the Pitch, Not the Product: User Evaluations of LLMs Reflect Expectations More Than Performance

04:00
arXiv cs.CL

EdgeBench:揭示真实世界环境下学习的缩放定律

基于38,000小时交互,发现agent环境学习遵循log-sigmoid缩放定律,速度每季度翻倍,开源51个任务。

04:00
arXiv cs.CL

知识内蕴,言语外显:解耦LLM数学可解性的潜在方向

LLM中数学可解性知识与言语化编码分离,伪造主因言语化变化,操纵言语化可提升模型拒答能力。

04:00
arXiv cs.CL

RABBiT:基于脑调谐的快速自适应BOLD基础模型,实现语音诱发脑反应的精准零样本与少样本预测

RABBiT通过区域注意力和成分分解,实现语音fMRI零/少样本精准预测,10分钟数据微调即可超越现有模型。

04:00
arXiv cs.CL

多大型语言模型协同临床记录严重程度评估

MOSAIC框架利用多LLM协同评估2型糖尿病严重程度,生成有临床意义的表型,优于传统规则方法。

04:00
arXiv cs.CL

也门伊比阿拉伯语中疑问词一致现象的句法研究

通过跨阶段一致分析,揭示疑问词一致中匹配与特征赋值的分离,为普遍语法提供有力证据。

04:00
arXiv cs.CL

还剩多少?大语言模型线性编码剩余输出长度

研究发现,LLMs能从提示最后隐藏状态线性解码总响应长度,该编码跨数据集通用,且能捕捉模型撤回重试行为。

04:00
arXiv cs.CL

FOI-O: 新西兰首个信息自由流程建模本体与验证方法包

FOI-O是新西兰首个可复用的信息自由流程建模方法及验证包,支持多种标准格式,但非官方法律建议。

04:00
arXiv cs.CL

拒绝忠实性:神经元选择器的因果审计

因果审计发现,归因分数可识别重要神经元行,但秩稳定选择器可能因果无效;拒绝由冗余子空间实现。

04:00
arXiv cs.CL

REDDIT:基于回放分布编辑的ASR模型生成时间戳漂移校正方法——避免遗忘

提出REDDIT框架,通过回放分布编辑校正ASR时间戳漂移,避免灾难性遗忘;仅更新1.6%参数,长间隔mIoU从38.7%提升至95.0%。

04:00
arXiv cs.CL

SPEARBench:流式语音到语音语言模型自然度评估基准

SPEARBench评估流式语音到语音模型自然度,发现模型在延迟、方言保持等方面与人类存在差异。

04:00
arXiv cs.CL

超越满意度:学习内容、评论与幸福感之间的关联

研究表明评分和情感仅部分反映幸福感,内容主题与幸福感有特定关联,推荐系统应超越满意度目标。

04:00
arXiv cs.CL

愤怒但准确:检测与描绘推特上的反错误信息生态系统

反错误信息帖子情绪更负面(愤怒等),且来自更成熟的用户账户。

04:00
arXiv cs.CL

渐进式精炼:一种面向中英混合语码转换语音识别的迭代伪标签方法

首次将迭代伪标签法用于中英混合语音识别,三阶段训练降低混合错误率6.35%-8.29%。

04:00
arXiv cs.CL

基于时间不变表示的流式神经语音编解码器

TiCodec分解时间不变表示,中间层捕获说话人/环境信息,Dual-TIRE提升重建质量,流式推理低延迟可行。

04:00
arXiv cs.CL

SalAngaBhava:一个基于方面的情感分析的僧伽罗市场数据集

发布首个僧伽罗语方面级情感分析数据集,含产品评论的方面-情感标注,推动低资源NLP研究。

2026年7月3日
04:00
arXiv cs.CL

TokenScope:面向大语言模型代码任务的令牌级可解释性与可理解性

TokenScope通过令牌级度量、注意力模式和AST聚合,交互式探索LLM代码生成决策路径。

04:00
arXiv cs.CL

在词边界突破安全防线:BPE分词如何产生LLM对齐的可利用漏洞

BPE分词将安全词拆成子词,形成对齐漏洞,可翻转80-100%的拒绝触发,48%产生有害输出。

04:00
arXiv cs.CL

基于溯源分析的LLM代理对齐防护

提出ProvenanceGuard,通过溯源分析检测代理工具调用是否与用户意图对齐,将误判率从42.9%降至1.8%,有效防护对齐失误。

04:00
arXiv cs.CL

SPARCLE:通过对比语言嵌入实现说话人感知的对齐表示

SPARCLE通过对比学习对齐字素与声学表示,在低资源TTS中将词错误率减半。

04:00
arXiv cs.CL

Kara:通过滑动窗口KV缓存压缩实现高效推理LLM服务

提出Kara滑动窗口KV缓存压缩,利用双向注意力选择信息对并扩展为块,结合KvLLM框架提升LLM推理吞吐量。

04:00
arXiv cs.CL

提示框架扭曲了基于计数的LLM错误检测评估:来自数值锚定的证据

提示中的数值锚定导致LLM错误检测F1分数虚高,与实际定位脱节,建议采用跨度感知指标。

04:00
arXiv cs.CL

将文本映射到多重图:莱维行走引导的提示压缩图剪枝

RAGP将提示压缩建模为多重图冗余感知剪枝,以莱维行走平衡局部与全局搜索,4倍压缩下平均分49.3,超越现有方法。

04:00
arXiv cs.CL

办公理解基准

首个公开基准OCB,评测LLM对Word、Excel、PowerPoint文件理解,最强系统仅达59.3%。

04:00
arXiv cs.CL

TurnNat:双人对话中话轮转换自然性的自动评估

提出TurnNat框架,基于似然自动评估双人对话话轮转换自然性,有效识别异质时序扰动。

04:00
arXiv cs.CL

RuleChef: 基于人类可编辑规则融入LLM任务知识

RuleChef利用LLM将任务知识转化为可编辑规则,通过迭代优化和人类反馈生成快速、可解释的规则系统。

04:00
arXiv cs.CL

基于互信息的多目标探索与偏好优化

通过最大化联合条件互信息统一多目标探索与对齐,实现可控生成和稳定权衡。

04:00
arXiv cs.CL

语言模型真的能进行上下文检索吗?在百万级token的文档中陷入困境

首次系统研究百万token上下文检索,揭示注意力稀释效应,通过长度感知调整和稀疏注意力,使模型匹配甚至超越密集检索。

04:00
arXiv cs.CL

RusFinChain:面向金融领域可验证思维链推理的俄语基准与模糊对齐评估

提出俄语金融可验证思维链基准RusFinChain,含5280示例及新指标;评估8个LLM发现推理差距,新指标与答案正确性相关性更强。

04:00
arXiv cs.CL

Grounded Optimization: 一种用于减少自动个人文档重写中LLM幻觉的分层工程框架

提出五层工程框架减少LLM文档重写幻觉,实验将幻觉率降至0.04-0.24。

04:00
arXiv cs.CL

MultAttnAttrib:长文档问答中的无训练多模态归因

提出无训练多模态归因方法,利用注意力定位证据,性能优于强基线,延迟低至1/7。

04:00
arXiv cs.CL

IsoSci:评估大模型推理与知识检索的同构跨域科学问题基准

IsoSci显示LLM推理增益91.3%依赖领域知识,链式思维提升不足5%,推理专用模型反而不如标准模型,挑战了推理的通用性。

04:00
arXiv cs.CL

从单语到多语:评估Mamba在南非语言语音识别中的应用

Mamba在单语ASR中与Conformer精度相当但资源更省;多语训练提升性能,语言嵌入增强跨语料鲁棒性。

04:00
arXiv cs.CL

FaithMed:训练大语言模型实现可信的循证医学推理

提出FaithMed框架,用步骤级奖励与优势分组强化学习,提升医学LLM推理忠实度,平均提高9%任务成功率。

04:00
arXiv cs.CL

监督式政治立场标度架构比较

本文整合文本标度方法,探究联合预测能否提升性能及分类与回归间是否存在中间地带。

04:00
arXiv cs.CL

参数高尔夫:什么真正有效?

资源受限下分析84种优化技术,多数贡献微小,仅少数方法降低13.6% BPB。

04:00
arXiv cs.CL

重新思考语音-LLM集成用于ASR:通过交错实现有效的语音-文本联合训练

提出JSTIP交错预训练,在ASR中提升实体识别,减少模态差距,保留LLM先验。

04:00
arXiv cs.CL

超越怀疑:用适应性教学警惕框架评估LLMs的教学意图推理

提出APV框架,提升LLMs教学意图推理,与人类判断高度相关(r=0.958),稳健处理自然数据。