10055 条条目 · 106 个活跃源
2026年7月23日
04:00
arXiv cs.CL

The Impact of Editorial Intervention on Detecting Native Language Traces

04:00
arXiv cs.CL

无需对齐数据的同步语音翻译

Hibiki-Zero模型无需词级对齐,基于句子级训练与GRPO强化学习优化延迟,实现同步语音翻译的SOTA性能。

04:00
arXiv cs.CL

设计性缺失:面向可撤销多模态情感分析的可证明模态删除

提出MBD框架,实现可撤销多模态情感分析,能在模态删除时保持性能并提供隐私-效用权衡。

04:00
arXiv cs.CL

内部知识无外显表达:探究古典中文语言模型的泛化边界

纯文言文模型内部能区分真假事件,但从不表达不确定性,元认知需额外训练。

04:00
arXiv cs.CL

EssayCBM:基于评分标准的概念瓶颈模型实现透明作文评分

EssayCBM将作文评分分解为8个可解释概念,实现透明可编辑的评分,性能匹配神经基线。

04:00
arXiv cs.CL

K12-KGraph:面向教育大语言模型评估与训练的课程对齐知识图谱

提出课程对齐知识图谱K12-KGraph及基准K12-Bench与训练集K12-Train,实验证明领域监督可提升模型性能。

04:00
arXiv cs.CL

基于量规的大语言模型评估中的自我偏好偏差

首证基于量规评估中的自我偏好偏差:客观标准下错误率超50%,主观场景偏差达10分,影响模型排名。

04:00
arXiv cs.CL

AugAbEx: 桥接抽象式与抽取式法律摘要生成

提出AugAbEx流水线,通过增强数据集引入银标准抽取摘要,提升法律摘要质量,在七个数据集上超越现有方法。

04:00
arXiv cs.CL

抽象促使语言模型和语音模型与大脑对齐

模型与大脑对齐源于共享意义抽象,中间层内蕴维度峰值预测脑信号,体现语义丰富性。

04:00
arXiv cs.CL

STEMTOX:从协作标签到细粒度有毒模因检测的熵引导多任务学习

提出TOXICTAGS数据集和STEMTOX框架,利用协作标签增强多模态毒性模因检测,显著提升性能。

04:00
arXiv cs.CL

SHOVIR: 评估放射学报告生成中视觉捷径学习的基准

SHOVIR基准通过局部遮挡实验检测视觉捷径,揭示高报告质量模型可能依赖浅层视觉证据。

04:00
arXiv cs.CL

流内智能体系统优化以实现有效规划与工具使用

提出AgentFlow框架与Flow-GRPO算法,通过流内优化协调四模块,显著提升规划与工具使用性能,超越GPT-4o。

04:00
arXiv cs.CL

大型语言模型文化偏见与对齐的提示编程

本文用DSPy提示编程优化文化对齐,减少LLM偏见,实现更稳定迁移。

04:00
arXiv cs.CL

情感对撞机:基于反情感反射的双曲镜像流形用于情感恢复

EC-Net双曲超图框架通过对比学习与超图融合,在模态缺失或噪声下显著提升情感识别准确率。

04:00
arXiv cs.CL

虚假共振:对语音生成评估中情感嵌入相似性的批判审视

批判语音生成评估中情感嵌入相似性指标,指出其受语言和说话者干扰,与人类感知错位。

04:00
arXiv cs.CL

基于LoRA微调的大语言模型通过多视角语音特征检测痴呆症

提出LoRA微调LLM,融合转录、主题、流畅度、音韵四种语音特征多视角推理,ADReSSo上F1达90.14%,各视角互补。

2026年7月22日
04:00
arXiv cs.CL

自我教学的分类器:用于动态文档分类的自我改进冻结门训练(SIFT)

SIFT通过廉价模型与LLM法官的自我教学循环,实现低成本高精度动态分类,并设安全门控防退化。

04:00
arXiv cs.CL

解码脑电信号以探究人脑中单词预测性

用EEG解码发现,词预测性对N400影响因词类而异:内容词强于功能词,动词强于名词,但名词预测信息更独特,解码技术优于传统分析。

04:00
arXiv cs.CL

构建欧洲多语言评估数据集:EMT网络内的MMLU本地化项目

DGT与EMT合作本地化MMLU至11种欧洲语言,为学生提供真实项目培训,突出方法论与工作流挑战。

04:00
arXiv cs.CL

Search-on-Graph-R1:使用强化学习训练大语言模型搜索知识图谱

通过监督微调和强化学习将知识图谱导航内化至8B小模型,无需昂贵推理,在多个数据集上超越前沿大模型,搜索效率更高。

04:00
arXiv cs.CL

面向大语言模型的卷积

深度卷积作为自注意力的轻量补充,在QKV前应用,提升下游性能且参数微增。

04:00
arXiv cs.CL

具有意义与表达替代灵活生成的语用推理计算模型

SAGE框架融合认知模型与语言模型,在语用任务中表现优异,但语言模型评估者可靠性不及生成者。

04:00
arXiv cs.CL

Relay-Bench:评估LLM的多领域推理链基准

Relay-Bench测量LLM跨多领域完成复合任务的能力,当前最优模型GPT-5.5得分43.3%。

04:00
arXiv cs.CL

使用微调大语言模型识别英国警方事件日志中的脆弱性指标

研究显示LLM可识别英国警方日志中的脆弱性指标,但直接输出不可靠,需人工校正与统计调整。

04:00
arXiv cs.CL

结构化输出导致44种语言模型的答案多样性下降

要求JSON格式回复时,模型答案趋同,模态答案占比从41%升至64%,多样性降低,机制在于寄存器而非解码器。

04:00
arXiv cs.CL

PathReportEval:病理报告生成的系统性基准

提出标准化基准和临床报告质量评分(CRQS),从临床事实覆盖、召回、幻觉率等维度评估病理报告生成,揭示临床正确性。

04:00
arXiv cs.CL

推理微调引发持久潜在策略状态

推理微调使模型产生持久潜在策略状态,具备功能特化与时间组织,可通过干预和剪枝提升性能。

04:00
arXiv cs.CL

RF-Agent:用于RFIC设计的语言Agent构建实用框架

RF-Agent通过教科书蒸馏构建RF推理数据集与基准,验证领域微调与语义检索可提升电路设计推理。

04:00
arXiv cs.CL

LatentMT:基于隐式推理的机器翻译

LatentMT利用隐式推理循环计算,使2.6B小模型在32个翻译方向上达到3-5倍大模型性能,中低资源语言SOTA,且计算更高效。

04:00
arXiv cs.CL

故事塑造智能体:LLM行为中的叙事先验

叙事框架比人物设定更能影响LLM行为,叙事先验解释方差能力数倍于人物,且大多与任务成功负相关。

04:00
arXiv cs.CL

缘何?解释模型对因果关系与对立关系的编码

通过可解释性分析,发现指令调优Transformer模型在编码因果关系与对立关系时,早期层与中层决策时机不同,且存在不对称偏好。

04:00
arXiv cs.CL

跨语言立场检测的推理引导知识蒸馏

用思维链引导大模型生成推理,蒸馏至小模型,双路径对齐表示与分布,对比学习增强判别,提升跨语言立场检测性能。

04:00
arXiv cs.CL

随机元遗忘:桥接语言主干与多模态遗忘

随机元遗忘(SMU)利用VLM级反馈学习遗忘初始化,实现最佳遗忘-保持权衡及可迁移性。

04:00
arXiv cs.CL

融合嵌入:文本、图像、视频和音频的统一嵌入空间

提出Fusion Embedding,在冻结视觉语言基础上添加音频模块,实现四模态统一嵌入,无需配对数据,单GPU训练数小时。

04:00
arXiv cs.CL

双注意力残差

提出双注意力残差,通过双向跨流交互改进历史检索,提升Transformer验证损失,保持深度多样性。

04:00
arXiv cs.CL

先诊断后微调:面向网络安全问答的小型LLM诊断研究

提出FiT框架,发现微调损害小型LLM的词汇与参数知识,指令微调更甚,诊断可预判微调效果。

04:00
arXiv cs.CL

AILQA:面向印度法律体系的AI法律问答系统评估

提出AILQA系统,利用检索增强生成提升印度法律问答质量,在律师资格考试中表现优异,但需应对模型幻觉挑战。

04:00
arXiv cs.CL

已知事实中的推理错误:面向大语言模型的步骤级自一致性组相对策略优化

提出SSC-GRPO,通过步骤级自一致性分数奖励,有效缓解LLM推理中的上下文敏感事实幻觉,实现SOTA性能。

04:00
arXiv cs.CL

HPD-Parsing:分层并行文档解析

提出分层并行解码,布局全局分析、内容并行解析,速度提升2.6倍以上,精度相当,开辟高效文档解析新方向。

04:00
arXiv cs.CL

从多语言流式ASR骨干到肯尼亚语言系统:以数据为中心的Nemotron 3.5适配基库尤语、多洛语和卡伦金语

本研究将Nemotron 3.5适配三种肯尼亚语言,通过数据审计与流式微调,Kikuyu和Dholuo的WER分别达42.97%和33.98%,Kalenjin仍有待改进。

04:00
arXiv cs.CL

CASE:因果对齐与结构增强提升思维链忠实性

CASE框架通过因果对齐和结构约束解决思维链不忠实问题,平均提升37%忠实性。

04:00
arXiv cs.CL

转录策略作为潜在变量:通过词级时间控制激活可控逐字ASR

将转录风格作为潜在变量,实现可控逐字ASR,提升零样本/微调效果与词级时间戳,提出verbatimize任务。

04:00
arXiv cs.CL

约束CTC解码的高效变音符恢复

提出约束CTC解码高效恢复阿拉伯语变音符,降低错误率,提升性能与效率。

04:00
arXiv cs.CL

解析NLP中的课程学习:迈向统一分类法

提出细粒度分类法,区分难度评估与训练调度,揭示NLP课程学习中的系统不可比问题,支持策略设计与分析。

04:00
arXiv cs.CL

基于未来反馈预测的开放域对话技能可验证自我进化

提出未来反馈预测方法,将对话反馈转化为固定离线目标,实现可验证的自我进化,准确率超75%。

04:00
arXiv cs.CL

AutoJourn:自动化新闻中LLM生成新闻的多视角摘要、偏见检测与中和

AutoJourn系统实现多视角摘要、偏见检测与自动中和,提升新闻多样性与公正性。

04:00
arXiv cs.CL

多样化语音的人类与自动语音识别基准测试:初步结果

人类与ASR在多样化语音识别上表现相近,ASR有时更优;未来需增强对年龄和口音变化的鲁棒性。

04:00
arXiv cs.CL

中文标题:内容即剩余:基于并行话语的不变语音分词

中文摘要:通过并行话语对齐,让语音分词仅保留共享语言内容,消除声学变异,大幅降低说话人识别准确率与语言模型困惑度。

04:00
arXiv cs.CL

超越分数预测:基于LLM的论文评分与反馈生成——通过带有评分标准奖励的强化学习

提出RLAES框架,用强化学习联合优化评分与反馈生成,引入RFE评估反馈质量,在ASAP基准取得最佳评分性能(QWK=0.803)。

04:00
arXiv cs.CL

翻译即增强:翻译数据对难度评估的影响

通过机器翻译将高资源语言标注数据迁移到低资源语言,增强训练集,显著提升难度评估准确性。