9766 条条目 · 106 个活跃源
2026年9月15日
04:00
arXiv cs.CL

CVSS-X:面向28种语言的多语言语音到语音翻译语料库

发布CVSS-X语料库,将英译扩展至28种语言,约24万对语音、超1.6万小时,规模为CVSS八倍,含两种变体,质量相当。

04:00
arXiv cs.CL

锥形束CT报告生成中部分可观测目标下的临床推理

CBCT颌面报告生成中,复合目标仅词法项可见;优化复合目标提升事实蕴涵,词法指标偏爱听写惯例。

04:00
arXiv cs.CL

面向生物医学与临床文本抽取式摘要的混合分层一维CNN-BiLSTM框架

提出分层1D-CNN-BiLSTM抽取式摘要,直接选句避免幻觉,提升生物医学与临床文本事实可靠性。

04:00
arXiv cs.CL

RFCLLM:评估大语言模型对网络协议状态机的推理能力

通过4类任务、1482条查询覆盖16种协议,评估大模型将自然语言规范映射为有限状态机的能力与偏差。

04:00
arXiv cs.CL

PhysMent:面向物理问题中大语言模型推理的交互式方法

PhysMent 让 LLM 通过 MuJoCo 模拟器交互实验推理物理;定性任务达80%,多步定量任务多低于30%,瓶颈在工具使用而非概念。

04:00
arXiv cs.CL

全双工语音大模型中伪起音的因果分析与缓解

全双工语音LLM静音下虚假发声源于条件概率骤增,提出因果反事实抑制法实时剔除伪起音,不损真实响应。

04:00
arXiv cs.CL

临床时序推理中的后见之明偏差:未来数据暴露如何影响大语言模型判断

配对基准测量临床时序推理的后见偏差:完整时间线暴露使大模型产生偏差,时间遮蔽可降低偏差而不损准确率。

04:00
arXiv cs.CL

面向大语言模型的词汇级提示压缩:一种免训练、确定性的流水线及跨十一类任务的实证帕累托分析

提出免训练、确定性的词汇级提示压缩流水线,40.3%压缩下保真度0.876,并刻画各任务帕累托前沿。

04:00
arXiv cs.CL

多语言语音识别中的Token合并:跨模型规模与微调的系统研究

系统评估Whisper的Token合并,覆盖16种语言和3种规模;提效且几乎不损准确率,微调后仍有效。

04:00
arXiv cs.CL

TestHallVQA:探索科学考试冗余上下文下 LVLMs 的文档级推理

提出 TestHallVQA 多图基准与 F1-R² 指标,评测 LVLM 在科学考试冗余上下文中的文档级推理与证据检索鲁棒性。

04:00
arXiv cs.CL

基于抽象语义表示的完整医院出院摘要生成

提出证据驱动的出院摘要框架,用语义图和深度学习实现跨文档对齐,确保每句有据可查,减少幻觉。

04:00
arXiv cs.CL

当编辑定位放大相对选择偏差:梯度几何、目标不匹配与重要性加权

编辑定位放大相对选择偏差,方向由梯度几何与目标不匹配决定;重要性加权可校正,实验显示相对偏差升而绝对偏差降。

04:00
arXiv cs.CL

同一患者,不同医嘱:重复运行下临床 LLM 智能体的动作级可靠性

临床 LLM 智能体相同输入重复运行会开出不同医嘱,单次评分掩盖动作级不稳定,需重复运行与动作稳定性评估。

04:00
arXiv cs.CL

从词元概率到语义约束:迈向语言模型的声明式概率评估

提出ModelLog声明式概率框架,将评估目标设为词元预测的符号约束,评估分数可作损失,连接评估与学习。

04:00
arXiv cs.CL

盲选之中:为机器翻译评测构建伪参考译文

七模型多提示翻译全文,无参考QE评分选优并由GPT-5.5后编辑,加语言识别惩罚消除错语种。

04:00
arXiv cs.CL

墨尔本大学 WMT 2026 CreoleMT 投稿:一种面向低资源太平洋克里奥尔语机器翻译的领域均衡方法

面向太平洋克里奥尔语机器翻译,先领域不平衡预训练再均衡微调,性能超开源基线3+ chrF++。

04:00
arXiv cs.CL

并非所有否定线索都相同:词缀否定能带来更好的否定理解

构建180万样本、200余种线索的NegCue;预训练显示词缀否定增益最大,单字否定有限,继续预训练可提升模型否定理解。

04:00
arXiv cs.CL

LayerRoute:面向高效LLM推理的自适应跳层与LoRA质量保持

提出LayerRoute,以逐层硬门控结合LoRA联合微调实现自适应跳层;10次训练均定位9个中间可跳层,提速约1.04倍且质量不降。

04:00
arXiv cs.CL

危害性传播动力学:大语言模型中对抗意图的逐层轨迹

发现有害提示的危害投影随层数单调上升,据此构建轻量分类器HERALD,越狱检测F1达98.4。

04:00
arXiv cs.CL

大型语言模型中的领域特定术语:通用模型与专用模型的比较分析

通用LLM医学术语任务反超医学微调模型;机制分析揭示误校准,重加权弥合差距,术语组件可跨域迁移。

04:00
arXiv cs.CL

HyperProve:面向多跳问答的答案引导超图扩展

结合问题分解与答案引导超图扩展,以中间答案和支持超边为检索状态,多跳问答准确率平均提升6.2%。

04:00
arXiv cs.CL

通过自动前群超标注扩展印地语量子自然语言处理

印地语前群超标注改为词级分类,380句上上下文回退达64.56%,符号修复使大模型达64.08%。

04:00
arXiv cs.CL

PolicyMem:面向大语言模型治理的几何策略记忆

将自然语言策略外化为可复用的低秩子空间几何记忆,以投影能量支撑检测-改写-验证闭环,五个基准取得最优检测效果。

04:00
arXiv cs.CL

ForeSight:通过早期安全信号蒸馏增强风险监控

提出ForeSight框架,仅用首token隐藏状态蒸馏早期安全信号,实现高效准确的风险预测。

04:00
arXiv cs.CL

深入VLM图表阅读:追踪垂直条形图中跨空间与深度的数值读取

激活修补显示,VLM读柱状图时柱顶、图例与提示序列状态跨层传递,共同支撑精确定值。

04:00
arXiv cs.CL

甜言蜜语者:提问表述如何塑造恋爱关系建议中的谄媚行为

研究以2400条恋爱提问测评两模型:语气影响小,视角框架影响更大,多轮谄媚递增,某模型更抗道德谄媚。

04:00
arXiv cs.CL

SyRHM:面向零样本有害模因检测的符号语言增强推理与联想检索

SyRHM将有害模因检测分解为语义检索与符号语言增强的多阶段推理,在多个数据集上超越多模态与推理基线。

04:00
arXiv cs.CL

DARE:面向结构化知识事实核查的辩证智能体推理

DARE多智能体框架以检索-推理-反思迭代,结合辩证双向验证与置信度元反思,8B模型事实核查准确率达88.12%。

04:00
arXiv cs.CL

当一致性不等于可靠性:评估本地大语言模型评判者与人类评分的一致性

本地开源LLM评判者自洽率超92%,但与人类评分相关性仅0.275/0.340,一致性不等于可靠性。

04:00
arXiv cs.CL

理解智能体化 ICD 编码的局限性

按稀有度评估:神经模型稀有码差0.43,工作流难处理损伤码,工具智能体提升0.34,无全能系统。

04:00
arXiv cs.CL

Phorecaster365:面向混合式药品销售预测与规划决策支持的人工监督参考架构

提出Phorecaster365人工监督参考架构,以预测上下文与证据包连接ERP数据与药品销售预测,并给出滚动评估与分阶段验证协议。

04:00
arXiv cs.CL

米赞:面向伊拉克阿拉伯语与伊拉克公民语境的大语言模型评估国家基准

伊拉克发布方言基准Mizan,含六维评测;27系统测试显示标准语饱和、方言区分度高,专用模型反逊。

04:00
arXiv cs.CL

ShopEase:基于生成式AI的多智能体框架,利用混合检索增强生成实现智能企业客户支持

ShopEase用FAISS+BM25混合检索,纯FAISS准确率85.37%最优,重排序未增益。

04:00
arXiv cs.CL

孟加拉语句子功能分类:语料库构建、模型基准评测与可解释性

构建1万句孟加拉语四类功能标注语料,TF-IDF双层集成模型准确率与宏F1均达0.95。

04:00
arXiv cs.CL

衡量多语言机器翻译评估中语言变体混同的代价:将莫桑比克希昌加纳语、尼亚尼亚语和塞纳语加入FLORES+

FLORES+新增莫桑比克三种班图语,参考变体选择显著影响评分,变体感知微调可提升目标变体表现。

04:00
arXiv cs.CL

LLM与规则标注在推理性叙事特征上的评分者间信度:基于土耳其语语料库的三项研究

土耳其语叙事语料:五种LLM与规则标注对“具象隐喻”的人评一致性近乎随机,高一致率系类别失衡假象。

04:00
arXiv cs.CL

North Small Translate:先进的高性价比翻译(Cohere CAT+)

开源MoE翻译模型,五步训练,支持50语种,1T参数内领先,推理无需昂贵思考。

04:00
arXiv cs.CL

思维缺乏系统性?评估推理模型在规则归纳任务上的表现

推理模型常能解原任务,却在结构等价变体上失败,缺乏系统性,难稳健评估其认知能力。

04:00
arXiv cs.CL

SHIFT-M3:面向多模态心电记录完整性的融合前对齐一致性筛查

提出SHIFT-M3,以融合前文本对齐筛查心电记录跨患者错配,78万条数据高精度检出互换与硬负例,纵向跨访视仍误报。

04:00
arXiv cs.CL

CRITICS——无国界的批判性科学:语言模型促进科学教育中的批判性思维

融合大模型机器翻译与教育科技,提供科学内容母语翻译,破除语言壁垒,促进科学知识普及与批判性思维。

04:00
arXiv cs.CL

解锁不可解:面向数据高效RLVR的教师引导式课程学习

借助教师模型部分推理轨迹构建难度课程并逐步撤除引导,仅用128道无解难题即达2000题GRPO水平,数据效率约提升16倍。

04:00
arXiv cs.CL

评估前沿大语言模型在自动化研究中的创造力

提出价值与新颖性两类指标评估前沿大模型自动化研究的创造力,发现变量级新颖性与研究表现关联最强。

04:00
arXiv cs.CL

面向大语言模型的演化式上下文参数化

提出MUSE任务与基准,并设计免训练方法PLUME,在序列演化场景下显著提升上下文参数化更新效果。

04:00
arXiv cs.CL

检索增强生成中的归因—压缩前沿

压缩减少生成器输入,却严重损害引用归因;提取式选择归因较稳,但答案质量下降。

04:00
arXiv cs.CL

当工具成为阻碍:不必要的工具可用性对LLM作答的影响

无关工具可用会使LLM答题率从98.2%降至63.5%,即便不调用;一句范围提示即可恢复大半。