10213 条条目 · 106 个活跃源
2026年5月28日
04:00
arXiv cs.CL

分析技术文档RAG助手中使用LoRA适配的质量-延迟-资源权衡

在Kubernetes文档RAG系统中,通过LoRA微调分析质量-延迟-资源权衡,发现仅适配q,v注意力投影效果最优。

04:00
arXiv cs.CL

SuperValid:面向泛化下游扩展的能力对齐OOD验证

SuperValid合成OOD能力对齐数据,训练时无需评估即可预测下游性能,支持模型选择与扩展。

04:00
arXiv cs.CL

当自信误导:扩散语言模型的后缀锚定与锚定邻近置信度调制

针对高置信度导致生成不完整和过早解码问题,提出后缀锚定置信度调制,改善非自回归解码性能。

04:00
arXiv cs.CL

DEPART: 分解多语言大语言模型中的语言差异

贝叶斯框架分解多语言大模型性能差异,语言特征解释79%以上方差,模型表示相似性主导预测,NLU与推理方差分布不同。

04:00
arXiv cs.CL

BenGER:德国法中基于涵摄的法律推理的大语言模型系统基准测试

BenGER基准含1127项任务,评估12种LLM在德国法涵摄推理能力,闭源旗舰领先,人机共创优于纯人工。

04:00
arXiv cs.CL

更难的文本嵌入基准(HTEB):超越一维静态鲁棒性

HTEB从词汇、长度、语言三维度动态评估文本嵌入鲁棒性,揭示模型特定弱点,挑战静态基准。

04:00
arXiv cs.CL

框架至关重要:通过基于行为的价值对齐解决决策中的框架敏感性问题

LLM在事实等价但不同框架输入下决策翻转率达28.6%,Valign通过表征级锚定价值对齐,有效抑制框架敏感性。

04:00
arXiv cs.CL

当有益的上下文泄露:领域自适应ASR中的隐私风险

领域自适应ASR的提示与微调可泄露隐私,组合加剧,无上下文微调是平衡最佳策略。

04:00
arXiv cs.CL

将混合专家模型剪枝并蒸馏为稠密语言模型

提出MoE转稠密框架,多样性感知评分最优,准确率提升6.3%,训练快1.6倍。

04:00
arXiv cs.CL

IFMTBench:多语言翻译指令遵循的综合基准

IFMTBench是一个多语言翻译指令遵循基准,覆盖7种语言和6种约束维度,揭示模型在指令遵循上的关键差距。

04:00
arXiv cs.CL

大型语言模型下的论证质量评估:一种成对Bradley-Terry方法

LLM评估论证质量与专家中等相关,Llama-70B最优,预测稳定。

04:00
arXiv cs.CL

监督语义差异法用于跨文化概念分析:以人类情感为例

提出跨语言SSD方法,在情感词库中验证了效价、唤醒、支配维度的跨语言对齐与残余差异,为跨文化心理意义比较提供可解释框架。

04:00
arXiv cs.CL

PrunePath:迈向高度结构化稀疏语言模型

PrunePath通过软max路由与累积阈值实现FFN层自适应结构化稀疏,兼顾性能与解码加速。

04:00
arXiv cs.CL

以社区为中心的普诺克丘亚语NLP资源建设

为普诺克丘亚语构建首个ASR资源:66小时语音语料库、系统基准测试及开源模型。

04:00
arXiv cs.CL

当求助者难以帮助时:在最坏情况交互中评估情感支持对话系统

针对难助求助者,评估情感支持对话系统,发现多数模型性能骤降,大型LLM更稳健,模拟数据可提升鲁棒性。

04:00
arXiv cs.CL

重新审视大语言模型推理中的拟人化反思标记

抑制拟人化反思标记不影响甚至提升推理性能,表明其非可靠反思代理,仅为表面线索。

04:00
arXiv cs.CL

为何评估语音翻译离不开语音

语音翻译评估指标忽视语音特性,新模型仍无法一致评估,需专用训练数据和模型。

04:00
arXiv cs.CL

CIRF:将思维链分词化为可重用功能单元,实现大型语言模型的高效潜在推理

CIRF将思维链转化为可重用功能token,实现高效潜在推理,在准确率与延迟间取得更优平衡。

04:00
arXiv cs.CL

HELEA:面向鲁棒实体对齐的硬负例基准与基于LLM的重排序方法

提出同名硬负例增强策略,构建评估基准与训练语料,结合编码器与LLM重排序,实现鲁棒实体对齐。

04:00
arXiv cs.CL

面向混合专家模型多语言下游任务的路由对齐微调

提出RA-MoE框架,通过路由对齐损失引导目标语言路由学习英语任务专家激活模式,提升多语言下游性能。

04:00
arXiv cs.CL

HardMTBench:在知识密集型领域对中英翻译进行压力测试

面向知识密集型中英翻译的诊断基准,覆盖12领域2万条测试,扩大系统差异并暴露术语弱点。

04:00
arXiv cs.CL

PubMedCausal:生物医学文本中因果关系抽取的跨度级标注语料库

构建PubMedCausal跨度级因果语料库,评估显示生物医学CRE挑战大,最佳检测F1=0.74,抽取F1=0.68。

04:00
arXiv cs.CL

LJP未见之案:起诉决定预测完善刑事责任评估

提出起诉决定预测(PDP)填补法律判决预测盲点,分类四类决定,LLM表现差且简单强化学习无效。

04:00
arXiv cs.CL

FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning

04:00
arXiv cs.CL

PrionNER: A Named Entity Recognition Dataset for Prion Disease Biomedical Literature

04:00
arXiv cs.CL

突破文字障碍:实现非拉丁文字中基于词性标注的ASR错误分析的自动对齐

提出语言无关的自动对齐方法,支持非拉丁文字的词性错误分析,利用错误信息改善ASR性能。

04:00
arXiv cs.CL

守约角色:多智能体结构化推理中的契约保持型角色演化

提出契约保持的角色演化方法,在保持五个结构契约下自适应演化角色池,提升多智能体推理性能。

04:00
arXiv cs.CL

AdaDPO:具有平衡梯度更新的自适应直接偏好优化

AdaDPO通过自适应梯度平衡修正DPO的不对称梯度,提升模型对齐效果,简洁易集成,可推广至多种偏好损失。

04:00
arXiv cs.CL

当话语压力冲突时:视觉-语言模型输出中的信息结构

VLM能区分新旧信息但过度规则化,人类更灵活;评估需关注内容的话语包装方式。

04:00
arXiv cs.CL

Skill0.5:面向智能体强化学习中分布外泛化的技能内化与联合利用

Skill0.5通过动态路由分层优化,融合技能内化与利用,在ALFWorld和WebShop中超越基线。

04:00
arXiv cs.CL

论形式数学中的组合学习行为

组合学习行为对攻克形式数学难题必要但不充分,高CLB得分模型才能达奥林匹克级别。

04:00
arXiv cs.CL

超越单一路径:评估与增强交互式LLM代理的发散性思维

提出MUTATE基准评估交互式LLM代理的发散思维,发现收敛压力致行动固定,ReDNA分离发散与收敛,显著提升发散性思维。

04:00
arXiv cs.CL

基于大语言模型的社会代理的真实性评估:以西班牙在线新闻评论反应为例

评估LLM生成西班牙新闻评论的真实性,发现现成模型低估仇恨言论,微调后Qwen3最均衡,Mistral7B情感语义对齐好但仇恨过高。

04:00
arXiv cs.CL

功能熵:用不确定性量化预测LLM生成代码的功能正确性

提出功能熵方法,以功能等价替代语义等价,有效预测LLM生成代码的正确性。

04:00
arXiv cs.CL

共单体形态音系学:芬兰语上下文相关形态规则的组合框架

提出Writer共单体框架,规则作为共Kleisli箭头组合,避免状态爆炸,实现双向形态分析,准确率83.92%。

04:00
arXiv cs.CL

A new semantically annotated corpus with syntactic-semantic and cross-lingual senses

04:00
arXiv cs.CL

ClinicalEncoder26AM:多语言可诊断ColBERT模型;来自MultiClinNER共享任务的证据

该模型通过临床后训练实现数据高效的多语言实体召回,在MultiClinNER任务中字符加权F1达前五。

04:00
arXiv cs.CL

GUI-CIDER:通过因果内化与密度感知样例重选进行GUI代理的中期训练

提出因果内化与密度感知重选方法,显式学习GUI世界知识,提升代理任务成功率。

04:00
arXiv cs.CL

Soft-SVeRL:基于软奖励的自我验证强化学习

Soft-RLVR通过原子检查列表生成软奖励,自验证需显式稳定防奖励膨胀;指令遵循任务提升11.1分。

04:00
arXiv cs.CL

了解评估设计方式的模型更安全

掌握评估结构特征的知识可显著提升模型安全测试表现,独立于显式记忆,构成新混淆因素。

2026年5月27日
04:00
arXiv cs.CL

检索增强生成中的上下文优化:梯度下降视角

将RAG视为上下文优化,提出轻量前向更新方法,提升冻结LLM证据利用效率,大幅降低查询成本。

04:00
arXiv cs.CL

面向多轮Text-to-SQL的记忆架构:基准与实证研究

提出多轮Text-to-SQL基准,发现无状态模型三轮后准确率归零,记忆架构效果不单调,部分模型退化。

04:00
arXiv cs.CL

每日剂量:放射肿瘤学中集成工作流的大语言模型自动化临床摘要与试验识别

提出LLM驱动自动化系统,整合放射肿瘤科工作流,实现临床摘要与试验识别;1月评估显示83.6%高频使用,满意度高,每日可节省≥10分钟。

04:00
arXiv cs.CL

大型语言模型中的预训练数据暴露:成员推断、数据污染及安全含义综述

本文首次统一综述LLM预训练数据暴露中的成员推断与数据污染,形式化暴露层次并总结攻击防御与未来挑战。

04:00
arXiv cs.CL

CroCo:基于自生成结果的跨语言对比偏好调优

跨语言对比偏好调优(CroCo)无需语言特定偏好标注,利用英语奖励模型提升多语言性能,避免灾难性遗忘。

04:00
arXiv cs.CL

SPEAR:代码增强的智能体提示优化

SPEAR通过Python沙箱执行结构化错误分析,结合自动回滚确保单调优化,在工业审判任务和基准测试上全面领先。

04:00
arXiv cs.CL

RICE-PO:将检索交互转化为推理智能体的信用信号

RICE-PO将检索交互转为局部学习信号,解决推理步骤信用分配,优于基线方法。

04:00
arXiv cs.CL

为什么LLM在结构化知识上产生幻觉:线性化表示推理的机制分析

LLM在结构化知识上幻觉源于注意力集中于结构捷径、前馈层语义接地失败,致依赖参数记忆,此模式可推广至多跳和表格。

04:00
arXiv cs.CL

自我验证蒸馏:语言模型其实是自己的合成数据管道

自我验证蒸馏法让模型自生成解并自验证过滤后训练,在数学、科学、编码上分别提升16.7、11.1、8.3个百分点。

04:00
arXiv cs.CL

中文标题:通过潜在激活引导的大语言模型文化价值对齐

中文摘要:提出情境探测与激活引导框架,无需重训即可调整模型文化价值,发现价值编码存在耦合结构限制精准对齐。