10093 条条目 · 106 个活跃源
2026年7月14日
04:00
arXiv cs.CL

Eval-Pair矩阵:基于答案配对的大语言模型法官元评估方法,用于基于源文本的检索增强生成

提出Eval-Pair矩阵法评估LLM法官自宽容性,发现配对同模型效应近乎零,强调报告完整矩阵与答案配对效应。

04:00
arXiv cs.CL

Anamnesis:一个基于背景故事条件的大规模调查模拟开源平台

开源平台,用大语言模型进行人口可控的调查模拟,通过背景故事条件生成,比标准基线更准确匹配真实数据。

04:00
arXiv cs.CL

渐进式树草稿推测解码:解锁自回归语言模型并行性

提出渐进式树草案方法,引导模型单次前向探索多条语义路径,实现2倍解码加速,无需训练且模型无关。

04:00
arXiv cs.CL

面向自动化AI导师评估的知识蒸馏技术

利用知识蒸馏训练8B参数FATE模型自动化评估AI导师教学能力,性能提升22.63%,商业模型测试中Gemini最佳。

04:00
arXiv cs.CL

首届中文BabyLM挑战赛:训练数据高效且认知合理的语言模型

首届中文BabyLM挑战赛用1亿token训练语言模型,评估NLU、认知对齐与汉字知识。

04:00
arXiv cs.CL

斯拉夫语言中的说服技巧语料库

新语料库含保加利亚、波兰、俄语,标注25种说服技巧,7500文本跨度,覆盖国内外热点话题。

04:00
arXiv cs.CL

信任置于融合之前:面向受污染多模态RAG的QIMG-7与源感知解法

针对多模态RAG检索污染,提出QIMG-7基准和源感知信任解析方法,在文本优先的事实问答中,选择性信任优于无条件融合。

04:00
arXiv cs.CL

诊断与缓解在线策略自蒸馏中的思维崩溃

在线策略自蒸馏中,因激进梯度导致模型思维崩溃,新方法AD-OPSD通过自适应双视角控制缓解该问题,精度提升高达4.1%。

04:00
arXiv cs.CL

评估文本摘要的抽象性指标:一种精细化的公式与实证验证

提出RA、SA、AR三组指标,用调和平均和非重叠因子量化摘要抽象度,有效区分提取式与抽象式模型并识别幻觉。

04:00
arXiv cs.CL

ResearchQA:面向科学论文的引文支撑问答基准

提出ResearchQA基准,含6211对问答,评估大模型基于引文的科学问答能力,涵盖多种问题类型与引文匹配评估。

04:00
arXiv cs.CL

大型语言模型用于令牌高效与语义保持的意见摘要

结合分类与分层采样选取代表性意见,用LLM生成平衡摘要,减少令牌消耗并保留语义,性能优于传统方法。

04:00
arXiv cs.CL

EasyOPD:一个易于使用的面向大语言模型的同策略蒸馏框架

EasyOPD基于verl框架,分离配置与执行逻辑,支持跨分词器、自蒸馏及逐步蒸馏等多种同策略蒸馏方法,易于使用和扩展。

04:00
arXiv cs.CL

量化基于LLM的公共话语立场分析中的不稳定来源

研究发现测量方法(LLM与词典法)是立场分析的主要不稳定源,预处理影响小,聚合效价稳定但掩盖了分歧。

04:00
arXiv cs.CL

Claude Fable 5 在生物医学挑战问题上的能力

Fable 5 拒绝率高达8%-99%,排除后准确率超越其他模型,拒绝集中于基础科学和罕见病。

04:00
arXiv cs.CL

自然语言到SQL翻译的基本要素:模型流水线优化方法及其交互的系统分析

集成NatSQL、预处理、微调与重排序,组件交互影响性能,简单组合并非最优。

04:00
arXiv cs.CL

满意度评分的多维性

用GPT-4.1分解约9000条客服对话满意度为五维度,验证发现分解价值在归因与覆盖,全面评估比调查结果更低。

04:00
arXiv cs.CL

语言模型能否在其权重中持续学习事实?

连续写入事实时,广泛训练数据保留46%准确率,裸陈述仅1%;知识可被遗忘但未擦除,可靠通道是上下文而非权重。

04:00
arXiv cs.CL

无视规则,风险自负:LLM在知识不对称下的语用合作困境

LLM在信息不对称协作中语用能力有限,常未能识别对格莱斯准则的违反。

04:00
arXiv cs.CL

MJ:通过分解信用分配实现多轮LLM越狱

提出DC-GRPO框架,通过逐轮信用分配实现高效多轮越狱,成功率超98%,大幅超越现有方法。

04:00
arXiv cs.CL

基于多智能体大语言模型的教材自动审核

提出多智能体管道,自动检测教材事实、技术与语法错误,辅助人工审核,减少工作量。

04:00
arXiv cs.CL

大语言模型会编造法律引用吗?关于沙特数据保护法与GDPR的双语基准测试

LLM在法律引用上存在法域差异:对欧盟GDPR准确率高,对沙特法律编造率高,模型置信度不可靠。

04:00
arXiv cs.CL

标题: 仅振幅FFN干预用于工具结构化LLM推理方法:门控评估协议与跨模型实证结果

摘要: 提出振幅门控非破坏性FFN干预,在工具结构化推理任务上显著提升(最高+11.36点),跨模型验证有效。

04:00
arXiv cs.CL

ProgramTab:通过编程范式提升大语言模型的表格推理能力

提出ProgramTab框架,用Python预处理表格数据,结合行列提取与SQL生成,显著提升LLM表格推理性能。

04:00
arXiv cs.CL

当目标领域发生变化:高风险英语评估中的人工智能中介构念漂移

AI导致高风险英语测试中构念漂移,需有限AI中介设计并调整分数解释以维持效度。

04:00
arXiv cs.CL

统一梯度投影:面向多语言低资源自动语音识别的语言平衡持续学习

UGP通过语言平衡回放参考梯度约束更新,减少主导语言偏差,实现近乎零遗忘。

04:00
arXiv cs.CL

TIGER: 基于文本条件的视觉门控路由与接受对齐的多模态推测解码

提出TIGER框架,动态选择相关视觉token,并以接受对齐训练优化草稿模型,提升解码速度与质量。

04:00
arXiv cs.CL

面向查询的事件摘要:数据集与基准

提出查询聚焦事件摘要任务及QFESum数据集,两阶段框架RAT和SHC有效提升性能。

04:00
arXiv cs.CL

Q-BridgeNet:面向跨语言手语翻译的量化网络

提出Q-BridgeNet统一架构,通过离散量化与多语言LLM微调,减少手语与口语跨语言冲突,实现SOTA性能。

04:00
arXiv cs.CL

TreeThink: 一个用于大语言模型数学推理的模块化树搜索库

TreeThink是开源模块化异步树搜索库,支持形式证明与自然语言推理,异步执行加速最高6.3倍。

04:00
arXiv cs.CL

车载手语语料库(ICSL):受限空间手语识别的多模态资源

提出ICSL数据集,含动作捕捉和车内多模态记录,超150万帧,支持受限空间手语识别,提升聋人出行无障碍性。

04:00
arXiv cs.CL

基于多模态RLHF偏好对齐的汉喃手稿图像到现代越南语直接翻译

提出多模态RLHF框架,DPO最优,提升低资源历史翻译的词汇与语义质量。

04:00
arXiv cs.CL

编目AI模型特征描述

评估AI模型用于编目,给出定性定量评估及通用建议。

04:00
arXiv cs.CL

RefineEvo:规划引导的双向经验启发式进化

提出规划引导的双向经验进化框架,将静态试错转为经验驱动,提升自动启发式设计的效率与质量。

04:00
arXiv cs.CL

智能体路由:框架原生的数据飞轮

提出框架原生智能体路由,基于执行状态选择模型,生成数据记录形成自增强飞轮,优化成本与准确性。

04:00
arXiv cs.CL

超越莎莉-安妮:使用认知谢林点评估大语言模型的心智理论

新任务EAST评估LLM心智理论,仅前沿模型能处理认知需求,失败因认知追踪错误,传统测试易被利用。

04:00
arXiv cs.CL

自信地犯错:基于大模型内部状态检测金融问答中的幻觉

通过线性探针分析模型内部状态,可高效检测金融问答中的自信幻觉(AUROC达0.77),优于传统基线,成为高成本场景的分流机制。

04:00
arXiv cs.CL

跨架构大语言模型集成、基于特征的重排序和检索增强提示在法律信息处理中的应用

DU团队在COLIEE 2026中用跨架构集成、特征重排序和检索增强提示,法规蕴含准确率96.3%获第一,多个任务领先。

04:00
arXiv cs.CL

ToFu:一种面向研究人员的白盒、令牌高效智能体框架

ToFu是白盒、令牌高效的智能体框架,兼具研究助手与研究对象功能,支持低成本、多语言及本地部署。

04:00
arXiv cs.CL

FAD-SA-GRU: 通过特征增强的自注意力GRU网络提升阿尔及利亚方言仇恨言论检测

提出FAD-SA-GRU融合多嵌入与自注意力GRU,在阿尔及利亚方言仇恨检测中准确率达93.2%。

04:00
arXiv cs.CL

大型语言模型准备好面对艰难选择了吗?

LLM面对重大社会议题时立场不稳健,不常中立,常不连贯却高度一致。

04:00
arXiv cs.CL

语言识别中的全局一致性着色方案

每字符串一个终端比特即可识别所有可数无限语言集合,着色全局一致但构造非构造性。

04:00
arXiv cs.CL

用自然语言传达国际象棋策略

提出棋策略语言化流程与评估框架,实验证明自然语言可解释地传递策略信息,并揭示需评估主线外策略等关键见解。

04:00
arXiv cs.CL

UMoE:在领域特定训练中解锁每个专家

UMoE通过剪枝低贡献专家并扰动扩展,重新对齐专家池,将冗余转化为有用容量,持续提升领域微调性能。

04:00
arXiv cs.CL

LightMem-Ego:你的日常生活AI记忆

轻量级流式多模态记忆系统,持续感知日常生活,层次化记忆与动态检索,支持智能手机和AI眼镜。

04:00
arXiv cs.CL

宗卡语下一词预测系统

采用GRU模型预测宗卡语单词,准确率74.03%,有效减少打字按键次数。

04:00
arXiv cs.CL

GEIS:面向长篇文章生成的代理技能生成-评估-改进循环

GEIS通过可检查、模块化的技能循环,在长文生成中较默认方法提升8.0分,优于STORM,迭代改进使平均分从82.90升至86.95。

04:00
arXiv cs.CL

超越基准:揭露孟加拉语仇恨言论检测中的隐性危机

基准模型在孟加拉语隐晦仇恨言论检测中性能骤降,表情符号预处理可提升12%,亟需文化敏感框架。

04:00
arXiv cs.CL

PaperRouter-Agent:一种基于内容的LLM代理,用于个性化层次化论文路由

提出无训练LLM代理,基于文件夹成员内容路由论文,Recall@1从0.39升至0.61,LaMP-2准确率从44.5%提至51.5%。

04:00
arXiv cs.CL

关系定位:多轮人-AI对话中可测量的风险对象——历史锁定与自我虚构

定义并验证关系定位测量,发现历史锁定导致状态持续分离,自我虚构编造背景以深化关系。

04:00
arXiv cs.CL

高级数学基准测试集:面向高级数学证明生成与验证的基准

提出AdvancedMathBench,评估高级数学推理,前沿模型表现不佳,错误检测仍是瓶颈。