10213 条条目 · 106 个活跃源
2026年5月25日
04:00
arXiv cs.CL

通过信息增益改进掩码扩散模型的采样

提出Info-Gain Sampler,平衡即期不确定性与信息增益,提升掩码扩散模型采样性能。

04:00
arXiv cs.CL

BURMESE-SAN:用于评估大语言模型的缅甸语自然语言处理基准

首个缅甸语LLM基准BURMESE-SAN,覆盖理解、推理与生成任务,揭示模型架构与微调比规模更关键。

04:00
arXiv cs.CL

面向智能体AI的技能检索增强

提出技能检索增强(SRA)新范式,构建SRA-Bench基准,发现技能整合瓶颈,为智能体系统能力可扩展增强奠基。

04:00
arXiv cs.CL

TurkicNLP:面向突厥语系的NLP工具包

开源NLP工具包,统一API覆盖四种文字体系,集成多任务管道,解决突厥语系碎片化问题。

04:00
arXiv cs.CL

SemEval-2026 任务6:CLARITY——揭穿政治答非所问

提出CLARITY任务,含清晰度与回避策略两个子任务,LLM提示法最优,清晰度F1达0.89,回避策略仅0.68。

04:00
arXiv cs.CL

基于本地大语言模型与布局感知解析的表格PDF信息提取:可靠性评估

本地LLM与确定性方法结合可高效准确提取表格PDF信息,Camelot+LLM管道达到亚秒级处理,Qwen2.5模型性能最稳定。

04:00
arXiv cs.CL

池化与语义偏移:长文本嵌入与检索的根本挑战

池化操作引起嵌入坍缩,语义偏移是长文本检索性能下降的根本原因。

04:00
arXiv cs.CL

RoIt-XMASA:面向罗马尼亚语和意大利语的多领域多语言情感分析数据集

提出含3.6万标注样本的多语言情感数据集,采用多目标对抗训练,XLM-R达66.23% F1,提升4.64%。

04:00
arXiv cs.CL

语言模型处理差异论元标记中的类型学对齐差异

GPT-2模型模拟差异论元标记时,表现对人类标记方向偏好,但未重现宾语标记优势。

04:00
arXiv cs.CL

SciNet:面向关系感知科学文献检索的AI代理评估

首个科学网络关系数据集SciNet,揭示现有检索代理关系任务准确率不足20%,但赋能后文献综述质量提升25.3%。

04:00
arXiv cs.CL

中文标题:稳定行为与有限变异:城市情感感知中LLM代理的角色有效性

中文摘要:LLM代理对城市情感判断表现出稳定一致性,但不同人设间差异有限,性别无影响,无人物模型有时更准确。

04:00
arXiv cs.CL

句法引导的句子理解中的信息维持

句法结构引导选择性维持预测关键信息,成本受预测头数和未完成依存数影响,二者不可简化,日语数据支持,英语不显著。

04:00
arXiv cs.CL

冻结深层,训练浅层:面向持续预训练的可解释层分配

提出LayerTracer框架,发现深层稳定关键,训练浅层冻结深层优于全参数微调。

04:00
arXiv cs.CL

PRISM:面向长程智能体的意图感知结构化记忆上的帕累托高效检索

无需训练,通过图结构记忆的检索与压缩,在极小上下文预算下实现高准确度,兼顾答案质量与检索效率。

04:00
arXiv cs.CL

HalluScan:一个用于检测和缓解指令遵循大语言模型中幻觉的系统性基准

提出HalluScan基准,含HalluScore(专家相关r=0.41)与ADR(降本2x,AUROC仅降0.1%),NLI验证AUROC达0.88。

04:00
arXiv cs.CL

FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准套件

FINESSE-Bench提出分层基准套件,含8个专门任务共3993题,评估大模型金融知识与技术分析能力。

04:00
arXiv cs.CL

向量检索中的相似性与多样性:难度几何?

首次证明联合优化相似性与多样性的向量检索是NP完全问题,并提出无参数启发式算法,超越MMR等基线。

04:00
arXiv cs.CL

基础模型生成缺失模态:我们还有多远?

本文评估三种缺失模态重建范式,发现基础模型在细粒度语义提取与生成验证上不足,提出代理框架与自精炼机制,显著提升性能。

04:00
arXiv cs.CL

GradingAttack:揭露基于LLM的教育评分代理的安全漏洞

提出GradingAttack框架,揭示LLM教育评分代理易受对抗攻击,需加强安全防御。

04:00
arXiv cs.CL

MAS-Orchestra:通过整体编排与受控基准理解并改进多智能体推理

提出整体编排框架和受控基准,揭示多智能体系统收益的关键因素,实现高效改进。

04:00
arXiv cs.CL

SciHorizon-GENE: 从基因知识到功能理解的生命科学推理大模型基准测试

提出SciHorizon-GENE基准,含19万基因54万问题,评估LLM基因功能推理,揭示模型异质性与挑战。

04:00
arXiv cs.CL

PROGRESSLM: 迈向视觉语言模型中的进度推理

提出Progress-Bench与两阶段进度推理范式,多数模型进度估计能力弱,训练型ProgressLM-3B表现提升。

04:00
arXiv cs.CL

GT-HarmBench:通过博弈论视角评估AI安全风险

GT-HarmBench测试1535个高风险博弈场景,发现前沿模型38%失败,博弈论干预提升18%社会效益。

04:00
arXiv cs.CL

评估LLM智能体的记忆结构

提出StructMemEval基准,测试智能体组织记忆结构能力,发现提示可提升但LLM自主识别不足。

04:00
arXiv cs.CL

多模态推理的视觉引导策略优化

VGPO通过视觉注意力补偿和双重优势重加权,增强视觉焦点,提升多模态推理性能。

04:00
arXiv cs.CL

熵感知的在线策略蒸馏语言模型

熵感知在线策略蒸馏动态平衡反向与正向KL,解决教师高熵问题,提升生成多样性与知识迁移,数学推理性能显著提高。

04:00
arXiv cs.CL

熵-梯度反转:迈向大型推理模型的内部机制

识别熵-梯度反转作为推理能力指纹,提出CorR-PO正则化方法,有效提升推理性能。

04:00
arXiv cs.CL

移动世界模型如何引导GUI智能体?

移动世界模型以可渲染代码和文本指导GUI智能体,代码高保真、文本鲁棒,生成轨迹提升性能,后验反思对自信智能体增益有限。

2026年5月22日
04:00
arXiv cs.CL

利用生成式AI拓宽交通安全数据获取途径:一种基于模式的空间自然语言查询框架

提出基于模式的自然语言接口,结合生成式AI与确定性执行,拓宽交通安全数据访问,验证层纠正了29%的错误。

04:00
arXiv cs.CL

“略微”是否意味着“有点”?测量LLM数值行为中的模糊强度词汇

LLM将10个强度词压缩为5种数值输出,且解释受系统状态影响,边界附近行为不连续。

04:00
arXiv cs.CL

RankJudge:多轮LLM评判合成基准生成器

RankJudge生成含单处缺陷的多轮对话对,评估LLM评判能力,通过Bradley-Terry排名并动态筛选降低噪声。

04:00
arXiv cs.CL

通过语言模型函数调用的反思性提示调优

提出反思性提示调优(RPT),用函数调用诊断错误模式并迭代优化提示,在推理任务上提升12.9%并改善校准。

04:00
arXiv cs.CL

Sem-Detect: 语义级检测AI生成的同行评审

提出Sem-Detect方法,利用AI观点趋同而人类多样的原理,结合文本与语义分析区分评审,二分类TPR提升25.5%,LLM润色后误判率<3.5%。

04:00
arXiv cs.CL

概率归因用于大语言模型

使用贝叶斯规则计算条件概率比,得到模型无关的token归因分数,结合熵分析提升LLM可解释性。

04:00
arXiv cs.CL

PromptNCE: 仅使用大语言模型和对比估计提示进行点互信息预测

PromptNCE通过对比提示+OTHER,零样本估计点互信息,相关性达0.82,适用低数据场景。

04:00
arXiv cs.CL

CR4T:基于重写的青少年大语言模型安全护栏

提出CR4T框架,通过选择性重写不安全或拒绝输出为年龄适宜指导,减少风险并避免对话僵局。

04:00
arXiv cs.CL

面向文本到SQL集成模型的残差技能优化

DivSkill-SQL无需微调,通过残差技能优化提升集成模型Pass@K,显著提高准确率并减少幻觉引用。

04:00
arXiv cs.CL

中文标题:当病例变得罕见:面向非指南临床问答的检索基准

中文摘要:提出OGCaReBench基准,评估LLM处理罕见非指南临床问答,最佳模型仅56%正确,检索增强可达82%。

04:00
arXiv cs.CL

LatentOmni:通过统一音频视觉潜在推理重新思考全模态理解

提出LatentOmni框架,用统一潜在空间进行音频-视觉推理,超越文本链,提升全模态理解性能。

04:00
arXiv cs.CL

SpecHop:持续推测以加速多跳检索代理

SpecHop通过多线程推测与异步验证,在保证准确率前提下,将多跳检索延迟降低达40%。

04:00
arXiv cs.CL

高风险医疗检索增强生成的声明选择性认证

在混合证据下,将医疗RAG响应分解为可验证声明,评分后映射至完整/部分/冲突/弃权四种操作,实现证据关联的精确选择。

04:00
arXiv cs.CL

诊断并非处方:语言共同适应解释LLM流水线中的修补风险

诊断非修补处:路由模块修补有害,上游修补有效,语言共同适应导致风险,跨代理族验证。

04:00
arXiv cs.CL

比较LLM与微调模型在不同提示复杂度下对NVDRS情境提取的表现

研究提出混合架构:LLM处理罕见复杂情境,微调模型处理常见情境,有效提升提取性能。

04:00
arXiv cs.CL

ACC:编译智能体轨迹用于长上下文训练

ACC将智能体轨迹转化为长上下文QA对训练,在长距离依赖任务上显著提升,媲美更大模型且保持通用能力。

04:00
arXiv cs.CL

超图即语言

提出超图即语言视角,通过Hyper-Align框架将高阶关联结构序列化并映射到LLM,在域内和零样本评估中显著超越现有方法。

04:00
arXiv cs.CL

基于Token权重的直接偏好优化与注意力机制

提出TwDPO和AttentionPO,利用LLM自身注意力估计token权重,提升对齐性能。

04:00
arXiv cs.CL

从TF-IDF到Transformer:情感分类的比较与集成方法

比较多种模型,RoBERTa最优(93.02%准确率),软投票集成提升分类性能。

04:00
arXiv cs.CL

中文标题

幻觉源于承诺失败:大模型虽知答案,却因概率分散而错误,规模越大越显著。

04:00
arXiv cs.CL

Structure Retention in Embedding Spaces as a Predictor of Benchmark Performance

04:00
arXiv cs.CL

Hy-MT2:面向复杂真实场景的快速、高效、强大多语翻译模型系列

Hy-MT2系列多语翻译模型(1.8B/7B/30B),支持33语言,量化后仅440MB,性能超越DeepSeek等开源模型。