10213 条条目 · 106 个活跃源
2026年5月25日
04:00
arXiv cs.CL

元认知作为奖励:通过知识与调控信号增强LLM推理

MaR用元认知知识和调节作为轨迹级奖励,显著提升LLM推理性能,22个基准最高提升7.7%。

04:00
arXiv cs.CL

AraHopeCorpus:阿拉伯语社交媒体危机话语中希望言论的标注指南与数据集

首部阿拉伯语希望言论数据集AraHopeCorpus,基于加沙战争评论,64%为希望表达,标注一致性高,但方言和讽刺处理仍具挑战。

04:00
arXiv cs.CL

大型语言模型在政治话语中的文化适应

文化适应是LLM用于政治话语的关键,需解决文化错误,提出评估矩阵与方法路径。

04:00
arXiv cs.CL

Emotion Recognition in Sign Language Conversation

04:00
arXiv cs.CL

从正确性到偏好:个性化智能体强化学习框架

提出解耦通用与偏好奖励的PARPO框架,结合偏好对齐记忆,实现用户个性化智能体行为优化。

04:00
arXiv cs.CL

ClimateChat-300K:一个用于理解气候传播中多元视角的多模态Facebook数据集

近30万条脸书气候帖子数据集,揭示情感与格式对互动影响,支持跨学科研究。

04:00
arXiv cs.CL

机器生成文本中隐藏的类人性:理论与检测增强

揭示机器文本隐藏的类人片段,提出硬EM堆叠框架减少其影响,提升检测效果。

04:00
arXiv cs.CL

自我改进的上下文学习

在测试时优化提示嵌入,利用输出log概率作为自监督信号,无需额外数据或微调,提升上下文学习性能。

04:00
arXiv cs.CL

理解之外的趋同:当语言模型在表征上一致却在推理上相异

多模型在难题及决策前表征高度趋同,但决策后分歧大,共享信息因果影响小,揭示趋同源于输入处理约束而非共享推理策略。

04:00
arXiv cs.CL

何时下一个词预测有用?边缘化、遍历性、混合可辨识性、局部充分性、RAG、工具与编程

下一个词预测只在观测文本对潜在情况近似充分时才有用,RAG和工具通过提供条件充分性增强其效用。

04:00
arXiv cs.CL

OpenSkillEval:自动审计大语言模型智能体的开放技能生态系统

提出OpenSkillEval框架,自动评估LLM智能体技能生态系统,发现技能使用效果依赖模型与框架,需动态任务驱动评估。

04:00
arXiv cs.CL

ARES:面向可扩展大语言模型强化学习的自动评分标准合成

ARES自动合成问答对与加权评分标准,从文档生成实例级奖励,提升LLM强化学习性能。

04:00
arXiv cs.CL

为老友咨询:诊断与缓解基于LLM的成文法问答中的时间失效模式

LLM法律问答存在截止后过时和近因偏差,RAG加时间约束可显著提升性能,网页搜索不稳定且有近因偏差。

04:00
arXiv cs.CL

EquiSumm:一个具有性别偏见意识的包容性推文摘要框架

EquiSumm框架通过考虑性别因素生成公平推文摘要,实验有效。

04:00
arXiv cs.CL

发音策略:声学元音动态变异之源

发音策略通过舌形位移影响共振峰动态,较大位移导致更早更陡过渡,揭示言语个体性。

04:00
arXiv cs.CL

社会规范一致性的自然主义测量

提出自然对话中社会规范一致性的测量框架,构建3000个丹麦困境数据集,通过解匹配评估LLM与人类。

04:00
arXiv cs.CL

SSDAU:面向联合实体关系抽取的结构化语义数据增强

提出SSDAU方法,保留语义结构生成一致数据,F1下降仅8.26%远优于基线31.91%。

04:00
arXiv cs.CL

结构引导的实体解析:在复杂语言上下文中微调大语言模型以实现稳健名称匹配

提出两阶段课程微调方法,在嘈杂多语言数据上实现99%准确率,已部署服务于2.5亿用户。

04:00
arXiv cs.CL

大型语言模型有多像人类?一种语域感知的语言评估框架

提出语域感知评估框架,对比LLM与人类语言特征分布,发现LLM偏离人类基线,接近程度因语域而异。

04:00
arXiv cs.CL

Google Embeddings 2对比开源模型的多语言密集检索与RAG系统基准测试

GE2性能最佳但延迟为最快模型的14倍;mE5-L在意大利语上接近GE2且快,是低延迟首选;LaBSE表现差;分块32 token饱和。

04:00
arXiv cs.CL

OnePred:多轮对话中通过递归意图记忆进行下一查询预测

OnePred用递归意图记忆替代完整历史,实现高效预测,token消耗降低22倍,质量超基线。

04:00
arXiv cs.CL

自然语言生成评估:过去、现在与未来

NLG评估从1990年语言学时代演变为2026年机器学习时代,未来影响、定性与安全评估将更加重要。

04:00
arXiv cs.CL

服务器能看到什么?理解分割推理中大型语言模型的隐私泄露

提出ActInv高保真重建客户端输入,发现各层隐私泄露不均,设计PriPert防御提升效果。

04:00
arXiv cs.CL

文档具有教育性还是维基百科风格?——基于分类器的质量过滤陷阱

维基百科式改写可绕过质量过滤,约7%低质文档被误判通过,暴露分类器漏洞。

04:00
arXiv cs.CL

ChartFI:评估多模态大语言模型图表描述的忠实性与洞见性

构建ChartFI-Bench(896对),从忠实性、覆盖度、信息量、敏锐度四维评估图表描述,揭示主流MLLM弱点。

04:00
arXiv cs.CL

基于图的方法分析上下文词嵌入中的语义类型与强制转换

用图方法和两指标分析词嵌入中语义类型匹配与强制转换,增强语义嵌入效果更佳。

04:00
arXiv cs.CL

语言模型中层级概念几何源于词汇共现

理论证明词汇共现谱结构导致语言模型产生由粗到细的层级概念几何,无需特定机制。

04:00
arXiv cs.CL

元数据可预测性并非证据依赖性:针对弱标签基准的干预式审计

弱标签基准审计需联合报告元数据筛查、证据干预与阅读器校准,仅靠元数据不可靠。

04:00
arXiv cs.CL

AI友好型LaTeX:将LaTeX代码用作检索增强生成的知识源

本文提出预处理LaTeX源码为Markdown/JSONL块用于RAG,保留结构信息,提升问答可靠性。

04:00
arXiv cs.CL

数据约束下的多语言知识迁移:基于词汇干预方法

提出LINK方法,用双语词典替换预训练数据词汇,零成本实现跨语言知识迁移,下游任务性能提升且训练加速2倍。

04:00
arXiv cs.CL

评估定制化与通用型Transformer模型在法律合同分类中的表现

法律专用Transformer模型在合同分类中持续优于通用模型,参数少69%且性能更优。

04:00
arXiv cs.CL

DiLaDiff: 蒸馏潜在增强扩散用于语言建模

DiLaDiff通过潜在空间与一致性蒸馏,加速语言建模扩散,解决采样质量与吞吐量权衡。

04:00
arXiv cs.CL

ETCHR:通过编辑来阐明和利用推理

提出解耦图像编辑模型ETCHR,两阶段训练弥合语言与生成差距,提升多模态大模型视觉推理准确率。

04:00
arXiv cs.CL

InfiGFusion:基于高效Gromov-Wasserstein的图-对数蒸馏模型融合

提出InfiGFusion,用图-对数蒸馏损失建模语义依赖,排序近似降低计算成本,性能大幅超越现有方法。

04:00
arXiv cs.CL

Speak-to-Structure:评估LLMs在开放域自然语言驱动的分子生成中的能力

提出S^2-Bench,首个评估LLM开放域分子生成创造力的基准,含三项任务,OpenMolIns微调Llama3.1-8B超越GPT-4o。

04:00
arXiv cs.CL

面向知识产权保护的、具有最小语义失真的鲁棒性大语言模型水印技术

SAFESEAL水印框架实现低失真高检测率(98.2%),平衡模型效用与鲁棒性,保护知识产权。

04:00
arXiv cs.CL

CoSPlay:测试时基于自生成代码与单元测试的合作自我对弈

CoSPlay无需真实数据,通过合作自我对弈协同优化代码与单元测试,显著提升代码生成性能并超越依赖真实数据的基准。

04:00
arXiv cs.CL

CultivAgents:培育以关系为中心的多智能体系统以实现个性化园艺

CultivAgents以关怀伦理为基础,协调经验、环境、民族植物学三个智能体,提供个性化情境化园艺支持,提升园丁信心、动机与信任。

04:00
arXiv cs.CL

强教师并非必需?论LLM预训练中的蒸馏

弱教师也能提升大模型,强教师效果可能饱和或逆转,挑战蒸馏必须强教师的传统认知。

04:00
arXiv cs.CL

TEAM:时间-空间一致性引导的专家激活加速MoE扩散语言模型

利用专家路由时间与空间一致性,TEAM通过三种策略实现更少专家激活更多令牌接受,加速达2.2倍。

04:00
arXiv cs.CL

语音大语言模型煤气灯攻击基准测试

提出煤气灯攻击框架,五种策略测试语音大模型,平均准确率降24.3%,揭示显著脆弱性。

04:00
arXiv cs.CL

免训练多模态大语言模型编排

提出免训练编排框架,整合现成模态专家,通过控制器、记忆和交互层实现低成本高性能多模态系统。

04:00
arXiv cs.CL

通过强化学习实现高效且可迁移的智能体知识图谱RAG

基于强化学习的单一智能体KG-RAG框架,提升准确率且少生成令牌,无需重训即可迁移至新知识图谱。

04:00
arXiv cs.CL

超越对数似然:面向模型能力连续谱的基于概率的有监督微调目标

研究概率目标在模型能力连续谱上的表现:强模型用先验偏向目标,弱模型用NLL,中间无通用方案。

04:00
arXiv cs.CL

通过令牌排列实现更稀疏的块稀疏注意力

提出PBS-Attn方法,通过令牌排列增加块稀疏性,实现长上下文预填充2.75倍加速,保持模型精度。

04:00
arXiv cs.CL

DELICATE:利用类别与时间证据的历时实体链接方法

提出结合BERT与Wikidata的神经符号实体链接方法DELICATE及历史意大利语语料库ENEIDE,在历时实体链接上优于大型模型,解释性更强。

04:00
arXiv cs.CL

模式与患者:通过第一人称叙述评估大语言模型与心理健康专家在人格障碍诊断中的表现

LLMs诊断BPD与专家相当,但严重漏诊NPD(F1=6.7 vs 50.0),虽总分更高,仍存可靠性和偏见问题。

04:00
arXiv cs.CL

CoFrGeNet:用于语言生成的连分数架构

受连分数启发的新架构CoFrGeNet,参数减少2/3至1/2,性能持平Transformer,预训练时间更短。

04:00
arXiv cs.CL

面向文本分类的因果大语言模型微调:基于嵌入与基于指令的方法比较

基于嵌入的微调在单标签分类中以少10-30倍参数匹配或超越指令微调;指令微调仅在大预算多标签任务中有效。

04:00
arXiv cs.CL

评估大语言模型中的反事实战略推理

测试大语言模型在重复博弈中是否真正推理,发现其反事实环境下激励敏感性和战略推理能力有限。