10213 条条目 · 106 个活跃源
2026年5月21日
04:00
arXiv cs.CL

MemGym:面向LLM智能体的长周期记忆环境

MemGym是长周期记忆基准,涵盖对话、搜索、编码等任务,隔离评估记忆能力,适配真实环境。

04:00
arXiv cs.CL

消费级硬件上的GraphRAG:面向医疗保健EHR模式检索的本地LLM基准测试

消费级硬件上GraphRAG可行,但模型需≥7B,本地检索优于全局摘要。

04:00
arXiv cs.CL

提升科学话语:面向科学领域的机器翻译

为促进跨语言科学交流,开发了西-英、法-英、葡-英科学语料库,涵盖通用及四个子领域,用于微调并评估神经机器翻译系统。

04:00
arXiv cs.CL

Terminal-World:通过智能体技能扩展终端智能体环境

Terminal-World自动化流水线以技能为中心合成任务、环境与轨迹,用1.2%训练数据超越基线,Terminal-Bench 2.0上Pass@1达31.5。

04:00
arXiv cs.CL

校准与决策:重新审视遗忘学习语言模型中的可靠性悖论

机器遗忘中,低校准误差可与捷径决策共存,可靠性悖论延伸至该场景。

04:00
arXiv cs.CL

基于认知评价的任务路由混合专家模型用于隐式情感分析

提出认知评价感知的多任务学习框架,用任务级混合专家模型减少干扰,在隐式情感分析上取得领先效果。

04:00
arXiv cs.CL

用发音音素识别评估语音发音合成

提出用发音音素识别评估语音合成,证明发音特征更能捕捉发音细节,助力新维度探索。

04:00
arXiv cs.CL

策略归纳:面向指令生成的任务级策略归纳

Strategy-Induct框架仅从问题示例推导任务指令,无需标签答案,显著提升LLM推理性能。

04:00
arXiv cs.CL

法律领域细粒度声明级RAG基准

提出法律RAG细粒度评估数据集ClaimRAG-LAW,双语覆盖专家与非专家,发现检索与生成局限。

04:00
arXiv cs.CL

记忆嫁接:通过离线条件记忆扩展语言模型预训练

提出记忆嫁接法,利用离线条件记忆扩展模型容量,降低开销并提升预训练性能,实验优于MoE和Engram基线。

04:00
arXiv cs.CL

单次通过、深度选择性读取的多方面情感分析

提出DABS单次编码框架,通过深度选择性读取实现高效多方面情感分析,性能相当且计算量减少高达60%。

04:00
arXiv cs.CL

面向上下文不变的大型语言模型安全对齐

提出锚定不变性正则化AIR,仅优化开放变体,显著提升安全鲁棒性。

04:00
arXiv cs.CL

JobArabi:来自社交媒体的阿拉伯语招聘公告语料库与分析

构建了20528条阿拉伯语招聘公告语料,揭示了性别化语言、地区需求差异等社会语言学模式。

04:00
arXiv cs.CL

ArPoMeme:一个用于政治意识形态和极化的带标注阿拉伯语多模态数据集

首个大规模阿拉伯政治表情包数据集,标注意识形态与极化维度,揭示对抗性框架差异。

04:00
arXiv cs.CL

从零开始利用招聘信息构建AI技能与任务的自定义分类法

利用LLM构建分类法时,过滤输入数据可提升领域覆盖,TaxonomyBuilder验证了该设计策略。

04:00
arXiv cs.CL

跨语言鲁棒性的大语言模型-大脑对齐及其计算根源

跨语言大脑-LLM对齐稳定,非预测或几何解释,源于词汇语义对应。

04:00
arXiv cs.CL

Beyond Text-to-SQL: An Agentic LLM System for Governed Enterprise Analytics APIs

04:00
arXiv cs.CL

APM:评估大语言模型中基于任意偏好映射的风格个性化

引入APM基准,通过隐藏随机映射评估个性化,发现路由最可靠,RAG依赖强基模型,软提示优化效果不佳。

04:00
arXiv cs.CL

LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control

04:00
arXiv cs.CL

GradeLegal:德国法律案例自动评分系统

研究27个大模型自动评分德国法律案例,公法评分最高0.91,刑法仅0.60,集成可提升15%。

04:00
arXiv cs.CL

LamPO:面向推理语言模型的Lambda风格策略优化

LamPO用成对分解优势替代标量优势,结合置信权重与辅助奖励,提升推理模型训练稳定性及样本效率。

04:00
arXiv cs.CL

WCXB:多类型网页内容提取基准

提出WCXB基准,含2008页七种类型,评估13系统,揭示结构化页面提取性能差异显著。

04:00
arXiv cs.CL

ACL-Verbatim:面向研究的无幻觉问答

提出基于VerbatimRAG的提取式问答系统,构建人工标注基准,150M参数模型F1达53.6,优于LLM提取器。

04:00
arXiv cs.CL

更智能的编辑?带有错误高亮和翻译建议的译后编辑

自动译后编辑的错误高亮和纠正建议未提升效率质量,但更受欢迎并改善用户体验。

04:00
arXiv cs.CL

精神科诊断的自动ICD分类:从经典NLP到大型语言模型

基于西班牙语精神科描述,利用从经典NLP到LLM的方法实现自动ICD分类,e5_large微调达最高F1=0.866。

04:00
arXiv cs.CL

中文标题:文学译后编辑中的隐喻:打开潘多拉魔盒?

中文摘要:研究表明文学译后编辑中三分之一隐喻被修改,质量差且比重新翻译更费力,支持了译后编辑限制创造力的观点。

04:00
arXiv cs.CL

Manga109-v2026:为现代漫画理解重新审视Manga109标注

修正Manga109约2.9万处对话标注,构建v2026版本以解决转录错误等问题,适配现代漫画理解。

04:00
arXiv cs.CL

大型语言模型是否了解卢森堡语的借词?探针低资源多语言模型中的词汇新词

通过知识图谱提示,借词分类准确率从25-35%提升至71-81%,但新词检测仍困难,且受少量样本设计影响。

04:00
arXiv cs.CL

Tracing the ongoing emergence of human-like reasoning in Large Language Models

04:00
arXiv cs.CL

西班牙临床笔记中的可靠自动分诊:风险感知型HIV疑似识别的混合框架

提出风险感知混合框架,双重验证解耦不确定度,实现可靠HIV疑似识别。

04:00
arXiv cs.CL

量化形态融合对一致吸引的跨语言影响

大模型指标证实:形态融合增强英、德语一致吸引,不影响土耳其语,部分解释俄语模式。

04:00
arXiv cs.CL

TextReg:通过正则化文本空间优化缓解提示分布过拟合

TextReg框架通过正则化文本空间优化,有效缓解提示分布过拟合,在多个推理基准上提升OOD泛化,准确率最高提升16.5%。

04:00
arXiv cs.CL

文本分析评估框架:以大语言模型与社交媒体为例的研究

提出含470问题的评估框架,测试LLM对社交媒体文本的理解与推理,发现输入超500时性能显著下降,尤其数值任务。

04:00
arXiv cs.CL

符号光V1:尖峰门控双路径语言模型——高激活稀疏性与亚十亿级预训练证据

提出尖峰门控双路径语言模型,194M参数训练后达>89%稀疏性,困惑度接近GPT-2,验证了时间积分而非稀疏性本身驱动性能,为神经形态部署奠定基础。

04:00
arXiv cs.CL

第五届多语言共指消解共享任务的结果:扩展面向长距离实体的数据集

第五届任务聚焦长距离实体,新增5数据集和2语言,10系统参赛,LLM潜力大,传统仍领先。

04:00
arXiv cs.CL

中文标题

提出CoTrace框架衡量AI目标级贡献:模型仅占11-26%,间接影响显著,用户感知存系统偏差。

04:00
arXiv cs.CL

LASH:面向大语言模型黑盒越狱的自适应语义混合技术

LASH自适应混合多种攻击策略,黑盒越狱成功率84.5%,仅需30次查询

04:00
arXiv cs.CL

借助条件尺度熵事后理解仅解码器语言模型中的隐喻处理

条件尺度熵揭示隐喻token在解码器模型中频谱广度更高,表明多尺度协调是隐喻处理标志。

04:00
arXiv cs.CL

Mem-π:通过学会何时生成以及生成什么来实现自适应记忆

Mem-π框架让智能体按需生成上下文相关指导,通过决策-内容解耦强化学习训练,在网页导航等任务中性能提升超30%。

04:00
arXiv cs.CL

利用大型语言模型进行语法适配:元模型-语法协同演化研究

提出LLM自动语法适配方法,测试集一致性达100%,优于规则方法,但大规模语法适配不足90%。

04:00
arXiv cs.CL

DASH:单GPU上几分钟内快速可微分混合注意力架构搜索

DASH框架实现分钟级可微分搜索,仅用12.3M tokens,20分钟即可发现优于现有方法的混合注意力架构。

04:00
arXiv cs.CL

隐藏在众目睽睽之下:在 Reddit 上寻找 MAHA

发布涵盖12个MAHA主题的Reddit数据集(2020-2025,1940万帖),用于研究运动动态。

04:00
arXiv cs.CL

Lean Refactor:通过智能策略搜索实现多目标可控证明优化

提出即插即用检索增强框架,实现多目标、版本鲁棒的Lean证明重构,显著压缩证明并减少编译时间。

04:00
arXiv cs.CL

AgentAtlas:超越基于结果的LLM智能体排行榜

提出AgentAtlas框架,通过六状态决策、九类失败、提示监督测量及基准审计,实验表明模型依赖标签菜单,无单一模型全能。

04:00
arXiv cs.CL

验证器严格性的隐藏信号:通过选择性潜在引导控制和改进逐步验证

发现验证器严格性隐藏信号,通过选择性潜在引导控制验证行为,无需微调即可平衡错误检测与正确认证。

04:00
arXiv cs.CL

多智能体协作中的状态管理

STORM通过状态管理实时检测并解决多智能体代码冲突,性能优于工作空间隔离,成本效率相当,可无缝集成。

04:00
arXiv cs.CL

分布感知奖励:基于预测分布的强化学习用于大语言模型回归

提出分布感知奖励,通过优化预测分布提升LLM回归校准性与鲁棒性,Spearman最高提升6点。

04:00
arXiv cs.CL

中文标题

在1-3B参数规模下,20种最新Transformer改进仅2种有效,注意力输出改进的损失-下游差距显著扩大,需噪声基线、下游评估和跨规模稳定性测试。

04:00
arXiv cs.CL

SMoA:用于参数高效微调的频谱调制适配器

提出SMoA,通过频谱块划分与Hadamard调制低秩分支,在低参数预算下提升微调性能,优于LoRA。

04:00
arXiv cs.CL

A Systematic Comparison between Extractive Self-Explanations and Human Rationales in Text Classification