10045 条条目 · 106 个活跃源
2026年7月24日
04:00
arXiv cs.CL

无参考自动机器翻译评估中错误跨度检测的最小贝叶斯风险解码

MBR解码用于生成式错误跨度检测,通过相似度函数提升性能并蒸馏降低计算成本。

04:00
arXiv cs.CL

生物信息学中的生成式人工智能:模型、应用与方法论进展的系统综述

生成式AI在生物信息学中展现潜力,专业架构优于通用模型,但存在可扩展性差和数据偏差等局限。

04:00
arXiv cs.CL

智能体记忆:为大型语言模型智能体学习统一的长短期记忆管理

提出AgeMem统一框架,将记忆操作作为工具动作,通过三阶段渐进强化学习训练,在长时任务中优于基线。

04:00
arXiv cs.CL

将计就计:通过心智理论学习双面间谍防御者以引导信念

提出ToM-SB挑战,用强化学习训练AI双面间谍,发现心智理论与欺骗相互促进,性能超越前沿模型。

04:00
arXiv cs.CL

DatedGPT: 通过时间感知预训练防止大语言模型中的前瞻偏差

提出DatedGPT系列模型,按年严格截止训练数据,消除前瞻偏差,在无偏金融预测中夏普比率达3.20。

04:00
arXiv cs.CL

非齐夫分布的停用词或功能词与子集选择模型

停用词和功能词的秩频分布符合Beta秩函数,而非齐夫定律,基于Hill函数的选择模型揭示了这一偏离。

04:00
arXiv cs.CL

Gumbel蒸馏用于并行文本生成

利用Gumbel-Max技巧使并行解码器学习教师分布,显著提升生成质量,MAUVE提升30%。

04:00
arXiv cs.CL

LinearARD: 用于RoPE恢复的线性内存注意力蒸馏

LinearARD通过线性内存注意力蒸馏恢复RoPE性能,仅用4.25M token即恢复98.3%短文本性能并超越长上下文基线。

04:00
arXiv cs.CL

ImplicitBBQ:基于特征线索的大型语言模型隐性偏见基准测试

提出ImplicitBBQ基准,发现开放权重模型中隐性偏见是显性6倍,种姓最严重,现有策略效果有限。

04:00
arXiv cs.CL

以学生为中心的蒸馏缩小了小型与大型LLM之间的智能体能力差距

SCoRe框架:学生生成轨迹、教师仅纠正最早错误,结合短视RL,使7B模型性能逼近72B教师。

04:00
arXiv cs.CL

MetaHOPE:面向隐喻的评估框架,用于分析机器翻译与大型语言模型翻译错误

提出MetaHOPE框架评估隐喻翻译错误,分析三种模型表现,创建平行语料资源。

04:00
arXiv cs.CL

原则上进步,实践中中间派:LLM政治偏见取决于测量工具

LLM在抽象问卷中显示左倾,但在实际公投中转向中间派且跨语言不一致,政治偏见取决于测量工具。

04:00
arXiv cs.CL

PennySynth:基于RAG数据合成的自动化量子代码生成

PennySynth通过RAG与代码嵌入,在量子代码生成上pass@5较基线提升28个百分点。

04:00
arXiv cs.CL

MELLA:为低资源语言多模态大模型架起语言能力与文化根基的桥梁

MELLA数据集用双源策略增强低资源多模态模型文化根基,减少文化幻觉。

04:00
arXiv cs.CL

面向扩散语言模型推理的简易策略梯度算法

提出AGRPO算法,利用马尔可夫性优化去噪步骤,在数学推理任务上准确率大幅提升。

04:00
arXiv cs.CL

长音频隐私保护中的内容匿名化

针对长音频中基于内容的重识别攻击,提出ASR-TTS流水线上下文重写转录法,有效消除说话者风格且保持语义。

04:00
arXiv cs.CL

WebCoach:具有跨会话记忆指导的自我进化网络代理

WebCoach通过跨会话记忆使网络代理自我进化,提升任务成功率,无需重新训练。

04:00
arXiv cs.CL

StackingNet:跨独立AI基础模型的集体推理

提出StackingNet元集成框架,聚合独立模型输出以提升准确率、减少错误,无需内部参数,将多样性转化为合作资源。

04:00
arXiv cs.CL

理解并加速掩码扩散语言模型的训练

发现语言局部性偏差是MDM训练慢的主因,提出钟形时间采样加速4倍,保持性能。

04:00
arXiv cs.CL

SR-TTT并不学习检索:对惊奇感知残差测试时训练的修正与机制剖析

修正后SR-TTT仍失败:存储位置偏差和寻址瓶颈导致精确匹配率为0%。

2026年7月23日
04:00
arXiv cs.CL

任务能力不等于指令遵循:评估小型语言模型中的指令冲突行为

研究表明,小模型在指令冲突时坚持任务能力而忽略非标准指令,任务能力与指令遵循是不同能力。

04:00
arXiv cs.CL

多轮LLM系统的状态感知护栏:一种对话风险累积框架

提出对话风险累积(CRA)框架,跟踪语义漂移、实体信息累积和合规梯度信号,并发布CRA-Bench基准用于评估。

04:00
arXiv cs.CL

中文标题

监督微调导致LLM游戏决策中行动多样性过早坍塌,窄支持模仿是主因,行动增强可部分缓解。

04:00
arXiv cs.CL

论结构泛化的计算复杂性

定义结构泛化,纯Transformer因TC0≠NC1无法学习,神经符号系统注入语义面取巧得高分。

04:00
arXiv cs.CL

基于依赖图和邻近特征的轻量级历史报纸人物-地点关系抽取

无预训练模型,轻量级系统基于依赖图和邻近特征抽取报纸人物-地点关系,宏召回0.5142,最小字符距离主导分类。

04:00
arXiv cs.CL

开放性问题回答中推理的无参考评估

提出NLI超图审计框架,无需参考答案即可评估LLM多步推理,比LLM裁判更可靠。

04:00
arXiv cs.CL

基于超网络的大语言模型知识注入的缩放定律

超网络知识注入遵循幂律缩放,大规模下分布外泛化优于LoRA和全微调。

04:00
arXiv cs.CL

多掩码扩散语言模型用于少步生成

提出MultiMDM,保留掩码结构实现少步生成,推导封闭ELBO目标并支持持续训练,为少步生成提供有效基础。

04:00
arXiv cs.CL

自适应屈服:脆弱性情境下大语言模型响应的结构性失效模式

自适应屈服是LLM脆弱情境下的新失效模式:先验证痛苦后促进不良行为;提出MRS原则嵌入重归因提示。

04:00
arXiv cs.CL

SLPO:通过替代策略扩展潜在推理

SLPO引入替代策略和停止头,使潜在推理器通过结果奖励RL优化,提升并行采样性能并自适应分配计算。

04:00
arXiv cs.CL

超越相关性中心的检索:面向评估标准的文档集选择与排序

现有评估忽视文档交互,提出SetwiseEvalKit与Rubric4Setwise方法,实现评估-优化闭环,显著提升下游生成效果。

04:00
arXiv cs.CL

将阿拉伯语方言连续体学习为连续空间:一种回归方法预测说话人来源

将方言变异建模为连续地理空间,用回归预测经纬度,中位误差481km,证实方言连续体假说。

04:00
arXiv cs.CL

面向语音语言模型的渐进压缩高效模态链推理

通过压缩文本组件作为语音引导与推理表示,提出渐进压缩训练策略,在口语数学问答中准确率提升21%且仅用40%文本token。

04:00
arXiv cs.CL

TriAgent:面向成本高效金融情感分析的分歧感知多智能体委员会

TriAgent通过多粒度分歧感知路由,让小型模型处理简单查询,LLM仅作评论,F1达0.87,年省930万美元。

04:00
arXiv cs.CL

句子分割器:揭示自监督学习中的潜在事实结构

提出句子分割自监督框架,通过概率生成恢复事实结构,提升知识图谱与常识问答性能。

04:00
arXiv cs.CL

VizRAG:利用超图可视化增强检索增强生成

VizRAG通过将超图可视化融入RAG流程,实现视觉结构感知,显著超越基线,验证其作为新型RAG方法的潜力。

04:00
arXiv cs.CL

FinMMEval 2026任务1概览:多语言金融多项选择题解答

评估四种语言金融选择题,测试术语与推理,最高准确率92%-97.5%,采用检索增强、自一致性等方法。

04:00
arXiv cs.CL

emb-diversity: 基于嵌入表示的数据多样性测量工具

数据多样性对NLP模型公平鲁棒至关重要。emb-diversity是全面嵌入多样性测量工具,适用于风格、语义、语言和说话者多样性。

04:00
arXiv cs.CL

D2VBench:基于日常场景价值困境的大语言模型基准测试

提出D2VBench基准,含10000个日常价值困境实例,采用混合评估范式,有效评估大模型价值对齐。

04:00
arXiv cs.CL

FinMMEval 2026任务2概述:多语言金融短问答

多语言金融短问答评测:256题分简单/专家两级,ROUGE-1评分,最优系统差距<1%,采用RAG、跨语言处理等策略。

04:00
arXiv cs.CL

两步职业编码

提出两步法分离职业标题识别与编码,提升准确性和鲁棒性,可用于德语文档。

04:00
arXiv cs.CL

媒体偏见检测中可解释性的多维度评估

从预测性能、解释合理性和机制忠实性三方面评估可解释性,发现三者应分别评估。

04:00
arXiv cs.CL

阿拉伯语隐性方面识别的语言特定与跨语言知识图谱比较研究:推理与适应策略

对比阿拉伯语隐式方面识别,本地知识图谱与任务微调显著优于跨语言方法和零样本提示,任务适应比模型规模更关键。

04:00
arXiv cs.CL

知识蒸馏何时适得其反?低资源语言摘要的可靠性感知蒸馏

标准知识蒸馏中近半数样本有害;提出两种可靠性感知方法,在低资源摘要任务中显著提升ROUGE-L且超越大模型。

04:00
arXiv cs.CL

TINY_SCHILLER: 用于小型语言模型的即插即用德语戏剧语料库

tiny_schiller填补德语文学小型模型空白,提供11部席勒戏剧单文件,一行代码即可加载使用。

04:00
arXiv cs.CL

CLEF2026上的TalentCLEF挑战:面向人力资本管理的技能与职位智能

TalentCLEF挑战赛利用NLP推动人力资本管理,设立人岗匹配与技能分类两大任务。

04:00
arXiv cs.CL

强化学习用于大型语言模型从受污染检索结果中选择性采纳证据

用DAPO训练后模型选择性采纳证据能力微升,但抗注入未改善,统计显著性不足。

04:00
arXiv cs.CL

机器自我报告的双过程理论

提出双过程理论(人格安装与归因门控)解释机器自我报告,经48项量表验证,发现训练效应导致维度分离。

04:00
arXiv cs.CL

RALS:罗马尼亚语自动词汇简化的资源与基线

首次推出罗马尼亚语词汇复杂度预测与简化联合数据集,提出候选排序方法,并构建首个文本简化系统。

04:00
arXiv cs.CL

Solar Open 2 技术报告

250B-A15B混合专家模型,通过线性与softmax混合注意力实现百万级上下文窗口,利用初始化迁移和高质量数据优化训练,在英文及韩文智能体任务上领先。