10183 条条目 · 106 个活跃源
2026年6月25日
04:00
arXiv cs.CL

Small edits, large models: How Wikipedia advocacy shapes LLM values

04:00
arXiv cs.CL

药物使用者在线上物质使用社区中自我污名的认知、情感与行为表达

分析了Reddit帖子,发现药物使用者自我污名普遍,行为指标常先于核心认知情感,但悲观情绪随时间加深。

04:00
arXiv cs.CL

基于图的噪声ASR语音错误纠正

提出G-SPIN框架,利用图神经网络构建候选集,结合MLM和LLM进行上下文重排序,轻量高效地纠正噪声ASR语音错误。

04:00
arXiv cs.CL

错误感知的TF-IDF检索增强生成用于ASR纠错

提出词法级错误感知框架,通过对称文本归一化和错误感知TF-IDF算法,将命中率从53.7%提升至90.9%,词错误率从23.06%降至18.83%。

04:00
arXiv cs.CL

AgentOdyssey:面向测试时持续学习智能体的开放式长周期文本游戏生成

通过生成开放式长周期文本游戏,评估智能体在测试时的持续学习能力,发现其探索与知识获取受限,短期记忆为关键,人类仍远优于最优模型。

04:00
arXiv cs.CL

完美检测,控制失败:语言模型中认知与操控的几何学

语言模型中检测与操控行为的方向夹角极大(余弦仅0.12),完美检测无法实现有效控制,且该分离源于预训练。

04:00
arXiv cs.CL

Dustin:用于高效长上下文自发式解码的草稿增强稀疏验证

Dustin框架利用草稿与目标模型注意力实现稀疏验证,长上下文解码加速27.85倍,精度无损。

04:00
arXiv cs.CL

大语言模型在真实双评GCSE基准上的表现

LLM在双评GCSE基准上表现优异,与评分者高度一致甚至更优,提供经济高效的自动评分方案。

04:00
arXiv cs.CL

基于LLM的科学同行评审:方法、基准与可靠性挑战

综述LLM在同行评审中的批评生成与分数预测,分析数据集偏见、鲁棒性风险及开放挑战。

04:00
arXiv cs.CL

中文标题:SemEval-2026任务13中的Dream:面向单次机器生成代码检测的SALSA方法

中文摘要:提出SALSA单次自回归分类法,用单token输出检测代码是否机生,跨语言OOD鲁棒,F1达0.789远超基线。

04:00
arXiv cs.CL

基于局部分支路由的高效可训练语言模型测试时扩展

提出局部分支路由(LBR),通过轻量路由选择前瞻子树,实现高效可训练测试时扩展,提升推理Pass@1和Pass@32。

04:00
arXiv cs.CL

改进的大型语言扩散模型

提出8B全双向掩码扩散模型iLLaDA,预训练12T tokens,在多项基准上显著提升,性能媲美自回归模型。

04:00
arXiv cs.CL

三个佛教词汇集:英语巴利三藏经藏、律藏、论藏的计量文体学分析

英译巴利三藏文体分析:经律藏词汇多样性相近,论藏数字密度高,派别律藏词汇重叠,新旧译本差异显著。

04:00
arXiv cs.CL

混合IR:面向复杂医学问答的双路径混合检索与迭代推理

提出双路径(图检索+稠密检索)与迭代推理机制,提升复杂医学问答准确性,实验验证有效。

04:00
arXiv cs.CL

记忆带来不同:评估不同记忆角色如何塑造对话代理

研究发现,不同功能角色的记忆对对话代理响应有差异化影响,澄清记忆提升准确性与个性化,无关记忆降低相关性。

04:00
arXiv cs.CL

低资源唐库尔语-英语神经机器翻译

针对唐库尔语-英语低资源翻译,微调ByT5-large模型(3.8万句对),BLEU达39.97,并分析正字法和领域偏差问题。

04:00
arXiv cs.CL

Towards Structuring an Arabic-English Machine-Readable Dictionary Using Parsing Expression Grammars

04:00
arXiv cs.CL

击中移动目标:持续分布漂移下AI文本检测的测试时自适应

提出利用推理时同质性的测试时自适应方法,鲁棒应对持续分布漂移,AI文本检测性能显著提升。

04:00
arXiv cs.CL

中间层知道什么:从熵动态检测越狱攻击

利用熵动态特征在模型中间层可有效检测越狱攻击,效果优于输出层,无需额外训练。

04:00
arXiv cs.CL

基于提示学习的学术论文要点自动生成

提出提示学习生成论文亮点,无需大量标注数据,ChatGPT结合模板性能优异但提示设计敏感。

04:00
arXiv cs.CL

你的越狱判定器可靠性如何?自动ASR评分的校准与对抗鲁棒性

比较专用分类器与LLM评判者,发现两者均有缺陷且易受攻击,建议报告精度、召回率并校正ASR。

04:00
arXiv cs.CL

PolicyAlign:面向大型语言模型的直接基于策略的安全对齐

PolicyAlign通过合成违规指令和自蒸馏直接对齐安全策略,提升安全性且不损害通用能力。

04:00
arXiv cs.CL

故事算子:在嵌入空间分解原著到续集的变换

通过嵌入空间分解原著到续集的几何变换,揭示续集分类并用经典案例验证与作者意图一致。

04:00
arXiv cs.CL

Beyond Next-Observation Prediction: Agent-Authored World Modeling for Sequential Decision Making

04:00
arXiv cs.CL

多语言语言模型毒性检测与缓解策略综述

综述多语言LLM毒性检测与缓解策略,揭示语言覆盖不均、文化危害定义差异等挑战。

04:00
arXiv cs.CL

Introducing corpora Hlava Cor and Hlava AD: Human Label Variation in Coreference and Discourse Relations

04:00
arXiv cs.CL

基于微调PEGASUS的抽象摘要优化

微调PEGASUS在XL-Sum上实现最优摘要,ROUGE指标较mT5显著提升。

04:00
arXiv cs.CL

中文标题:野外探测:基于无监督发音分析的普通话次方言自监督语音表征案例研究

中文摘要:通过无标签探测管道分析自监督模型在普通话次方言上的发音特征,发现声学显著特征稳定,精细频谱特征随方言变化。

04:00
arXiv cs.CL

大语言模型的红队测试框架:关于忠实性评估的案例研究

提出多角色红队框架,通过对抗提示暴露模型不忠实性,攻击成功率提升7.9%,发现架构设计比参数规模更影响安全性。

04:00
arXiv cs.CL

回收评估:有损记忆比空记忆更糟

有损记忆使模型自信输出错误结论,源头优先策略可恢复可纠正性。

04:00
arXiv cs.CL

使用MARBERT模型进行阿拉伯语推文垃圾信息与情感检测

采用MARBERT模型分析阿拉伯语推文情感,在STC客户服务数据集上取得优于现有技术的准确率。

04:00
arXiv cs.CL

BitNet文本嵌入

BITEMBED极端低比特框架,将LLM转为BitNet编码器,量化与蒸馏训练,性能近全精度,大幅降存储成本。

04:00
arXiv cs.CL

星级评分的缺陷:评分与情感不一致的行为驱动因素

星级与文本情感不一致达18.6%,主因保守评分和强制5星行为,受场所、经验等影响,两者不能互替。

04:00
arXiv cs.CL

开源大模型中的约束代价:结构化输出约束下工具调用抑制的实证研究

工具调用与结构化输出约束共存时,多个开源模型抑制工具调用,归因于语法掩码阻塞工具token,两阶段执行策略可恢复调用。

04:00
arXiv cs.CL

SFL-MTSC:利用语义框架级多任务自一致性实现鲁棒的多意图口语理解

提出SFL-MTSC框架,通过语义框架级分解与聚类提升多意图口语理解鲁棒性,零样本实验显示槽位F1和准确率提升。

04:00
arXiv cs.CL

MedGuards:可靠医疗错误检测与纠正的多智能体系统

MedGuards提出多智能体上下文学习框架,无需额外训练即可检测并纠正医疗错误,结合KPCS指标提升LLM安全部署。

04:00
arXiv cs.CL

Riazi-8B:用于数学推理的乌尔都语大语言模型

Riazi-8B通过乌尔都语预训练和GSM8K链式思维微调,显著提升低资源语言数学推理能力。

04:00
arXiv cs.CL

BiPACE:基于双模拟引导和动作反事实估计的LLM智能体策略优化

BiPACE用双模拟聚类和动作反事实估计修正信用分配,无需额外模型,大幅提升LLM智能体训练性能(成功率97.1%)。

04:00
arXiv cs.CL

保持角色:基于书籍的角色扮演代理的视角限定记忆

提出REVERIEMEM三层记忆架构,解决事实越界与风格单调,知识边界保真度提升34.6%,胜率约79%。

04:00
arXiv cs.CL

GraphRAG 是否必要?从基础 RAG 到图/代理方案与上下文优化

比较9种RAG场景,提出上下文优化节省19-53% token,揭示检索增强未等比提升生成质量。

04:00
arXiv cs.CL

OPERA:基于客观困惑度的强化学习对齐开放式推理

OPERA用困惑度动态作为内在奖励,替代外部评判,实现开放式推理对齐,在Qwen3-8B上达到新SOTA。

04:00
arXiv cs.CL

编码器足够吗?面向LLM对抗性评估的编码器与解码器安全评判器系统比较

比较编码器与LLM评判器在对抗评估中的性能,发现编码器可低成本低延迟替代,性能损失可控。

04:00
arXiv cs.CL

多步工具使用强化学习为何崩溃及监督信号如何修复

强化学习在多步工具任务中因控制token概率尖峰而崩溃,交错监督微调可提升稳定性但泛化受限。