10213 条条目 · 106 个活跃源
2026年6月2日
04:00
arXiv cs.CL

智能体聚类:通过多智能体优化的可控文本分类体系

提出多智能体动态聚类,自适应调整流程,在文本聚类基准中性能领先,ARI最高提升32%。

04:00
arXiv cs.CL

LongAttnComp:跨家族上下文压缩用于长上下文推理

提出两阶段微调的轻量交叉注意力压缩方法,在代码调试任务中达到全上下文精度,并可跨模型迁移。

04:00
arXiv cs.CL

IndoBias:一个双轨文化基准,用于评估印尼语言中大语言模型的偏见

研究发现LLMs对印尼语原型句子偏见强,当地语言在意识形态和宗教类别上偏见更高,且预训练中Common Crawl文本比人工审核文章引入更多偏见。

04:00
arXiv cs.CL

词中世界:多智能体协作翻译古代中文文本中的文化负载词

提出MACAT框架,通过多智能体动态识别文化负载词并选择性注入解释,提升古汉语翻译的文化保真度与可读性。

04:00
arXiv cs.CL

Challenger at MultiPRIDE: Is It Hate Speech or Reclaimed?

04:00
arXiv cs.CL

SkillAdaptor:从轨迹中自适应技能的LLM智能体

SkillAdaptor是无需训练的步骤级技能自适应框架,通过显式故障归因提升性能,在三个基准上最大提升1.5-1.8点。

04:00
arXiv cs.CL

别什么都读:线性注意力的曲率条件查询

借鉴softmax几何,通过二阶泰勒展开在读取时收缩查询,提升检索与长上下文表现,计算开销小。

04:00
arXiv cs.CL

Med-HEAL:使用幻觉感知的上下文学习分析与缓解医疗大语言模型幻觉

Med-HEAL通过构建临床幻觉数据集,采用自我批评和检索增强上下文学习策略,有效减轻医疗大语言模型幻觉,提升准确率。

04:00
arXiv cs.CL

DiffuSent:面向方面级情感分析的统一扩散框架

DiffuSent提出非自回归扩散框架,将ABSA子任务统一为边界去噪过程,解决边界不敏感问题,性能提升且推理加速。

04:00
arXiv cs.CL

TukaBench:面向非洲语言的文化适应性越狱基准

提出TukaBench,评估非洲语言模型安全性,发现文化适应提示降低拒绝率,但存在理解失败与判断不可靠问题。

04:00
arXiv cs.CL

Dr. DocBench:面向专家级与困难文档解析的全面基准

提出专家级文档解析基准,含4514页长文档及65k标注,揭示现有模型在困难任务上的不足。

04:00
arXiv cs.CL

基于稀疏自编码器的文本到语音可解释情感控制

利用稀疏自编码器识别情感相关稀疏特征,通过特征级干预实现情感诱导与抑制,性能优于全局控制。

04:00
arXiv cs.CL

在生物制药制造中评估本地大语言模型的自然语言到SQL查询能力:基于消费级硬件的实证基准

代码调优通用LLM优于领域专用模型,本地部署可行但需人工监督。

04:00
arXiv cs.CL

从饱和数据学习:超越正确性的大语言模型训练信号

利用自我评判和token熵等质量信号,可从已饱和数据中提取有用信息提升模型性能,但复杂任务效果有限。

04:00
arXiv cs.CL

一致性且独特性:基于相似图最大独立集提示选择的LLM基准效率

提出最大独立集提示选择法,在保持排名一致性(W≥0.997)下减少25-48%提示量,低阈值密集图时排名略有差异。

04:00
arXiv cs.CL

UniD$^3$:一种知识图谱增强的RAG框架,用于药物-疾病发现与推理

UniD$^3$融合大模型与知识图谱增强检索,处理16万篇论文构建图谱,生成高质量药物-疾病数据集,验证F1达0.82-0.87,AUROC=0.90。

04:00
arXiv cs.CL

跨语言自一致性:语言模型的多语言推理方法

无需监督数据,通过跨语言自一致性强化学习,使多语言推理平均提升21.7%,并泛化到未见语言。

04:00
arXiv cs.CL

DrugClaw与DrugAudit:基于原始资料的智能体与权威感知基准的药品信息问答

提出DrugClaw多智能体系统与DrugAudit基准,前者基于原始文献回答,后者评估引文忠实度,DrugClaw多项指标最优。

04:00
arXiv cs.CL

温度调节前后:创造性LLM生成的分布视角

温度重塑分布的单特征预测创造力排名达0.918,远超基线0.76,机制源于不连贯状态的分布特征。

04:00
arXiv cs.CL

ATE-IT中的Peacemaker:基于编码器模型从意大利语废物管理文本中自动提取术语

本文提出一种低成本、可解释的自动术语提取方法,针对废物管理意大利文本,使用微调编码器在低资源下取得均衡性能。

04:00
arXiv cs.CL

长文本输出评估中LLM评判员的基准测试

LongJudgeBench基准测试揭示当前LLM评判长文本输出存在可靠性差距,评分配置有帮助但不足。

04:00
arXiv cs.CL

TimeSage-MT:用于评估智能体时间序列推理的多轮基准测试

TimeSage-MT是一个含240任务、2680轮对话的多轮基准,揭示模型在决策任务中的记忆与不确定处理缺陷。

04:00
arXiv cs.CL

已编码但未路由:科学主张验证中表格与图表差距的解释

图表信息被编码但未用于预测,导致表格-图表差距,而非编码失败。

04:00
arXiv cs.CL

误导比纠正更容易:LLM遵从中的有害与有益修正

研究发现,LLM在多智能体系统中易被共识误导正确答案,权威标签加剧此倾向,推理干预无法有效减少有害修正。

04:00
arXiv cs.CL

超越主题相似性:RAG中可解释注意力对齐的对比证据检索

CERA框架通过硬负例与注意力对齐损失,实现RAG中可解释的证据检索,提升效果与忠实性。

04:00
arXiv cs.CL

AlphaToken:在LLM后训练中解耦适应性与稳定性以实现路径感知的响应令牌估值

AlphaToken解耦适应性与稳定性,路径感知估值令牌并掩码低值项,提升后训练性能并缓解灾难性遗忘。

04:00
arXiv cs.CL

当意义旅行:细粒度视角下混合专家模型在语言模型习语理解中的作用

提出Hybrid-MoE框架与多模态习语语料库,在低资源语言习语理解中提升5-6%性能。

04:00
arXiv cs.CL

识别大语言模型中高置信度的社会偏见,以构建可信的对话式辅导代理

评估对话辅导中LLM的社会偏见检测,发现其自然情境下难以识别且过度自信,影响反馈准确性。

04:00
arXiv cs.CL

为什么自伤预测模型难以泛化?急诊科分诊记录的词汇和语义差异

跨医院分诊记录词汇和语义差异导致自伤预测模型泛化能力下降,尽管核心主题一致。

04:00
arXiv cs.CL

EvoPool: 面向标签高效专业监督的进化式程序化标注

进化式多智能体标注框架,自动生成可执行标注器,速度提升4500–31000倍,专业任务平均宏F1提升0.141。

2026年6月1日
04:00
arXiv cs.CL

利用基于RAG的跨模型多数投票工作流评估ChatGPT在生物医学关联生成与验证中的协议

提出评估ChatGPT生成疾病生物医学关联的协议,采用自一致性策略和RAG语义验证,以暴露幻觉。

04:00
arXiv cs.CL

CanLegalRAGBench:评估加拿大判例法上的检索增强生成

提出加拿大法律RAG基准,发现检索设计敏感、开源模型有竞争力,但生成答案常含幻觉或不相关内容,8-29%的声明无依据。

04:00
arXiv cs.CL

你的多模态语音模型说我有一张只适合电台的脸

首次评估多模态语音识别偏见,发现模型在性别、种族上词错误率差高达4.05点,更多模态未必更好。

04:00
arXiv cs.CL

探索面向模型特化的自主智能体数据工程

提出自主智能体数据工程,LLM自主策展数据驱动模型特化,实验提升57.29%。

04:00
arXiv cs.CL

跨语言引导的比喻语言生成

比喻语言生成的方向可跨语言迁移,跨语言方向可媲美甚至超越目标语言自身方向。

04:00
arXiv cs.CL

语言模型中的领域适应与推理框架:一项以历史宇宙学为背景的对照实验

历史宇宙学实验表明,领域适应主要重塑语言模型的解释框架,立场变化是框架转变的次要结果。

04:00
arXiv cs.CL

LLM团队能玩"什么?哪里?何时?"吗?

团队策略提升LLM在问答游戏中的准确率最高达20个百分点,最佳达44.23%,接近人类水平,交互主要起答案筛选和纠错作用。

04:00
arXiv cs.CL

知识图谱增强的零样本主题分类:一项多策略比较研究

知识图谱增强对零样本主题分类小模型有益,大模型无益;自一致性解码增五倍成本无提升。

04:00
arXiv cs.CL

面向平衡安全对齐的可配置奖励模型

提出CSRM,联合优化安全合规与奖励建模,无需额外标注,在可配置安全基准达SOTA,改善帮助-安全平衡。

04:00
arXiv cs.CL

当英语改写本地知识:大型语言模型中的全球叙事主导

英语提问触发全球叙事主导,本地证据难消语言认知偏差,文化失败本质是叙事优先级问题。

04:00
arXiv cs.CL

Probing the Prompt KV Cache: Where It Becomes Dispensable

04:00
arXiv cs.CL

线性集成冲刷掉水印:论LLM中分布扰动的脆弱性

平均多个LLM输出可消除水印,检测z分数降至2以下,TPR低于50%,质量提升27.5%。

04:00
arXiv cs.CL

ImmigrationQA:基于源文档的美国移民法数据集与小模型适配

构建17K源文档问答对,微调3B模型提升27%性能,但弱于Claude零样本,成本29美元。

04:00
arXiv cs.CL

使用项目反应理论审计LLM基准

通过114个模型响应,以95%精度识别基准标签错误,发现奖励模型偏好风格而非事实,存在污染或过度优化。

04:00
arXiv cs.CL

通用型还是特定型嵌入,哪个更好?非英语语言临床编码检索的实证研究

合成数据微调多语言编码器提升ICD编码检索召回,非英语语言显著改善,英语轻微下降。

04:00
arXiv cs.CL

中文标题

评估使用模拟工具调用隔离不可信输入的效果,发现未提升鲁棒性,反增攻击风险。

04:00
arXiv cs.CL

生成与优化LLM作为评判者的动态评估准则

无需人工标注自动生成细粒度评估准则,并迭代微调生成器,性能超越现有基线。

04:00
arXiv cs.CL

优化基于词的L2韩语语法错误标注

改进L2韩语词级语法错误标注,解决评估与错误层级不匹配,提升校正性能。

04:00
arXiv cs.CL

跨语言的推测解码

相比任务蒸馏,n-gram草稿模型虽接受率低,但生成更快,总能大幅提升非英语语言的推测解码效率。

04:00
arXiv cs.CL

用于监测和分类研究文献中所用数据的人工智能

提出多任务GLiNER框架,结合合成数据与LLM验证,实现研究文献数据集使用的可扩展监测。