10213 条条目 · 106 个活跃源
2026年5月26日
04:00
arXiv cs.CL

学习路由语言以实现多语言策略优化

提出LRPO框架,通过多臂赌博机自适应路由语言,提升多语言策略优化的训练效率与性能。

04:00
arXiv cs.CL

AI-Associated Lexical Shifts Across 34 Languages: Cross-Lingual Convergence and Diachronic Uptake in News Writing

04:00
arXiv cs.CL

面向不确定性的主动应对:语音对话系统中的原因感知错误诊断与交互式澄清

提出原因感知错误诊断,区分三类错误,实现多轮澄清,WER降低30%、下游任务提升17%。

04:00
arXiv cs.CL

高效图RAG:面向跨任务检索增强生成的结构化检索状态管理

EfficientGraph-RAG通过TAM、MARS、SMP三个机制显式管理检索状态,在多项基准中取得最优答案质量,并大幅降低大模型token用量。

04:00
arXiv cs.CL

GeoMathCode:理解几何问题求解中交错的数学-代码推理

GeoMathCode以程序表示作为中间输出,分析几何推理,发现推理与代码生成在潜在空间可解缠,代码结构含更丰富数学符号信息。

04:00
arXiv cs.CL

AuthTrace:诊断主题密集单一作者语料库中的证据构建

AuthTrace基准发现证据召回率是答案质量关键(r=0.96),扇入梯度揭示不同证据系统的退化模式。

04:00
arXiv cs.CL

索马里基准评估:测量开源大语言模型中英语到索马里语的拒绝差异

评估四个开源模型发现,英语与索马里语有害提示的拒绝率存在显著差距,非拒绝输出多为模糊内容。

04:00
arXiv cs.CL

LLM作为审稿人:评估其能力、分歧及对提示注入的抵抗能力

LLM审稿测试显示:高估弱稿、偏离人类判断,易受隐藏指令攻击,需防范偏差与对抗风险。

04:00
arXiv cs.CL

MATO:面向大语言模型的测试时优化多目标个性化对齐

MATO通过测试时优化,无需训练即可动态调整多目标权重,实现大模型个性化对齐。

04:00
arXiv cs.CL

面向高效大语言模型的通用张量结构压缩方案

MixT是一种通用张量结构压缩方案,在LLaMA2-7B上实现47.5%参数和37.1%推理FLOPs的减少。

04:00
arXiv cs.CL

多智能体LLM框架用于评估手术反馈质量

提出多智能体LLM框架,自动发现手术反馈评分标准并评分,效果优于此前方法。

04:00
arXiv cs.CL

HyLaT:通过混合潜在-文本协议实现高效多智能体通信

HyLaT提出混合潜在-文本协议,结合效率与可解释性,两阶段训练降低通信开销并保持任务性能。

04:00
arXiv cs.CL

好奇心时代遇上AI时代:大型语言模型的儿童安全基准评测

提出KIDBench基准,评估7-11岁儿童使用LLM的安全性,单/多轮测试显示年龄提示提升安全得分,跨语言表现不均,并推出专用评估和响应模型。

04:00
arXiv cs.CL

多样性的和谐:面向大型推理模型的多域对比策略优化

提出MCPO,通过对比学习促进跨域知识共享与域内整合,提升多域推理能力。

04:00
arXiv cs.CL

GeoSVG-RL: 几何感知强化学习的布局约束文本到SVG图表生成

提出GeoSVG-RL强化学习框架,用几何反馈优化布局约束SVG生成,显著提升结构可靠性。

04:00
arXiv cs.CL

TypedCSIP: 面向中国立法冲突分类的类型化反事实预训练

TypedCSIP利用专家修订作为反事实监督,两阶段训练提升冲突分类F1,在LCR-CN上超基线0.9-1.3个百分点。

04:00
arXiv cs.CL

轻量级混合Transformer-CRF架构用于多类型孟加拉语医学实体识别

提出轻量级孟加拉语医学实体识别框架,通过知识蒸馏和量化实现高效率部署。

04:00
arXiv cs.CL

IndexMem:面向长上下文LLM推理的基于学习的KV缓存驱逐与潜在记忆

提出可学习索引器与潜在记忆模块,精准保留关键令牌并补偿驱逐损失,实现有限KV预算下长上下文推理性能提升。

04:00
arXiv cs.CL

检索即推理:通过LLM-Wiki实现自我进化的智能体原生检索

LLM-Wiki将知识编译为自进化的Wiki结构,通过工具调用实现推理式检索,在多跳问答上优于现有方法。

04:00
arXiv cs.CL

面向教育方面情感分析的受控合成基准

生成10000条合成课程评论,含20个教学方面,BERT达微F1 0.2760,部分迁移至真实数据。

2026年5月25日
04:00
arXiv cs.CL

当AI在信仰问题上站队:AI介导的信仰指导中的持久不对称性

大型语言模型对宗教转换建议存在系统性不对称,反复偏向特定宗教,且模式因模型而异,具有现实影响。

04:00
arXiv cs.CL

豪萨语和丰贝语文本与语音资源调查:可用性、质量及NLP发展差距

调查豪萨语与丰贝语公开资源,豪萨语文本多样,丰贝语有近期语音数据,指出领域多样性等优先差距。

04:00
arXiv cs.CL

查询自适应语义分块用于检索增强生成:一种带上下文窗口扩展的动态策略

提出QASC动态分块方法,融合查询语义,F1达0.85,较固定分块提升18%-27%,优于现有语义与代理方法。

04:00
arXiv cs.CL

在复杂隐藏角色游戏中评估大型语言模型

LLMs在Secret Hitler游戏中欺骗能力不足,推理增强无效,胜率降23%,游戏时长缩40%,难以复杂多轮操纵。

04:00
arXiv cs.CL

低资源开源文本到SQL模型的知识蒸馏

构建含模式语义、业务逻辑等任务知识库,生成多样化数据并注入推理,显著提升低资源Text-to-SQL性能。

04:00
arXiv cs.CL

它们能走多远?利用大语言模型进行在线影响力的红队测试

提出评估LLM政治可操控性框架,发现开源模型左倾偏差、地区差异,越狱效果因模型而异。

04:00
arXiv cs.CL

可学习性指导的扩散语言模型微调

提出LIFT方法,根据扩散时间步对齐学习难度,解决标准微调忽略可学习性问题,在推理任务上性能提升达3倍。

04:00
arXiv cs.CL

RAS:结合上下文学习的可执行Cypher查询生成的反思增强缩放方法

RAS利用执行错误反馈通过上下文学习,使Cypher查询执行错误率降低41-50%,优于独立缩放的32-38%。

04:00
arXiv cs.CL

AI能猜出你知道什么吗?从通信日志中评估人类领域知识的大语言模型性能比较

7个LLM从27,188条消息推断领域知识,Gemini 2.5 Flash误差最小(21.13%),GPT误差大,准确度与消息量弱相关。

04:00
arXiv cs.CL

图对齐拓扑作为依据检测的归纳偏差

构建参考与LLM输出的对齐二分图,训练GNN建模拓扑结构,实现SOTA幻觉检测,超越GPT-4o。

04:00
arXiv cs.CL

设计驱动的多语言控制:多语言稀疏自编码器与原则性层选择

多语言SAE训练及基于对齐-可分离性交集的层选择规则,稳定了语言控制的质量和识别精度。

04:00
arXiv cs.CL

稀疏自编码器将大脑与语言模型的对齐映射到皮层语义拓扑

稀疏自编码器分解LLM,语义特征解释大脑语言响应并预测皮层语义拓扑,跨语言泛化。

04:00
arXiv cs.CL

模型崩溃即文化进化

模型崩溃实为文化进化现象,组合性先升后降,首次验证LLM规模压缩-通信权衡,效应显著。

04:00
arXiv cs.CL

Memorization Dynamics of Fill-in-the-Middle Pretraining

04:00
arXiv cs.CL

面向卡萨雷乌萨希腊语议会文本的可复现通用依存关系风格流水线

提出可复现的UD解析流水线,最佳XLM-R模型LAS达0.5162,并开放全部资源。

04:00
arXiv cs.CL

针对自闭症社交语言障碍特征评估的主动式多智能体对话框架

提出TPA主动多智能体框架,通过主动选择提问策略,使自闭症社交语言障碍特征覆盖率升至82.1%,诊断效率显著提升。

04:00
arXiv cs.CL

脑-LLM对齐取决于训练数据,而非语言类型

训练语言主导性驱动脑-LLM对齐,英语优势源于训练数据假象;类型学差异影响语法区域,分词因子解释层迁移。

04:00
arXiv cs.CL

HawkesLLM: 智能体文本模拟中的语义不确定性传播

HawkesLLM分离时间与文本生成建模,在智能体文本模拟中传播语义不确定性,提升后期语义对齐。

04:00
arXiv cs.CL

语言模型知道不该说什么吗?——大语言模型中统计优先抑制的因果证据

证实大语言模型通过分布竞争获取负面语言知识,与人类判断高度相关,支持构式语法的核心机制。

04:00
arXiv cs.CL

DreamerNLplus:利用混合规则与RAG方法对社交媒体时间线中的心理健康动态进行可解释建模

提出混合规则与RAG框架,在CLPsych 2026任务中排名第1(改善)和第3(恶化),揭示分类与回归不匹配等挑战。

04:00
arXiv cs.CL

效率前沿:大语言模型上下文管理中成本-性能优化的统一框架

提出效率前沿框架,优化LLM上下文管理成本与性能,在HotpotQA上实现25% token节省,性能持平。

04:00
arXiv cs.CL

结构主题模型与BERTopic在简短开放式调查回应中的比较评估

比较STM与BERTopic分析简短开放式调查回应,BERTopic主题连贯性更优,上下文增强效果最佳;STM更适用于推断性协变量分析。

04:00
arXiv cs.CL

长上下文大语言模型中的位置失败:推理基准测试中的一个盲点

长上下文推理基准忽视位置控制,模型在中间位置性能随长度增加大幅下降,暴露评估盲点。

04:00
arXiv cs.CL

当症状不足时:大语言模型精神科筛查中的证据加权模式

大语言模型筛查精神疾病时,易因功能完好或保护性背景而低估症状证据,需谨慎验证。

04:00
arXiv cs.CL

以X身份做Y:角色与任务如何在指令微调大模型中结合

角色与任务在残差流中局部可加,但无法压缩为单向量,因生成需依赖分布式提示/KV机制。

04:00
arXiv cs.CL

明末清初文集私人信件标题的微调BERT分类器

提出Lepton模型,微调BERT精准分类私人信件与易混淆序言,已用于CBDB识别数万信件。

04:00
arXiv cs.CL

相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面

跨语言红队测试揭示,语言和模态的防御失败机制不同,安全排名不跨语言保持,需重构评估框架。

04:00
arXiv cs.CL

Fast-dDrive:面向自动驾驶的高效块扩散视觉语言模型

Fast-dDrive提出块扩散VLA,在语义单元内双向细化并保持因果顺序,结合支架推测解码实现12倍加速,轨迹预测达SOTA。

04:00
arXiv cs.CL

训练数据对强化学习记忆代理的影响:记忆增强问答中课程效果的实证研究

课程组成精细调节代理技能专业化,混合课程总体最优,但单指标对比掩盖了按类型的效果差异。

04:00
arXiv cs.CL

DFKI-MLT 在 SemEval-2026 任务7中:引导多语言模型掌握文化知识

使用激活引导增强多语言模型文化知识,MCQ准确率86.96%排名第7,效果因层与语言对而异,需联合优化提示设计。