9995 条条目 · 106 个活跃源
2026年8月5日
04:00
arXiv cs.CL

形合意不合:低资源孟加拉语辱骂性言论中大语言模型安全的理解-遏制解耦

审计五款大模型:孟加拉语辱骂的安全对齐基于形式非语义,理解与遏制解耦,高资源基准难保低资源安全。

04:00
arXiv cs.CL

OPTD:少步扩散语言模型的在策略转移蒸馏与一致性引导自适应压缩

提出OPTD,采用在策略轨迹与一致性引导自适应压缩,提升少步扩散语言模型的质量-效率权衡。

04:00
arXiv cs.CL

字符象似性与任意性:阿拉伯语自然语言处理视角

阿拉伯语字符去点后,随机重映射也可达到相同性能,表明字符形式与功能关系基本任意。

04:00
arXiv cs.CL

每个错误答案都算数:面向LLM多项选择基准的选项级心理测量学

提出选项级心理测量模型,证明错误答案蕴含有用信息,能更准确估计模型能力并提升基准测试效率。

04:00
arXiv cs.CL

语言模型编码命题的语境真值

研究发现语言模型以线性方向编码语境真值,受对话中他人断言影响,并可区分两种迎合行为。

04:00
arXiv cs.CL

PAMT:面向多领域机器翻译的过程对齐强化学习

提出PAMT,用域感知长思维链监督与强化学习,以步骤级过程奖励解决翻译推理漂移,性能超越基线。

04:00
arXiv cs.CL

PI-Mem:以并行迭代记忆将长上下文推理扩展至360万token

PI-Mem并行迭代精炼共享记忆,突破长上下文瓶颈,在360万token上准确率提升超6点,速度提升达6倍。

04:00
arXiv cs.CL

论文字破译中统计度量的非特异性

生成式徽章系统测试表明,常用统计度量可检测符号组织性,却缺乏语言特异性,不能单独证明编码言语。

04:00
arXiv cs.CL

超越准确率:大型语言模型统计推理的多维评估

现有评估重准确率、轻解释方式。综合准确率、行为、主题建模及词汇分析,发现模型准确率差异大,但概念结构趋同,同供应商风格更相似。

04:00
arXiv cs.CL

模仿还是估计?基础模型与后训练语言模型在意见模拟中的不同优势

基础模型更擅长生成个体响应模拟人群,后训练模型更擅长直接预测总体分布,选模型应依据任务类型。

04:00
arXiv cs.CL

激活引导的神经元干预以在大型语言模型中诱发阿尔茨海默病相关计算语言表型

通过放大与阿尔茨海默病相关的神经元,在大型语言模型中诱发了类似AD的语言损伤,证明其行为影响。

04:00
arXiv cs.CL

CVPO:通过值方差自适应与动态课程学习增强大语言模型强化学习推理

针对强化学习反馈精度不足和难度漂移问题,提出CVPO方法,利用值方差调整优势并动态适配题目难度,超越VAPO,提升数学推理性能。

04:00
arXiv cs.CL

TQLite:多LLM评审团引导蒸馏,实现实时MQM翻译质量评估

用多LRM评审团蒸馏训练小模型,MQM评估性能接近最佳LRM,远超普通小模型,高效经济。

04:00
arXiv cs.CL

SeqLLM:为微信支付高风险决策而用行为序列建模增强LLM

SeqLLM为微信支付提供行为序列建模增强,筛查精度由92.0%升至97.5%,并保持语言能力。

04:00
arXiv cs.CL

语言的作用与证据支撑:具身智能体中语言锚定的功能角色分类及证据审计

提出语言在具身智能体中的五种功能角色,并逐项审计证据,发现功能主张与实证支持之间存在普遍差距。

04:00
arXiv cs.CL

大语言模型预训练中的可扩展频率与长度感知子文档去重

提出可扩展子文档去重框架分离检测与保留用频率长度感知自适应复制预算提升预训练性能

04:00
arXiv cs.CL

VIVID:植根于文化的基准,揭示越南语NLP中的比喻语言差距

首个越南语习语基准VIVID含1636条,评估显示最优模型得分不足半,暴露文化能力缺失。

04:00
arXiv cs.CL

论大语言模型类比生成的多样性

评估十种LLM类比生成多样性,发现领域同质化;提升多样性常以牺牲质量,因果分析揭示其机制。

04:00
arXiv cs.CL

通过结构感知策略学习内化学术写作工作流以生成引言

提出StructPO框架,将多阶段写作流程内化为单次策略,提升引言质量与效率,媲美GPT-5.1。

04:00
arXiv cs.CL

ANCHOR-RE:一种用于有依据的生物医学关系抽取的智能体神经符号框架

提出ANCHOR-RE神经符号框架,整合本体推理与外部知识,免微调提升LLM生物医学关系抽取可靠性,多基准及新文献验证有效。

04:00
arXiv cs.CL

HomoEnsNER:语言对齐在古吉拉特语命名实体识别中是否优于架构复杂性?

HomoEnsNER同质集成五个GujaratiBERT投票,在古吉拉特语NER上F1达0.8442,超过基线及异构集成,表明语言对齐比架构复杂更有效。

04:00
arXiv cs.CL

从SQL错误到概念缺口:AI驱动的知识图谱分析平台助力个性化反馈

构建AI知识图谱平台,将SQL错误关联概念缺口,两课程验证节点与三元组有效,能支持个性化诊断反馈。

04:00
arXiv cs.CL

测试时对齐大型视觉语言模型:轨迹引导的结构化采样方法

提出轨迹引导结构化采样的测试时对齐方法,无需重训练即可提升多模态推理准确率,并保持低开销。

04:00
arXiv cs.CL

ICO:通过迭代上下文优化增强语义偏移越狱攻击

提出ICO框架,利用上下文语义偏移能力诱导模型恢复有害含义,成功率74.6%,优于8个基线。

04:00
arXiv cs.CL

基于LLM的多智能体系统中的关系先验作为收敛压力

关系先验在LLM多智能体系统中主要起收敛压力作用,增强协调性,但未必提升准确性,建议按任务诊断性使用。

04:00
arXiv cs.CL

探查字符级Transformer对西班牙语L形形态素的编码

模型将L形形态素编码为词项特异性抽象,位于中间解码器词干末尾辅音处,不随表层交替变化。

04:00
arXiv cs.CL

基准之基准:检验常识基准的预测效度

测试23模型发现,常识基准对下游任务预测力有限,修订版未提升,仅对少数任务有效。

04:00
arXiv cs.CL

MoEGen:用于实例自适应LoRA生成的混合专家

MoEGen用专家码和轻量超网络生成输入特定低秩更新,解耦容量与存储,提升常识推理和领域适应性能。

04:00
arXiv cs.CL

ArtECulture:多模态大语言模型中文化条件化视觉情感理解的基准测试

提出文化条件化视觉情感理解任务及基准ArtECulture,含6792件艺术品,评估16个MLLM最佳准确率不足50%,检索增强框架可提升性能。

04:00
arXiv cs.CL

为模型排名动态分配评估精力

将多模型人类评估化为多臂老虎机最优臂识别,自适应采样聚焦竞争模型,证明最优,提升顶级模型区分,评估更快更廉价。

04:00
arXiv cs.CL

DUD:面向大语言模型可靠不确定性量化的解耦更新动态

提出DUD框架,解耦前馈网络与注意力更新,基于噪声干预量化模块恢复力,显著提升不确定性估计与校准性能。

04:00
arXiv cs.CL

跨语言对齐能否预测大语言模型的多语言分类与翻译表现——英语就够了吗?

比较27种跨语言对齐分数,英语对齐能预测分类与翻译质量,不逊于源语-目标语,支持英语为内部枢轴。

04:00
arXiv cs.CL

FACTWASH:捕捉将传闻洗成事实的AI改写

开源FACTWASH用规则和模型证人捕捉AI改写将传闻洗成事实,提升线索召回。

04:00
arXiv cs.CL

别让我去问:大语言模型在溯因推理中主动获取多轮信息方面存在不足

大模型溯因推理:预先提供证据优于多轮;外部示例优于自选查询;易过拟合自选证据,难以验证假设和决定停止

2026年8月3日
04:00
arXiv cs.CL

LLMs真能理解题目难度吗?对用LLM自动生成试题的启示

研究显示LLM预测题目难度准确率低于ConvBERT,且难易标签混合,高级模型低估难度,用LLM生成特定难度试题需谨慎。

04:00
arXiv cs.CL

零样本@CHiPSAL 2026:基于对比学习的两阶段视觉语言适配用于尼泊尔模因分类

提出两阶段视觉语言适配方法,结合对比学习分类尼泊尔模因,仇恨检测获第二,情感分析获第四。

04:00
arXiv cs.CL

模型链:跨模型审计提升LLM裁判的偏差鲁棒性

提出链式模型(CoM):用另一模型审计首模型推理迹,按偏差类型选审计者,达最高精度0.884。

04:00
arXiv cs.CL

从经验中学习状态化预测知识

提出SKL,以状态化预测知识取代轨迹反思,结合自蒸馏与强化学习自动提取应用,显著提升性能。

04:00
arXiv cs.CL

知识蒸馏对小语言模型偏见的非对称效应

知识蒸馏对明确任务减偏,对模糊任务破坏拒答校准,聚合指标掩盖要害,PCCD可诊断。

04:00
arXiv cs.CL

基于GMM和LLM的定向数据增强实现不平衡数据聚类

提出结合GMM和LLM的无监督数据增强方法,改善少数类聚类,保持性能并提升可解释性。

04:00
arXiv cs.CL

TokenSwap:多模态大语言模型中模态差距的基准测试与缩减

提出令牌交换方法,构建图文交错输入,发现多模态大模型存在模态差距,训练中采用可有效减小。

04:00
arXiv cs.CL

评估联邦预训练:下游微调与内在评估的可靠性

联邦预训练评估中,下游微调不可靠,直接预测下一词更能反映预训练质量。

04:00
arXiv cs.CL

大语言模型的金融推理可信吗?基于长期报表的现实世界检验

新基准评估金融长文推理揭示两大缺陷知识瓶颈致无提示时性能崩塌结构瓶颈致复杂任务退化微调可部分修复

04:00
arXiv cs.CL

形式主义陷阱:在社交负荷下,LLM裁判评估器是否被共识模仿蒙蔽?

提出形式主义陷阱与评估失调指数,揭示大模型裁判混淆程序与真理,跨域普适脆弱,需架构专项防护。

04:00
arXiv cs.CL

令牌级诊断大语言模型谄媚行为:基于归因引导的干预

提出ASI归因法发现谄媚响应更关注权威标记,据此构建对比激活引导,将谄媚率从96%降至25%。

04:00
arXiv cs.CL

揭秘大型推理模型中基于熵的思维链压缩选择

熵剪枝无优于随机剪枝,仅数学任务低熵token有效,推理信息分散而非集中。

04:00
arXiv cs.CL

核查问题:受监管企业中AI上线前必须满足什么条件?

AI在受监管企业难落地,实测仅56.1%配置达标;无置信度需全量核查,引用加置信度降至49%,自校验更慢且未达标。

04:00
arXiv cs.CL

东干语形态核心:双方言有限状态模型与多体裁评估

东干语显性形态罕见且有限,歧义集中于两个附着词,语法核心封闭,开放前沿实为词汇。

04:00
arXiv cs.CL

自监督技能优化

提出自监督技能优化框架,无需任何真实标签,仅用未标注任务实例和LLM评判优化技能,性能超越现有无监督优化器,接近甚至超过有监督方法。

04:00
arXiv cs.CL

TELLER:面向表格实体链接的双路径迭代偏好优化

提出双路径迭代偏好优化法,动态更新偏好数据并规整推理长度,提升表格实体链接准确率,验证迭代学习有效。