10213 条条目 · 106 个活跃源
2026年6月3日
04:00
arXiv cs.CL

ReaLM:残差量化桥接知识图谱嵌入与大语言模型

ReaLM用残差向量量化将知识图谱嵌入离散化为LLM可学习令牌,结合本体约束实现SOTA性能。

04:00
arXiv cs.CL

关系线性度是幻觉的预测指标

语言模型在线性关系下易对未知实体产生幻觉,非线性关系则更易避免,线性度强相关于幻觉率。

04:00
arXiv cs.CL

REFLEX:通过裁决锚定的风格控制实现自优化可解释事实核查

REFLEX通过裁决锚定的风格控制自优化,仅用465样本实现SOTA,有效缓解忠实幻觉并提升野外数据准确率。

04:00
arXiv cs.CL

KBQA-R1:强化大型语言模型的知识库问答

提出KBQA-R1框架,利用强化学习与GRPO优化知识库问答策略,通过RRS解决冷启动,在多个数据集上达到最优。

04:00
arXiv cs.CL

CourseTimeQA: 一个讲座视频基准测试和一种面向带时间戳问答的延迟约束跨模态融合方法

提出课程视频时间戳问答基准CourseTimeQA及轻量跨模态检索器CrossFusion-RAG,单GPU中位延迟1.55秒,nDCG@10提升0.10。

04:00
arXiv cs.CL

识别AI语言中的量子结构:人类与人工智能认知进化的趋同证据

大语言模型概念测试现非经典量子结构,与人类认知结果一致,表明人机认知进化趋同。

04:00
arXiv cs.CL

当模型拒绝时:政治可操控性与特征丰富性作为意识形态深度的度量

LLM拒绝善意指令可能源于意识形态深度不足,即政治可操控性和特征丰富性缺失。

04:00
arXiv cs.CL

SeSE:基于结构信息理论的大语言模型黑盒不确定性量化

SeSE利用结构熵量化大语言模型不确定性,适用于长文本,性能超越基线。

04:00
arXiv cs.CL

一次训练,处处复用:通过路由注意力实现可泛化的隐式上下文学习

提出路由注意力(ICR)方法,捕获可泛化隐式上下文学习模式,一次训练即可在多领域复用,优于需任务特定检索的方法。

04:00
arXiv cs.CL

基于超网络的即时大语言模型个性化适配

提出Profile-to-PEFT框架,用超网络将用户档案映射为适配器参数,无需逐用户训练,实现即时适应与泛化,高效且隐私友好。

2026年6月2日
04:00
arXiv cs.CL

DraDDP:多模态多方对话话语解析数据集

基于美剧构建首个多模态多方对话话语解析数据集,实验证明多模态信息有效。

04:00
arXiv cs.CL

迈向鲁棒的上下文学习:利用分布外代理进行目标不可访问的示范检索

提出DOPA框架,用分布外代理引导示范检索,增强大模型在分布偏移下的鲁棒性。

04:00
arXiv cs.CL

面向医疗大语言模型安全性、鲁棒性和公平性评估的多领域红队框架

提出多领域红队框架评估医疗LLM,发现性能差异与单点失败,公平性误差放大,需混合评估确保安全。

04:00
arXiv cs.CL

AEyeDE:基于注意力的归因框架用于AI生成文本检测

基于注意力归因矩阵,轻量CNN区分人机文本,表现稳健,注意力图结构差异提供可解释信号。

04:00
arXiv cs.CL

lmfaoooo 在 SemEval-2026 任务 1:幽默取决于受众——面向约束幽默生成的偏好建模

采用“生成多选优”策略,通过偏好模型学习人类比较,在英语和汉语子任务中获第一,西班牙语第二。

04:00
arXiv cs.CL

CSRP:基于效率感知奖励的强化学习实现中文文本纠错的思维链推理

CSRP三阶段框架(连续预训练、思维链微调、效率感知RL)在中文语法纠错上达SOTA,F0.5=50.99,有效缓解过度纠正。

04:00
arXiv cs.CL

ART:注意力运行时终止机制助力高效大语言模型解码

ART通过运行时终止不重要的KV块访问,提升大模型解码吞吐量20%且精度相当。

04:00
arXiv cs.CL

SENSE:基于软门控评估的语义嵌入导航用于检索式推测解码

SENSE通过语义嵌入导航与软门控评估实现语义对齐,在检索式推测解码中取得4.09平均接受长度和3.26倍加速,保持生成质量。

04:00
arXiv cs.CL

TrustLDM:语言扩散模型可信度基准测试

提出TrustLDM基准,评估语言扩散模型安全性、隐私和公平性,发现恶意上下文降低对齐,开发自动评估框架揭示脆弱性。

04:00
arXiv cs.CL

在线社区中抑郁的认知语言指标:基于DistilBERT和全息简化表示的分析

混合DistilBERT与HRR编码认知语言特征,抑郁检测F1达0.94,AUC达0.981,显著优于基线。

04:00
arXiv cs.CL

LLM作为评判者的评估中的一致性指标:报告什么以及为什么

多数一致性指标在二元数据上冗余,仅Cohen's κ有价值,弃权处理需明确。

04:00
arXiv cs.CL

利用KAN模块增强BiGRU进行法律文档分类与摘要

提出KAN增强BiGRU模型,用于低资源多语言法律文档分类与摘要,准确率提升至67.96%。

04:00
arXiv cs.CL

不同LLM访问权限对论文写作行为的影响

有限制使用LLM可保持作者信心,无限访问则降低创造性,建议约束而非禁止。

04:00
arXiv cs.CL

现实测试:人们如何探查AI身份及模型是否会披露

基于人类真实提问的多模态多语言基准显示,AI身份披露受提问方式和对话上下文影响远大于模型本身,单一抑制指令即可大幅降低披露率。

04:00
arXiv cs.CL

BOUTEF:一个面向北非假新闻研究的多语种语料库——以语言为武器

构建北非多语种假新闻语料库BOUTEF,分析显示假新闻依赖情感叙事与混合语言,辟谣重事实。

04:00
arXiv cs.CL

DeSQ:基于分解的SPARQL查询生成

DeSQ通过分解问题为原子约束并生成SPARQL片段,组装查询,在多项基准上超越SOTA,且简化评估、支持细粒度错误分析。

04:00
arXiv cs.CL

跨实体金融情感分析的图增强检索:一项比较研究

图增强检索相比向量检索,实体召回率提升6.4%,复杂查询答案相关性提升11.7%,无质量损失,延迟略增。

04:00
arXiv cs.CL

基于结构化临床数据的心血管风险预测的大语言模型

结合结构化数据与LLM生成叙述,构建保护隐私的混合临床预测系统,验证一致性达94.61%。

04:00
arXiv cs.CL

TCAR-Gen: 时序图检索与证据融合的知识驱动生成框架

提出TCAR-Gen框架,通过图神经网络、时序证据融合与树链推理,在犯罪叙事问答中Recall@5达0.3738,优于现有方法。

04:00
arXiv cs.CL

DLLM-JEPA:面向掩码扩散语言模型的联合嵌入预测架构

DLLM-JEPA结合JEPA与掩码扩散语言模型,无需显式多视图数据和双前向传播,训练FLOPs降低33%,在多个任务上提升准确率并降低困惑度。

04:00
arXiv cs.CL

SALSA:通过学习的引导激活向量实现语音感知的大语言模型适配

SALSA通过监督学习逐层引导向量,提升语音大模型域外性能,最高提升46.8%,引导编码器后层更有效。

04:00
arXiv cs.CL

Uncovering Temporal Framing in the News

04:00
arXiv cs.CL

参数对齐缓解多语言专家语言模型中的灾难性遗忘

参数对齐策略通过层冻结、正则化等有效减少多语言模型持续预训练中的灾难性遗忘,平衡语言获取与知识保留。

04:00
arXiv cs.CL

通过近未来引导弥合在线策略蒸馏中的推理轨迹

OPD的token级学习难弥合轨迹,TOPD用近未来轨迹信息引导,准确率提升至52.2%。

04:00
arXiv cs.CL

中文标题

大规模多语言平行数据评估分解为平行性与质量估计,无通用模型,需方向感知路由校准。

04:00
arXiv cs.CL

隔离大语言模型词汇偏差:一种无需人工标注的偏好阶段学习三角化度量

提出三角化偏好偏移评分,无需人工标注即可量化偏好学习引起的词汇偏差,助力模型对齐与可信AI开发。

04:00
arXiv cs.CL

屏蔽过时观测有助于搜索智能体——直到适得其反:一个态域图及其机制

屏蔽过时观测的效果呈不对称倒U形,取决于检索器与模型能力的交互,过犹不及。

04:00
arXiv cs.CL

Which Institutional Frameworks Do Chatbots Assume? Auditing Jurisdictional Defaults in Multilingual LLMs

04:00
arXiv cs.CL

自动解释标签的泛化能力有多强:跨语言、文字和改写的受控研究

自动解释标签泛化能力有限,在非英语语言中常遗漏相同含义,且与训练数据表示程度相关。

04:00
arXiv cs.CL

ProtStructQA:蛋白质结构推理中的指称阈值

ProtStructQA基准揭示语言模型在蛋白质结构推理中存在从不可解析语言到可执行指称的阈值,低于时工具辅助方法更优。

04:00
arXiv cs.CL

学习检索:面向文本到SQL智能体的双层长期记忆

提出MERIT双层记忆检索框架,用强化学习优化,提升交互式Text-to-SQL任务成功率。

04:00
arXiv cs.CL

SPADER:面向多答案问答的逐步同伴优势与多样性感知探索奖励

SPADER通过逐步同伴优势机制和多样性感知探索奖励,提升多答案问答的召回率和F1分数。

04:00
arXiv cs.CL

技能还是跳过?通过双粒度偏好学习实现智能体任务中的选择性技能调用

提出SelSkill框架,通过技能-跳过决策和双粒度偏好学习选择性调用技能,显著提升任务成功率和执行精度,且可迁移至新领域。

04:00
arXiv cs.CL

论LLM适应性的局限:模型内化先验对标注任务性能的影响

LLM零样本错误近三分之二难以纠正,定义对齐比记忆指标更能提升性能。

04:00
arXiv cs.CL

使用Phi Silica进行短文本重写

通过数据集和微调适配小语言模型Phi Silica,提升短文本重写的语义忠实度与幻觉鲁棒性,缩小与云端模型差距。

04:00
arXiv cs.CL

ProactiveLLM: 面向流式大语言模型的主动交互学习

提出ProactiveLLM,利用掩码流式建模和同步特权自蒸馏,无需外部监督即可主动决策交互时机,显著降低延迟并保持质量。

04:00
arXiv cs.CL

重新审视大语言模型中基于参数的知识编辑:理论局限与经验证据

参数编辑损害大模型核心能力,检索方法表现更优。

04:00
arXiv cs.CL

LaSR:通过潜在推理的上下文感知语音识别

LaSR利用潜在推理实现上下文感知语音识别,显著提升术语识别,不增加延迟,优于标准微调。

04:00
arXiv cs.CL

文本编辑能否泛化到视觉生成?统一多模态模型中跨模态知识编辑的基准测试

首个跨模态知识编辑基准UniKE揭示文本编辑至图像生成准确率仅18.5%,推理增强参数编辑提升18.6%

04:00
arXiv cs.CL

沙盒编码代理是全模态任务求解的有力竞争者

编码代理通过代码和工具接口将全模态任务转化为检索问题,在音视频基准上媲美甚至超越原生全模态模型。