10213 条条目 · 106 个活跃源
2026年5月27日
04:00
arXiv cs.CL

MicroSpec:利用轻量级上下文词汇表加速推测解码

MicroSpec无需训练,动态构建紧凑上下文词汇表,将词汇量缩减40倍以上,推测延迟降低51.6%,实现1.12-1.32x端到端加速。

04:00
arXiv cs.CL

LURE:利用实时使用回放评估降低评估感知

LURE通过回放真实交互轨迹降低评估感知,使评估更接近实际部署,提升安全基准可靠性。

04:00
arXiv cs.CL

向量并非中性:从摘要任务中导出的LLM表示推断敏感信息

研究审计LLM摘要导出向量泄露敏感信息,不同工件风险不联动,需针对性审计与缓解。

04:00
arXiv cs.CL

定向重掩码:离散扩散语言模型中令牌编辑到令牌-掩码精炼的替代

提出无训练的令牌-掩码重掩码方法,重置可疑错误令牌为掩码,在12个基准上提升性能,数学任务提升5.92%。

04:00
arXiv cs.CL

迈向即时自适应反馈:通过知识驱动的LLM增强学生学习

提出知识驱动LLM框架,提供即时自适应反馈,在千人课程中成绩提升超80%,有效纠正错误概念。

04:00
arXiv cs.CL

中文标题

提出基于标注者立场的心理测量加权框架检测反自闭症歧视,发现LLMs依赖表面关键词匹配,易产生有害输出。

04:00
arXiv cs.CL

幻灯片问答质量保证应用:教学问题生成的多阶段流水线

提出幻灯片问答质量保证系统,通过四阶段LLM流水线处理PDF幻灯片,生成结构化教学问题,过滤非教学内容,提高覆盖与一致性。

04:00
arXiv cs.CL

Conv-to-Bench:通过代码任务中的用户-助手对话评估语言模型

提出Conv-to-Bench框架,自动将对话转化为可验证清单,高效评估语言模型。

04:00
arXiv cs.CL

探究大型语言模型中的最简阶段结构:通用依存关系无法刻画的内容

UD不变条件下,LLM表示呈现最简阶段梯度与凝聚性,证明预训练习得超越UD的形式句法抽象。

04:00
arXiv cs.CL

大型语言模型的对齐微调:以数据为中心的视角看对齐数据流水线

从数据视角将对齐微调重构为三阶段流水线,识别权衡与失败模式,提炼原则并指出挑战。

04:00
arXiv cs.CL

迈向无差错电子健康记录:临床笔记与结构化表之间的推理密集型一致性验证

提出推理密集型一致性验证基准EHR-ReasonCon和LLM框架EHR-Inspector,在MIMIC-III上实现先进性能。

04:00
arXiv cs.CL

模型遗忘目标因语言功能不同而异

针对语言功能设计不同遗忘目标,如危险知识与毒性的遗忘,实验表明采用不同训练目标效果显著。

04:00
arXiv cs.CL

Reddit平台药物相关实体的整理与提取

构建Reddit药物剂量效果数据集ReDose,基准测试显示DRUG提取F1=0.843,EFFECT召回率仅0.41。

04:00
arXiv cs.CL

FAB-Bench:半导体制造中自适应RAG基准测试框架

FAB-Bench针对半导体制造RAG系统,定义六项指标并精选200问答对,揭示上下文缩放行为与注意力稀释问题。

04:00
arXiv cs.CL

又是灯塔里的伊莱亚斯?——诊断LLM故事的低多样性

LLM故事中高频出现“灯塔”“伊莱亚斯”等词,源于偏好数据,导致多样性低下,显示小数据集与对齐算法的巨大影响。

04:00
arXiv cs.CL

LATTE:基于同行锚定偏好轨迹预测的个性化大语言模型生成

LATTE通过预测同行锚定相对偏好状态实现个性化LLM生成,显著优于静态概况等方法。

04:00
arXiv cs.CL

Verilog-Evolve:反馈驱动与技能演进的Verilog生成

提出反馈驱动框架,通过多维度评估与技能库演化,提升Verilog正确性、综合友好性及下游目标性能。

04:00
arXiv cs.CL

概念隐写术

提出概念隐写术,利用推理步骤的高层行为模式隐蔽传输信息,比词汇隐写更抗释义防御,但策略感知释义器可有效阻断。

04:00
arXiv cs.CL

中文标题:临床随访指令的可靠提取:一种混合神经符号管道

中文摘要:混合神经符号管道分离实体提取与日期计算,在合成病历上配对F1达0.99+、日期零误差,优于生成模型(配对F1仅0.5)。

04:00
arXiv cs.CL

多语言嵌入模型中,枢纽性而非各向异性驱动跨语言检索不对称性

实验表明,枢纽性(hubness)是跨语言检索不对称的主因,CSLS校正可弥补63.5%的差距。

04:00
arXiv cs.CL

PRISM:评估大型语言模型审稿人的多维基准

PRISM四维评估发现LLM可匹敌人类审稿,但各有盲区,建议作为补充而非替代。

04:00
arXiv cs.CL

提示优化为何有效,又为何有时无效:一项受因果启发的编辑层面分析

提示优化成败源于编辑类型与任务特征的交互:复杂性编辑损害数学推理,逐步编辑改善逻辑推理。

04:00
arXiv cs.CL

中文标题

忽略语境差异导致AI评估偏差,特定基准可纠偏

04:00
arXiv cs.CL

迷宫与线:重新思考大型语言模型中顺序知识编辑的正则化

发现顺序编辑的稳定性源于累积约束而非正则化,许多正则化策略非必要,并扩展了冲突编辑处理。

04:00
arXiv cs.CL

NestedKV:用于长上下文KV缓存压缩的嵌套内存路由

NestedKV无需训练,通过多尺度键异常评分与自适应路由压缩缓存,小缓存下长上下文性能显著提升。

04:00
arXiv cs.CL

证据缺失不等于证据不足:事实核查中NEI构建伪影的诊断

NEI-CAP诊断协议揭示构建伪影导致模型能力不迁移,聚合分数掩盖真实问题。

04:00
arXiv cs.CL

Granuscore:面向文本分析与问答的无参考粒度度量

引入基于层次嵌入结构的无参考粒度度量Granuscore,能恢复层级排序、解释句子特异性,并分析问答差异性。

04:00
arXiv cs.CL

语言模型中跨语言泛化的体外研究

跨语言迁移取决于分词子结构,小词汇量更优;迁移分阶段,语法先于词汇;桥强度与可达性相关。

04:00
arXiv cs.CL

有限路径上下文:基于LLM的知识图谱问答中可见路径历史的受控研究

有限路径上下文截断历史为最近K跳,K=1在KGQA中优于全历史,减少输入token。

04:00
arXiv cs.CL

外部观察者的必要性:形式化充分性差距——序列模型中混合可识别性与上下文对齐的数学扩展

形式化了序列模型中因未观测状态导致的充分性差距,外部信号需超过保真度阈值才能修正,但完全消除需完美揭示潜在状态或验证机制。

04:00
arXiv cs.CL

From Snippets to Semantics: Rethinking Evidence Granularity for Multilingual Fact Verification

04:00
arXiv cs.CL

KARMA:与业力对齐的奖励模型自适应

KARMA用Reddit奖励模型强化学习微调语言模型,发现依赖上下文的奖励模型预测业力差但下游对齐更好,改进语用但损害事实性。

04:00
arXiv cs.CL

通过多个不完美度量的偏好学习优化摘要事实一致性

聚合弱指标分数构建偏好数据集,仅用源文档训练,提升模型事实一致性,小模型可达大模型水平。

04:00
arXiv cs.CL

有质量无用处:LLM生成的XAI叙述作为信任启发式而非决策辅助

LLM生成解释虽质量高,但不能提升任务准确率,反而增加过度自信,甚至掩盖模型错误。

04:00
arXiv cs.CL

EmoDistill: 面向对抗性谈判的语言模型代理的离线情感技能蒸馏

EmoDistill离线蒸馏情感谈判技能,通过情感选择与表达学习,显著提升谈判效用,泛化能力强。

04:00
arXiv cs.CL

共享语义空间中的心理构念

提出在共享词嵌入空间中表示心理构念的框架,通过语义微分实现跨测量比较,测试验证情感与人格维度。

04:00
arXiv cs.CL

用LLM驱动知识图谱推理生成逻辑一致的合成供应链数据

TabKG框架通过知识图谱和LLM验证关系,生成逻辑一致的合成供应链数据。

04:00
arXiv cs.CL

SeDT:基于句子变换器决策变换器的多轮对话可靠性条件化

SeDT借离线强化学习返回条件化,为对话片段注释累积相关性分数,无需训练即可大幅提升多轮对话可靠性,性能恢复达37.7%。

04:00
arXiv cs.CL

重新审视多语言推理差距:层交换方法

通过层交换将英语专家中层迁移至本地专家,几乎消除多语言推理差距(缩小至1.9-3.5%)。

04:00
arXiv cs.CL

ContextGuard:语言模型中上下文学习的结构化自我审计

大语言模型在复杂上下文学习中易遗漏外围或格式要求,ContextGuard提供结构化自我审计。

04:00
arXiv cs.CL

KZ-SafetyPrompts:面向大语言模型的哈萨克语安全评估提示数据集

创建含5717条哈萨克语提示的安全评估数据集,覆盖11类风险,基线总体拒绝率28.2%。

04:00
arXiv cs.CL

不确定性感知的自适应测试时推理预算分配

UAB框架利用输出对数概率估计每问题不确定性,无需额外成本重新分配采样预算,提升推理准确率高达5%。

04:00
arXiv cs.CL

Telenor北欧客户服务自助语料库

四种北欧语言的1122篇客户服务文档公开语料库,支撑可重复的北欧NLP与信息检索研究。

04:00
arXiv cs.CL

GeoFaith:基于时空双视角的忠实思维链

GeoFaith框架利用几何结构与熵动态诊断推理忠实性,8B检测器超越GPT-5,生成更短可解释链。

04:00
arXiv cs.CL

视频模型是教育中的零样本学习者和推理者吗?EduVideoBench:面向教育视频生成的知识-技能-态度基准

EduVideoBench首创基于KSA框架评估教育视频,发现前沿模型在知识、技能、态度上均有提升空间。

04:00
arXiv cs.CL

学习调整SFT数据以提升推理泛化能力

DART通过强化学习自适应调整SFT数据,匹配模型分布,提升泛化与训练效率,超越标准微调。

04:00
arXiv cs.CL

推理深度与环境复杂性:逻辑推理任务中RLVR数据分配的对照研究

发现联合深度-复杂性覆盖优于单轴,推理族反应不均,均匀混合优于分阶段课程。

04:00
arXiv cs.CL

超越问题:评估大语言模型(实际)所知

提出开放知识评估新范式,通过开放提示考察模型自然表达的知识,而非预设问答,并构建BeQu基准验证。

04:00
arXiv cs.CL

基于LLMs的可问责人机协商:通过共生支架扩展集体智慧

提出三层共生框架,融合多样性、溯源与人类优先,在扩展集体智慧的同时保障主体性与合法性。

04:00
arXiv cs.CL

DunbaaBERT:从牺牲到语义

DunbaaBERT是乌尔都语RoBERTa模型,32k词表变体在多个任务上实现高性能与效率平衡。