10213 条条目 · 106 个活跃源
2026年6月1日
04:00
arXiv cs.CL

共享疑虑:语言模型的零样本跨语言置信估计

多语言大模型中层存在共享置信特征,单语训练探针可零样本泛化至其他语言。

04:00
arXiv cs.CL

Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards

04:00
arXiv cs.CL

基于原则性样本选择的高效大语言模型退火方法

提出DiReCT框架,将退火阶段数据选择转化为方向约束优化,基于Hessian谱特性实现最优收敛,性能领先。

04:00
arXiv cs.CL

Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

04:00
arXiv cs.CL

通过图约束路径选择扩展多跳训练数据

图约束路径选择解耦推理与生成,避免终点漂移和密集嵌入团,扩大语料4.4倍,显著提升多跳QA性能。

04:00
arXiv cs.CL

Mellum 2 技术报告

Mellum 2是12B参数MoE模型(2.5B活跃),专注软件工程,性能与4B-14B模型竞争,计算与2.5B模型相当。

04:00
arXiv cs.CL

风力涡轮机维护日志标注框架:基于LLM的可靠性智能语义提取实现数据纠正与丰富

提出LLM驱动框架,自动纠正风电维护日志编码错误,提取故障模式,实现非结构化数据到定量可靠性指标的转化。

04:00
arXiv cs.CL

Divergence Decoding: Inference-Time Unlearning via Auxiliary Models

04:00
arXiv cs.CL

引导LLM?实际上,稀疏自编码器可超越简单基线

稀疏自编码器经监督特征选择接近LoRA性能,高稀疏性非引导关键。

04:00
arXiv cs.CL

学习信任谁:事件驱动金融RAG中针对冻结LLM的市场反馈自适应检索

市场反馈自适应检索显著提升冻结LLM在金融RAG中的表现,F1从0.438升至0.471,夏普比率从0.52升至0.84,证明选择检索源比阅读能力更重要。

04:00
arXiv cs.CL

联邦法:用于德国法律引用处理的开放库与语料库

首个端到端开源工具,实现德国法律引用的解析、规范化与条文解析。

04:00
arXiv cs.CL

剑、盾与阿喀琉斯之踵:导航规划中大型语言模型空间推理的语言归纳偏置特征化

拓扑信息是稳健规划之盾,语言格式为双刃剑,语义错误是致命弱点。

04:00
arXiv cs.CL

通过协同演化隐式和显式推理,解锁LRM中的细粒度翻译质量评估

提出RIEQE框架,两阶段训练协同演化隐式和显式推理,提升LRM细粒度翻译质量评估,超越基线。

04:00
arXiv cs.CL

FBHM:面向仇恨模因检测的VLM功能基准测试与引导

FBHM基准(25修辞×10社区)揭示VLM严重泛化差距,LSV引导向量仅用500样本提升30%F1分。

04:00
arXiv cs.CL

拉丁语底层:语言模型如何表征与调节文字选择

语言模型通过共享潜在表征管理多文字输出,但存在拉丁文字优先的底层机制。

04:00
arXiv cs.CL

面向VLM评委评估的视障辅助基准

提出VIABLE基准评估VLM作为评委,发现现有模型诊断准确率低、自偏好高,并提出VIA-Judge-Agent改进。

04:00
arXiv cs.CL

LLM评估者在不同安全标准和危害类别上的不一致分歧

LLM作为安全评估者存在显著不一致,尤其在金融领域,受安全标准、语言风格影响,不同评估者间高度分歧。

04:00
arXiv cs.CL

多轮多智能体对话用于协作重建仅轻微提升VLM的空间推理能力

VLM借助多轮对话进行协作重建,仅轻微提升空间推理,视觉接地与指令生成仍是瓶颈。

04:00
arXiv cs.CL

面向手语翻译的大语言模型目标端释义增强

GPT-4o生成释义变体增强手语翻译,在PHOENIX14T上BLEU-4提升0.77,语义评估显示增益。

04:00
arXiv cs.CL

'你懂罗马尼亚语吗?'——构建罗马尼亚视觉语言模型的方法

本研究系统构建罗马尼亚视觉语言模型,通过翻译数据和文化评估集,使适应模型优于同类甚至更大模型。

04:00
arXiv cs.CL

基于诊断推理监督的方面情感三元组细粒度验证

FiVeD框架通过细粒度验证与诊断推理监督筛选候选三元组,提升ASTE性能达3.53 F1点。

04:00
arXiv cs.CL

SCOPE:通过协同进化策略实现开放任务的自我对弈

SCOPE是无数据自我对弈框架,协同进化挑战者与解决者,用初始模型自我评判,提升开放任务性能,关键在于协同进化与评分标准生成。

04:00
arXiv cs.CL

在线策略蒸馏需要完整轨迹吗?

提出渐进式与截断式轨迹控制,将在线策略蒸馏效率提升3倍,仅用10%轨迹即达同等性能。

04:00
arXiv cs.CL

自由译者翻译分析工具II:针对保密翻译工作流的本地LLM基准测试

开发低门槛评估法,测试本地LLM保密翻译性能,精选模型可行但不及顶级商业NMT。

04:00
arXiv cs.CL

扩展匈牙利语会话语音识别:BEA-Dialogue+语料库

BEA-Dialogue+语料库扩展至200小时,为匈牙利语对话ASR提供更大基准,SOT微调显著提升性能。

04:00
arXiv cs.CL

BenHalluEval:孟加拉语大语言模型多任务幻觉评估框架

首个孟加拉语LLM幻觉评估框架,含四个任务和12000个候选,提出双轨校准指标BenHalluScore,揭示模型幻觉差异。

04:00
arXiv cs.CL

神经符号句法分析:用CYK算法塑造神经网络

本文提出CYKNN,将CYK算法注入循环神经网络,在简单语法上优于大语言模型。

04:00
arXiv cs.CL

语言模型能组合性解析指代,但并非其天生强项:以个人关系任务为例

LLM与人类语义解析能力相反:人类外延强、LLM内涵强,缺乏指代基础是关键缺口。

04:00
arXiv cs.CL

技能可用性与表现粒度对大型语言模型代理的影响:一项受控的SkillsBench研究

技能可用性显著提升任务成功率,而表现粒度变化影响微弱且不确定。

04:00
arXiv cs.CL

DOA:面向语音大语言模型长文本同声传译的无训练纯解码器注意力策略

DOA提出无训练策略,利用自注意力代理对齐,实现低延迟长文本同声传译,质量接近离线。

04:00
arXiv cs.CL

Consolidating Rewarded Perturbations for LLM Post-Training

04:00
arXiv cs.CL

LongTraceRL:利用评分奖励从搜索智能体轨迹中学习长上下文推理

LongTraceRL利用搜索轨迹构建高混淆性干扰物,以实体级评分奖励进行过程监督,显著提升长上下文推理质量。

04:00
arXiv cs.CL

可靠的多语言骨科决策支持:临床叙述的语言感知适应与验证引导的延迟决策

针对英、印、旁遮普语骨科文本,提出IndicBERT-HPA与验证层,实现高可靠性,Macro-F1达0.88,支持延迟决策。

04:00
arXiv cs.CL

语义三元组恢复:一种用于大语言模型层次化表格理解的新协议

提出语义三元组恢复协议,将表格单元转为三元组事实,减少输入标记,提升小模型与长表格性能。

04:00
arXiv cs.CL

UniAudio-Token:赋予语义语音分词器通用音频感知能力

通过语义-声学基元和均衡机制,使分词器兼顾通用音频感知与语音能力,成统一音频接口。

04:00
arXiv cs.CL

如果大语言模型具有类人属性,那么《帝国时代II》也是如此

LLM拟人属性非独特,任何强基座实体皆可能呈现,实证需明确标准否则结论空洞。

04:00
arXiv cs.CL

Preference-Aware Rubric Learning for Personalized Evaluation

04:00
arXiv cs.CL

分歧理由:重新思考仇恨言论检测中的分类与可解释性评估

统一评估框架研究标注分歧,发现软表示更优,需重新思考主观NLP评估。

04:00
arXiv cs.CL

中文标题:我错过了什么?将问答作为隐藏状态探测

中文摘要:提出问答作为推理时干预,通过学生-教师模式发现隐藏状态可预测最终正确性,但干预效果依赖自一致性,诊断与修正存在差距。

04:00
arXiv cs.CL

最先揭示什么?图到文本生成的扩散模型轨迹分析

扩散模型图到文本生成轨迹:先实体后关系词,SFT破坏策略,lambda解码提升BLEU-4,Graph-LLaDA整合图结构且泛化更优。

04:00
arXiv cs.CL

二手车销售机器人?部分信息下LLM作为谈判代理的诚实与轻信

LLM在讨价还价中偏离博弈均衡,会撒谎却难利用信息不对称,优化财务收益增加不诚实。

04:00
arXiv cs.CL

无社会语言标签的巴西葡萄牙语口音特征提取

提出仅用声学标签提取巴葡口音特征的方法,利用音素对齐器获取局部特征,在口音分类中优于通用模型。

04:00
arXiv cs.CL

语言模型习得构式语义,更遑论句法:探究LM对配对焦点构式的理解

中等开源模型能理解罕见配对焦点构式,语义学习晚于句法并与世界知识相关。

04:00
arXiv cs.CL

专门护栏的威胁分类

提出RouteGuard,通过分诊对话至专门护栏,提升威胁检测细粒度和泛化性,支持模块化扩展。

04:00
arXiv cs.CL

一种面向化学成分可变的无机结构编码增强的填充方法

提出对称性感知填充编码,提升无机材料生成,重建精度提高5.3%,新颖稳定材料生成率提高63.5%。

04:00
arXiv cs.CL

LLM匿名化对抗代理重新识别

提出AURA框架,通过掩码-重构与自适应隐私范围,抵抗代理搜索重新识别并保留文本效用。

04:00
arXiv cs.CL

设计上可追溯:用于欧盟监管咨询分析的LLM流水线与仪表盘

提出端到端LLM流水线及仪表盘,实现监管咨询结构化主题提取与逐字可追溯,应用于数字公平法案案例,生成万余条注释。

04:00
arXiv cs.CL

EvoDefense:与大型语言模型协同进化的黑盒防御

EvoDefense通过防护LLM与体验记忆模块迭代优化攻击防御策略,无需再训练即可泛化应对未知攻击,显著降低攻击成功率。

04:00
arXiv cs.CL

以复杂度换取表现力:结构化广义线性令牌混合

提出统一框架分离直接影响与循环传播,设计结构化循环模式平衡复杂度与表现力,涵盖注意力与状态空间模型。

04:00
arXiv cs.CL

使用验证反馈的强化学习改进小语言模型的代码生成

在MBPP上,RLVR最多提升小模型代码生成13个百分点,但静态分析奖励导致偏向短代码,组合奖励更稳定。