9946 条条目 · 106 个活跃源
2026年8月12日
04:00
arXiv cs.CL

每一词元皆关键:用于测量大语言模型态度与偏见的精确李克特量表分布

提出精确框架,用全因子实验和词元级概率分布消除采样噪声,测量LLM态度与偏见。

04:00
arXiv cs.CL

校准LLM数据污染检测中的训练后特征偏移

针对训练后特征偏移问题,提出CalibDCD框架,通过多视角偏移检测与有界特征校正,提升LLM数据污染检测,AUC+7%,TPR@5%FPR+15%。

04:00
arXiv cs.CL

发布的LLM词表能否用于隐藏语料的Token级估计?

提出QGDE方法,利用分位数引导密度估计,从已发布词表估计隐藏语料中任意token比例,平均相对误差低至3%。

04:00
arXiv cs.CL

ASR往返评估可能掩盖中文新闻TTS中依赖上下文与惯例的朗读错误

语音识别往返评估会掩盖依赖上下文或惯例的朗读错误,仅宜筛查,不可单独作为中文新闻TTS风险评测依据

04:00
arXiv cs.CL

基于可验证情感反馈的双环自进化多轮共情对话

提出双环自进化框架,利用可验证情感回报优化多轮共情策略并动态调整训练分布,显著提升SAGE性能。

04:00
arXiv cs.CL

种子先于目标:重新思考低资源加瓦尔语ASR评估

低资源语料下,单次运行比较难复现。加瓦尔语多随机种子基准显示,Focal CTC等增益脆弱,仅w2v-BERT 2.0稳定领先。

04:00
arXiv cs.CL

分解诱导的上下文-记忆冲突:当事实验证流水线与其源文本自相矛盾

分解阶段会诱发上下文-记忆冲突,使生成断言违背源文本;检测基线失效,现有缓解手段代价高且不可部署。

04:00
arXiv cs.CL

离散扩散的单纯形松弛

提出单纯形松弛法,在保持原扩散边际不变下引入辅助变量,提升文本生成与数独性能。

04:00
arXiv cs.CL

利用人类阅读行为进行关键词提取:基于网络摄像头的眼动追踪语料库

基于网络摄像头眼动追踪特征(注视次数与总时长)可提升中文学术摘要关键词提取性能,构建了CLIS-ET语料库并验证其价值。

04:00
arXiv cs.CL

基于采样BPE词元统计的中文网络规模语料审计

采样BPE审计管线:高效揭示中文语料污染广泛且动态变化,发布66万记录分层词元数据集。

04:00
arXiv cs.CL

评估基于BERT的模型在问答任务上的可靠性

评估BERT系列问答模型可靠性,发现RoBERTa最可靠,ALBERT与DistilBERT不稳定,蒙特卡洛丢弃法可作可靠性指标。

04:00
arXiv cs.CL

认证或拒绝:协变量偏移下带覆盖率下限的选择性风险控制的跨模型映射

证明覆盖率下限认证需可行性边界;跨模型给出风险与下限的复杂度匹配,下限创造映射。

04:00
arXiv cs.CL

SPIEval:评估大语言模型作为移动助手应对分散个人信息的能力

SPIEval基准含250任务5种认知能力评测9个LLM,最佳准确率57.3%,主要失败源于信息定位不准。

04:00
arXiv cs.CL

面向NLPCC 2026共享任务6的EVIL-Detect:LLM生成文本检测

多信号集成与冲突感知融合框架,在NLPCC2026任务6中排名第一,宏F1为0.8888

04:00
arXiv cs.CL

多数生物医学论文呈现LLM辅助写作迹象

新法估算:2025年底89%生物医学论文出现LLM词汇,讨论区使用率高于方法区,但方法区仍超50%。

04:00
arXiv cs.CL

开放大语言模型的多语言机器翻译无参考后训练

采用GRPO与无参考质量评估奖励后训练,插值SFT和RL检查点,在46语种上提升翻译质量,超越多个开源及专有基线。

04:00
arXiv cs.CL

Surfacing the Unsaid: CUE-Bench for Affective Stance in Chinese Discourse

04:00
arXiv cs.CL

缓解上下文干扰,实现可靠高效的搜索智能体

多轮搜索智能体上下文干扰主要源于最新检索文档;用蒸馏式细化器并纳入强化学习,显著提升可靠性与效率。

04:00
arXiv cs.CL

X2-Turn:用于联合流式ASR和话轮状态预测的帧同步双头建模

提出X2-Turn,在共享流式表示上帧级同步预测ASR与话轮状态,实现低延迟准确检测。

04:00
arXiv cs.CL

VibeLifeBench:你的生活智能体能在不断变化的世界中保持主动与持久吗?

提出VibeLifeBench基准:含200个长期任务,测试智能体在动态世界中的主动性与持续性,前沿模型得分低。

04:00
arXiv cs.CL

FaithformBench:数学思维链自动形式化的忠实度基准评测

提出廉价且可靠的基准,评估数学自动形式化系统忠实度,发现多数系统会“静默纠正”错误输入,且忠实度与纠正倾向存在矛盾。

04:00
arXiv cs.CL

基于人格特征的突发错位数据归因

微调引发模型错位源于人格特征,可调控;人类文本不足,合成问答对才有效。

04:00
arXiv cs.CL

MUSE:科学问题、解决方案与理据的全文本跨领域知识库

构建37K科学问题-方案-理据三元组知识库;理据监督提升复杂问题解决,但可能削弱简单问题表现。

04:00
arXiv cs.CL

REAP:面向从大语言模型进行闭卷知识库构建的关系感知抽取与解析

REAP系统用于闭卷知识库构建,结合思维链与关系查询,在无微调、32B参数预算下取得宏F1 0.62。

04:00
arXiv cs.CL

使用小型语言模型的多语言短文本分类成本高效路由管道

多语言短文本分类中,选择性翻译低资源语言可显著提升其宏F1,无需微调。

04:00
arXiv cs.CL

ReLTEx:基于大语言模型的可靠分类体系扩展

ReLTEx结合LLM候选生成与结构感知验证、递归扩展控制,减少幻觉,提升分类扩展的可靠性与一致性。

04:00
arXiv cs.CL

迭代自馈式语言模型探针测量了什么——以及一项区分构造与模型的测试

自馈探针同时测量构造固有量与模型真实量,固定其一变动另一方即可区分。

04:00
arXiv cs.CL

ConRub-Med:基于共识规则的开放式医学问答强化学习

提出ConRub-Med,以多模型共识规则为奖励,三态评分区分正确、缺失与错误,医学问答基准六项第一。

04:00
arXiv cs.CL

论多语言文本到图像生成中跨语言一致性的局限性

提出多语言基准,用三万三千提示评估跨语言内容与文本渲染,揭示语言不平等及依赖语言的模式。

04:00
arXiv cs.CL

模板化还是完全合成?提示构建作为衡量LLM政治立场(超越写作辅助)的混杂变量

扩展IssueBench至信息寻求和观点分享,提出全合成提示,其更真实且立场清晰,模板提示会高估模型倾向。

04:00
arXiv cs.CL

LLM推荐器知道自己在幻觉吗?目录忠实性中的置信度校准审计

审计四款LLM推荐器:幻觉率随目录而异,但置信度系统性欠自信,校准差,弃权阈值难分离正确项与幻觉。

04:00
arXiv cs.CL

myMediWhisper:构建缅甸语医学语音语料库及微调Whisper用于临床对话ASR

构建28小时缅甸语医学语料,微调Whisper,最优词错率23.44%。

04:00
arXiv cs.CL

TEAMMix:面向大模型增强弱监督层次文本分类的类别体系丰富与少数类增强混合策略

提出大模型增强弱监督层次文本分类框架通过丰富类目语义生成伪样本及高斯混合优化提升细粒度不平衡数据性能

04:00
arXiv cs.CL

行动胜于言语:衡量工具使用智能体的跨语言策略保持

提出跨语言行为策略测量法,消除五个混淆后:大模型保持71-73%策略,小模型失效;揭示英语中转和规则陷阱。

04:00
arXiv cs.CL

用于识别政治观点的多类情感分析

对社交媒体政治观点进行多类情感分析,评测两种模型,F1约0.28,任务困难,提供基线。

04:00
arXiv cs.CL

注意力路径脆弱性:大语言模型中的不确定性信号

以掩码注意力头测量子网络互信息,识别自信但脆弱的预测,可补充误差预测信息并超越语义熵。

04:00
arXiv cs.CL

ConVAWG:基于检索的受控合成对话生成框架,用于针对女性及女孩的暴力场景

提出ConVAWG框架,基于检索生成多轮合成对话,模拟对女性暴力场景,含6000余事件,经评估质量高。

04:00
arXiv cs.CL

低资源语言中跨语言安全的假象

跨语言安全迁移严重不足,有害提示保留不到10%拒绝信号,多语言安全对齐流于表面。

04:00
arXiv cs.CL

从可解释性到可控性:TrustNLP研讨会六年洞见

六年144篇论文:从可解释转向机制理解与主动控制;真实性增长最快,公平性最稳定,可解释性U型回升。

04:00
arXiv cs.CL

OpenPM:面向LLM投资组合管理代理的可审计时点评估

提出可审计时点评估框架,防前视泄漏并强制执行风险指令;分析师质量比构造器选择更重要,换手率是主要成本。

04:00
arXiv cs.CL

通过年龄感知训练实现儿童语音的边缘音素识别

轻量模型联合预测年龄和音素,94M参数胜过大型模型,实现手机端儿童音素识别。

04:00
arXiv cs.CL

迷失于重建:在视觉-语言-动作模型中对齐动作表示与语言

重建优化使动作表示丢失语言信息;SALT用辅助目标从量化动作恢复指令,显著提升语言条件控制。

04:00
arXiv cs.CL

扣留补全块:流式LLM输出的确定性成对补全护栏

以双词谓词合取定义危险信号,扫描前缀并扣留首个补全配对块。能精确拦截,但覆盖窄,非语义审核替代。

04:00
arXiv cs.CL

谁被倾听?EPA规则制定中回应性的义务层面审计

提出义务级回应性审计,发现公众参与仅适度关联修改,组织意见多致编辑性而非实质性变化。

04:00
arXiv cs.CL

DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

全新基准:275项任务覆盖数据科学全流程,最强模型56.7%,开源低于1%,差距显著。

04:00
arXiv cs.CL

VoxSumm:面向联合摘要与翻译的长篇语音新闻多语种语料库

提出联合语音摘要与翻译任务及多语种基准VoxSumm,含24语言703小时,评估显示模型差异显著。

04:00
arXiv cs.CL

评估自然语言中的理性缔约

当前语言智能体在低不确定性下能达成高效合约,但在高不确定性下常无法协商出满意互利的合约,且执行时易违约。

04:00
arXiv cs.CL

思维病毒:多智能体LLM系统中的自传播观念

思维病毒可在多智能体LLM系统传播;有害载荷传播力弱但有效,系统提示加简短警告可近乎完全免疫。

04:00
arXiv cs.CL

Riemann GeoResolver:从欧氏解析器到双曲-球面几何的非欧几里得注意力框架

提出逆距离注意力理论,欧氏原型证明三项定理,非欧扩展以双曲存储、球面路由构建十模块框架。

04:00
arXiv cs.CL

面向生成式创意写作的叙事关键帧

提出叙事关键帧技术,通过情节、角色和视角三类关键帧控制生成文本,提升创意写作的可控性、透明度和参与感。