9726 条条目 · 106 个活跃源
2026年9月21日
04:00
arXiv cs.CL

语义校准在词元置信度失效处更胜一筹:长文本科学问答基准测试

首个大规模长文本科学问答不确定性基准显示:词元置信度失效,仅最终答案语义一致性校准良好。

04:00
arXiv cs.CL

基于依存句法引导大语言模型的可解释多模态方面级情感分析

提出生成式可解释多模态方面级情感分析框架,用依存句法提示引导多模态大模型预测情感并生成解释。

04:00
arXiv cs.CL

无国界的教诲?——基于多语言故事寓意生成评估大语言模型的文化对齐

以14组语言文化数据提出多语言故事寓意生成任务,发现前沿模型虽贴近人类解读,却跨语言差异小、价值观趋同。

04:00
arXiv cs.CL

MemoryArena:在相互依赖的多会话智能体任务中评测智能体记忆

MemoryArena统一评测多会话记忆-智能体-环境循环,记忆与行动耦合,覆盖导航、规划、搜索与形式推理,现有基准高分智能体表现不佳。

04:00
arXiv cs.CL

为什么大语言模型在策略博弈中举步维艰?观察、信念与行动之间的断裂链路

大模型策略博弈失败暴露观察—信念、信念—行动两大内部断链:信念脆弱,且转化为高收益行动受阻。

04:00
arXiv cs.CL

Draft-OPD:面向投机草稿模型的同策略蒸馏

Draft-OPD以目标辅助生成和错误位置重放做同策略蒸馏,提升草稿接受率,实现超5倍无损加速。

04:00
arXiv cs.CL

Sometin Beta Pass Notin:通过知识蒸馏改进尼日利亚语言的多语种ASR

提出SBPN多语种ASR,经两阶段知识蒸馏,覆盖五种尼日利亚语言,WER相对降29%,优于SOTA。

04:00
arXiv cs.CL

十六个模型,不到两种声音:在无唯一正确答案时测量集成离散度

16个模型平均语义多样性仅1.69;模型身份仅部分解释分歧,集成离散度应实测而非假定。

04:00
arXiv cs.CL

基准的平衡:面向任务条件模型比较的语义密度重加权

提出BoB框架,以语义密度重加权和分数等值,提升任务条件下模型比较的准确性与稳定性。

04:00
arXiv cs.CL

MemeLens:面向模因的多语言多任务视觉语言模型

提出MemeLens统一多语言多任务视觉语言模型,整合38个数据集为20项任务,揭示多模态训练对模因理解的关键作用。

04:00
arXiv cs.CL

SteganoBackdoor:通过隐写后门规避数据投毒防御

提出SteganoBackdoor框架,用自回归令牌替换生成隐写投毒样本,在超低毒化预算下实现高攻击成功率。

04:00
arXiv cs.CL

注意差距:基于心理理论的摩擦用于认知对齐

将心理理论推断作为摩擦策略优化的控制信号,用四元信念结构计算摩擦,捕捉隐性分歧,提升干预与校准的稳定性。

04:00
arXiv cs.CL

维基词典作为英语方言的众包词库

本文评估维基词典作为英语方言众包词库,发现其覆盖不逊传统词典,且与地理社交媒体语言数据高度吻合。

04:00
arXiv cs.CL

新的注意力机制真能修复百万 token 上下文中的注意力汇吗?

SinkProbe评测:注意力汇由训练目标而非架构产生,门控效果未复现,汇与位置偏差各自独立。

04:00
arXiv cs.CL

MENASpeechBank:面向音频大语言模型的、以人格为条件的多轮对话参考语音库

构建含1.8万条多方言语音、124位讲者,并生成41.7万组人格化多轮对话的参考语音库,助力AudioLLM研究。

04:00
arXiv cs.CL

通过激活子空间理解加法的上下文学习

将少样本加法学习定位到少数注意力头,并在Llama-3-8B中归约为三头六维子空间,追踪信息聚合。

2026年9月18日
04:00
arXiv cs.CL

VisKG-LM:将知识图谱编译为视觉记忆以用于多项选择问答

将检索到的子图离线编译为可复用的视觉记忆,推理时仅末层读取,在多个问答基准上超越在线图传播方法。

04:00
arXiv cs.CL

用于矛盾与犹豫识别的模态差异Transformer

提出模态差异Transformer(MDT),以9令牌建模跨模态差异并文本引导融合,BAH集Macro F1达0.7408,超基线10分。

04:00
arXiv cs.CL

FakeSpotter:一种与内容和策略无关的病毒式虚假信息检测工具

FakeSpotter依据结构指纹评估文本的病毒式虚假信息风险,短/长文本宏F1约0.79,输出可解释。

04:00
arXiv cs.CL

超越静态几何的阈下提示:因果深度与多词元混杂

潜隐学习可经无关输出传递隐藏特征;固定几何、可读性、因果深度与多词元测量各异,多词元关联受长度混杂,机制未明。

04:00
arXiv cs.CL

采样揭示风格:无监督、免训练发现LLM激活中的提示条件风格轴

高温重复采样并对隐藏激活做PCA,可无监督、免训练发现提示条件风格轴,模型间差异显著。

04:00
arXiv cs.CL

别再删除停用词:一个继承的预处理默认设置如何扭曲法律文本数据研究

穷举单词消融显示:删停用词均不如保留,通用词表低于基线,优化词表亦无增益,反倒扭曲法律文本信号。

04:00
arXiv cs.CL

面向人类-大模型对话中用户侧隐式冲突的主动检测

构建UC-Bench基准与SynUC合成法,使小模型主动检测用户侧隐式冲突并超越大模型。

04:00
arXiv cs.CL

新古典:评估中国古典诗词语言美学推理的基准

提出新古典基准,以当代格律诗和逆向探针评估古典诗词语言美学推理,揭示模型跨域性能骤降、语篇排序薄弱。

04:00
arXiv cs.CL

用户如何看待生成式AI:应用商店评论中信任与摩擦的跨平台NLP分析

六大生成式AI应用1.7万评论:负面多因广告、认证、服务器与订阅,Claude最负面且极化,信任摩擦

04:00
arXiv cs.CL

反思式恢复:一种从错误中学习推理的自监督方法

提出自监督反思式恢复,将失败轨迹转为恢复训练数据,使模型学会纠错,突破规模崩塌并提升推理。

04:00
arXiv cs.CL

低方差奖励下组相对优化中的优势尺度校准失衡:诊断与有界恢复

区分亚分辨率抖动与可信小差距,提出优势尺度三方校准接口,揭示GRPO类方法KL失衡,并实现有界恢复。

04:00
arXiv cs.CL

CliniCIRCA:从原始电子健康记录叙述构建纵向心理健康患者旅程的模块化LLM框架

CliniCIRCA多阶段LLM框架,从无时间戳出院小结重建纵向心理患者事件时间线并生成摘要,指令微调提升多模型表现。

04:00
arXiv cs.CL

从记忆到超越:跨越长期多模态个人档案,从记住你到懂你

构建首个真实多年个人视觉档案多模态记忆基准,含事实回忆、人格推断与预测个性化三级评测,并提出时序加权模块。

04:00
arXiv cs.CL

为什么预训练无法实现跨语言知识共享

预训练中不相交的词元空间是跨语言知识难以共享的根本障碍,映射到共享词元空间可大幅提升迁移效率。

04:00
arXiv cs.CL

全双工语音模型中工具调用的前后端架构

提出语音前端发委派令牌、文本后端LLM执行工具调用、结果回注前端并由流式TTS合成的全双工架构。

04:00
arXiv cs.CL

细粒度危害信号在大语言模型安全中的作用

细粒度类别残差影响大模型危害编码与拒答,并增强通用危害对齐,安全分析需纳入。

04:00
arXiv cs.CL

YNU-HPCC 在 SemEval-2025 任务 11:利用多个预测头弥合基于文本的情感识别差距

YNU-HPCC团队在SemEval-2025任务11子任务A用RoBERTa改进输出头,单头优于六头,Google英译数据更佳,官方得分0.44。

04:00
arXiv cs.CL

少即是多:基于多信号后期融合的无图多模态RAG

TrioRAG免图多模态RAG,融合问题、锚图与VLM查询三信号检索,成本更低、快1.6-2.3倍。

04:00
arXiv cs.CL

从参数到行为:大语言模型模型融合综述

综述界定大语言模型融合,划分参数、表示、行为三层次,梳理指标、基准与应用,总结挑战并展望方向。

04:00
arXiv cs.CL

仅你可见:评估孤立语言模型实例间的协调

信号游戏测试孤立模型能否仅凭预训练与指令传递隐藏信号;多数协调难,前沿模型近完美且能误导,跨架构更弱。

04:00
arXiv cs.CL

基于梯度的数据归因方法中形式重于内容

梯度相似度主要反映答案格式而非任务语义,跨模型规模与训练阶段成立,LESS数据选择亦偏向目标格式。

04:00
arXiv cs.CL

思维链熵作为可靠性信号:一项预注册复现研究

复现发现:思维链熵轨迹形态可预测答案正确性,熵降幅度信号随设定而变。

04:00
arXiv cs.CL

F²DR:面向DeepSearch工作流的细粒度全流程奖励框架

提出F²DR全流程奖励框架,从内容、轨迹、答案评估DeepSearch并构建RM-Bench基准。

04:00
arXiv cs.CL

全双工语音模型在被问到时才开口,而非在需要时

全双工语音模型更易被点名和停顿触发,却难因错误事实或危险主动插话,纠正与警告比例也很低。

04:00
arXiv cs.CL

基于分层LLM与RAG抽象的原始遥测语义层归纳

分层LLM与RAG框架从原始遥测自动归纳业务语义层:质量50→80+,维护降80%,滤噪74%。

04:00
arXiv cs.CL

通过结构相似性提升研究论文中句子序列分类的跨语言迁移

构建13语种SSC数据集;发现结构/标签分布比语言邻近更能预测迁移;提出结构感知生成法提升跨语言迁移。

04:00
arXiv cs.CL

先学后判:面向可解释仇恨表情包检测的渐进式知识到决策对齐

现有可解释仇恨表情包检测将解释与分类耦合训练,相互干扰致性能受限;ProKDA采用三阶段渐进对齐,先学背景知识再检测与边界对齐,刷新三项基准最优。

04:00
arXiv cs.CL

泰老统一纯ASCII音位罗马化方案:系统性跨语言对应与面向中文用户的友好设计

泰老统一纯ASCII音位罗马化方案,标记音段、元音长短与声调,一音一符,兼容拼音粤拼,便学习与机器处理。

04:00
arXiv cs.CL

面向大语言模型标注数据的非分词语言词典约束字音转换

提出词典词格CRF神经G2P方法,借大模型生成数据缓解标注稀缺,在多语言基准上显著超越传统方法。

04:00
arXiv cs.CL

进化还是幻觉?重新思考LLM进化搜索中的评估

LLM进化搜索评估不能只看单一种子预算;种子与迭代分配及策略排名随任务和预算变化,需报告完整前沿。

04:00
arXiv cs.CL

D-Quant:用于KV缓存量化的可漂移熵编码

D-Quant通过漂移机制将KV缓存熵编码转为定长比特流,兼顾高压缩与并行反量化。

04:00
arXiv cs.CL

逮捕之前:基于不完整证据的LLM犯罪侧写基准评测

PIJ基准含2500起真实凶杀案,评测LLM三项刑侦任务,隐式推理为瓶颈,与专家差距大且存在偏见。

04:00
arXiv cs.CL

PetriBench:面向动态状态空间的LLM推理基准测试

基于Petri网的LLM推理基准,四类任务三级难度;难度越高准确率越低,测试时计算与程序化生成影响各异。

04:00
arXiv cs.CL

Transformer模型中的词汇抽象泛化:以功能词为例

功能词嵌入居中且独特;词汇化句与功能句分属不同子空间,混合训练方能显现共享结构。