9717 条条目 · 106 个活跃源
2026年9月22日
04:00
arXiv cs.CL

Deep Persona:面向角色扮演智能体与模拟的心理学基础架构与评估框架

提出三层心理学人格架构与无参考评估框架;发现大模型语用流畅,但情感表达与共同注意存在系统性局限。

04:00
arXiv cs.CL

大语言模型中的上下文因果性:综述

综述提出上下文因果性的语义、干预与反事实分类,分析现有研究局限,并展望未来方向。

04:00
arXiv cs.CL

国际象棋解释能反映模型决策吗?LLM推理忠实性的行为与词元级测试

200个残局谜题的行为与词元级测试表明,解释的语言流畅性、动作一致性与正确性彼此独立,仅有限反映真实推理。

04:00
arXiv cs.CL

佐证错觉:更多新闻反而让大模型预测更失真

攻击者仅靠发新闻即可毒化语料、操纵LLM概率预测,单篇翻转56%预测,五篇达69%,常见防御可绕过。

04:00
arXiv cs.CL

提示工程教程:从混乱想法到AI工作流

提示工程:把模糊意图转为结构化AI规范,精简上下文、设定角色与正向目标,辅以批判验证,重在清晰。

04:00
arXiv cs.CL

DIPLOMAT:面向礼貌且具说服力的职场谈判对话的对话跨度感知直接偏好优化

DIPLOMAT采用对话跨度感知偏好优化,生成连贯、礼貌且有说服力的职场谈判回应。

04:00
arXiv cs.CL

无品格的功能性情绪:大语言模型、亚里士多德式性情与行为对齐的局限

大模型有因果活跃的情感概念表征,但缺乏品格与主观感受;对齐应视为持久性情而非输出符合。

04:00
arXiv cs.CL

检查点还不够:CoSLR——面向系统性文献综述的人机协作系统中的信任校准

CoSLR人机协作系统支持系统综述并设强制人工检查点;63人调研中34.9%愿免核查直接信任AI输出,显示监督有效性取决于用户意愿,信任校准需设计应对。

04:00
arXiv cs.CL

上下文层中哪一部分在起作用?在 Text-to-SQL 智能体中分离语义内容与检索脚手架

四组消融显示:文本转SQL中语义内容主导增益,检索脚手架作用有限,应语义优先、脚手架次之。

04:00
arXiv cs.CL

被使用、被提及,还是被谴责?代码混合 Hinglish 厌女检测中“使用—提及”区分的受控对比集诊断

Hinglish厌女检测中,词典法难辨辱骂使用与提及;受控对比集与配对一致性诊断下强模型仍约五分之一反制言论对出错

04:00
arXiv cs.CL

预训练人格混合模型与串联模型用于人类模拟

提出预训练人格混合模型替代指令微调角色扮演,更准确多样;串联模型结合监督者效果最佳。

04:00
arXiv cs.CL

Vox-Infinity:长上下文语音语言模型能力边界的基准评测

首个长上下文语音语言模型基准,按轮数与时长扩展历史并提供答案溯源;评测7个模型均呈明显近因效应。

04:00
arXiv cs.CL

正确诊断,更佳反馈:用于逻辑证明中忠实 LLM 辅导反馈的符号验证器

逻辑证明辅导中,以符号验证器分离诊断与反馈生成;表面反馈质量可能掩盖诊断错误,忠实性需与正确性分开评估。

04:00
arXiv cs.CL

当余弦相似度无法反映对话模型中的线性可解码结构时

对话大模型中余弦相似度会低估线性可解码的人设结构,监督子空间可弥补,单句情感分类无此问题。

04:00
arXiv cs.CL

CultureMINE:用于提升NLP系统文化能力的数据集与方法

分析375余篇论文,梳理文化NLP的目标能力、数据构建与提升方法,总结趋势与空白。

04:00
arXiv cs.CL

Apollo Restore:面向古希腊文本中间填充修复优化的历史希腊语基础大语言模型

24B参数历史希腊语基础模型,用中间填充修复古希腊残卷空缺,性能超基线,专家盲评偏好,并改进纸草释读

04:00
arXiv cs.CL

学生大模型能否继承分布外鲁棒性?面向可靠知识迁移的不变性加权蒸馏

提出不变性加权蒸馏IWD,按教师预测的不变性动态加权样本,显著提升学生模型分布外鲁棒性。

04:00
arXiv cs.CL

基于留一方言交叉验证与可解释AI的孟加拉语区域方言跨方言命名实体识别

孟加拉语五方言数据上以留一交叉验证评测八种预训练模型,E5-Large最优(F1最高97.26%);LIME显示预测倚重实体表面形式。

04:00
arXiv cs.CL

利用语言模型从可穿戴数据迈向个性化睡眠指导

提出两阶段框架:多智能体LLM生成数据并蒸馏至小模型,实现可穿戴数据个性化睡眠指导,优于大模型。

04:00
arXiv cs.CL

忠实保留要旨:摘要评估中超越饱和的语义脚手架

提出语义脚手架评估框架,从原文提取事实层级结构,导出三项诊断指标,缓解ROUGE与LLM评判饱和。

04:00
arXiv cs.CL

分析城市化公共话语:基于YouTube评论的主题聚类、情感分析与检索增强生成

基于2.2万条YouTube评论构建城市议题RAG系统,发现情感分类中性类崩溃、稠密检索占优、常用评估指标失效。

04:00
arXiv cs.CL

思维链文本转语音:基于音频上下文感知的推理式语音合成

提出上下文感知推理式TTS任务,构建900万样本数据集,实现基于对话上下文的情感与韵律合成。

04:00
arXiv cs.CL

AlexandriaX 2026:首届阿拉伯语方言机器翻译共享任务

AlexandriaX 2026首届阿拉伯语方言机器翻译共享任务设对话、金融跨方言翻译和错误检测三子任务,最佳系统显著超基线,资源公开。

04:00
arXiv cs.CL

Beetle:面向第二语言加工建模的双语模型套件

提出可控双语预训练模型套件,发布330个模型;分阶段课程更贴合二语阅读时间,小数据与近亲语言增益最大。

04:00
arXiv cs.CL

LLaDA-PRM:双向步骤级推理评估器

8B双向步骤级推理评估器,在MR-MATH等基准超越34B基线,支持在线评估与数据筛选。

04:00
arXiv cs.CL

基于医疗转录文本的临床领域分类

对比机器学习、Transformer与少样本提示法进行医疗转录临床领域分类,用同义词替换和SMOTE缓解类别不平衡,BERT的F1达0.996。

04:00
arXiv cs.CL

NLPCC 2026 任务10:基于DeBERTa集成与类别校准的引文级忠实性验证

融合段落交叉编码器与DeBERTa文档分类器,类别校准,证据结合BM25;离线,获NLPCC 2026任务10赛道二,Macro-F1 89.55。

04:00
arXiv cs.CL

超越最终词元分类:面向证据支撑的自杀风险检测的异构读出

提出异构读出分解HRD,分离语义验证与输出实现,提升自杀风险检测分类与证据抽取性能。

04:00
arXiv cs.CL

先诊断,后修复:面向领域机器翻译的两阶段MQM引导后编辑框架

两阶段MQM引导后编辑:先结构化诊断,再受限最小修复,减少改写漂移;多模型多语言上提升COMET-22与COMETKiwi,且与人工标注高度一致。

04:00
arXiv cs.CL

MIS-Bench:面向心理治疗人际技能评估的多模态大模型基准测试

提出MIS-Bench基准,评测多模态大模型的心理治疗人际技能,并给出MIS-RAFT微调法。

04:00
arXiv cs.CL

大语言模型在序贯临床分诊中锚定主诉,未能整合证据

LLM急诊序贯分诊性能随对话推进下降,锚定主诉、未整合后续证据,离线基准会漏判。

04:00
arXiv cs.CL

语义-几何解耦路由的块稀疏注意力

免训练块路由框架,语义聚合前移至RoPE前空间,几何偏置由结构先验重建,128K下较FlashAttn提速5.03倍。

04:00
arXiv cs.CL

整合还是不整合?基于同行评审的多参考训练中整合策略的影响评估

多参考生成任务中,整合多样参考为统一训练信号至关重要;本文提出MERC-36K数据集并验证整合训练更优。

04:00
arXiv cs.CL

通过心理测量画像测量大语言模型的行为特征

用七种心理工具、中英双语测评九个LLM,发现模型行为画像各异、未答项结构化,语言与来源影响回答性。

04:00
arXiv cs.CL

基于LLM智能体用户模拟的自动多模态UX改进建议

AMUSER多模态框架模拟用户行为,自动生成并排序UX改进建议,效果超纯文本模拟且成本降89%。

04:00
arXiv cs.CL

桥接静态与智能体RAG:面向台湾历史问答

静态与智能体RAG总体相当,但超七成问题不同;事后选择器融合二者,显著优于单管道并回收六成最优选择空间。

04:00
arXiv cs.CL

重新审视代码语言模型中的枢轴编程语言

控制各向异性与长度差异后,跨语言几何无统一中心;Python的优势是与英语对齐,而非几何中心地位。

04:00
arXiv cs.CL

面向文本到SQL的迭代式LangGraph智能体:芝加哥犯罪数据库的自然语言访问

LangGraph文本到SQL智能体免微调,芝加哥犯罪数据评测有效SQL率93%、执行准确率60%

04:00
arXiv cs.CL

审计大语言模型助手的政治对齐:参与、立场与用户身份

审计六个AI系统发现其政治回应随用户身份与议题变化:控制题均迎合,争议题参与和立场分化,立场可外溢。

04:00
arXiv cs.CL

RAG 引用中的可归因事后合理化:一项受控复现与 RLVR 对比

RAG会事后合理化引用未用来源;RLVR奖励答对不提升忠实性,维基问答1/7引用不实,单独训练评估。

04:00
arXiv cs.CL

引导大语言模型遵循法律的字面规定或精神实质

定向适配可让大语言模型偏重法条或法理精神,其内部形成三维可解释空间,契合预设法概念几何框架。

04:00
arXiv cs.CL

从概念对齐到因果接地:思维链忠实性的干预检验

用共享稀疏自编码器比较预测与思维链的内部概念,发现概念对齐高但因果贡献有别,忠实性需因果检验。

04:00
arXiv cs.CL

OmniEdu:面向学习与教学的开放基础模型

OmniEdu是面向K-12的开源基础模型系列,按四大能力构建指令数据,各规模均提升解题与教学表现。

04:00
arXiv cs.CL

Chronologic:衡量语言模型表征过去的能力

基于1831—1930年历史文本构建基准,发现生成任务难于判别任务,模型尚不能完全令人信服地再现历史语境。

04:00
arXiv cs.CL

基于异构图神经网络增强语音表示的低资源跨模态对齐

提出基于HGNN和链接预测的数据高效语音-文本对齐法,经消息传递迁移文本信息,低资源词级任务媲美或超越SAMU-XLSR。

04:00
arXiv cs.CL

低资源环境下基于异构图神经网络的跨模态知识迁移增强语音表征学习:以Yemba语为例

提出异构图神经网络跨模态知识迁移,融合语音与语言节点,提升低资源语音表征,Yemba语实验验证有效。

04:00
arXiv cs.CL

尤斯顿:消除数学谄媚而不失数学能力

以GraphSynth生成真假配对数据、GRPO微调8B模型,假命题识别率由29.5%升至63.75%,数学能力未显著下降。

04:00
arXiv cs.CL

ChemCLIR-Bench:多语言化学专利中的跨语言信息检索基准评测

构建五语言化学专利跨语言检索基准,评测八种模型,发现跨语言检索召回与排序深度显著劣化。

04:00
arXiv cs.CL

SoK:面向事实核查与信息完整性的形式化方法

按形式化对象分五层梳理121项工作,发现相关形式化工具多未落地,核查系统自身验证缺口最大。

04:00
arXiv cs.CL

以貌取评:基于LLM的同行评审评价指标的可靠性分析

保义改写测试29个LLM评审指标,23个对改写敏感、仅6个稳健,显示指标混淆评审质量与语言表达。