10025 条条目 · 106 个活跃源
2026年7月28日
04:00
arXiv cs.CL

引导语言模型更具同理心:通过人类-LLM协作生成文化敏感的心理健康建议

提出RP-RCAF框架,通过人机协作生成文化敏感的心理健康建议,在低资源语言中超越常规提示,更贴近专业咨询。

04:00
arXiv cs.CL

ARCH HDL中形式化验证的可综合浮点数据类型

单一描述生成三种形式,机器校验所有运算符等价,并通过Lean证明乘法和FMA正确舍入。

04:00
arXiv cs.CL

新颖主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

动态评估减少但未消除污染,新主张多可基于已有知识验证,污染显著夸大性能。

04:00
arXiv cs.CL

图表能帮助大语言模型推理吗?来自三段论推理的证据

实验表明,图表表示未持续提升LLM的三段论推理性能,模型在中性问题上表现不佳,整体收益有限。

04:00
arXiv cs.CL

语言中的JEPA悖论:语言备选项的几何结构

JEPA在文本中因多可能补全无法压缩至单一潜点,导致表示崩溃与迁移性能下降。

04:00
arXiv cs.CL

GEMCo:一种经验证、可合乎道德发布的代理,用于替代无法获取的咨询数据

GEMCo是经验证的人类编写代理,替代无法公开的咨询数据,差距小且无隐私问题,推动领域语言研究。

04:00
arXiv cs.CL

语言影响多语言大语言模型中的指令层级遵从性

XIH-Bench揭示多语言指令层级遵从存在语言不对称性和语言边界效应,语言专长带来安全和可靠风险。

04:00
arXiv cs.CL

EmoTrace:以情感轨迹为中心的心理支持对话生成框架

提出EmoTrace框架,通过建模求助者情感轨迹,增强情感表达与共情,显著提升生成对话的情感丰富性。

04:00
arXiv cs.CL

标准词嵌入属性的实证研究

回顾词嵌入机制,研究公开工具包和矩阵,实验选型以理解特性。

04:00
arXiv cs.CL

Pointer-Augmented Autoregressive Generation of Patent Claims with Joint Topology and Content Decoding

04:00
arXiv cs.CL

Indic DiarBench:印度语言的多语种联合说话人分割与ASR基准

涵盖22种印度语、108小时多说话人音频的联合说话人分割与ASR基准数据集,人工校正,开放获取。

04:00
arXiv cs.CL

Earnings25:面向金融领域的500小时综合语音基准

Earnings25基准评估金融财报电话会议ASR,含500小时数据及结构化元数据,支持说话者与行业感知分析。

04:00
arXiv cs.CL

Zing:大语言模型的社会心智

提出评估、内化与落地的社交智能框架,评测显示模型潜力大,训练与推理方法有效提升性能。

04:00
arXiv cs.CL

上下文归因如何处理模型已知内容

上下文与训练数据重叠时,归因方法无法区分内外贡献,分数不可靠;实验表明不忠实,无法分离来源。

04:00
arXiv cs.CL

冻结12B模型在验证任务上击败前沿模型:100%准确、零Token、比特精确、永久有效

提出冻结模型+验证记忆方案,已解决问题零token、比特精确复用,准确率100%,并扩展至开放推理。

04:00
arXiv cs.CL

理解大语言模型中语气相关的推理成本

提示语气显著影响LLM答案准确性与推理成本,输出token消耗差异达44.3%,需权衡准确性与资源消耗。

04:00
arXiv cs.CL

附加疑问句与45种语言模型中谄媚现象的世代反转

附加疑问句使模型赞同率在±32%间摆动,并随世代从谄媚转为抵抗(模式匹配非原则),'maybe?'则全模型支持上升。

04:00
arXiv cs.CL

SyRuP:通过奖励引导预测增强大语言模型解码中的系统提示遵循

SyRuP训练奖励头并在解码时重排候选,有效提升系统提示遵循,性能优于基线且开销适中。

04:00
arXiv cs.CL

MoLGE:面向大规模多语言语音识别高效扩展的语言组专家混合模型

MoLGE通过语言组专家和分层LoRA,在495语言上以少量参数提升多语言语音识别性能。

04:00
arXiv cs.CL

基于LLM与基于词典的情绪信号在Meme股尾部风险检测中的比较

比较LLM与词典情绪信号,LLM表征更丰富,但预测性能不稳定。

04:00
arXiv cs.CL

BioSentinel在EXIST 2026:基于XLM-RoBERTa的软标签优化用于迷因性别歧视意图分类

使用XLM-RoBERTa和混合损失函数优化软标签,在迷因性别歧视分类任务中取得中等排名。

04:00
arXiv cs.CL

通过语言可解释性探寻自发性芬兰语语音中的情感

研究结合文本与音频特征建模情感感知,发现组合特征改善效价回归,但对唤醒度提升有限。

04:00
arXiv cs.CL

压缩短文本生成中的质量瓶颈:分阶段定位

通过分阶段诊断发现,压缩短文本生成质量瓶颈主要在编解码器重建而非潜在去噪,编解码器导致困惑度提升超80%。

04:00
arXiv cs.CL

分词税:量化并解释子词分词对印度语言的跨语言成本

子词分词致印度语言成本达英8-13倍,源于合并失败;多语言分词器减73%,但阅读能力更受资源影响。

04:00
arXiv cs.CL

StanceFlip:面向多模态对话立场翻转预测的全面多维基准

提出StanceFlip基准与ConStaFF框架,通过六元组抽取和翻转归因,解决多模态对话立场动态演化和歧义问题,性能达最优。

04:00
arXiv cs.CL

相关性新角色:在智能体搜索中引导语料库交互

RARG将相关性转化为交互执行先验,实现粗到细搜索引导,加速收敛并提升准确率与效率。

04:00
arXiv cs.CL

CAGE:面向长形式问答中忠实内联引用生成的认知归因图

CAGE提出两阶段框架,先构建认知归因图对齐答案与文档,再生成带引用的句子,解决证据边界越界问题,性能最优。

04:00
arXiv cs.CL

准确率隐藏模型失败:在匹配输出预算下测量失败状态

准确率混淆执行状态与验证,双层评估框架揭示模型失败模式,需报告执行状态与覆盖。

04:00
arXiv cs.CL

INS-ActBench:大语言模型专业精算能力综合评估基准

INS-ActBench含12050道问答,评估LLM精算能力,发现前沿模型标准化知识强,但案例推理与工具使用弱。

04:00
arXiv cs.CL

铭记于心:评估智能体记忆中的隐式关联盲点

现有记忆系统因依赖相似性检索而忽略隐式关联,导致间接查询准确率从84%骤降至14.4%。

04:00
arXiv cs.CL

SINT-Flow:使用大规模语言模型工作流的模式集成

SINT-Flow通过五个LLM操作员工作流实现全自动模式集成,处理多实体表,基准测试F1达96%、85%、83%。

04:00
arXiv cs.CL

检索增强的大语言模型作为监管知识管理认知计算架构的组件

RAG增强LLM用于监管知识管理,提升事实一致性与规范精度,实现可审计动态更新。

04:00
arXiv cs.CL

临床LLM中模式合规性的闭环验证-修复:面向医疗互操作性的多模型研究

闭环验证-修复将临床LLM模式合规率从约90%提升至99%,有效保障医疗互操作性。

04:00
arXiv cs.CL

LEX-EC: 黑盒设置下零样本大语言模型人格分类的词汇证据通道审计框架

LEX-EC框架通过词汇消融等方法审计黑盒LLM人格分类,区分边际分布效应与词法证据下的特质关联。

04:00
arXiv cs.CL

在Transformer推理中为潜在算法路由奠定基础

ROUTEBENCH基准表明,密集Transformer可发展内部路由变量,根据数据模式选择算法族,但未证明通用路由能力。

04:00
arXiv cs.CL

重新思考块扩散语言模型的生成顺序

提出并行自回归解码(PARD),保留从左到右结构并允许并行,在块扩散语言模型中加速生成且质量接近自回归。

04:00
arXiv cs.CL

CONSISTRE:面向大语言模型的文档级关系抽取的统一一致性感知框架

提出CONSISTRE框架,通过推理时约束和训练时蒸馏两轨道,提升LLM文档级关系抽取的一致性与可靠性。

04:00
arXiv cs.CL

自创验证在启发式自我改进智能体中不可靠

自改进智能体依赖自创验证易致性能虚高,SEAL通过外部审计防止退化,需至少一个外部信号确保可靠改进。

04:00
arXiv cs.CL

面向检索增强生成系统的交叉注意力校准去重

提出CACD去重,利用交叉编码器保留token细节,结合新信息分数与多数投票,移除9.75%冗余块,速度比最强基线快27%。

04:00
arXiv cs.CL

同一问题,不同答案:超越准确率评估大语言模型可靠性

大语言模型对等价不同表述的问题答案不稳定,单次准确率不可靠,自释义策略可提升一致性。

04:00
arXiv cs.CL

PIVOT: 用于令牌级稀疏注意力机制的高效查询组索引

PIVOT通过分组查询共享扫描,将索引器加速4倍且精度不变,端到端延迟降低1.6倍。

04:00
arXiv cs.CL

从数据到设备:ELMOD——面向移动推理的高效德语优先2.7B语言模型

2.7B德语模型ELMOD,经德语专用数据预处理与质量过滤,在有限算力下性能媲美7B模型。

04:00
arXiv cs.CL

大型语言模型与基于Transformer的机器翻译在英-泰米尔双向翻译中跨数据集的系统性分析

系统评估多模型在英-泰双向翻译,发现数据质量与领域对齐关键,注意机制增强可解释性,少样本LLM也能生成结构合理翻译。

04:00
arXiv cs.CL

从转录到语义语料分析:古代语言句子表示的无监督学习

提出TSDAE和CSE两种无监督策略适配古代语言句子编码器,在圣经复用任务中优于基线,实现从转录到语义分析。

04:00
arXiv cs.CL

D-Score:用于大型语言模型幻觉检测的谱隐态信号

D-Score通过单次前向传播中隐藏激活的奇异方向计数检测幻觉,无需外部验证或多次生成。

04:00
arXiv cs.CL

Kimi K3:开放前沿智能

Kimi K3是2.8T参数MoE模型,百万token上下文,原生视觉,性能前沿但略逊顶级闭源,已开源。

04:00
arXiv cs.CL

DataOrchestra:学习为每个示例编排预训练数据管理

提出DataOrchestra框架,为每个数据示例定制处理流水线,稳定提升性能并减少计算。

04:00
arXiv cs.CL

循环并非可靠性:面向智能体代码修复的状态绑定证据与类型化修订契约

循环不保证可靠;提出状态绑定证据与类型化修订契约,绑定验证至状态,保留检查点,生成审计凭证。

04:00
arXiv cs.CL

多轮长程规划的物理学:从预训练到后训练的单教师与多教师在线智能体蒸馏

通过可控环境研究多轮长程规划三阶段:预训练需显式世界模型与少量长程数据,后训练OPD优于GRPO,多教师蒸馏可整合能力但存冲突。

04:00
arXiv cs.CL

MM-ShiftKV: 面向多模态大语言模型的解码感知预填充阶段KV选择

MM-ShiftKV通过构造方差扩展查询代理估计KV重要性,解决解码查询方差大导致视觉token丢失问题。