9701 条条目 · 106 个活跃源
2026年9月23日
04:00
arXiv cs.CL

可微分模糊推理层:面向大语言模型的单调、可组合序数推理头

提出可微模糊推理层,用双路径预测头让大模型获得序数推理的单调性与t-范数组合能力,无需组合训练数据。

04:00
arXiv cs.CL

领域自适应预训练增强水处理语义表征,助力大规模结构化文献挖掘

提出领域自适应模型WaterBERT,经大规模水处理语料持续预训练,在下游任务表现最优,并支撑知识图谱构建与大规模文献挖掘。

04:00
arXiv cs.CL

CoVeR:智能体检索中基于覆盖率的验证器调用路由

用冻结句向量的覆盖率阈值门控,仅在证据模糊时调用验证器,减少62–68%调用且精度几乎无损。

04:00
arXiv cs.CL

优化扩散大语言模型中的去噪轨迹:一种轻量级进化启发式方法

提出仅393参数的CMA-ES进化启发式调度器,融合特征,在扩散语言模型多基准上超越SOTA。

04:00
arXiv cs.CL

超越静态图表:语言与视觉语言模型能否生成交互式数据可视化界面?

提出VIS-GEN基准,评测LLM/VLM生成交互式可视化界面,并设计多阶段框架提升15.9%。

04:00
arXiv cs.CL

损伤预测恢复:压缩金融大语言模型时校准数据何时重要?

压缩损伤决定校准数据是否重要:量化损伤小则影响小,剪枝损伤大时金融任务混合校准可挽回大部分损失。

04:00
arXiv cs.CL

同一图表,不同叙事:视觉语言模型图表解读中的偏见

首个图表解读偏见基准ChartBias:覆盖六类社会属性,揭示叙事偏移、群体幻觉与偏好极性,并提出缓解框架。

04:00
arXiv cs.CL

设计与分析论辩挖掘流水线:迈向全面评估

系统评述论辩挖掘端到端流水线,从语言学、计算与领域三视角提出任务级分析框架。

04:00
arXiv cs.CL

CHiME-9 ECHI:为应对听力障碍而增强对话的机器学习挑战

CHiME-9挑战在嘈杂餐厅四人对谈中,从智能眼镜与助听器多通道录音提取语音,提升可懂度与质量;七队参赛,最佳系统优于基线。

04:00
arXiv cs.CL

面向GROBID的版面引导掩码:大规模科学PDF摄取中的轻量级结构增益

为GROBID加轻量CPU版面掩码定位图表与页眉页脚,提升科学PDF结构解析,成本远低于GPU方案。

04:00
arXiv cs.CL

PACE-dLLM:基于置信度断崖估计的扩散语言模型弹性块解码

PACE-dLLM利用置信度断崖自适应前瞻窗口并独立提交阈值,解耦块解码,提速最高8.52倍且保精度。

04:00
arXiv cs.CL

TransBERT:面向领域特定语言建模的合成翻译框架

提出TransBERT框架,仅用合成翻译文本预训练,即可在法语生命科学领域达到先进下游性能。

04:00
arXiv cs.CL

跨党派指责:丹麦议会中的政治对比与责任归因

研究丹麦议会1997—2026年指责归因:近年上升,反对党更甚,右翼与极端化加剧,呈不对称硬化。

04:00
arXiv cs.CL

HySparse2:具有两级KV共享的混合稀疏注意力

HySparse2以两级KV共享稀疏注意力,跨解码KV缓存由自解码器生成,预填充提前退出,省算力与缓存。

04:00
arXiv cs.CL

用对话上下文丰富语音情感表征

提出ACERT模块,利用可变长对话上下文捕捉情感演变,在多个数据集上超越现有方法。

04:00
arXiv cs.CL

自然语言推理中的语义抽象:发现与补偿大语言模型语义知识与推理缺口的方法论框架

提出语义抽象框架,重构词义关系以发现并补偿大模型在自然语言推理中的语义与推理缺口,准确率提升超10%。

04:00
arXiv cs.CL

融合分层认知过程与过程监督的可解释场景安全理解

融合分层认知过程与过程监督,构建过程标签数据集和LoRA/MoE框架,提升场景安全理解性能与可解释性。

04:00
arXiv cs.CL

会出声思考的口语语言模型

提出异步出声思考框架,主推理流搭配轻量出声流,动态协调减少静默并保持准确率。

04:00
arXiv cs.CL

如何判断你是否已在草堆中找到多根针:多标签文本分类中的校准度量

多标签校准度量欠缺,现有分箱偏差大;提出正负标签等权分箱,获可靠校准误差,并为大模型多标签校准奠定评估基础。

04:00
arXiv cs.CL

转录、翻译与优化:面向语音翻译的联合奖励学习

针对语音翻译中转录式思维链的训练—推理失配,提出GRPO联合奖励微调,实验提升BLEU并降低WER。

04:00
arXiv cs.CL

一个用于评估自然语言生成中保真度与覆盖度的符号学感知框架

提出符号学对齐评估框架,输出保真度与覆盖度;覆盖常低于保真,低采样温度下LLM与人工数据最对齐。

04:00
arXiv cs.CL

校准应成为大语言模型评估的一级标准

现有基准多已具备置信度与正确性两项输入,校准可即刻报告;呼吁各子领域将校准与主指标并列,视其为模型必备属性。

04:00
arXiv cs.CL

接纳而非谄媚:区分语言模型中的积极互动与顺从

社交谄媚评估与对话接纳性高度重合,或误罚可取行为;实验显示用户偏好更接纳的回应,并给出兼顾接纳与独立判断之法。

04:00
arXiv cs.CL

对使用大语言模型研究婴儿句法学习的回顾性分析

回顾大模型研究婴儿句法学习:方法论假设削弱理论解释,现实语料影响有限,模型与婴儿学习者存在计算差异。

04:00
arXiv cs.CL

PersonaWeaver:程序化角色生成中超越传统原型的可控多样性

PersonaWeaver将世界构建与行为设定解耦,借助道德立场与对话反应库,使LLM角色生成突破默认模式,分布更趋多样。

04:00
arXiv cs.CL

面向持续文档编写的知识拉取请求

提出知识拉取请求框架,抽取声明路由至章节并标记冲突,生成变更日志,使持续文档修订可解释且信息更全。

04:00
arXiv cs.CL

测量的是服务栈而非模型:本地工具调用评估中的隐藏混杂因素

本地服务栈的模板门控与错误处理会左右工具调用评估,可致误判0%保真度,须纳入评估协议。

04:00
arXiv cs.CL

扩散草稿,自回归验证:以自推测解码加速文档 OCR

GravityOCR以扩散起草、自回归验证加速文档OCR,端到端提速1.32倍。

04:00
arXiv cs.CL

使用可解释的风格计量特征检测GPT辅助写作

可解释文体特征可区分学生独立与GPT辅助写作,随机森林ROC-AUC 0.87,词汇语法特征主导。

04:00
arXiv cs.CL

强大而简约:提取与刻画前沿模型中的隐藏思维链

通过API工具诱导前沿模型外化隐藏推理,其表现媲美原生CoT;Astra更高效定向,仅外化关键步骤。

04:00
arXiv cs.CL

SpeakerMem-R1:以说话人为中心的双轨记忆,面向多方对话

SpeakerMem-R1提出以说话人为中心的双轨记忆,融合逐字消息与结构化状态视图,提升多方对话归属与关系理解,多项基准领先。

04:00
arXiv cs.CL

超越重复采样:为LLM推理学习搜索策略

训练小概念生成器作搜索策略,通过强化学习为大模型生成多样概念,提升困难推理并跨模型迁移。

04:00
arXiv cs.CL

Agensh:将组织智能扩展至1024个智能体

Agensh是无中心编排器的自组织多智能体框架,扩展至1024个智能体可显著提升复杂任务通过率。

04:00
arXiv cs.CL

Flash-dLLM:面向快速、内存高效扩散大语言模型的I/O感知KV缓存与并行解码

免训练Flash-dLLM融合I/O感知KV缓存与并行验证解码,提升扩散LLM速度与内存效率。

04:00
arXiv cs.CL

Qwen-Audio-3.1-Realtime:迈向可靠的智能体语音交互

融合思考、行动与表达协调,任务成功率提至82.0%,背景语音误响应率降至13%。

04:00
arXiv cs.CL

与人类对齐的模型是人类模型吗?偏好对齐中的图灵测试差距

偏好对齐未必使模型更像人类;偏好与行为对齐存在图灵测试差距,人类似然随偏好权重增强而下降。

04:00
arXiv cs.CL

真实对话语音增强中多说话人提取的挑战

真实对话静音多、注册语音不匹配影响多说话人提取;新损失缓解静音影响,STOI与fwSNR提升。

04:00
arXiv cs.CL

从模式识别器到个性化陪伴者:大语言模型在心理健康领域应用综述

综述大模型在心理健康中的三阶段演进:从评估工具与共情对话,到具记忆推理的个性化陪伴智能体。

04:00
arXiv cs.CL

通用分形自然语言决策图:跨异构域的实时边缘分诊

提出通用分形自然语言决策图,零权重显存,基于Mandelbrot逃逸动力学实现跨异构域边缘实时分诊,防注入且低延迟。

04:00
arXiv cs.CL

TopoCompress:面向分布式边缘 MoE 推理的拓扑感知令牌压缩算法

提出拓扑感知令牌压缩框架TopoCompress,联合优化压缩、专家部署与路由,降低跨服务器流量与资源开销,保持推理质量。

04:00
arXiv cs.CL

面向大语言模型越狱攻击防御的动态深度提示优化

以LLM中间层为特征提取器动态生成防御嵌入并注入后续层,无需改动权重,性能显著优于静态提示优化。

04:00
arXiv cs.CL

突破短片段限制:用向量档案扩展说话人嵌入

提出VAM-ECAPA,用向量档案映射增强短语音说话人嵌入,1秒EER 8.334%,相对降54.8%。

04:00
arXiv cs.CL

WatchPoint:面向真实世界智能体 Web 开发的可执行用户反馈

模拟用户执行诊断脚本,为编码智能体提供可执行反馈,任务恢复率 57.6%,接近人类。

04:00
arXiv cs.CL

行为并不足够:LLM社会中社会规范涌现的基于机制的评估

提出同时测量行为趋同与期望的评估框架,区分社会学习与社会选择机制,相同合作结果源于不同底层社会过程。

04:00
arXiv cs.CL

通过文本实现不相交表格的发现驱动集成

LOKI用双向交叉注意力与全局对比学习,发现文本中介的行-句连接路径,实现不相交表格的发现驱动集成。

04:00
arXiv cs.CL

论大型语言模型在代码理解中的词汇迷信:对低词汇质量代码的再评估

大模型代码理解存在词汇迷信:过度依赖标识符,误导性名称会左右输出,提示与微调干预难消除。

04:00
arXiv cs.CL

ABAI在COLIEE 2026任务1:结合GraphRAG增强元学习的多阶段检索,及交叉验证到测试差距的事后研究

ABAI在COLIEE 2026判例检索中F1=0.177,远低于交叉验证0.311;事后分析推翻归因并改进。

04:00
arXiv cs.CL

学术出版网络的语义方法:基于 OpenAlex 数据的文档向量表示与结构-语义混合融合

用SPECTER2向量接入OpenAlex图,可调权重融合语义与结构;分类优于TF-IDF,推荐信号互补。

04:00
arXiv cs.CL

DA-Cramming:融合依存一致性,提升高性价比语言模型预训练

提出DA-Cramming,将依存一致性融入预训练,单GPU一天可训BERT,多项任务显著优于现有方法。

04:00
arXiv cs.CL

用于检测和纠正LLM幻觉的几何不确定性

提出基于答案嵌入语义分布的几何框架,量化提示与答案两级不确定性,检测并纠正幻觉,医疗数据集表现优异。