9866 条条目 · 106 个活跃源
2026年8月28日
04:00
arXiv cs.CL

Can a Model Catch Its Own Hallucinations for Free?: Label-Free Doubt Signals Hold Their Own Against a Labelled Dataset for Abstention

04:00
arXiv cs.CL

FIRSTPASS:基于真实编辑结果的多领域多轮同行评审数据集

首个跨五大学科、基于真实编辑决策的多轮同行评审数据集,含完整审稿对话与结果标签,用于评测AI科学判断。

04:00
arXiv cs.CL

哪个印度能在翻译中幸存?大语言模型中印度口头传统的叙事同质化

研究发现LLM输出部分同质化,跨传统相似度高;区域语言提示反而降低传统保真度,最多降27%。

04:00
arXiv cs.CL

训练时可解释性用于多语言仇恨言论检测:使模型推理与人类理由对齐

提出训练时可解释性框架,对齐模型推理与人类理由,提升多语言仇恨检测性能与可解释性,捕捉文化特定线索。

04:00
arXiv cs.CL

TelecomGPT-R1:面向电信栈的统一开源推理器

针对电信领域通用推理器缺乏专业基础、专用模型推理弱的问题,发布9B开源推理器,用67K样本训练,登顶GSMA榜单,性能比肩闭源模型。

04:00
arXiv cs.CL

自然语言策略到可执行决策:一个可解释的大语言模型框架

可解释LLM框架将自然语言策略转为可执行决策,用于旅游定价,处理3960单,团队缩减、效率提升。

04:00
arXiv cs.CL

ElementCheck:基于句子元素的复杂度感知长文本事实性评估

提出复杂度感知方法,构建句子元素图评估句子复杂度,简单句直接核查,复杂句细化核查,提升长文本事实核查效果。

04:00
arXiv cs.CL

TreeGraft:基于树的推测解码中的自适应多草稿器嫁接方法

TreeGraft用多草稿器协作构筑草稿树,强草稿器重打分并调度控制成本,平均提速15.1%。

04:00
arXiv cs.CL

DeflectBench:评估大语言模型中修辞谬误生成的基准

提出新基准,评测四模型生成修辞谬误:拒绝取决于请求结构而非主张内容,提示框架可大幅改变拒绝。

04:00
arXiv cs.CL

通过采样实现大语言模型引导与扩展的方法

基于序贯蒙特卡洛与副本交换的采样框架,无需外部监督即可引导和扩展大语言模型生成,性能优于现有基线。

04:00
arXiv cs.CL

奖励感知的稀疏自编码器与解答完整性混淆

奖励感知稀疏自编码器区分好坏推理,主要反映解答完整性而非推理质量。

04:00
arXiv cs.CL

AdaThinking-E:单令牌熵调控的自适应思考

提出AdaThinking-E,用单令牌熵调控学习自适应思考,模型自主决定何时思考,复杂题准、简单题快。

04:00
arXiv cs.CL

可解释、公平评估的自动二语口语测评:超越单人评分上限,且停顿编码不影响LLM流利度分数

可解释特征+LLM混合二语口语评分ρ=0.818,胜过81%人类评分员;停顿编码不影响LLM流利度,信号来自实测语音时序特征。

04:00
arXiv cs.CL

句法与语义:Transformer如何学习深层依赖

提出机理框架:梯度饥饿抑制稀疏语义依赖,导致突现;CoT绕过抑制;拓扑对比目标提升2倍。

04:00
arXiv cs.CL

心理健康自然语言处理中的跨平台泛化失败:社交媒体上Transformer模型的五轴公平性审计

心理健康自然语言处理模型跨平台时性能、校准与公平性严重退化,五轴审计表明跨平台验证应为标准要求。

04:00
arXiv cs.CL

Agents 不翻页:LLM 工具响应的首块选择

研究发现提高首块命中率不提升下游准确率,关键词评分器虽提升p1但无实际收益。

04:00
arXiv cs.CL

扩散式大语言模型的词缀缓存

ACache仅重算约20%锚点令牌,恢复扩散大模型缓存复用精度,降延迟55.7%,吞吐提升1.68倍。

04:00
arXiv cs.CL

智能体Seer:从规范理解合成场景

利用工具规范自动合成评估场景,无需人工或真实执行,生成多轮对话,质量强且覆盖全。

04:00
arXiv cs.CL

现实对话情境中的语言模型评估

提出UPHELD基准,基于专业对话与36万条人工标注,发现现有指标不可靠,混合裁判提升相关性30%。

04:00
arXiv cs.CL

评估荣誉候选人的数据科学方法

提出模块化OSINT与情感分析流程用MINOS评估公众声誉用于英国荣誉制度决策支持

04:00
arXiv cs.CL

位置即一切:MLLM指称表达分割中的免费午餐Token压缩策略

指称分割的标记压缩需保留位置信息;提出仅依位置信息的免训练压缩法PAYN,超越现有方法。

04:00
arXiv cs.CL

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

模型自生成文本识别受评估格式影响,质量启发式是混杂因素,训练可迁移并致自我偏好,影响安全。

04:00
arXiv cs.CL

为什么当前的XAI不足以应对阿拉伯语NLP:可解释性差距的批判性综述

阿拉伯语NLP可解释性存在方法、任务、语言三重差距,需构建基于语言文化的可解释AI研究议程。

04:00
arXiv cs.CL

CARE:面向医学大语言模型的因果对齐推理探索

提出CARE框架,通过因果充分性与近端可学习性筛选经验,减少正确但推理不一致,提升训练稳定性。

04:00
arXiv cs.CL

超越准确率:视觉语言模型在模因仇恨言论检测中的定性分析

超越准确率,定性分析四个顶级视觉语言模型在零样本/少样本下对仇恨模因的解释,揭示其忽视上下文线索的局限。

04:00
arXiv cs.CL

迈向可解释的抑郁症检测:将声学特征与DSM-5指标相关联

提出透明链接框架,将语音声学特征映射至DSM-5抑郁指标,实现可解释、隐私保护的本地检测,初步验证关联合理。

04:00
arXiv cs.CL

Vagdhenu:一种感知诗律(Vrutta)的梵语颂诗转吟唱(TTS)系统

诗律感知的梵语颂诗吟唱TTS:现成架构加模块,文本韵律调节无效,需参考音频与重训练,专家MOS 4.6。

04:00
arXiv cs.CL

评估面向癌症患者的AI生成摘要

采用人类专家与LLM双重评估AI癌症摘要,识别遗漏与不准确,迭代改进提示与安全护栏。

04:00
arXiv cs.CL

人工智能模型可预测并协同调节人类记忆检索

研究显示:大语言模型在语义流畅任务中预测人类记忆轨迹的能力优于人类,可协同拓展认知。

04:00
arXiv cs.CL

VFA:基于无视觉适配增强多语言多模态大模型

提出无视觉适配框架,解耦语言增强与视觉对齐,多语多模态基准性能提升且数据高效。

04:00
arXiv cs.CL

双种子比较互惠去偏:大型语言模型概率采样的新方法

提出双种子比较(DSC)协议,用两个独立LLM种子消除偏差,通过比较序数值构造比特序列并映射到目标分布,在96%场景优于现有方法。

04:00
arXiv cs.CL

迷失在压缩中:抽取式提示压缩器的受控跨语言审计

压缩器对非英语语言效果差,流失上下文;多语言训练更好,翻译后压缩更划算。

04:00
arXiv cs.CL

利用Poly-Encoder实现计算高效的自动化创造力评估

利用多编码器微调,以低计算成本实现与大语言模型相当的创造力评估性能,便于在普及型硬件上规模化应用。

04:00
arXiv cs.CL

大语言模型幻觉:基于生命周期的成因、检测、缓解与预防综述

按数据、训练、推理三阶段综述LLM幻觉,涵盖成因、检测、缓解与预防,提供标准化框架以提升可靠性。

04:00
arXiv cs.CL

土耳其语RAG系统的分块与嵌入策略比较

比较土耳其语RAG分块与嵌入策略,布局感知分块对表格更有效,最优组件非最佳,最佳配置87%。

04:00
arXiv cs.CL

PACEShop:评估个性化、可操作、组合式且基于证据的购物助手

提出PACE评估框架及PACEShop基准和PACEJudge协议,用于结构化购物助手响应,实现可诊断的联合评估。

04:00
arXiv cs.CL

探究提示语言与响应语言对LLM内容生成的影响

研究发现提示语语言显著影响LLM输出长度,但语义相似度仍高,软Jaccard揭示概念重叠。

04:00
arXiv cs.CL

从声音到症状:面向对话式医疗代理的实时呼吸信号理解

实时对话中咳嗽检测与湿/干亚型分类,F1达93%,延迟340ms,支持临床。

04:00
arXiv cs.CL

LLM长文本生成中大纲阶段的多框架比较

LLM长文生成:七框架三粒度比较,无单一框架占优,大纲与写作排名仅中度相关,支持大纲-写作解耦。

04:00
arXiv cs.CL

当典范完备化出错时:形式化并测量大语言模型中的跳跃

提出跳跃的形式定义与度量;用Kan扩展作默认完备化。248次约束试验中模型全放弃默认,故第二步非瓶颈。

04:00
arXiv cs.CL

噪声响应何时具有普遍性?分词作为语言模型中的隐藏变量

模型噪声鲁棒性取决于噪声尺度:词级噪声下各架构表现趋同,字符级噪声下分化,根源在于分词。

04:00
arXiv cs.CL

论范围分类与当前知识编辑基准:一项负面结果,以INLAY为无梯度案例研究

现有知识编辑基准无法测量作用域判定:最佳路由与静态策略持平,弃权毫无优势。

04:00
arXiv cs.CL

MemToC:大语言模型中记忆-工具冲突消解的基准测试

MemToC评测大模型工具与记忆冲突仲裁:工具主导,正确保留率低,微调可改善但需权衡。

04:00
arXiv cs.CL

一种协调异构语音与文本检索器的重排序器

提出STeReO重排序器,聚合异构语音与文本检索证据,训练后显著改善下游问答性能。