TruthRL:通过强化学习激励大语言模型保持真实性
TruthRL用强化学习优化LLM真实性,通过三元奖励减少幻觉,提升知识边界识别能力。
CoTAL:人机协同的提示工程方法用于可推广的形成性评估评分与反馈
CoTAL方法通过人机协同提示工程提升GPT-4评分性能最高38.9%,师生认可其评分与解释质量。
What Really Matters for Table LLMs? A Meta-Evaluation of Model and Data Effects
CGES:置信度引导的早期停止策略实现高效准确的自我一致性
CGES通过贝叶斯框架自适应停止采样,在五个推理基准上平均调用减少58%,精度仅降0.4个百分点。
需求获取访谈与需求的自动对齐
提出需求忠实度与访谈覆盖率度量,用LLM自动评估达0.86 F1,嵌入模型提升可扩展性。
面向叙事任务的轻量级潜在推理
LiteReason提出轻量级潜在推理,结合强化学习,将叙事任务推理长度减少77-92%且保持性能。
Swivuriso:南非下一代语音多语种语音数据集
介绍3000小时多语种语音数据集Swivuriso,用于南非七种语言ASR开发与基准测试。
CommonLID:重新评估网络数据语言识别性能
提出CommonLID基准,覆盖109种语言,测试发现现有模型准确性被高估。
通过细粒度事实核查与领域自适应减少医疗大语言模型的幻觉
提出独立事实核查和领域微调模型,精准验证电子病历事实,有效降低医疗LLM幻觉。
GhazalBench:评估大语言模型对波斯抒情诗的理解与经典形式访问
提出GhazalBench基准,发现大语言模型理解诗意但难以精确补全诗句,能力受训练数据影响。
AI应用为用户观看的社交媒体视频实时反馈和平程度
基于LLM的AI应用实时评估视频的和平维度,帮助用户了解媒体内容倾向。
参数化知识并非万能:通过检索预训练数据实现诚实的大语言模型
提出利用公开预训练数据评估LLM诚实性,并开发新方法减少幻觉,促使模型坦然承认知识边界。
RankLLM:通过量化问题难度对大语言模型进行加权排名
RankLLM量化难度与能力,双向传播评分,90%人类一致性,高效稳定。
通过从语言模型中蒸馏软标签改进主题建模
提出DSL框架,从语言模型蒸馏软标签训练主题模型,提升主题连贯性与分配准确性,检索任务表现优异。
inversedMixup:通过反转混合嵌入实现数据增广
提出inversedMixup框架,结合Mixup可控性与LLM可解释性,将混合嵌入重构为可读句子,缓解流形侵入,在少样本和全监督场景有效。
ProbeLLM:自动化LLM故障的原则性诊断
ProbeLLM通过分层蒙特卡洛树搜索自动发现结构化故障模式,基于可验证测试,揭示更广更细的故障景观。
扩展自监督语音模型揭示深层语言关系:来自太平洋集群的证据
扩展自监督语音模型至4千语言规模,发现太平洋宏观集群,揭示深层语言关系和接触历史。
BEACON:用于大型语言模型中跨模型幻觉检测的行为熵聚合
提出BEACON黑盒检测框架,仅用模型输出提取31维特征,AUROC达0.8123,证明幻觉需多维度信号,5次调用变体实用。
代码与文本间的双向小粒度搜索
提出代码与文本双向小粒度搜索任务,用GPT-4生成数据,模块化方法在域内外表现良好。
TinyJudge:通过轻量级专家集合实现不可验证约束对齐
TinyJudge用0.6B小模型集成蒸馏前沿知识,评估不可验证约束,性能提升10%,奖励精度高12%,训练提速3倍。
评估领域自适应大型语言模型中的幻觉现象
研究发现微调后的Llama-2模型在回忆新领域信息时易产生幻觉,倾向过度生成,仅靠微调难以缓解。
通过微调语言模型中的语义偏移检测社区特定俚语与实体
提出无监督方法,利用微调模型语义偏移检测社区特有词汇,底部10%数据成功识别俚语与实体。
面向尼泊尔法律领域问答的检索增强生成框架
首次将RAG模型用于尼泊尔法律问答,BM25检索精度达91%,回答真实率84%,有效弥补低资源语言法律问答缺口。
ABLE:基于归因的大模型嵌入
ABLE利用梯度归因与词级对齐,无训练即可高效表征并映射LLM,在关系预测等任务表现优异。
GraphLoRA:面向大语言模型推荐的结构感知低秩适配
GraphLoRA将图结构信号融入低秩适配,实现协同与文本语义深度融合,显著提升推荐性能与泛化。
Implicit Causal Graph Construction in Text via Chain Discovery
后训练是(大规模)监督学习
后训练实质是监督学习的分布拟合,从零后训练也能取得显著效果,应转向“学习如何学习”。
CAPruner: 概念邻近场景图剪枝器——增强大语言模型三维空间推理能力
针对3D视觉语言任务,提出CAPruner,结合语义与空间邻近性剪枝场景图,保留关键关系,提升LLM空间推理性能。
连接传统可解释性方法与多模态多语言模型:基于XAI的分析
提出多模态Shapley值扩展与频谱对齐方法,开源工具揭示输入模态驱动归因波动。
抑制之下,先验犹存:词汇覆盖的斯特鲁普范式
词汇先验通过抑制而非替换持续存在;斯特鲁普范式证实干扰源于先验,且覆盖仅在其上留痕。
结合领域知识从Medline数据库中寻找概念间的新联系
基于ABC模型改进的适应性模型,用于发现医学概念间的隐藏联系。
mllm-shap: 面向文本-音频多模态大语言模型的沙普利值可解释性平台
首个将沙普利值可解释性扩展至文本-音频多模态大模型的开源框架,解决模态遮罩等挑战,支持多种估计策略。
原则性智能体辩论:对抗仲裁减少大语言模型讨好行为
提出PAD架构,通过两对立倾向模型辩论与盲评仲裁,显著降低讨好偏见,准确率最高达48.5%。
从架构到输出:大型语言模型中幻觉的结构起源及数据的放大作用
大语言模型幻觉源于自注意力、极大似然估计和自回归解码三架构决策,数据病理放大但非独立致因。
多语言拒绝对齐:构建更安全的大型语言模型
研究多语言对齐动态,发现单语言对齐不足以保证跨语言安全,多语言训练可提升安全性且无损性能。
利用MetaMap和文本挖掘技术发现医学概念间的隐藏关系
提出新模型,利用MetaMap和文本挖掘发现医学概念隐藏关系,创建索引找到跨文档链接。
释放全双工语音模型中LLM的能力
LWS范式让LLM语音交互中同时听、写、说,文本作为一等输出,实现高效全双工。
超越英语基准:巴西葡萄牙语临床大语言模型评估
双语基准ClinicalBr显示:诊断检索英语优势明显,其他任务表现相当,巴西地方病模型表现更佳。
阅读机器:一种用于结构化语料库阅读和大规模综合的计算方法
基于大语言模型,通过分阶段分析实现可追溯的大规模语料综合,优先覆盖性与差异性保留。
Phantom transitions in language model fine-tuning
解锁潜在价值:基于分类学指导从低层网络语料中恢复高性能数据
提出分类学框架,利用时效性和文化特异性新维度及两阶段过滤,从低质数据中恢复高性能,超越高层数据。
在干净、误导及混合检索场景下评估RAG可靠性
提出评估协议,利用参数覆盖和置信度指标分析误导信息对RAG生成的影响。
SLMJury:小型语言模型能否像大型模型一样进行评判?
SLMJury评估小型语言模型评判能力,发现领域依赖的过度思考,闭端与开端评判能力分离,多模型各有所长。
ACUTE协议:利用语言模型激活实现更好的校准、效用和可信度
提出ACUTE协议和EURO指标,提升语言模型的校准、效用和可信度。
中文标题:多智能体交互中的表征相似性与模型行为
中文摘要:AI模型表征相似性促进合作但抑制创新,早期层影响最显著,对多智能体系统设计至关重要。
字幕对齐微调Whisper用于瑞士德语语音识别:基准污染、惯例不匹配及诚实的基线25.6% WER(13.8% cWER)
研究揭示基准污染导致瑞士德语ASR结果虚高,提出25.6% WER诚实基线,真实错误率约三分之一,并发布Apache 2.0模型。
函数向量头分为两类:上下文学习中的写入者与取消者
函数向量头实际分为写入者和取消者两类,传统幅度排名无法区分,取消者零消融可提升logit和准确率。
MechLens:事实知识的晚期结晶解释语言模型中干预的有效性
发现LLM事实知识在最后层突然结晶,并提出基于此的干预原则,跨模型验证。
谁的规范?解析大语言模型中的文化对齐与个人偏好
提出PACT框架评估模型在文化规范与个人偏好间的权衡,发现文化对齐受国家语境影响大,模型难捕捉多元性。
LLM Agent的冷启动安全差距
LLM Agent会话初期最不安全,完成常规任务后安全性提升,建议部署前先用常规任务预热。