Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination
高效代理强化学习中的在线策略内在知识边界增强
AKBE在线双路径训练动态界定知识边界,提升准确率1.85%、减少18%工具调用,实现无权衡效率提升。
阿尔巴尼亚语大语言模型安全评估数据集
首个阿尔巴尼亚语LLM安全评估数据集,含2951条提示覆盖11类安全主题,填补低资源语言安全评估空白。
PashtoTTS-Bench:低资源非拉丁字母文本转语音的自动筛查
为低资源非拉丁字母TTS提出INSV-A自动筛查框架,在普什图语上测试多系统,对比WER与语言识别效果。
JuICE:评估LLM评判者识别文化错误的基准
新基准JuICE揭示LLM评判者识别文化错误能力弱,F1仅0.52,常遗漏深层错误。
Tournament-GRPO:面向开放式长文本生成的强化学习的群体锦标赛奖励
提出Tournament-GRPO,将评分转换为相对奖励,在长文本生成任务上超越基线4.52分。
Recon:基于重建引导的推理合成用于用户建模
Recon通过动作重建评估推理质量,在四个领域提升用户建模性能,胜率达70%,证明后验合理化不足。
撒更宽的网:面向代码推理的协调Pass@K策略优化
提出CPPO,将pass@K生成转为策略联合探索,规划器输出多种方法,显著提升pass@4。
PersLitEval:波斯语文学大语言模型细粒度评测基准
提出波斯文学选择题基准PersLitEval,发现模型在拼写与构词上表现最差,提示策略和错误类型影响显著。
提示注入检测具有场景依赖性:一项带可解释结构信号的部署感知评估
提示注入检测性能高度依赖场景与阈值,Transformer最强,结构信号在特定场景有增益。
论大规模语言模型反事实知识训练中的隐藏代价
反事实调优在LLM遗忘中引发知识冲突与幻觉溢出,导致性能下降。
ExTax:基于说服、情感与叙事角色分类法的可解释虚假信息检测
提出ExTax框架,融合说服、情感与叙事角色分类,实现可解释虚假信息检测,跨域基准Macro F1达0.8456。
基于属性的LLM与仇恨言论标注对齐诊断
发现LLM在显性维度与人工标注一致,但评价维度反转;提出置信度加权回归方法,R²达0.71,优于直接预测。
FalAR:大规模说话人标注的欧洲葡萄牙语议会会议语音语料库
FalAR语料库含5800小时欧葡议会语音及说话人标注,预训练可降14%词错率。
基于大语言模型的查询驱动事件时间线摘要在工业搜索中的应用
提出QDET系统,用多任务微调和强化学习摘要,以1%参数超越DeepSeek-R1-671B,在线CTR提升5.5%。
BhashaSetu:一种以数据为中心的低资源机器翻译方法
BhashaSetu英-马拉地平行数据集(278万句对)证实语料级去重是低资源翻译质量提升的最关键预处理步骤。
E3:面向自动化研究评审的问题级回测
E3自动化评审助手通过问题级回测,论文技术问题召回率90.2%,远超人类及LLM。
QUACK:多模态社交推理智能体中沟通知识的提问、理解与审计
QUACK开源框架审计多模态社交推理智能体语言基础,三层面评估并自动标记幻觉与虚假指控,揭示前沿模型存在显著缺陷。
共享更多,搜索更少:面向高效测试时扩展的协作并行思考
提出协作并行思考框架,通过并行分支间信息共享减少冗余探索,提升测试时扩展效率。
追踪大语言模型中的计算密度
s-Trace方法揭示LLM计算分两阶段:早期稀疏子图粗略预测,后期密集注意力头细化,计算量与不确定性正相关。
LLM已是优秀导师:免训练提示优化实现教学数学辅导
免训练提示优化在数学辅导中超越强化学习基线,高效平衡成绩、防作弊与有用性。
基于利益相关者关联的文本嵌入对齐
文本嵌入与专家语义差距达19-26个百分点,作者提出利益相关者锚定练习以评估对齐。
Beyond Binary: Speech Representations Across the Cognitive Score Hierarchy
MAIGO: 通过历史清理的在线策略自蒸馏缓解对话迷失
提出MAIGO方法,利用历史清理的在线自蒸馏减少自我污染,显著提升多轮对话准确率。
大规模音频语言模型中学习听时的思考时机
提出可学习的wait-think-answer控制,优化推理轨迹,提升准确率并减少延迟。
LitSeg: 面向文学RAG的叙事感知文档分割
提出叙事感知分割框架LitSeg及轻量版,提升文学RAG检索准确性与生成质量。
MiRD: 通过误覆盖风险分解实现开放域问答的可靠集值预测
MiRD两阶段框架分解误覆盖风险,控制采样与选择风险,实现开放域问答的可靠集值预测。
中文标题:并非所有词元都同等重要:基于决定性词元监督的动态上下文向量蒸馏用于长文本医疗报告生成
DIVE框架通过关键词元监督与状态条件动态引导,提升长文本医疗报告生成质量,在多项指标上取得最优。
马达加斯加语动词变位的形式化
基于Unitex构建马达加斯加语动词形态分析器,用有限状态转换器形式化变位,词典可读易扩展。
EpiCurveBench:评估视觉语言模型在流行病曲线数字化上的表现
EpiCurveBench与ECS评估疫情曲线提取:最强52.3%,区分度远超传统,助力数据解锁。
图表数据提取的自集成视觉语言模型
提出自集成方法提升VLM图表数据提取精度,新基准含复杂图表,准确率相对提升23%。
采样中的迷失:基于词覆盖率得分(WCS)评估大语言模型的词汇可达性
WCS指标量化采样参数对低频高信息词汇的剪除,揭示默认采样导致文本同质化,为平衡连贯性与词汇丰富性提供诊断工具。
对入对出:面向高效大语言模型的潜在多令牌预测
PIPO统一潜在压缩与多令牌预测,训练轻量置信头免验证,实现2.64倍加速和7.15点性能提升。
GraphReview:基于LLM图消息传递的科学论文评估
提出GraphReview框架,用图消息传递统一整合评审信号,LLM生成比较证据,决策与排名性能平均提升29.7%。
时间同步性预测情感语料库中的标注质量
标注时间间隔越短,一致性越高;超过一天则大幅下降,成为预测标注质量的主导因素。
ENPMR-Bench: 面向情感支持代理的主动记忆检索基准测试
提出ENPMR-Bench基准,评估情绪需求感知的主动记忆检索,发现现有方法共情分数低,链式思维提示改进有限。
覆盖幻觉:从检索前路由失败到生产RAG系统中的检索后级联
现代RAG存在“覆盖幻觉”:合成查询高估LLM需求,后检索级联策略无需训练,提升质量降低延迟,72.2%查询免于LLM增强。
分离RAG阅读中的语义竞争与上下文长度
通过固定段落数量与长度、替换硬竞争段落,证明语义竞争独立于上下文长度影响RAG阅读性能,F1和答案包含指标改善明显。
探究大语言模型的文化意识:跨文化美学文体学案例研究
LLM在跨文化文体识别上依赖表层信息而非深层结构,与人类有差异,且识别与生成不一致。
不总是谄媚:从认知不确定性角度衡量LLM的从众行为
LLM从众行为受谄媚与认知不确定性共同驱动,且随用户专业度和建议合理性增强。
BAIT:边界引导的自我条件推理披露升级策略
BAIT三步越狱框架利用模型自身推理实现内部披露,攻击成功率高,关键为预防性框架和细化步骤。
真实图像导致更差判断:评估视觉语言模型的具体性与意象性
真实图像上下文干扰视觉语言模型词汇判断,导致与人类评分偏差,需校准视觉输入使用。
SSD中的语义梯度交互:种族身份与仇恨言论的案例研究
交互SSD扩展监督语义差分,可统计检验种族身份如何调节仇恨言论判断中的语义线索作用。
MATCHA:通过对比语义对齐进行文本匹配
MATCHA新指标同时奖励语义一致与惩罚矛盾,在多项基准上优于ROUGE和BERTScore。
FinHarness:面向金融大语言模型代理的内联生命周期安全护栏
FinHarness通过内联监视器与级联判断,将攻击成功率从38.3%降至15.0%,良性批准基本不变,高级判断调用减少4.7倍。
MONA:结合涅斯捷罗夫加速的Muon优化器,用于可扩展语言模型训练
MONA在Muon正交化框架中加入曲率感知加速,避免尖锐极小值,1B-68B参数规模上优于Muon和AdamW,68B模型达SOTA。
最强教师并非总是最佳教师:以学生为中心的答案选择
提出SCAS框架,根据学生中心的学习成本从验证过的教师答案中选择,实验表明该方法持续提升学生表现。
Chartographer:用于评估视觉语言模型的反事实图表生成
提出反事实图表生成框架,评估视觉语言模型,发现模型在需要新视觉推理时无法泛化。
MerLean-Prover:面向端到端Lean 4定理证明的递归循环框架
提出无需微调的递归循环框架,在博士资格考试与Putnam基准上超越开源基线,证明框架设计是关键。
人口统计信息何时有助于仇恨言论检测?面向视角感知的数据与建模机制
人口统计信息仅在数据低分歧、高测试分歧、足够样本且模型可控时才有用,门控残差模型可针对性提升效果。