为什么所有大语言模型都痴迷于日本文化?——论大语言模型隐藏的文化与地域偏见
提出文化开放问答数据集,发现大模型有文化地域偏见,偏向日本;低资源语言偏本土,该偏见在监督微调后显现。
双语混合专家语言模型中专家路由的陈述性-程序性视角
研究双语混合专家模型的路由:混合训练出现更强类别专化但随种子漂移,分阶段训练产生稳定、语言平衡的路由。
基于深度学习的《古兰经》学习者发音错误自动检测与纠正
构建98%自动化管道、848小时数据集与基准,提出QPS-ASR模型,塔吉威德错误检测PER为0.21%
多智能体地理信息系统安全:风险评估与提示加固优化
提出多智能体地理信息系统安全框架,通过红队攻击与提示加固优化,在不降低任务性能下提升安全性。
SkillSafetyBench:面向技能攻击面的智能体安全评估
提出技能安全基准,155个对抗用例,显示非用户攻击可诱导不安全行为,安全取决于模型对齐及对技能、工作流、环境的解读。
安全的不稳定性:随机种子和温度如何暴露LLM拒绝行为的不一致性
LLM安全拒绝行为受随机种子和温度影响,约两成提示决策翻转,高温降低稳定性,单次评估不可靠,应多采样。
Can a Model Catch Its Own Hallucinations for Free?: Label-Free Doubt Signals Hold Their Own Against a Labelled Dataset for Abstention
FIRSTPASS:基于真实编辑结果的多领域多轮同行评审数据集
首个跨五大学科、基于真实编辑决策的多轮同行评审数据集,含完整审稿对话与结果标签,用于评测AI科学判断。
哪个印度能在翻译中幸存?大语言模型中印度口头传统的叙事同质化
研究发现LLM输出部分同质化,跨传统相似度高;区域语言提示反而降低传统保真度,最多降27%。
训练时可解释性用于多语言仇恨言论检测:使模型推理与人类理由对齐
提出训练时可解释性框架,对齐模型推理与人类理由,提升多语言仇恨检测性能与可解释性,捕捉文化特定线索。
TelecomGPT-R1:面向电信栈的统一开源推理器
针对电信领域通用推理器缺乏专业基础、专用模型推理弱的问题,发布9B开源推理器,用67K样本训练,登顶GSMA榜单,性能比肩闭源模型。
自然语言策略到可执行决策:一个可解释的大语言模型框架
可解释LLM框架将自然语言策略转为可执行决策,用于旅游定价,处理3960单,团队缩减、效率提升。
ElementCheck:基于句子元素的复杂度感知长文本事实性评估
提出复杂度感知方法,构建句子元素图评估句子复杂度,简单句直接核查,复杂句细化核查,提升长文本事实核查效果。
TreeGraft:基于树的推测解码中的自适应多草稿器嫁接方法
TreeGraft用多草稿器协作构筑草稿树,强草稿器重打分并调度控制成本,平均提速15.1%。
DeflectBench:评估大语言模型中修辞谬误生成的基准
提出新基准,评测四模型生成修辞谬误:拒绝取决于请求结构而非主张内容,提示框架可大幅改变拒绝。
通过采样实现大语言模型引导与扩展的方法
基于序贯蒙特卡洛与副本交换的采样框架,无需外部监督即可引导和扩展大语言模型生成,性能优于现有基线。
奖励感知的稀疏自编码器与解答完整性混淆
奖励感知稀疏自编码器区分好坏推理,主要反映解答完整性而非推理质量。
AdaThinking-E:单令牌熵调控的自适应思考
提出AdaThinking-E,用单令牌熵调控学习自适应思考,模型自主决定何时思考,复杂题准、简单题快。
可解释、公平评估的自动二语口语测评:超越单人评分上限,且停顿编码不影响LLM流利度分数
可解释特征+LLM混合二语口语评分ρ=0.818,胜过81%人类评分员;停顿编码不影响LLM流利度,信号来自实测语音时序特征。
句法与语义:Transformer如何学习深层依赖
提出机理框架:梯度饥饿抑制稀疏语义依赖,导致突现;CoT绕过抑制;拓扑对比目标提升2倍。
心理健康自然语言处理中的跨平台泛化失败:社交媒体上Transformer模型的五轴公平性审计
心理健康自然语言处理模型跨平台时性能、校准与公平性严重退化,五轴审计表明跨平台验证应为标准要求。
Agents 不翻页:LLM 工具响应的首块选择
研究发现提高首块命中率不提升下游准确率,关键词评分器虽提升p1但无实际收益。
扩散式大语言模型的词缀缓存
ACache仅重算约20%锚点令牌,恢复扩散大模型缓存复用精度,降延迟55.7%,吞吐提升1.68倍。
智能体Seer:从规范理解合成场景
利用工具规范自动合成评估场景,无需人工或真实执行,生成多轮对话,质量强且覆盖全。
现实对话情境中的语言模型评估
提出UPHELD基准,基于专业对话与36万条人工标注,发现现有指标不可靠,混合裁判提升相关性30%。
评估荣誉候选人的数据科学方法
提出模块化OSINT与情感分析流程用MINOS评估公众声誉用于英国荣誉制度决策支持
位置即一切:MLLM指称表达分割中的免费午餐Token压缩策略
指称分割的标记压缩需保留位置信息;提出仅依位置信息的免训练压缩法PAYN,超越现有方法。
自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差
模型自生成文本识别受评估格式影响,质量启发式是混杂因素,训练可迁移并致自我偏好,影响安全。
为什么当前的XAI不足以应对阿拉伯语NLP:可解释性差距的批判性综述
阿拉伯语NLP可解释性存在方法、任务、语言三重差距,需构建基于语言文化的可解释AI研究议程。
CARE:面向医学大语言模型的因果对齐推理探索
提出CARE框架,通过因果充分性与近端可学习性筛选经验,减少正确但推理不一致,提升训练稳定性。
超越准确率:视觉语言模型在模因仇恨言论检测中的定性分析
超越准确率,定性分析四个顶级视觉语言模型在零样本/少样本下对仇恨模因的解释,揭示其忽视上下文线索的局限。
迈向可解释的抑郁症检测:将声学特征与DSM-5指标相关联
提出透明链接框架,将语音声学特征映射至DSM-5抑郁指标,实现可解释、隐私保护的本地检测,初步验证关联合理。
Vagdhenu:一种感知诗律(Vrutta)的梵语颂诗转吟唱(TTS)系统
诗律感知的梵语颂诗吟唱TTS:现成架构加模块,文本韵律调节无效,需参考音频与重训练,专家MOS 4.6。
评估面向癌症患者的AI生成摘要
采用人类专家与LLM双重评估AI癌症摘要,识别遗漏与不准确,迭代改进提示与安全护栏。
人工智能模型可预测并协同调节人类记忆检索
研究显示:大语言模型在语义流畅任务中预测人类记忆轨迹的能力优于人类,可协同拓展认知。
VFA:基于无视觉适配增强多语言多模态大模型
提出无视觉适配框架,解耦语言增强与视觉对齐,多语多模态基准性能提升且数据高效。
双种子比较互惠去偏:大型语言模型概率采样的新方法
提出双种子比较(DSC)协议,用两个独立LLM种子消除偏差,通过比较序数值构造比特序列并映射到目标分布,在96%场景优于现有方法。
迷失在压缩中:抽取式提示压缩器的受控跨语言审计
压缩器对非英语语言效果差,流失上下文;多语言训练更好,翻译后压缩更划算。
利用Poly-Encoder实现计算高效的自动化创造力评估
利用多编码器微调,以低计算成本实现与大语言模型相当的创造力评估性能,便于在普及型硬件上规模化应用。
大语言模型幻觉:基于生命周期的成因、检测、缓解与预防综述
按数据、训练、推理三阶段综述LLM幻觉,涵盖成因、检测、缓解与预防,提供标准化框架以提升可靠性。
土耳其语RAG系统的分块与嵌入策略比较
比较土耳其语RAG分块与嵌入策略,布局感知分块对表格更有效,最优组件非最佳,最佳配置87%。
PACEShop:评估个性化、可操作、组合式且基于证据的购物助手
提出PACE评估框架及PACEShop基准和PACEJudge协议,用于结构化购物助手响应,实现可诊断的联合评估。
探究提示语言与响应语言对LLM内容生成的影响
研究发现提示语语言显著影响LLM输出长度,但语义相似度仍高,软Jaccard揭示概念重叠。
从声音到症状:面向对话式医疗代理的实时呼吸信号理解
实时对话中咳嗽检测与湿/干亚型分类,F1达93%,延迟340ms,支持临床。
LLM长文本生成中大纲阶段的多框架比较
LLM长文生成:七框架三粒度比较,无单一框架占优,大纲与写作排名仅中度相关,支持大纲-写作解耦。
当典范完备化出错时:形式化并测量大语言模型中的跳跃
提出跳跃的形式定义与度量;用Kan扩展作默认完备化。248次约束试验中模型全放弃默认,故第二步非瓶颈。
噪声响应何时具有普遍性?分词作为语言模型中的隐藏变量
模型噪声鲁棒性取决于噪声尺度:词级噪声下各架构表现趋同,字符级噪声下分化,根源在于分词。
论范围分类与当前知识编辑基准:一项负面结果,以INLAY为无梯度案例研究
现有知识编辑基准无法测量作用域判定:最佳路由与静态策略持平,弃权毫无优势。
MemToC:大语言模型中记忆-工具冲突消解的基准测试
MemToC评测大模型工具与记忆冲突仲裁:工具主导,正确保留率低,微调可改善但需权衡。
一种协调异构语音与文本检索器的重排序器
提出STeReO重排序器,聚合异构语音与文本检索证据,训练后显著改善下游问答性能。