使用Whisper的波斯语语音情感识别中ASR适配与表示降维研究
波斯语情感识别中,Whisper编码器特征经PCA降维有效提升性能并降低开销,ASR微调收益有限。
英语源多语言RAG中隐私风险何在:跨五种查询语言的分阶段审计
英语源RAG中,仅输出过滤时英语泄露最高;加输入审核后阿语和斯瓦希里语仍残留,附加原文可堵住15/17。
大语言模型中的条件性认知偏差:有偏用户轮次如何调节上下文推理
提出三条件框架评估多轮交互偏见,8个模型中6个偏差增强,并识别两种竞争机制。
DREAM:基于事件感知记忆图的LLM动态角色扮演
DREAM用事件记忆图构建动态双粒度角色画像,提出TCM基准,在多个测试中达最优,增强角色一致性与可解释性。
ConWriter:转换约束下的有状态长篇故事生成与轻量级神经符号一致性控制
ConWriter是无需训练的框架,通过场景级增量生成、符号状态推理和风险信号,维持长故事一致性,避免错误累积。
CNM-BERT:基于表意文字描述序列的汉字即插即用结构嵌入
CNM注入汉字IDS树结构至BERT,不改主干,OOV准确率+9.8,F1+7.7,多项任务提升。
LLM翻译中的数值本地化分析
分析五款可本地运行的LLM对时间、数字、日期的本地化能力,发现将本地化原则嵌入提示词显著提升准确率。
立场:是时候针对自洽性优化大语言模型了
提出以自洽性为框架理解大模型失败:根源于单输出评估假设,多种技术属一致性优化特例,优化可提升能力。
大语言模型中类人回指消解
探究五个大语言模型对回指消解多个因素的反应,发现其与人类认知存在选择性对齐,对语义干扰不敏感。
模型趋同与人类分殊:开放生成中分布多元性的覆盖框架
提出覆盖框架与两个指标,测LLM生成内容的分布广度,发现其集中于人类响应中心、狭窄但合理。
DBLAST:面向随机投机解码的依赖块草拟
提出依赖块草拟器,用低秩潜混合与面向接受的训练,提升随机投机解码的接受长度,尤其在高熵场景。
语调与词汇声调的交互:汉语方言中的边界现象
探讨汉语方言语调与声调的交互,聚焦边界现象,及其在传达疑问/陈述和态度信息中的作用。
承诺前锁定证据:冻结接口削弱LLM裁判评估
将证据冻结为下一轮输入会降低LLM裁判与人类偏好一致性(降4-6点),加剧顺序偏差(增8-10点),不如单次结构化判断。
FOCUS:解耦大语言模型中的专家人设以增强领域专家能力
提出FOCUS:正交分解解耦专家人设,门控模块自适应激活,提升金融、法律、医疗等跨领域任务准确率。
不同扰动,不同机制:理解持续预训练对零样本方言鲁棒性的影响
系统比较六种扰动持续预训练,发现字符噪声法显著提升零样本方言鲁棒性,且不同方法机制各异。
SkillZip:可扩展智能体技能库的契约保持图压缩
SkillZip用契约保持图压缩技能库,提升12.2点,压缩3.46倍,依赖保持99.2%。
语气至关重要:句法敏感性如何削弱安全对齐
非祈使句法形式可绕过安全对齐,拒绝受句法特征影响,源于数据偏差,增加句法多样性可缓解。
基于示例引导的文档级文本简化提示
示例引导提示通过检索平行语料中的简化示例,提升大模型文档级简化质量,优于仅提示及监督/规划系统。
接力而非路由:面向成本高效LLM驱动进化的自适应种群交接
LLM进化前期收益高、成本模型可替代强模型。提出训练无关框架,用廉价模型探索、强模型精炼,按种群交接分配预算,12设
先答后思:扩散大语言模型中的承诺顺序
扩散LLM自由承诺顺序致推理失败,有序承诺+思维链提升34.8个百分点,门控干预恢复性能。
用于改进随机索引嵌入的稀疏互信息图平均
在稀疏PPMI图上加权平均可修复弱随机索引嵌入,童话语料类比准确率从19.4%升至30.7%,但不如神经基线。
M³R-Bench:基于证据的多模态隐喻理解统一基准
提出M3R-Bench证据基准揭示跨模态错配 M3R-Reasoner以8B参数超越大模型
通过随机数生成缓解LLM-as-a-Judge的评分偏差
提出一种通过随机数生成测量并校准LLM潜在数字偏差的方法以缓解评分偏差并在四项评估任务上优于基线
一次响应,始终响应:通过潜在提示恢复检测LLM生成文本
提出EchoPrompt:恢复潜在提示并测量似然增益以检测LLM生成文本,无需训练,零样本检测达到最优且鲁棒。
任务条件流匹配用于平衡的多语言文本嵌入适配
提出任务条件流匹配,按任务分派优化目标,均衡多语言嵌入适配,在Indic基准上创最佳并泛化。
如何识别新词:上下文偏置方法与语音大语言模型的比较
对比上下文偏置与语音大模型识别新词:偏置法使目标词错误率降88%,大模型读稿优但泛化差且易受干扰。
语言模型的层次潜在预测
提出HiLP,用高层抽象潜在减少潜空间误差累积,增强长程推理与编码效率。
面向多语言数学推理的同策略差值蒸馏
OPD²以师生概率差为信号,多语言数学推理优于原法,韩日语提升显著缩小英韩差距;纯英语训练易偏向英语
面向事实性检查与幻觉检测的分解式蕴含
提出HallDetect轻量级无参考黑盒框架,分解内容为原子声明,用编码器蕴含模型验证,多数基准上优于基线。
利用合成查询探测映射嵌入模型间的相似性空间
提出合成查询探测法,学习跨嵌入模型分数映射,对齐相似性空间,提升阈值可移植性,等渗回归效果最佳。
MoCA:隐式社会情境分析
提出隐式社会情境分析任务与基准,发现大模型依赖显式线索表现不足,提出CoDAR框架显著提升推理。
FormBharo:在印度农村用于对话式填表的语音代理的设计与评估
为印度农村设计语音填表代理,混合大模型与规则控制,端到端评估显示需权衡准确率、成本与延迟,并发布基准。
通过分层推理与话语级目标奖励提升大语言模型的社交智能
提出TSR分层与LHRL-VGR,动态奖励提升社交智能,SOTOPIA上超GPT-4o 7.32%。
MACRO:Transformer层的马尔可夫链路由
MACRO框架将层路由建模为上下文相关的马尔可夫策略,无需修改权重即可实现跳过、重复等操作,在多个大模型上平均提升5.0%准确率,路由搜索时间缩减9.4倍。
基于LLM生成合成数据训练的临床沟通处理:结构化综述与新应用案例研究
综述LLM合成临床沟通数据的生成与应用,13个案例证明无需真实标注即可启动系统,但真实数据迁移验证仍有限。
MameLoshnLM:意第绪语语言模型与评测基准
首个开源8B意第绪语模型,构建语料与基准,超越同类模型,为低资源语言提供模板。
EpiBench:大语言模型能否理解抗体药物发现中的表位?
提出EpiBench基准,基于序列和功能数据评估大语言模型表位推理,覆盖五项相关任务,发现当前模型能力有限。
面向反馈驱动智能体修复的因果情景记忆
免训练MERIT以因果情景记忆优化Text-to-SQL:Spider69.79%,BIRD48.44%。
通过选择性上下文偏好优化学习何时信任
提出选择性信任问题,构建MIST基准与SC2W指标,发现模型普遍易受误导。SCOPE方法平衡优化各条件,降低误导翻转率,同时保持上下文准确。
基准的基准:对话智能体基准评估
提出无参考框架,用LLM评估对话基准的一致性、复杂度和策略覆盖,可区分质量并为人工基准提供诊断。
面向LLM个性化共写的免训练词元级引导
提出SteerWrite,免训练、词元级引导个性化共写,无需微调,适配小数据,显著减少人工编辑,达SOTA。
路由在最宝贵之处最难学习:Web智能体表示路由的界限
逐任务选观察模式的收益被噪声夸大;路由策略不优于固定模式,因监督受制于智能体成功率。
去殖民化自动语音识别中的语言政策:跨文化胜任语音AI框架
语音识别失败实为殖民语言等级,须以社区为共同设计者,经三害分类与七层模型实现跨文化胜任。
NeSy-RAG:用于可解释问答的神经符号RAG
提出神经符号RAG框架,生成可溯源的Prolog查询,自动检测缺失用户事实,ShARC准确率达61.1%,优于基线42.8%。
RP-OPSD:推理枢轴引导的同策略自蒸馏用于多语言推理迁移
提出RP-OPSD,用推理枢轴引导同策略自蒸馏,强化优质推理信号,提升多语言数学推理性能。
面向国家标准文件规则密集型审查的大语言模型基准评测与增强
提出标准审查基准,评测14种大模型,最优分数由0.328提至0.509,仍低于专家0.664。
工具调用的苦涩教训
程序化工具调用在基准上评测14个模型,多数匹配或超越JSON调用,并行与上下文退化下更稳健,是可行替代方案。
超越序列顺序:面向 Transformer 的语法感知位置嵌入
提出SiPE(语法感知位置嵌入),将依存句法先验注入位置编码,在SyntaxGym上提升10.3%、GLUE上提升8.2%,困惑度降9%,推理成本不增。
Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts
无CVE的漏洞:管理AI编码智能体中任务授权与权限之间的持续差距
提出APV概念,管理AI编码智能体任务授权与权限间持久差距,区别于CVE,提供模式、生命周期等。