分析技术文档RAG助手中使用LoRA适配的质量-延迟-资源权衡
在Kubernetes文档RAG系统中,通过LoRA微调分析质量-延迟-资源权衡,发现仅适配q,v注意力投影效果最优。
SuperValid:面向泛化下游扩展的能力对齐OOD验证
SuperValid合成OOD能力对齐数据,训练时无需评估即可预测下游性能,支持模型选择与扩展。
当自信误导:扩散语言模型的后缀锚定与锚定邻近置信度调制
针对高置信度导致生成不完整和过早解码问题,提出后缀锚定置信度调制,改善非自回归解码性能。
DEPART: 分解多语言大语言模型中的语言差异
贝叶斯框架分解多语言大模型性能差异,语言特征解释79%以上方差,模型表示相似性主导预测,NLU与推理方差分布不同。
BenGER:德国法中基于涵摄的法律推理的大语言模型系统基准测试
BenGER基准含1127项任务,评估12种LLM在德国法涵摄推理能力,闭源旗舰领先,人机共创优于纯人工。
更难的文本嵌入基准(HTEB):超越一维静态鲁棒性
HTEB从词汇、长度、语言三维度动态评估文本嵌入鲁棒性,揭示模型特定弱点,挑战静态基准。
框架至关重要:通过基于行为的价值对齐解决决策中的框架敏感性问题
LLM在事实等价但不同框架输入下决策翻转率达28.6%,Valign通过表征级锚定价值对齐,有效抑制框架敏感性。
当有益的上下文泄露:领域自适应ASR中的隐私风险
领域自适应ASR的提示与微调可泄露隐私,组合加剧,无上下文微调是平衡最佳策略。
将混合专家模型剪枝并蒸馏为稠密语言模型
提出MoE转稠密框架,多样性感知评分最优,准确率提升6.3%,训练快1.6倍。
IFMTBench:多语言翻译指令遵循的综合基准
IFMTBench是一个多语言翻译指令遵循基准,覆盖7种语言和6种约束维度,揭示模型在指令遵循上的关键差距。
大型语言模型下的论证质量评估:一种成对Bradley-Terry方法
LLM评估论证质量与专家中等相关,Llama-70B最优,预测稳定。
监督语义差异法用于跨文化概念分析:以人类情感为例
提出跨语言SSD方法,在情感词库中验证了效价、唤醒、支配维度的跨语言对齐与残余差异,为跨文化心理意义比较提供可解释框架。
PrunePath:迈向高度结构化稀疏语言模型
PrunePath通过软max路由与累积阈值实现FFN层自适应结构化稀疏,兼顾性能与解码加速。
以社区为中心的普诺克丘亚语NLP资源建设
为普诺克丘亚语构建首个ASR资源:66小时语音语料库、系统基准测试及开源模型。
当求助者难以帮助时:在最坏情况交互中评估情感支持对话系统
针对难助求助者,评估情感支持对话系统,发现多数模型性能骤降,大型LLM更稳健,模拟数据可提升鲁棒性。
重新审视大语言模型推理中的拟人化反思标记
抑制拟人化反思标记不影响甚至提升推理性能,表明其非可靠反思代理,仅为表面线索。
为何评估语音翻译离不开语音
语音翻译评估指标忽视语音特性,新模型仍无法一致评估,需专用训练数据和模型。
CIRF:将思维链分词化为可重用功能单元,实现大型语言模型的高效潜在推理
CIRF将思维链转化为可重用功能token,实现高效潜在推理,在准确率与延迟间取得更优平衡。
HELEA:面向鲁棒实体对齐的硬负例基准与基于LLM的重排序方法
提出同名硬负例增强策略,构建评估基准与训练语料,结合编码器与LLM重排序,实现鲁棒实体对齐。
面向混合专家模型多语言下游任务的路由对齐微调
提出RA-MoE框架,通过路由对齐损失引导目标语言路由学习英语任务专家激活模式,提升多语言下游性能。
HardMTBench:在知识密集型领域对中英翻译进行压力测试
面向知识密集型中英翻译的诊断基准,覆盖12领域2万条测试,扩大系统差异并暴露术语弱点。
PubMedCausal:生物医学文本中因果关系抽取的跨度级标注语料库
构建PubMedCausal跨度级因果语料库,评估显示生物医学CRE挑战大,最佳检测F1=0.74,抽取F1=0.68。
LJP未见之案:起诉决定预测完善刑事责任评估
提出起诉决定预测(PDP)填补法律判决预测盲点,分类四类决定,LLM表现差且简单强化学习无效。
FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning
PrionNER: A Named Entity Recognition Dataset for Prion Disease Biomedical Literature
突破文字障碍:实现非拉丁文字中基于词性标注的ASR错误分析的自动对齐
提出语言无关的自动对齐方法,支持非拉丁文字的词性错误分析,利用错误信息改善ASR性能。
守约角色:多智能体结构化推理中的契约保持型角色演化
提出契约保持的角色演化方法,在保持五个结构契约下自适应演化角色池,提升多智能体推理性能。
AdaDPO:具有平衡梯度更新的自适应直接偏好优化
AdaDPO通过自适应梯度平衡修正DPO的不对称梯度,提升模型对齐效果,简洁易集成,可推广至多种偏好损失。
当话语压力冲突时:视觉-语言模型输出中的信息结构
VLM能区分新旧信息但过度规则化,人类更灵活;评估需关注内容的话语包装方式。
Skill0.5:面向智能体强化学习中分布外泛化的技能内化与联合利用
Skill0.5通过动态路由分层优化,融合技能内化与利用,在ALFWorld和WebShop中超越基线。
论形式数学中的组合学习行为
组合学习行为对攻克形式数学难题必要但不充分,高CLB得分模型才能达奥林匹克级别。
超越单一路径:评估与增强交互式LLM代理的发散性思维
提出MUTATE基准评估交互式LLM代理的发散思维,发现收敛压力致行动固定,ReDNA分离发散与收敛,显著提升发散性思维。
基于大语言模型的社会代理的真实性评估:以西班牙在线新闻评论反应为例
评估LLM生成西班牙新闻评论的真实性,发现现成模型低估仇恨言论,微调后Qwen3最均衡,Mistral7B情感语义对齐好但仇恨过高。
功能熵:用不确定性量化预测LLM生成代码的功能正确性
提出功能熵方法,以功能等价替代语义等价,有效预测LLM生成代码的正确性。
共单体形态音系学:芬兰语上下文相关形态规则的组合框架
提出Writer共单体框架,规则作为共Kleisli箭头组合,避免状态爆炸,实现双向形态分析,准确率83.92%。
A new semantically annotated corpus with syntactic-semantic and cross-lingual senses
ClinicalEncoder26AM:多语言可诊断ColBERT模型;来自MultiClinNER共享任务的证据
该模型通过临床后训练实现数据高效的多语言实体召回,在MultiClinNER任务中字符加权F1达前五。
GUI-CIDER:通过因果内化与密度感知样例重选进行GUI代理的中期训练
提出因果内化与密度感知重选方法,显式学习GUI世界知识,提升代理任务成功率。
Soft-SVeRL:基于软奖励的自我验证强化学习
Soft-RLVR通过原子检查列表生成软奖励,自验证需显式稳定防奖励膨胀;指令遵循任务提升11.1分。
了解评估设计方式的模型更安全
掌握评估结构特征的知识可显著提升模型安全测试表现,独立于显式记忆,构成新混淆因素。
检索增强生成中的上下文优化:梯度下降视角
将RAG视为上下文优化,提出轻量前向更新方法,提升冻结LLM证据利用效率,大幅降低查询成本。
面向多轮Text-to-SQL的记忆架构:基准与实证研究
提出多轮Text-to-SQL基准,发现无状态模型三轮后准确率归零,记忆架构效果不单调,部分模型退化。
每日剂量:放射肿瘤学中集成工作流的大语言模型自动化临床摘要与试验识别
提出LLM驱动自动化系统,整合放射肿瘤科工作流,实现临床摘要与试验识别;1月评估显示83.6%高频使用,满意度高,每日可节省≥10分钟。
大型语言模型中的预训练数据暴露:成员推断、数据污染及安全含义综述
本文首次统一综述LLM预训练数据暴露中的成员推断与数据污染,形式化暴露层次并总结攻击防御与未来挑战。
CroCo:基于自生成结果的跨语言对比偏好调优
跨语言对比偏好调优(CroCo)无需语言特定偏好标注,利用英语奖励模型提升多语言性能,避免灾难性遗忘。
SPEAR:代码增强的智能体提示优化
SPEAR通过Python沙箱执行结构化错误分析,结合自动回滚确保单调优化,在工业审判任务和基准测试上全面领先。
RICE-PO:将检索交互转化为推理智能体的信用信号
RICE-PO将检索交互转为局部学习信号,解决推理步骤信用分配,优于基线方法。
为什么LLM在结构化知识上产生幻觉:线性化表示推理的机制分析
LLM在结构化知识上幻觉源于注意力集中于结构捷径、前馈层语义接地失败,致依赖参数记忆,此模式可推广至多跳和表格。
自我验证蒸馏:语言模型其实是自己的合成数据管道
自我验证蒸馏法让模型自生成解并自验证过滤后训练,在数学、科学、编码上分别提升16.7、11.1、8.3个百分点。
中文标题:通过潜在激活引导的大语言模型文化价值对齐
中文摘要:提出情境探测与激活引导框架,无需重训即可调整模型文化价值,发现价值编码存在耦合结构限制精准对齐。