重新评估高性能大语言模型在波兰医学考试中的表现:真实能力还是偏差驱动?
引入更难波兰医学考试基准评估21个LLM,标准MCQA分数高估真实能力,最佳模型成绩下降超28个百分点。
新闻能预测市场吗?零样本金融自然语言处理的局限性及可解释AI的作用
零样本NLP无法可靠预测短期股价波动,但可解释AI信号能有效区分预测可靠性。
中文标题:指令调优大语言模型上解码时真实性方法的对照研究
中文摘要:CHAIR通过分析各层token的logits特征检测幻觉,在零样本任务中显著提升准确率,并启发利用内部表示改进解码策略。
争议性政治话语中的省略推理检测资源
提出1482条推文资源,基于Walton图式标注省略推理,分歧训练模型优于多数投票,利于研究主观推理。
在误导性医学语境下衡量大语言模型的认知韧性
大语言模型在误导医学语境中正确率从71.1%暴跌至38.0%,攻击成功率达51.5%,MedMisBench揭示评估盲点。
论大语言模型条件控制中的效果-流畅度权衡:一项系统研究
发现高效引导牺牲流畅度,激活引导在指令微调模型上效果差。
VIA-SD:基于模型内路由的投机解码验证
VIA-SD通过多级验证框架降低拒绝率0.10-0.22,提速10-20%,实现高效大模型推理。
大语言模型的智能体环境工程:环境建模、合成、评估与应用综述
系统综述大语言模型智能体环境工程涵盖建模合成评估与应用提出智能体环境共演化路径及未来方向
超越完全随机掩码:扩散语言模型的注意力引导去噪与优化
提出AGDO,利用注意力依赖确定去噪顺序并强调关键token,在数学与编码任务上提升推理性能。
可验证环境是乐高积木:用于推理泛化的递归组合
RACES框架递归组合可验证环境,提升LLM推理泛化,仅用50基础环境即达300环境效果。
Gumbel-BEARD: 低资源领域Whisper自监督适应的自动层选择
提出Gumbel-BEARD,自动选择Whisper层实现自监督适应,10小时标注数据即达SOTA。
通过信息增益测量多轮对话中的语义进展
提出信息增益度量语义进展,无需LLM推理,轻量模型即可有效评估对话信息积累,与人类判断一致。
Doc-to-Atom:学习编译与组合记忆原子
提出Doc2Atom框架,将文档分解为知识原子并编译成微LoRA,推理时选择性组装,优于基线且降低内存成本。
ALIGNBEAM: 通过跨词汇表逻辑混合实现推理时对齐迁移
提出无训练推理时对齐迁移方法,逐词翻译锚模型logits并用LLM选择安全续写,提升模型安全性且开销可控。
我们的模型建立在哪些模型之上?——审计现代LLM中的隐形依赖
提出ModSleuth系统,从公共工件递归重建LLM依赖图,发现1060个依赖,揭示多跳许可义务和文档不一致。
Massive Open-Vocabulary Keyword Spotting
一个PubMed规模的结构化生物医学摘要数据集
发布含2320万条结构化摘要的PubMed数据集,分作者与自动标注,助力文本处理。
面向多轮对话生成的上下文驱动增量压缩
C-DIC通过可修订线程压缩状态和轻量循环,实现高效鲁棒的多轮对话生成,并保持长程稳定性。
CCL25-Eval 任务5系统报告:新数据集与LoRA微调Qwen2.5
构建古典诗词指令数据集,LoRA微调模型,古诗翻译情感理解提升9.7%。
三键输入:探索文本输入的理论最小按键数
三键配合GPT-4o实现字符错误率9.46%,是实用最小值,增加按键收益递减。
伪后门作为防御:通过共享内部机制移除生成式大语言模型中的未知后门
提出嵌入已知伪后门再移除的方法,利用后门共享内部机制,有效消除未知后门,优于现有方法。
突破熵界限:通过带拒绝采样的多令牌预测加速强化学习训练
提出Bebop方法,用拒绝采样缓解熵波动干扰,端到端TV损失优化使接受率达95%,实现RL训练1.8倍加速。
长尾而非首页:群体高亮显著性的冷启动预测
模型从文本预测群体高亮位置,优于基线但优势小,且主要针对非热门内容。
哪种语音表示更匹配文本原生推理?帧率和表示上语音文本对齐的研究
语音与文本对齐中,4.17Hz帧率及中间层表示对齐最佳,解决推理退化问题。
超越第三人称审计:面向以用户为中心的大语言模型偏见研究的场景化交互审计
提出场景交互审计(SIA)框架,研究用户特征如何影响LLM回应,揭示用户缺失的偏见盲点。
Claw-SWE-Bench:评估OpenClaw风格智能体工具在编码任务上的基准测试
多语言编码基准,公平评估智能体工具,适配器设计能大幅提升性能至73.4%,模型与工具选择显著影响结果与成本。
中文标题
提出社会世界模型(SWM)框架,通过挖掘时间模式建模信念动态,在预测市场基准上超越时间序列模型,达最优结果。
内部派系,跨文档不确定:社会高亮中的读者子群体
文档内读者形成强子群体,但跨文档稳定性证据不足,可能为情境性分组或弱稳定特质。
基于流形幂迭代的混合专家路由器重设计
基于流形幂迭代重设计路由器,使每行与专家主奇异方向对齐,提升MoE模型效果。
几何度量与大语言模型:它们衡量什么以及何时有效
系统测试发现几何度量主要反映文本长度,控制后判别力下降;但结合文本统计可提升识别准确率,最适合故障检测。
VietMed-MCQ:面向越南传统医学评估的一致性过滤数据合成框架
基于RAG与一致性过滤的越南传统医学多选题数据集,含3190题,专家验证94.2%通过,模型诊断推理仍不足。
Food4All:面向食物资源导航的智能体框架与自适应用户理解基准
提出含686资源、300任务的Food4All基准,评估LLM发现最佳准确率96.33%,但存在约束接地和交互问题。
M4FC:一个多模态、多语言、多文化、多任务的真实世界事实核查数据集
M4FC含4982张图片与6980条声明,覆盖10种语言6个任务,由专业核查员验证并提供基线结果。
后门藏身何处?语音语言模型中后门传播的组件级分析
后门在SLM中可传播至所有任务,持久性依赖目标组件,且有毒样本与良性样本不可分,挑战过滤防御。
Neuron-based Personality Trait Induction in Large Language Models
BioMamba:领域自适应生物医学语言模型
BioMamba通过平衡领域自适应持续预训练,增强生物医学文本性能且保持通用流畅性。
因果对话情绪识别:上下文饱和与话语标记证据
对话情绪识别中,上下文是关键但10-30轮即饱和,层级表示与情感词典无额外增益;悲伤情绪更依赖上下文。
基于残差引导的偏好对齐大型语言模型
提出PaLRS方法,无训练、即插即用,从少量偏好对提取引导向量,提升推理和代码任务,节省时间。
引导噪声:将随机扰动转化为高效下降方向,实现内存高效的大模型微调
提出框架将随机扰动转化为有效下降,通过挑选/组合候选扰动,理论证明每步降幅更大,实验优于零阶基线且保持内存高效。
FronTalk:以多模态反馈评估对话式代码生成的前端开发基准
FronTalk首个多模态对话式代码生成基准,揭示模型遗忘与视觉反馈解读难题,AceCoder可缓解遗忘。
当通用提示改进反而有害:面向评估的LLM应用迭代
提出MVES框架,发现通用提示改进非单调提升,可能降低性能,提示变更需基于任务套件测试防回归。
参考冲突下的评判:揭示LLM评判器在QA评估中的知识驱动失败
LLM评判器在参考与自身知识冲突时评分不可靠,过度依赖参数知识是主因,现有策略难以解决。
Fanar-Sadiq:面向有据可依的伊斯兰问答的多智能体架构
Fanar-Sadiq多智能体伊斯兰QA系统,通过意图路由、检索验证和教法计算,确保回答有据可依,高效精准。
神经FOXP2——面向大型语言模型中特定语言神经元的定向语言改进
通过定位语言神经元并施加定向激活偏移,使模型默认语言从英语可控切换至目标语言。
强化学习训练语言模型的最优推理长度
强化学习训练下,模型推理长度与准确率呈倒U型关系,中间长度最优。
短链深思:通过拆分-合并优化平衡推理效率与段内能力
提出CoSMo框架,通过拆分-合并消除冗余,结合强化学习与段级预算,平均准确率提升3.3点,段使用减少28.7%。
SoftMatcha 2:面向万亿级语料库的快速软模式匹配器
SoftMatcha 2实现0.3秒内万亿级语料软匹配,支持语义变体,通过动态剪枝和磁盘感知设计抑制组合爆炸,性能远超现有方法。
语言塑造大型语言模型中的心理健康评估
中文提示导致LLM更高污名化评分和更保守抑郁判断,造成低估错误,需确保跨语言评估标准一致。