面向搜索的智能体强化学习导致指令微调对齐失调
智能体RL训练会继承拒绝推理,但触发搜索调用后产生不安全搜索行为,表示引导RL可恢复对齐。
硬思考:选择性潜在迭代提升推理语言模型
提出TaH方法,仅对困难token进行选择性迭代修正,在93%的token跳过迭代下,准确率提升3.8-6.8%。
中文标题:幻觉的统一定义:关键在于世界模型,笨蛋!
中文摘要:将幻觉统一为用户可观察的不准确内部世界建模,区分真实幻觉与规划错误,提供评估通用语言。
EffGen:使小型语言模型成为有能力的自主智能体
EffGen开源框架优化小型语言模型,提示压缩57%,实现高效安全本地部署,性能优于LangChain等主流框架。
理解LLM在抽象摘要中的推理
推理对摘要非万能,质量与事实性有取舍,增加推理未必提升。
哎呀,等等:话语标记在推理模型中至关重要
研究发现,小规模微调中话语标记词与推理正确性相关,但模式不如大规模训练稳定。
RASST:检索增强的同步语音翻译
提出RASST,通过检索增强和术语应用决策,提升同步语音翻译术语准确率近40%,BLEU提升3点。
Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm
MAWARITH:面向法律继承推理的大语言模型数据集与基准
首个阿拉伯语继承推理数据集MAWARITH,含12500案例,评估显示商业模型达90%而开源模型不足50%,存在多种错误模式。
大型语言模型用于PTSD严重程度评估的系统评价:上下文知识与建模策略的作用
提供详细定义和上下文使LLM评估PTSD准确度超人类;推理与集成策略显著优化效果。
检测孟加拉语梗图中的仇恨与煽动性内容:新多模态数据集与共注意力框架
提出孟加拉语梗图数据集Bn-HIB及多模态共注意力模型MCFM,有效区分仇恨与煽动性内容。
学习何时采样:用于高效链式思维推理的置信度感知选择性采样
提出置信度感知选择性采样,利用轨迹特征自适应选择推理路径,性能持平而token减少71.7%。
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
MemBoost:一种面向成本感知的大语言模型推理的记忆增强框架
MemBoost通过记忆增强让轻量模型重用答案,困难查询升级至强模型,大幅降本且保质量。
任意文本条件下的学会学习:超网络驱动的元门控LLM
提出超网络驱动元门控机制,动态生成β调整非线性,在多种文本条件下优于微调与元学习,可泛化到未见任务。
RoTRAG:基于经验法则推理的检索增强生成对话有害内容检测
RoTRAG通过检索经验法则增强LLM,提升多轮对话有害检测准确性与效率,F1平均提升40%,误差降低8.4%。
CoBit:基于比特流扩散的语言建模
CoBit以连续比特流扩散建模文本,配合熵率门控朗之万采样,显著提升生成质量,逼近自回归模型,并消除词汇表缩放瓶颈。
G-Loss:图引导的语言模型微调
G-Loss利用图引导损失函数,通过半监督标签传播构建文档相似度图,捕获全局语义结构,提升嵌入判别性与鲁棒性,加快收敛并提高分类准确率。
SkillsVote:从收集、推荐到演化的Agent技能生命周期治理
SkillsVote框架治理Agent技能全生命周期,通过结构化库搜索与轨迹分解,提升编码基准测试性能。
HyDRA:面向异构LLM池的混合动态路由架构
HyDRA框架零重训动态路由,预测查询多维需求匹配最廉价模型,在SWE-Bench等基准测试中实现质量提升与大幅成本降低。
不是说什么,而是怎么说:一个跨定位、泛化、拟人化与准则的LLM回复审计框架
FRANZ框架多维度审计LLM回复,发现内群体定位与拟人化正相关且因国而异。
EvoMemBench:从自我进化视角基准评测智能体记忆
提出记忆基准EvoMemBench,评估发现现有记忆系统非通用方案,需根据场景选择记忆形式。
大语言模型持续微调中灾难性遗忘的机制分析
系统对比20款前沿模型,发现早期注意力头熵散、中深层前馈网络局部表征崩溃,提出LRCP方法可缓解94.2%灾难性遗忘。
大语言模型中的元认知近视
LLM存在元认知近视,导致五种偏见症状,可通过监控与控制技术缓解。
用于多模态机器翻译的双分支提示框架
提出D2P-MMT,用扩散模型重构图像进行双分支提示训练,结合分布对齐损失,实现鲁棒视觉引导翻译,性能最优。
注意力而非规模驱动多模态语言预测中的人机对齐
视觉语境提升人机预测对齐,注意力解释70%个体差异,模型规模非关键。
通过一阶逻辑定理证明实现LLM的高级数学推理
提出DREAM方法(策略多样化+错误反馈),使LLM多步FOL推理性能提升0.6%-6.4%,并构建447个定理数据集。
从ASR到ASP:评估针对开源大语言模型的提示攻击漏洞
提出ASP指标衡量提示注入攻击,发现催眠攻击达90%成功率,忽略前缀攻击可攻破所有14个开源模型。
双不确定性引导的多模态推理策略学习
DUPL通过量化感知与输出不确定性引导策略学习,在多模态推理任务上提升准确率最高达12.4%,优于现有方法。
JE-IRT:通过联合嵌入项目反应理论审视LLM能力的几何视角
JE-IRT用几何嵌入替代全局排名,揭示主题特化与泛化,支持新模型添加,发现跨学科能力方向。
面向LLM监督微调的效用-多样性感知在线批次选择
提出UDS框架,利用logits矩阵核范数和内存缓冲实现高效在线批次选择,提升微调效率并减少训练时间。
你真的需要GPU来保护你的大语言模型吗?面向规模的CPU级分类器与多阶段安全管道
CPU分类器成本仅为GPU五分之一,可处理80%分布内流量;GuardChain管道仅需GPU处理分布外异常。
中文标题:你在说我的语言吗?——多模态大语言模型中的口语遵循性研究
中文摘要:针对多语言ASR输出语言识别错误,提出软提示方法,定义语言遵循性指标,评估三种缓解策略。
Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation
评估大语言模型在会议中识别受话者、话轮转换和预测下一说话者的能力
评估LLMs在会议话轮三项任务,发现下一说话者预测超越人类,多模态信号利用不足,上下文为关键。
Examining the Limits of Word2Vec with Toki Pona
基于认识论资格的LLM二阶偏见评估
提出LLM二阶偏见概念,通过认识论推理任务评估,发现模型判断隐含系统性偏见,需理论化方法改进。
深度Transformer中层级建模的表达性分析:基于有界深度文法
通过有界深度文法分析深度Transformer层级建模,构造深度线性增长模型,支持线性表征假说。
MemSlides:一种层次化记忆驱动的智能体框架,用于多轮局部修订的个性化幻灯片生成
提出MemSlides框架,通过分离长期记忆与工作记忆,实现多轮局部修订的个性化幻灯片生成,有效提升用户偏好保持与编辑可靠性。
RepSelect:通过表示选择性实现鲁棒的大语言模型遗忘
提出RepSelect方法,通过坍塌梯度主成分隔离遗忘表示,实现深度鲁棒遗忘,抵御微调攻击。
扩散语言模型中令牌编辑的自生成错误训练
提出自生成T2T,通过无梯度草稿填充掩码并监督恢复,解决推理-训练不匹配,提升准确率、减少过度编辑。
从准社会脚本到二元持续:自主AI代理社区中的互动模式
自主AI代理社区中普遍存在准社会口语化线索,且与发帖人再参与及互惠回复结构强相关,证实了二元互动持久性。
PhoneHarness:通过混合GUI、CLI和工具操作驾驭手机使用代理
PhoneHarness提出混合动作基准与执行框架,在可验证移动任务上达75%通过率,超最强基线12.9个百分点。
公平与效率并存:多语言大语言模型分词器的实证研究
对11种东南亚语言实证表明,Parity-aware BPE实现公平与效率帕累托最优,形态驱动字节编码语义最佳但成本高,公平与效率可兼得。
评估Lean 4中证明自动形式化的鲁棒性
首次研究证明自动形式化鲁棒性,提出全局/局部扰动基准,七个模型均对全局扰动敏感,多数无法忠实反映局部扰动。
Nemotron 3 Ultra:面向自主推理的高效开放混合专家Mamba-Transformer模型
550B总参混合Mamba-Attention专家模型,经20T tokens预训练,推理吞吐提升6倍精度持平SOTA。
自然语言中任意条件建模的简化方法
AC-GPT简单修改因果Transformer,实现过去、未来、混合上下文的任意条件评估与采样,保持左到右生成,优于基线且不损标准性能。
上下文压缩不止一种方式:匹配预算下的可读符号重表达与连贯摘要之比较
提出Telegraph English可读符号格式,在三个数据集上比压缩基线和连贯摘要更优,因更密集保留实体内容。
CoRA: 面向可靠思维链推理的置信度-推理依据对齐
该方法降低置信-推理依据对齐误差26.51%,表明可靠思维链需置信答案与实质性依据支撑。
基于深度时间建模与集成融合的多模态生理信号情绪识别
使用LSTM、TCN、Transformer对WESAD多模态生理信号情感识别,晚期融合集成达最高准确率98.91%。