Poller:大语言模型是否适合评估诗歌理解任务?
提出Poller方法,让LLM扮演诗人评估诗歌,误差大幅降低(修辞94.55%,陌生化89.53%),验证了有效性。
演变为混合注意力模型
提出FlashMorph方法,通过优化门控和正则化实现高效层选择,在保持性能的同时降低转换成本。
扩展视野,而非参数:35B智能体实现万亿参数级性能
提出35B MoE智能体Agents-A1,通过扩展长程轨迹与异构能力,达到万亿参数性能,在多项长程任务上领先或匹敌1T模型。
中文标题:干扰差距:人类记忆与RAG系统的检索边界比较
中文摘要:人类记忆与RAG系统在语义干扰下检索边界不同,人类干扰敏感性更低,HippoRAG居中。
帝国的数字遗产:四种语言模型在文字上呈现相同的帝国版图
DSRI显示仅9.7%书写系统获完全支持,四种模型在172个特征上一致错误,揭示帝国历史不平等通过共享训练语料延续。
叙事-UFET:面向超细粒度实体类型的叙事生成
用自动生成叙事替代句子级上下文,显著提升超细粒度实体类型中长尾类型的识别性能,类型变化的叙事信号更强。
Position: The Term "Machine Unlearning" Is Overused in LLMs
形式化潜在思维:LLM中思维表示的四个公理
提出LLM潜在思维表示的公理评估框架,发现表示无法同时满足所有公理,仅能区分任务类型,信息有限。
自动演讲辅导综述:系统、方法与开放挑战
综述自动演讲辅导系统,提出五维任务分类,指出标注语料稀缺、口音公平及低延迟诊断等挑战。
发展方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化
研究发现Transformer先学最抽象全局统计,后学局部依赖,早期过度泛化后期受约束,据此提出新框架。
因果关联:利用多语言微调进行金融问答(FinCausal 2026)
对比三类模型,监督微调最优;GPT-4.1 Mini微调后英语并列第一、西班牙语第三,验证多语言微调价值。
Supersede:诊断与训练LLM智能体中的记忆更新差距
LLM代理存在记忆更新差距,完整上下文准确率92%降至自维护记忆77%,对话增长进一步恶化至28%,但可通过GRPO微调训练提升。
EntMTP:基于熵引导的多令牌预测加速大语言模型推理
EntMTP无需训练,根据局部熵动态调整预测深度,在多个基准上比Hydra/Medusa加速1.15-1.36倍。
上下文就绪型Transformer
新架构通过预上下文化token和校正网络实现循环,单层K=10模型击败6层Transformer,推理快2.6倍,完美解决指针追踪任务。
Ko-WideSearch:韩语广度搜索基准,用于网络代理穷举集枚举
韩语广度搜索基准Ko-WideSearch评估网络代理穷举能力,发现代理可找回集合但难以填充行,获取正确值比格式化更困难。
通过平滑MMD对齐增强大语言模型中的数值预测
提出SMMD损失,用距离核与图平滑对齐数值分布,提升LLM数值预测精度,超越现有方法。
基于双阈值难例挖掘的跨平台中文攻击性评论检测
提出双阈值难例挖掘方法,用少量标注难例微调,显著提升跨平台中文攻击性评论检测性能。
从信号到迁移:大语言模型中基于探针的不确定性估计的分解研究
研究发现域内最优为原始隐藏状态与注意力特征,分布偏移下需结构化特征;提示与标签影响显著;训练了可迁移的基线探针。
掩码语言流模型
将掩码融入连续流,解决并行生成与多步推理矛盾,首次实现流模型在推理任务上的扩展。
Yuvion LLM:一种具有对抗意识的大型语言模型,用于内容与AI安全
Yuvion LLM通过对抗意识训练提升内容与AI安全,在安全基准上超越GPT-5.4等大模型,尤其对抗鲁棒性突出。
通过层特定位置嵌入缩放缓解Transformer中的位置偏差
LPES方法用遗传算法自动选择每层缩放因子,平衡注意力分布,无需微调或增加延迟,准确率最高提升11.2%。
为下一代LLM预注册以缓解基于LLM的p值操纵
提出预注册未来LLM协议,阻止p值操纵,实验验证有效,成功率超70%。
搜索代理何时应提问:面向澄清感知的深度搜索基准DiscoBench
DiscoBench评估搜索代理识别模糊和澄清提问能力,发现重复搜索不如直接猜测,揭示检索与交互解决问题差距。
低宜人性人格调节用于安全的大语言模型微调
通过低宜人性人格调节,在保持对话温暖的同时降低模型越狱和有害输出风险,无需安全标签。
语音强调模型能否跨语言和情感泛化?
新语料MMEE揭示:多语训练提升跨语言泛化,模型跨情感和合成/感知数据泛化稳健。
KG2Cypher:面向数据的企业文本转Cypher系统构建管道
提出数据驱动管道,从知识图谱生成查询对,经LLM验证与微调,韩语企业场景执行F1达0.964。
人类书写文本中的事实错误实证分析及其应用
通过报纸修正提炼人类事实错误分类,发现汉字误转换等特有类别,评估LLM检测性能仅52%F1,凸显难度。
位置偏差校正不足以实现单遍注意力排序
位置偏差校正仅缩小37%差距,无法匹敌迭代排序,重复排序提供额外增益。
SHIFT: 门控调制激活导向用于检索增强生成中的知识冲突缓解
SHIFT通过可学习门控自动调节模型内部激活,仅优化0.01%参数,有效缓解RAG中检索与参数知识冲突。
校准引导LLM压缩中的输出空间分配成本:一项实证研究
输出空间分配成本提升准确率但增加困惑度,低压缩率下效果不显著,因权重与输出误差高度相关。
NLL引导的全注意力层选择:用于无需训练的滑动窗口适配
提出NLL引导的层选择方法,仅用1/4全注意力层达到与1/2相当的准确率,大幅降低计算成本。
历史文本中命名实体识别的时间融合策略研究
系统研究历史文本NER时间融合策略,发现后期融合在早期噪声时期更鲁棒且可泛化。
从汽车维修说明中学习互补动作建模
提出互补动作建模,通过修改动作短语识别程序性对应指令,强调基于微妙词汇线索而非表面相似性。
三方狼人杀:大语言模型多跳心智理论中的小丑角色
三方激励结构揭露了二元推理游戏无法显现的多智能体推理层。
VASAE:基于词汇对齐锚定的SAE字典方向命名方法
VASAE在训练时用词汇对齐锚定给SAE特征分配token名,不降重构质量,浅中层的特征对齐率达90%以上。
LLM推理轨迹中的认知片段实现可解释的人类题目难度预测
Epi2Diff框架将推理轨迹映射为认知片段,有效预测人类题目难度,揭示困难题目引发更努力的迭代过程。
受思维树启发的法律案例判决摘要混合方法(基于大语言模型)
提出思维树启发的抽取-生成式摘要法,实验显示其提示效果优于其他类型。
中文标题:从黑盒到临床洞察:基于语音的认知障碍检测的多阶段可解释框架
中文摘要:提出多阶段可解释框架,融合SHAP与LLM推理,将黑盒语音认知检测转化为临床解释,F1达72.11%,SUS评分82/100。
ToxiREX:上下文中有毒推理的数据集
首个多语言、上下文隐含毒性数据集,含Reddit评论和结构化注释,用于捕捉并解释有毒推理。
从对话到检测:用于保险欺诈检测的多模态混合NLP流水线
提出合成多模态框架,融合语音、文本与说话人特征,实现保险欺诈早期检测,提供可复现基线。
MultiHashFormer:基于哈希的生成式语言模型
MultiHashFormer用哈希签名表示token,实现高效自回归,多规模实验优于标准Transformer,参数恒定支持多语言扩展。
信号覆盖矩阵:对陈述自动形式化中的类型错误和语义错误进行分层
提出信号覆盖矩阵四类输出,发现自动形式化改进主要来自类型错误恢复,语义错误改善有限。
基于机制驱动的监控器用于大语言模型训练不稳定的预防性检测
通过监控QK谱熵和MoE路由器指标,在损失发散前数千步预判训练不稳定。
从令牌到状态:LLM作为世界模型的特例及超越的连续路径
LLM是世界模型的退化特例,存在从令牌预测到状态预测的连续谱,但面临自监督数据和架构适配挑战。
LLMs 判断是否优于生成?评估上下文 QA 中的任务不对称、机制可解释性与可迁移性
LLM自评估并非总比生成容易,生成准确率多数更高,因评估对上下文注意力不足。
Towards Automating Scientific Review with Google's Paper Assistant Tool
视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制
VLM中视觉默认,先验覆盖依赖于少数注意力头,消融可翻转预测,揭示不对称因果回路。
延迟验证破坏多智能体大语言模型信念:不稳定性阈值与最优校正器放置
延迟验证引致多智能体LLM信念振荡,阈值与通信延迟相关,校正放置有(1-1/e)近似最优解。
集群、路由、升级:面向成本感知的LLM服务的级联框架
两阶段级联框架先聚类路由再质量估计升级,保留97-99%准确率并降低输出时间成本。
集体困境中的AI说服框架
AI通过个性化说服提升合作但效果短暂,自私框架负面影响更持久,揭示双重使用风险。