思考种子:利用历史多样性实现LLMs中的位置感知强化学习
提出token级混合策略框架,用历史前缀维持探索多样性,同时在线策略保持稳定性,显著提升LLM强化学习性能。
C-ΔΘ:面向选择性拒绝的电路受限权重算术
提出C-ΔΘ方法,通过定位拒绝因果电路并施加约束权重更新,实现离线选择性拒绝,无需推理时钩子,降低计算成本。
AnyPoC:面向可扩展的基于LLM的漏洞检测的通用概念验证测试生成
ANYPoC多智能体框架自动生成可执行PoC验证漏洞,减少幻觉,发现121个新漏洞,108个被确认。
ContestTrade:基于内部竞赛机制的多智能体交易系统
提出内部竞赛机制的多智能体交易系统,数据与研究团队协作,经A股回测取得更高收益和风险调整表现。
犯罪领域命名实体识别(CrimeNER):案例研究与数据集
提出犯罪领域NER数据库CrimeNER-db,含1500+标注文档、4粗21细实体类型,实验验证质量,开源可用
与语言模型练习培养人类共情沟通
LLM教练通过个性化反馈显著提升人类共情表达,且不导致回答同质化。
回译增强的直接偏好优化用于神经机器翻译
提出DPO后训练方法,结合回译增强,显著提升英德翻译质量,COMET分数从0.703升至0.747。
异步软件工程代理的有效策略
提出CAID框架,通过中心化委托、异步执行和隔离工作区,在两项任务中准确率提升25.6%和14.7%。
理解引导强度的探索
首次理论分析引导强度,揭示其非单调效应,通过概率和交叉熵定律验证于多种语言模型。
双路径归因:通过逐层目标传播实现SwiGLU-Transformer的高效归因
DPA以O(1)复杂度实现SwiGLU-Transformer的逐层目标传播归因,无需反事实,忠实高效。
GUI代理是否足够专注?通过语义级UI元素注入的自动干扰
提出语义级UI元素注入的黑盒攻击,通过叠加无害UI元素误导代理视觉定位,实验显示攻击效果显著且跨架构迁移。
LiveOIBench:大型语言模型在信息学奥林匹克竞赛中能超越人类选手吗?
LiveOIBench基准测试显示,LLM在信息学奥赛中仍逊于人类顶尖选手,GPT-5达81.76百分位,开源模型仅60百分位。
Omni-Embed-Audio:利用多模态大语言模型实现鲁棒的音频-文本检索
提出基于多模态LLM的检索模型OEA,在真实用户意图查询和困难负样本区分上显著优于现有方法。
通过直接在线策略蒸馏实现弱到强泛化
Direct-OPD利用弱模型RL前后策略差异作为隐式奖励,低成本提升强模型性能,8 GPU 4小时即显著改进。
Nectar:通过回归对缓存令牌注意力进行神经估计
Nectar用神经网络预测注意力输出,替代长上下文缓存注意力,成本固定,近似误差小。
角色如何影响智能体在“分或偷”游戏中的选择
角色提示影响LLM智能体策略,亲社会/原则性角色更合作,分析性角色易剥削,友情促“分”,金钱复仇促“偷”。
The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment
NAVER LABS 对 IWSLT 2026 指令遵循任务的系统复现
复现 NAVER LABS 流程,三阶段法,10万合成示例,MCIF 上 EN-ZH COMET 0.781,SQA BERTScore 0.346。
基于嵌套与层级重复的文本距离:一种压缩视角
提出Ladderpath方法提取序列嵌套层次重复结构,定义距离度量,在OOD/低资源文本分类中超越gzip和BERT。
长上下文服务中KV缓存优化在任务质量与系统性能上的基准测试
KV缓存优化基准测试:压缩比非性能指标,KIVI4稳定、SnapKV吞吐强、CaM敏感,需按工作负载选择。
大多数LLM从众无需说话者:测量同伴压力基准中的无说话者基线
LLM从众多因重复错误答案而非同伴压力,需先测量无说话者基线以避免混淆。
中文标题: 提示鲁棒性依赖于任务:比较LLM评估中的客观问题与信念型问题
中文摘要: 模型、数据集和提示类别影响鲁棒性,客观与主观问题对提示变化的敏感度不同。
重新审视现代端到端语音识别中语言模型困惑度与ASR词错误率的关系
重新评估现代端到端ASR中困惑度与词错误率的关系,发现外部LM仍有提升但内部建模改变线性关系。
ResonatorLM:因果共振场混合实现高效长上下文语言建模
ResonatorLM用阻尼谐振子因果函数替代注意力,长上下文解码速度提升6.47倍,准确率达61.31%。
BaFCo: 复杂孟加拉语表格理解的文档理解基准
BaFCo数据集包含200份多页孟加拉政府表单,细粒度标注26种实体,评估显示MLLMs定位精度不足。
RPAM:一种评估语言模型关联性的原理性指标,在下游输出中具有高预测效度
提出RPAM指标,强关联人类关联与下游偏差,优于先前记录。
Population-Level Profiling of DSM-5 Depressive Symptoms Among Self-Reported ADHD and ASD Users on Twitter: An Exploratory Study Using Advanced NLP and Statistical Analysis
CoPiT:面向双文字低资源传统蒙古文的认知枢纽翻译
CoPiT通过西里尔文字路由解决传统蒙古文歧义,显著提升低资源翻译性能,使开源模型媲美GPT-4.1。
做得对!成功NLP系统开发方法论
本文提出将系统开发生命周期(SDLC)应用于NLP项目的逐步方法,强调算法仅是成功要素之一。
SpanUQ:面向大语言模型生成的跨度级不确定性量化
SpanUQ通过轻量探针快速检测语义跨度并估计不确定性,精度高且速度快10-20倍。
大语言模型何时应搜索?搜索路由的反事实监督
通过比较无搜索与强制搜索构建反事实监督,训练搜索路由策略,F1从0.70提升至0.82-0.83。
UCSC NLP在SemEval-2026任务10:面向阴谋检测的边界感知跨度抽取与RoBERTa分类
采用边界感知跨度抽取和RoBERTa分类,在阴谋标记检测(宏F1 0.2251)和文档检测(加权F1 0.7694)中分别排名第7和第11。
何处切,切多深:化学SMILES中的BPE与Unigram-LM
BPE与Unigram-LM在SMILES上构建几乎不重叠的子词词表,Unigram-LM分割更细,子词算法是建模决策而非默认。
Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模态语言模型
三模态语言模型统一AR、扩散与自推测,互补提升速度精度,8B解码6倍于Qwen3-8B。
注入还是导航?面向交易法律文档LLM分析的令牌高效检索
相比全语料注入,结构感知分块的结构化检索(NAVINDEX)在持平结果质量下大幅降低令牌消耗56倍、成本25%。
领域自适应总是有益的吗?基于冻结主干网络的跨域情感迁移研究
冻结主干网络中领域自适应的效果取决于其是否已具备目标域知识,对专业主干甚至有害。
混合模式优势正则化缓解大型推理模型事实性幻觉
提出MARGO框架,通过混合模式优势正则化抑制思考诱导幻觉,提升事实问答可靠性。
提示复杂度:大型语言模型中文本和行为的最短提示
定义LLM提示复杂度为最短提示生成目标文本,扩展至软提示、距离和行为复杂度,提出研究议程。
PluraMath:将数学推理评估扩展至低资源语言
PluraMath通过18种低资源语言扩展数学推理评估,揭示高资源与低资源语言性能差距,并开源数据集与框架。
中文标题:嗯...用Transformer?来自四个斯拉夫议会中填充停顿使用的研究发现
中文摘要:利用Transformer分析约4000小时斯拉夫议会演讲,发现填充停顿率与年龄、语速负相关,与情感正相关,性别效应因语言而异。
InfluMatch:以4B模型成本实现前沿质量的KOL搜索
InfluMatch以4B模型成本达前沿KOL搜索性能,级联系统媲美Kimi-K2.6,输出减少35倍,单A100处理50KOL仅20秒。
MemDefrag:大型语言模型的潜在内存碎片整理
MemDefrag利用中间层追踪信号进行内存碎片整理,结合信息量遗忘机制,显著提升知识保留。
从蓝图到现实:基于大语言模型多智能体模拟的普特南社会资本理论建模与应用
提出SocaSim框架,基于LLM多智能体模拟社会资本理论,再现宏观模式并揭示微观因果路径。
共享决策实践测量(OPTION12):面向更好隐私与可持续性的开源小型LLM研究
首次用开源小模型评估共享决策,通用模型优于医学模型,仍难替代人工,但为隐私保护的人机协同奠基。
CurateEvo: 面向智能体后训练的数据整理演化
CurateEvo通过失败驱动动态演化数据整理策略,提升智能体后训练效果与效率,平均得分提升3.2和2.7。
从投票到智能体协作:面向BioASQ 14b的答案类型感知LLM流水线
针对不同类型问题设计LLM流水线,结合证据排序与多智能体协作,在BioASQ 14b事实型子任务中夺冠。
LongCrafter:通过证据图引导的指令合成实现多样化长上下文理解
LongCrafter通过证据图引导指令合成,生成多样化难度可控的长上下文数据,提升模型推理并缓解“中间迷失”。
Spider 2.0-AIFunc:将现实世界文本到SQL扩展到AI原生SQL工作流
Spider 2.0-AIFunc基准含465个AI原生SQL实例,专有模型准确率67-70%,开源模型58.1%,传统智能体框架不适用。
面向深思熟虑协作的LLM智能体:部分可观测下联合决策研究
研究部分可观测下LLM智能体的深思熟虑协作,设立基准评估,发现复杂任务仍具挑战,但深思熟虑可提供反思纠错机会。
从僧伽罗语到迪维希语:低资源语音识别的跨语言迁移学习
从相关语言僧伽罗语迁移学习显著提升迪维希语语音识别,持续预训练+微调使WER降低13.5%,证实语言相关性与策略关键作用。