MicroSpec:利用轻量级上下文词汇表加速推测解码
MicroSpec无需训练,动态构建紧凑上下文词汇表,将词汇量缩减40倍以上,推测延迟降低51.6%,实现1.12-1.32x端到端加速。
LURE:利用实时使用回放评估降低评估感知
LURE通过回放真实交互轨迹降低评估感知,使评估更接近实际部署,提升安全基准可靠性。
向量并非中性:从摘要任务中导出的LLM表示推断敏感信息
研究审计LLM摘要导出向量泄露敏感信息,不同工件风险不联动,需针对性审计与缓解。
定向重掩码:离散扩散语言模型中令牌编辑到令牌-掩码精炼的替代
提出无训练的令牌-掩码重掩码方法,重置可疑错误令牌为掩码,在12个基准上提升性能,数学任务提升5.92%。
迈向即时自适应反馈:通过知识驱动的LLM增强学生学习
提出知识驱动LLM框架,提供即时自适应反馈,在千人课程中成绩提升超80%,有效纠正错误概念。
中文标题
提出基于标注者立场的心理测量加权框架检测反自闭症歧视,发现LLMs依赖表面关键词匹配,易产生有害输出。
幻灯片问答质量保证应用:教学问题生成的多阶段流水线
提出幻灯片问答质量保证系统,通过四阶段LLM流水线处理PDF幻灯片,生成结构化教学问题,过滤非教学内容,提高覆盖与一致性。
Conv-to-Bench:通过代码任务中的用户-助手对话评估语言模型
提出Conv-to-Bench框架,自动将对话转化为可验证清单,高效评估语言模型。
探究大型语言模型中的最简阶段结构:通用依存关系无法刻画的内容
UD不变条件下,LLM表示呈现最简阶段梯度与凝聚性,证明预训练习得超越UD的形式句法抽象。
大型语言模型的对齐微调:以数据为中心的视角看对齐数据流水线
从数据视角将对齐微调重构为三阶段流水线,识别权衡与失败模式,提炼原则并指出挑战。
迈向无差错电子健康记录:临床笔记与结构化表之间的推理密集型一致性验证
提出推理密集型一致性验证基准EHR-ReasonCon和LLM框架EHR-Inspector,在MIMIC-III上实现先进性能。
模型遗忘目标因语言功能不同而异
针对语言功能设计不同遗忘目标,如危险知识与毒性的遗忘,实验表明采用不同训练目标效果显著。
Reddit平台药物相关实体的整理与提取
构建Reddit药物剂量效果数据集ReDose,基准测试显示DRUG提取F1=0.843,EFFECT召回率仅0.41。
FAB-Bench:半导体制造中自适应RAG基准测试框架
FAB-Bench针对半导体制造RAG系统,定义六项指标并精选200问答对,揭示上下文缩放行为与注意力稀释问题。
又是灯塔里的伊莱亚斯?——诊断LLM故事的低多样性
LLM故事中高频出现“灯塔”“伊莱亚斯”等词,源于偏好数据,导致多样性低下,显示小数据集与对齐算法的巨大影响。
LATTE:基于同行锚定偏好轨迹预测的个性化大语言模型生成
LATTE通过预测同行锚定相对偏好状态实现个性化LLM生成,显著优于静态概况等方法。
Verilog-Evolve:反馈驱动与技能演进的Verilog生成
提出反馈驱动框架,通过多维度评估与技能库演化,提升Verilog正确性、综合友好性及下游目标性能。
概念隐写术
提出概念隐写术,利用推理步骤的高层行为模式隐蔽传输信息,比词汇隐写更抗释义防御,但策略感知释义器可有效阻断。
中文标题:临床随访指令的可靠提取:一种混合神经符号管道
中文摘要:混合神经符号管道分离实体提取与日期计算,在合成病历上配对F1达0.99+、日期零误差,优于生成模型(配对F1仅0.5)。
多语言嵌入模型中,枢纽性而非各向异性驱动跨语言检索不对称性
实验表明,枢纽性(hubness)是跨语言检索不对称的主因,CSLS校正可弥补63.5%的差距。
PRISM:评估大型语言模型审稿人的多维基准
PRISM四维评估发现LLM可匹敌人类审稿,但各有盲区,建议作为补充而非替代。
提示优化为何有效,又为何有时无效:一项受因果启发的编辑层面分析
提示优化成败源于编辑类型与任务特征的交互:复杂性编辑损害数学推理,逐步编辑改善逻辑推理。
中文标题
忽略语境差异导致AI评估偏差,特定基准可纠偏
迷宫与线:重新思考大型语言模型中顺序知识编辑的正则化
发现顺序编辑的稳定性源于累积约束而非正则化,许多正则化策略非必要,并扩展了冲突编辑处理。
NestedKV:用于长上下文KV缓存压缩的嵌套内存路由
NestedKV无需训练,通过多尺度键异常评分与自适应路由压缩缓存,小缓存下长上下文性能显著提升。
证据缺失不等于证据不足:事实核查中NEI构建伪影的诊断
NEI-CAP诊断协议揭示构建伪影导致模型能力不迁移,聚合分数掩盖真实问题。
Granuscore:面向文本分析与问答的无参考粒度度量
引入基于层次嵌入结构的无参考粒度度量Granuscore,能恢复层级排序、解释句子特异性,并分析问答差异性。
语言模型中跨语言泛化的体外研究
跨语言迁移取决于分词子结构,小词汇量更优;迁移分阶段,语法先于词汇;桥强度与可达性相关。
有限路径上下文:基于LLM的知识图谱问答中可见路径历史的受控研究
有限路径上下文截断历史为最近K跳,K=1在KGQA中优于全历史,减少输入token。
外部观察者的必要性:形式化充分性差距——序列模型中混合可识别性与上下文对齐的数学扩展
形式化了序列模型中因未观测状态导致的充分性差距,外部信号需超过保真度阈值才能修正,但完全消除需完美揭示潜在状态或验证机制。
From Snippets to Semantics: Rethinking Evidence Granularity for Multilingual Fact Verification
KARMA:与业力对齐的奖励模型自适应
KARMA用Reddit奖励模型强化学习微调语言模型,发现依赖上下文的奖励模型预测业力差但下游对齐更好,改进语用但损害事实性。
通过多个不完美度量的偏好学习优化摘要事实一致性
聚合弱指标分数构建偏好数据集,仅用源文档训练,提升模型事实一致性,小模型可达大模型水平。
有质量无用处:LLM生成的XAI叙述作为信任启发式而非决策辅助
LLM生成解释虽质量高,但不能提升任务准确率,反而增加过度自信,甚至掩盖模型错误。
EmoDistill: 面向对抗性谈判的语言模型代理的离线情感技能蒸馏
EmoDistill离线蒸馏情感谈判技能,通过情感选择与表达学习,显著提升谈判效用,泛化能力强。
共享语义空间中的心理构念
提出在共享词嵌入空间中表示心理构念的框架,通过语义微分实现跨测量比较,测试验证情感与人格维度。
用LLM驱动知识图谱推理生成逻辑一致的合成供应链数据
TabKG框架通过知识图谱和LLM验证关系,生成逻辑一致的合成供应链数据。
SeDT:基于句子变换器决策变换器的多轮对话可靠性条件化
SeDT借离线强化学习返回条件化,为对话片段注释累积相关性分数,无需训练即可大幅提升多轮对话可靠性,性能恢复达37.7%。
重新审视多语言推理差距:层交换方法
通过层交换将英语专家中层迁移至本地专家,几乎消除多语言推理差距(缩小至1.9-3.5%)。
ContextGuard:语言模型中上下文学习的结构化自我审计
大语言模型在复杂上下文学习中易遗漏外围或格式要求,ContextGuard提供结构化自我审计。
KZ-SafetyPrompts:面向大语言模型的哈萨克语安全评估提示数据集
创建含5717条哈萨克语提示的安全评估数据集,覆盖11类风险,基线总体拒绝率28.2%。
不确定性感知的自适应测试时推理预算分配
UAB框架利用输出对数概率估计每问题不确定性,无需额外成本重新分配采样预算,提升推理准确率高达5%。
Telenor北欧客户服务自助语料库
四种北欧语言的1122篇客户服务文档公开语料库,支撑可重复的北欧NLP与信息检索研究。
GeoFaith:基于时空双视角的忠实思维链
GeoFaith框架利用几何结构与熵动态诊断推理忠实性,8B检测器超越GPT-5,生成更短可解释链。
视频模型是教育中的零样本学习者和推理者吗?EduVideoBench:面向教育视频生成的知识-技能-态度基准
EduVideoBench首创基于KSA框架评估教育视频,发现前沿模型在知识、技能、态度上均有提升空间。
学习调整SFT数据以提升推理泛化能力
DART通过强化学习自适应调整SFT数据,匹配模型分布,提升泛化与训练效率,超越标准微调。
推理深度与环境复杂性:逻辑推理任务中RLVR数据分配的对照研究
发现联合深度-复杂性覆盖优于单轴,推理族反应不均,均匀混合优于分阶段课程。
超越问题:评估大语言模型(实际)所知
提出开放知识评估新范式,通过开放提示考察模型自然表达的知识,而非预设问答,并构建BeQu基准验证。
基于LLMs的可问责人机协商:通过共生支架扩展集体智慧
提出三层共生框架,融合多样性、溯源与人类优先,在扩展集体智慧的同时保障主体性与合法性。
DunbaaBERT:从牺牲到语义
DunbaaBERT是乌尔都语RoBERTa模型,32k词表变体在多个任务上实现高性能与效率平衡。