KinyaMed:要的是种子,而非行数——以错误单位书写的语料要求为何约束不了任何东西
以行数而非种子数设定语料要求,百万行130秒即可生成却仍不达标;评估集与模型均可被表层变动轻易欺骗。
量化阈值可复现,失效模式不可复现:波兰语智能体工具使用从8位到2位的三模型研究
三模型六精度波兰语智能体工具研究:仅崩溃阈值可复现于3至2位间,失效模式各异;基准与轨迹已公开。
ScopeIF:通过分级奖励建模提升大语言模型中的作用域感知精确指令遵循能力
提出ScopeIF框架,用作用域-目标-范围模式与分级奖励建模,提升模型作用域感知精确指令遵循能力。
mu-bench:多语言话语转录基准
发布多语言语音转录基准mu-bench及语义指标UER,含4270条银行来电,与人工一致κ=0.78。
使用语言模型模拟句子理解中语境与共指的影响
语境窗口与阅读数据呈U型:长语境拟合最佳;扰乱跨句共指链使预测力降20%–40%。
类型化决策模型:早期证据审计与评估清单
综述28篇论文:类型化读出未见独立精度优势,主要省延迟与成本,并提炼14项评估清单。
神经语言模型学习轨迹中的泛化与记忆:范畴化的几何阐释
神经语言模型早期即通过范畴化几何结构泛化,后期转向样例记忆并破坏该结构。
评委并非其孪生:后训练让模型的写作更可预测,却几乎不会让其作为评委的品味偏向可预测的写作
后训练令模型写作更可预测,但作为评委几乎不更青睐可预测文本;创意评估几乎不受影响。
OptiArena:LLM 能否在固定资源预算下改进可执行算法?
OptiArena 验证 LLM 在固定资源与五轮编辑下优化可执行博弈算法的能力:改进弱基线较稳定,优化强基线则差异显著。
理性对话者模型:理解与产出的统一
提出理性对话者模型,用身份、保真度、知识三参数统一理解与产出,解释对不同伙伴的交流调整。
TRAP:理解与缓解语言模型中的隐私记忆
提出TRAP,用逐token目标参考优势单侧惩罚,将隐私记忆降至未训练水平而几乎不损实用性。
梯度用于干预、激活用于检测:语言模型中的定向特征学习
对比六种定向特征学习方法:激活值法检测最强,梯度法干预最强,特征质量取决于模型信号与估计器。
SinBrief:僧伽罗语法律文档抽象文本摘要的混合框架
SinBrief混合框架无需人工标注,融合领域词图与神经评分,实现僧伽罗语法律文档抽象摘要。
LANTERN:照亮语言模型中隐藏的数学知识
LANTERN借模型内部激活排序数学关系,在OEIS发现62条经验证关联,4条全新,全程不足8小时。
语言距离对公平跨语言迁移具有实用价值
首次公平评估语言距离选源:复合距离与训练排序器降低资源及任务不平等;有评估用训练排序器,否则复合距离
解出每一步仍不够:里程碑神谕揭示大语言模型数学推理中的组合鸿沟
提出神谕阶梯诊断,发现大模型数学推理最大瓶颈为组合鸿沟:各步能解,整体难成。
PlurVA-LLM-2026共享任务赛道1:通过多语言微调与阈值校准实现大语言模型的多元价值对齐
以4-bit QLoRA微调Llama 3.1 8B,结合数据增强与阈值校准,三国任务宏观平均准确率达0.805。
FA-Bench:干净与噪声条件下词级和音素级强制对齐及ASR时间戳的基准测试
FA-Bench统一评测词/音素级强制对齐与ASR时间戳,涵盖干净及降质语音,揭示系统性时间戳偏差。
从内部支持与展演文化
以人类学主位/客位框架,剖析NLP文化研究全流程假设,揭示"NLP文化"影响,提出更贴合文化的AI路径。
回答之前:规模匹配记忆构建下的证据充分性
删除段落会因记忆规模泄露标签;规模匹配构造消除捷径,MemSafe在多跳问答检测有效,但泛化有限。
用词汇蕴涵解释文本蕴涵:利用大语言模型为形式化证明提供词汇关系
评估大模型能否用词汇蕴涵解释文本蕴涵,并为逻辑证明器补充词汇知识;结果显示任务仍难,生成关系常仅部分可靠。
DualGuard:面向逻辑保持数据增强的双模式质量控制
双模式质量控制框架:实例级筛选修复+跨实例异常追踪回滚,保障增强数据逻辑可靠,七项任务五项最优。
掩码高频词元可锐化直接偏好优化
屏蔽高频共享词元以抑制梯度纠缠,ADPO零开销显著提升DPO偏好对齐效果。
自我报告无法识别自我模型:反事实报告的可识别性检验
自我报告仅反映提示环境行为,非自我模型证据;错误来源示范使报告偏移,机制绑定可减弱,基准需加环境偏移检验。
反射器应当看到什么?——反思式提示优化中证据的实证研究
九种反思策略对比:仅失败样本平均测试增益最大;无示例反思局部最优但终题提升有限;校准增益易高估泛化改进。
共享世界,私密心智:以世界创造为范式的长篇写作结构化记忆
NarraWorld视长篇写作记忆为世界创造:从共享图谱派生世界事实、角色信念与情节分支等四视图,分层聚合检索,多基准领先。
面向任务自适应自精炼流水线的流线化反思演化
提出WDA,联合演化阶段指令与顺序结构,SPLIT拆分冗余指令,生成任务自适应自精炼流水线,五个基准显著提升。
PC-SubMax:基于正则化子模最大化的高效提示压缩
PC-SubMax将提示压缩建模为正则化单调子模最大化,RGM算法高效求解,七项基准表现优异。
巴萨语自动语音识别:一种低资源方法
英语等资源丰富语言的语音识别已近人类水平,但低资源语言受益少;本文探索巴萨语低资源ASR。
AdaTutoRank:面向RAG与深度研究的自适应辅导优化文档集重排学习
AdaTutoRank以自适应辅导优化训练文档集重排器,按表现分级提示并蒸馏令牌优势,十大基准最佳且检索更少。
当用户改变主意:测量与修复LLM智能体中的意图漂移
IntentFlux基准量化多轮意图漂移;StateForge显式状态维护可部分缓解但未恢复单轮水平。
面向大语言模型持续适应的锚定提示空间学习
提出LAPS:自蒸馏对齐历史提示,构建锚定提示空间择优迁移,提升持续适应并减少遗忘。
CoT-Pass@k 真的检验了思维链吗?一项多语言数学审计
审计发现CoT-Pass@k的评判模型几乎无法识别推理链错误,仅凭答案一致性给分,难以真正检验推理。
如何减少 Whisper 幻觉
用合成幻觉短语作正样本微调,静音段幻觉率由61.9%降至2.4%,语音召回率反升。
Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL
HERO-MoE:基于尺度保持融合的历史专家路由
HERO-MoE将前层MoE历史路由分布经尺度保持融合后残差注入路由器,无需辅助损失,降低损失且开销极小。
KV-Lingo:通过蒸馏学习 KV 缓存翻译器
用蒸馏训练线性映射翻译源模型KV缓存给目标模型,免重预填充,首词元最高提速29倍,支持动态切换。
语言作为独立信息层:沟通、认知与决策的概念模型
提出融合企业词汇概率向量空间与本体知识库模型,桥接统计与语义因果,识别业务瓶颈,语言为独立动态信息层
对齐悖论:后训练如何放大语言模型中的高置信度幻觉
后训练对齐会放大高置信幻觉,限制DPO边距可减少35.3%错误并保持推理。
局部合理,全局不足:多跳推理中的局部—全局差距
多跳推理局部合理但全局不足,即局部—全局差距;E-Closure兼顾准确与可靠,LGG率降至6.2%。
语义保持变换下的LLM对齐——效用不对称
在语义保持变换下,模型任务效用基本保留而对齐失效显著加剧,称为“对齐—效用不对称”。
语言模型中的角色人设效应能泛化多远?
人设效应可预测却难迁移:跨模型/提示需目标校准,正则更新更优,源关系须有增量价值。
C-HAT-Bench:超越完全生成文本的中文AI文本检测基准
中文人机协作文本检测基准含5千源文本、24万变体,21个检测器在协作模式下AUROC平均降12%。
ExpVoyager:面向动态智能体技能合成的直接经验导航
技能合成重构为经验动态导航,管理者按需多视角探索轨迹,边提取可复用知识边追踪剩余需求,提升下游表现。
聚焦条件:推理时自对比引导让LLM获得更优条件文本嵌入
提出推理时自对比引导SCS,以无条件嵌入精炼条件嵌入,免训练即插即用,提升LLM条件文本嵌入质量。
MixDetect:AI编辑的词级定位与量化
MixDetect实现AI编辑词级定位与量化,分别预测各词是否被编辑及强度,揭示编辑范围与强度模式。
论大语言模型智能体的行为特质
提出A-B-D法,从34万余条轨迹自下而上推断智能体特质,得六因子,揭示知识与行为差距。
OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准
从611例、1.9万轮真实肿瘤委员会讨论构建基准,评测14个大模型,最佳仅3.43/5,微调可提升。
ARSM:面向智能体推理压缩的自回归状态机
ARSM是免训练自回归状态机框架,借HAR微链与动态状态机压缩推理历史,保性能并降token消耗。
从知到弃答:弥合视觉语言模型中的表征—行动鸿沟
提出VAD-R基准与Rep2Act,将视觉语言模型潜在可答性转为弃答决策,显著提升拒答性能。