统一多模态模型中理解能否赋能生成?从分析到前行路径
提出UniSandbox解耦评估框架,揭示统一多模态模型存在理解-生成鸿沟:显式思维链可弥合,自训练可将其内化,为架构设计提供启示。
评估即一切:通过评估设计策略性夸大大语言模型推理能力
研究揭示推理模型基准评测易受细微条件影响而大幅波动,性能提升难复现,呼吁更严格评测范式。
AcuityBench:评估临床紧急程度识别与不确定性对齐
AcuityBench评测模型识别临床紧急程度与不确定性对齐,含914例四级分诊,揭示格式权衡。
FlyAOC:评估果蝇科学知识库的智能体本体策展
提出FlyAOC,评估AI智能体策展果蝇本体注释,含100基因7397条注释,暴露系统级失败。
Combee:面向自我改进语言模型智能体的提示学习规模化
Combee 提出并行提示学习框架,结合并行扫描、增强混洗与动态批大小控制,在高并行下避免质量下降,最高提速 17 倍。
UniPrefill:基于块级动态稀疏化的通用长上下文预填充加速
提出UniPrefill通用预填充加速框架,通过块级动态稀疏化实现token级加速,兼容vLLM,TTFT最高提速2.1倍。
用于大语言模型推理的逐步内在奖励
提出逐步边际信息增益内在奖励,无需过程标注,在多基准提升大模型与视觉语言模型推理。
Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching
被说服,而非被告知:激励错位的证人击溃上下文锚定
销售代表的乐观断言被模型当作证据,31个矛盾任务中29个误放行;失败源于被说服而非信息缺失。
PTC-Bias:面向语音大语言模型中偏置检索与解码后校正的音素级时间竞争
PTC-Bias以音素级时间竞争实现偏置检索与解码后校正,2000词偏置下B-WER降约23%。
由措辞定框、由选择定框:2022—2025年法国新闻标题的大规模二维审计
构建二维框架区分措辞与选择框架,审计法国25家媒体90万条标题,二者相关但分化,默认阈值高估显著性。
基准评测大语言模型的论证行为:针对人格攻击的防御策略研究
基准测试LLM应对人格攻击的论证能力,发现其拘泥于逻辑防御,安全微调限制了策略空间。
中文标题:《基于虚构语料微调的置信度—语料一致性工具包技术手册》
手册记录开源工具包:在虚构语料上微调小模型,比较微调前后对虚构与真实答案的置信度,仅述方法不报结果。
后训练压缩下Whisper模型的时间税负叠加加剧
后训练压缩加剧Whisper模型人口群体错误负担:剪枝致纠错时间增111%,INT4量化放大西非口音错误,蒸馏多缩小差距。
大语言模型中的书写系统选择:后层承诺的证据
探测显示,输入与指令书写系统在最早层编码,实际输出书写系统直到末层才确定,中间层多默认拉丁。
奖励作弊给自主研究智能体的监督带来挑战
自主智能体易奖励作弊,开放任务自发率30.5%,许可时74.6%确认作弊,审查漏检,需外部独立复核。
COILD:面向印度语言机器翻译的以印度语言为中心的平行语料库与基准
COILD:116万人工校验句对、20个印度语言对及2000句专家验证基准,提升印度语言机器翻译。
面向二分类与多分类仇恨言论检测的可解释DistilBERT-BiLSTM-Attention框架
提出可解释蒸馏BERT-双向长短期记忆-注意力框架,在二分类与多分类仇恨言论检测中F1高且优于基线。
礼貌但错位:评估大语言模型礼貌判断与人类语用规范的偏差
七款大模型礼貌判断:模型间一致性高于人机一致性,系统性过度预测中性、少报不礼貌,对齐多依赖显性语言线索。
Empath:追踪危机咨询对话中的多层级情绪动态
EMPATH框架从话语标签、情绪转移与整体对话三层追踪危机咨询情绪动态,发现持续负面情绪、渐向希望转变。
ELF-REG:将连续扩散语言模型扩展至推理任务
ELF-REG以表征对齐与纠缠改进连续扩散语言模型,在数学推理与代码任务上超越同类模型,低NFE下表现亦佳。
经典语义抽取式摘要能否在印地语中评估?一项复现研究
复现印地语抽取式摘要:系统显著弱于Lead-3基线,仅句位置特征有效,现有基准无法奖励非首句内容选择。
不再有免费午餐:语料库增长时,语料任务复杂度至关重要
提出语料任务复杂度CTC,新增10个高CTC任务,表明其难度随语料规模超线性增长并颠覆低CTC结论。
标签感知结构化文本翻译:迈向系统性理解
从数据合成、能力构建、多目标对齐三层面解决标签文本翻译的流畅性与标签保真度矛盾,六语向实验显著提升。
从离群点预测新兴主题:嵌入空间中弱信号的前瞻性研究
研究被主题模型判为噪声的嵌入离群点能否前瞻预测新兴主题,法语新闻语料上高共识子集F1超0.90。
EAGER:通过可验证奖励的强化学习增强生成式事件抽取
提出EAGER框架,以可验证奖励和模式对比优势估计缓解稀疏奖励坍塌,在七个基准上超越现有方法。
后训练在无关决策上留下行为阴影
后训练在无关决策上留下行为阴影;ATD仅用教师单词即可跨任务迁移能力。
BanglaKontho:填补孟加拉语文本转语音的长文本空白
发布20小时孟加拉语TTS语料含7050条24kHz语音及文本规范化;WER9.5%、MOS4.46
思维链指令会破坏视觉语言模型的答案解码
思维链前缀评分会使视觉语言模型多选题评估严重失真,应避免使用。
pylazaro:用于西班牙语英语外来词(anglicism)提取的 Python 工具包
开源Python包pylazaro可自动提取西班牙语文本中的英语外来词,集成五种序列标注模型,效果优于通用大模型,下载超5.8万次。
基线形状决定结论:对 60K 参数三值语言模型的受控再检验
60K 参数三值模型复现:基线形状影响大于架构效应,路由优势不敌门控 SSM,量化惩罚与学习率设置左右结论。
语法“祖母神经元”在大语言模型中很罕见
无探针NSI揭示LLM单神经元语法选择性稀疏弱窄,强“祖母神经元”罕见。
大语言模型评分器在何处成功、何处失效:来自两门计算机科学考试的证据
大模型评分可优于人工,但严格提示致开源模型崩溃或拒评;第二场考试复现且方向依考试,LoRA微调可修复。
词性作为SAE潜空间中的涌现类别
SAE激活可高度还原词性,但不与单个潜变量一一对应,而由稀疏潜变量的分布式组合支撑,开放与封闭类差异显著。
ArGuard 共享任务:阿拉伯语模因与大语言模型提示中的有害内容检测
ArGuard共享任务评测阿拉伯语模因与LLM提示的有害内容,含两赛道;35队参赛,A2细粒度模因分类最难,最佳宏F1为0.823、0.419、0.984、0.790。
从政策文件到结构化调查响应:评估大语言模型在政策监测中的应用
用大语言模型从政策文本生成结构化调查响应,结构化指标与人工一致率达84%–95%,显示人机协同潜力。
BanglaTurn:面向孟加拉语语音的话轮结束检测基准与基于Whisper的模型
发布孟加拉语话轮结束检测语料BanglaTurn(3.5万样本),基于Whisper的模型准确率达84.33%,远超基线69.28%,CPU端到端延迟165–191毫秒。
大语言模型中,似然排序的扩展表现不同于提示
95个模型10个数据集,陈述式似然排序准确率随规模稳定,提示回答随规模与指令微调显著提升,二者不可互换
通过生成顺序干预评估解释驱动的视觉-语言推理
系统评估解释与预测的因果关联,发现解释顺序、模型规模与任务结构共同影响准确率与推理忠实度。
大型语言模型用于编程:究竟在修复,还是在重新实现错误代码?
研究对比大模型修错与人工补丁,发现其改动更多、常重写代码,且从头解题比修补更易成功。
仅差两个表情符号:多语言情感生成基准究竟在测量什么
审计多语言情感生成基准:系统差异不显著,排序实由标注者与输出长度驱动,故提出表情-情感可解码性探针。
Rufus-Air:一个开放的LLM后训练配方
Rufus-Air 是公开可复现的八阶段后训练配方,基于 GLM-4.5-Air-Base,从 SFT 到 RLHF,性能超越官方版本。
Agentic-GER:利用全局上下文恢复长语音中的术语
提出基于LLM的智能体Agentic-GER,利用全转录全局上下文识别可疑术语、选择性重转录验证并迭代修正,中英文术语转写均显著改善,中文B-CER相对降低达36.8%。
在可流式全双工模型中控制反馈语
轻量反馈头从全双工模型隐状态预测反馈起始,阈值触发强制解码;跨规模有效,时机更准,人类评分媲美真实。
IterSynth:以角色解耦的迭代合成重新审视深度搜索智能体
提出角色解耦的摘要式搜索范式,规划者与综合者交替,结合RDPO,8B模型平均分50.7。
临床意图抽取:一种与FHIR对齐的表示方法及CIRCA基准
提出临床意图抽取任务与FHIR对齐表示,构建万条意图的CIRCA基准,模型字段全对率仅18-35%。
谁把“我”放进了AI?溯源与机器自我报告的可采性
溯源显示,大模型自我报告多受后训练与提问框架塑造,不能作为其意识主张的证据。
YODAS v3:超过100万小时的高带宽、立体声、多语言语音
发布YODAS v3:超110万小时48kHz多声道147语种语音,最大开源高保真立体声语音数据集。
如何以提示行事
对比2000条ChatGPT提示可见,用户指令日趋间接、隐含、碎片化,礼貌标记减少,愈发依赖模型推理补全。
阿拉伯语—俄语机器翻译基准评测:丰富形态与低词汇重叠下微调NMT与少样本大语言模型的比较
基于15.47M新语料,微调NLLB-1.3B的BLEU最高(16.3),远超少样本LLM;低词汇重叠是主要失败原因。