面向自动语音识别的词元级转写歧义容忍训练准则
提出词元级容错训练,将通配路径细化至词元并融合词级路径;多语言均优于CTC,WER降9.45%。
SemMSA:面向不完整数据的潜在语义辅助鲁棒多模态情感分析
提出SemMSA,用LLM构建情感语义,经跨模态语义精炼与谱对齐融合多模态,在不完整数据下达最优。
音频语言模型对听与读的区别性特征表征是否一致?
音频语言模型听读区别性特征表征多不一致;仅Qwen2.5-Omni浊音超随机基线,模型家族比规模更关键。
JevOut:自然语境即可颠覆决策模型
简短自然语境即可将决策模型的正确判断翻转为高置信度错误选择,翻转率达六至七成。
网络阴谋论的智能体检测
提出智能体框架,借助社交语境工具推断发言意图,在希伯来语推文上显著优于纯文本分类。
中文标题:查询同盟:学习检索动作
中文摘要:轨迹微调使小模型胜任检索问答的动作控制器,动作预测宏F1由0.17升至0.65,端到端精确匹配提升至0.79。
家庭不受保护区:算法治理与对话式AI中施害者话语的再生产
六款AI:四款拒答率<1%,亲密框架令漏答放大4–11倍,新会话96%以上复发,即“家庭不受保护区”。
Spooftral:Voxtral 音频-语言模型能否检测语音欺骗?
Voxtral检测语音欺骗,DoRA轻量适配提出Spooftral,ASVspoof5上EER 4.25%。
来自主动语音代理蜜罐的真实诈骗与骚扰电话对话语料库
主动语音蜜罐53天采集万通真实诈骗与骚扰通话,含895小时音频及逐轮转录,并验证真实性。
CodeGraph:基于维基数据锚定的源代码开放分类法知识图谱
用代码大模型抽取语义实体并链接维基数据,构建含1.58亿节点、10亿边的源码开放分类知识图谱。
口音类比引导:跨语言语音克隆中同等口音下更高的说话人相似度
提出免训练口音类比引导,减少参考口音泄漏,同等口音下提升说话人相似度,四个开源TTS模型有效。
将语言模型从视觉编码器中解放:语义序列化作为小语言模型的感知接口
冻结感知栈将场景序列化为文本供纯文本LLM作答,7B/3B超越同规模零样本VLM,监督下二者趋同。
在自动语音识别中从未标注测试数据学习新词
提出ASR测试时从未标注数据学新词,以KL散度优化CTC候选拼写,OOV字符错误率最多降14.97%。
奖励倾斜的在线策略蒸馏:面向音频语言模型的声学依据
提出RT-OPD:用教师有无音频的对数概率差为奖励重塑分布,做反向KL蒸馏强化声学依据。
面向通用服务机器人的基于大模型链式任务规划的设计与评估
提出LLM链式两阶段架构,提示长度减约45%,各模型规划提升最高37个百分点,实机10任务完成6项。
个性化韩语唇读作为视觉语音识别:OLKAVS 上的迁移、统计与自适应
提出个性化韩语VSR系统,在OLKAVS上量化个体误差;低秩适配器以少量视频降低高错说话人CER并跨摄像头迁移。
ExplorationBench:衡量AI系统在可验证异世界中的探索能力
发布ExplorationBench基准:以规则可执行、与常识相悖的可验证异世界沙盒,评测AI能否通过探索获取并应用全新知识。
用可渲染程序进行多模态思维
SVGLM用SVG基元连接文本与图像推理,构建SVG图像编辑数据集,使VLM能"边想边画"。
在扩散语言模型中实现近似联合采样
提出轻量采样器,使扩散语言模型单次全模型前向可近似联合采样多个词元,兼顾并行与精度,MAUVE达0.87。
PoEM:基于现有策略预测强化学习结果
提出PoEM,利用已有奖励后训练模型,免额外强化学习即可预测新奖励下的策略,并在文本图像任务验证。
OpenAI o1 评测:通用人工智能的机遇与挑战
对OpenAI o1的跨领域复杂推理评测显示其表现优异,部分超越人类,迈向AGI仍存局限。
信任还是不信任:语音中的检索增强事实核查
提出VeriSpeak语音事实核查基准,含3879条声明,揭示文本-语音模态差距,检索结合显式推理可使准确率达86.1%。
语言特定知识:模型在X语言中比英语懂得更多吗?
提出语言特定知识,发现换用非英语乃至低资源语言可提升问答表现,需为查询选择最优语言。
大语言模型基础
本书聚焦大语言模型基础,涵盖预训练、生成模型、提示、对齐、推断与推理,适合学生、从业者及感兴趣者。
基于人类反馈的会中交互式说话人纠错
提出LLM辅助会中说话人纠错,用户反馈修正归属;AMI上DER降31.99%、替换错误降52.68%
校准还不够:评估语言变化下的置信度估计
提出鲁棒性、稳定性与敏感性三维评估框架,揭示现有置信度估计难以区分语义不同答案的缺陷。
IDRBench:深度研究智能体交互能力基准测试
提出IDRBench评测深度研究智能体交互;交互平均提升对齐6.39分,但非总有效,取决于提问与反馈利用。
别贪心,三思而行:文档级信息抽取的采样与选择
提出ThinkTwice:LLM生成多候选模板并择优,优于贪心解码与监督SOTA。
通过能量驱动的潜在冲突检测对抗指令冲突
提出ELCD响应级潜在冲突检测器,用隐藏状态与排序目标识别响应漂移,多模型上显著优于基线。
LLM惊奇度是捕捉英语花园路径效应的必要而非充分条件:来自阅读范式联合潜变量建模的证据
潜过程MPT模型整合四种阅读范式,预测英语花园路径效应优于仅LLM惊奇度;融合惊奇度可再提升。
Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis
Continued Pretraining of FinBERT on Finnish Histopathological Reports: Train-Time Signals and Proxy Downstream Correlations
Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation
DiscoPhon:基于离散语音单元的无监督音素库发现基准
提出多语言基准DiscoPhon,用离散语音单元做无监督音素发现;覆盖6+6语言,用10小时新语言语音映射音素,评测识别与切分,提供HuBERT/SpidR基线。
LiveMathematicianBench:基于证明草图的研究级数学推理动态基准
动态基准源自最新arXiv论文,用证明草图干扰项评测LLM研究级数学推理,最佳仅43.5%,远未饱和
COMED:多LLM推理中路由与协作之间缺失的中间地带
揭示跨模型协作的非单调性,COMED以锚点自洽、路由边距与轻量探针选择性升级协作,在16项基准上最多提升10.7个百分点且更省算力。
当学习式上下文规划未能胜过强检索:面向长上下文问答的规划、路由与重排序对照研究
受控实验表明,学习式上下文规划经强检索、路由与重排序控制后仍不及混合检索,只是弱相关信号。
专家在LLM分歧处登场:利用跨模型分歧定位专家投入,改进大规模标注的LLM编码手册修订
以LLM跨模型分歧定位专家投入;理由标注法准确率64.9%,优于专家修订手册,将数月修订缩短至数天。
事实核查得分提升时究竟改变了什么?训练验证器与大语言模型中的证据与答案归因
联合分数提升主要来自证据改善而非答案准确率;扩大上下文可放大证据增益,聚合指标会掩盖声明级差异。
句子级解释准则分类:来自德国联邦宪法法院的基准
基于德国联邦宪法法院判决,构建句子级解释准则分类基准;四模型七项子任务平均F1为70.4–79.2。
LEGO:协同专家GraphRAG与专家思维链进行法律推理
LEGO融合法律专家GraphRAG与专家思维链,借规范关系检索和结构化推理提升大模型法律推理能力。
能识别却无法生成:面向文化特定亲属称谓的生成基准
多选高分但生成低分:五种开源LLM在印地、泰米尔、韩语亲属称谓生成中准确率骤降,需生成式评估。
伊利诺伊社会态度聚合语料库(ISAAC):用于大规模分析社会群体话语的开放工具与可复现流程
推出ISAAC:5.27亿条Reddit帖子,覆盖六类社会群体,支持标注、验证与可复现分析。
EduBehaviors:面向教育对话可审计编码的基于断言模式
提出EduBehaviors框架,用大模型测量可观察行为并训练分类器,实现可解释、可扩展、可审计的教育对话标注,在TalkMoves上具竞争力,并开源工具。
LexLattice:通过文档层级上的神经细胞自动机实现多语言抽取式摘要
将法律文档层级映射为二维语义晶格,用神经细胞自动机整合证据,实现多语言抽取式摘要,24语种SOTA。
NADI 2026:第二届多方言阿拉伯语语音处理共享任务
NADI 2026设五项八子任务,覆盖ASR、方言识别、TTS、翻译与理解;域外泛化仍是瓶颈。
数证据,而非数句子:面向长文本价值测量的LLM判断退火证据融合
提出免训练TEF,按信息增益加权句子证据、抑制不确定句,在MIND基准上平均提升4.5个准确率点。
UniDataAgent:面向企业问报到报告自动化的本体驱动智能体
本体驱动的企业问报到报告智能体,语义构建与执行分离,构建周期由一周缩至数小时,严格准确率95.0%,远超文档RAG的72.5%。
把信用归于应得之处:面向高效推理的冗余感知学习
提出RECAP,以结构责任和步骤效能做冗余感知信用分配,重塑GRPO优势,提升推理准确率并减少冗余。
洞悉关键:面向大规模推理的原则性上下文表示
基于关联实现原则提出R3Con,构建大规模上下文表示,显著超越基线,小模型亦可媲美大模型且成本更低。