Myovox:从面部肌肉读取语音
Myovox 用面部肌电解码英语语音,词错率从51.17%降至18.53%,瓶颈为肌电音素错误率。
2026年英语词义消歧:当标注成为瓶颈
WSD瓶颈转向标注:LLM准确率近95%,发布lexEN基准,重标注提升模型,成本成约束。
信心源于经验:从推理到智能体的经验性置信度估计
XConf借助模型自身过往经验记录估计置信度,无需logit或权重更新,多项基准上超越自洽采样。
BPE 分词在波兰语中的局限:分割-屈折形式、语法锚定与屈折语语言模型中的第一人称稳定性
分析波兰语 BPE 分词局限:其稳定高频语法标记片段而非语法范畴,并涉及语法锚定与第一人称稳定。
使政治文本标度具有可比性:17种算法的基础设施与超参数敏感性
17种文本理想点估计视为可配置流程;超参数影响有限,关键敏感点为语言/嵌入模型、种子关键词和主题数。
路加是福音书与《使徒行传》的作者吗?
定量分析支持路加为《路加福音》与《使徒行传》的共同作者。
美国政治口语的演变
1960—2024年19位美总统候选人辩论显示:政治语言趋简化、句短词少,情绪化升、逻辑理性降。
一种测量推理优化如何影响输出质量的校准工具
用校准LLM评委测输出质量,可跨系统比较优化;损失随语言、任务和模型而异,置信度难辨有效错误。
AfriSyCo:测量非洲语言内容中的断言式框架、验证与措辞敏感性
非洲语言事实内容中,断言式框架增加错误目标选择,验证降低;措辞和模型差异大,提示实现影响测量。
PrimeScientist:自主研究中研究投入的战略性分配
PrimeScientist联合决策研究方向与资源投入,用自适应MCTS分配精力,提升研究质量与效率。
面向工具调用智能体的监督微调还是强化学习?一项跨数据、方法与规模的受控研究
在Qwen3 0.6B–32B上对比LoRA SFT、GRPO与SFT→GRPO:SFT分布内最佳,GRPO跨集略优但不足1分,数据混合迁移强,LoRA优于全参微调。
谁担任评委很重要:测量 LLM 评审团中的家族条件偏好
四家族模型交叉评判显示同族偏好显著(3.4–8.4个百分点),位置效应致55.4%配对反转。
TACTICS:面向机器翻译的分类体系感知智能语料采样
以覆盖度为显式目标,依风格指南建分层分类,固定预算内优化稀有类别覆盖与文档连贯,用更少样本还原真实排名
校准内容如何影响基于注意力的重排序
空查询校准易受提示指令污染;提出免训练插值空校准,恢复并超越生成式重排序;示例仅经查询通道,少干扰。
建模终结性习得中的发展转变
以GPT2惊讶度差标注CHILDES终结性;儿童依赖动词后限定词,成人依赖动词语义,支持句法启动假说。
DualSQL:基于多智能体强化学习的文本转SQL
DualSQL让双智能体共享单一模型权重与工具,用多智能体强化学习联合优化,4B在BIRD达68.0%。
凝视作为共同基础建立的证据:MapTask与MUNDEX的跨语料库分析
两项协作任务语料显示,任务导向凝视更多、凝视熵更低与共同基础对齐相关,但效应微弱,仅为辅助线索。
TeochewBench:经人工审核的潮州话汉字翻译基准
提出经人工审核的潮州话汉字翻译基准,含300条表达并评测13个模型;高特异性表达得分明显偏低。
人工编码还是AI编码:课堂观察中AI评分的比较评估
研究比较AI与人工课堂互动评分:情感支持较一致,课堂组织与教学支持差异大,AI宜作初筛而非替代人工。
从压缩向量表示中精确读出语义
给出压缩向量精确线性/仿射语义读出的充要条件;预训练嵌入多仅线性可分,监督训练能达精确仿射读出。
招聘场景下开放权重大语言模型的性别与种族偏见语言触发因素
审计六款开放权重LLM,发现招聘用语触发性别与种族偏见,并提出预部署审计协议。
Behavior2Value:面向电商行为消费者价值测量的LLM基准评测与能力增强
提出B2V任务及电商价值分类ECVT,构建首个淘宝行为基准,并设计验证模型,多标签分类提升34%。
从基列的一条河到大型语言模型的推理分布:隐蔽方言偏见与大规模语言画像
大模型住房判断中隐性贬抑AAVE与尼日利亚皮钦语,尼日利亚标准英语随社会亲近度增加由优转劣
超越准确率:程序性痕迹如何改变大语言模型监督者的决策标准
程序性痕迹使LLM监督者决策标准偏向拒绝、误报增多;评估AI审计者应兼顾准确率、决策标准与误报行为。
T-SANDHI:面向低资源台湾闽南语语音识别的变调感知自适应网络与解耦混合注入
T-SANDHI解耦变调与本调,以词典引导多任务学习与动态门控注入,冻结Whisper上低参超越基线。
匈牙利制造:生成式语言模型性能评述
匈牙利三项目生成式语言模型性能存疑:评测不可靠、数据污染、训练不佳、能力遗忘,亟需严谨实验。
M-SQE:多语言技能质量评估,促进智能体技能使用中的语言平等
提出检索后多语言技能质量评估框架M-SQE,缓解技能库英语中心,显著提升低资源语言任务成功率,促进语言平等。
好得不真实?诊断并缩小 AI 偏好与真实用户参与度之间的差距
117万条多平台回答显示,AI偏好重逻辑、真实互动重情感表达;OMRA干预使差距缩小54.4%。
回滚世界,保留反思:面向长时程LLM智能体的回滚诱导反思
提出回滚诱导反思(RIR):回滚环境状态并保留可复用经验,兼顾状态修复与知识留存,提升长时程智能体表现。
基于知识图谱的增强与检索增强生成在文化相关问答中的对比
在LatamQA文化问答基准上,图谱增强与RAG性能相当,将LLM错误降低72%–78%,并可零样本迁移至葡萄牙语。
SEA-LION-v4.8:技术报告
推出基于NVIDIA Nemotron 3的SEA-LION-v4.8系列(30B-A3B与120B-A12B),经继续预训练与后训练,SEA-HELM得分升至51.57和63.44。
注意力分散作为大语言模型幻觉的诊断信号
用无监督注意力分散指标检测幻觉,注意力熵峰值对应推理崩溃,GSM8K上AUC最高提升0.076。
依赖感知的轨迹精炼:实现高效多轮智能体微调
将轨迹视为轮级依赖DAG并精炼微调,准确率提升1.7pp,推理消息与token减少约40%/48%。
情感体验、表达与感知:多模态社交媒体帖子的情感分析
研究多模态社媒帖子情感分析,构建Mult2EMo数据集,发现情感重建可行但困难,理解触发事件是关键。
规划还是即兴?在开放模型与开放跨层转码器上对诗歌规划位点进行压力测试
在开放模型上压力测试押韵规划:因果位点位于输出邻近处而非换行符,未复现换行规划机制。
理性的声音:面向口语数学的强化学习
将强化学习应用于GLM-4-Voice语音模型,显著提升数学推理准确率,结合流式推理达74.8%,创语音原生模型新纪录。
PACT:企业级 AI 助手在压力之下还值得信任吗?
PACT基准测评企业AI助手在多重压力下的规则遵从性:22个模型会违规,施压使违规率平均升65%。
探针偏移并非公平性修复:语音模型中表征引导的局限
语音模型可线性解码说话人属性,但据此引导表征未必能缩小WER差距,甚至更差;公平干预需多层联合评估
DyMT-ESB:用户与大语言模型交互中社会偏见的动态多轮评估
提出响应驱动的动态多轮评估协议,发现大模型交互中偏见延迟出现、非单调波动并可再度浮现。
谬误基准评测的是论证图式识别,而非谬误检测
谬误基准的低假阳性率源于类别构造假象;模型识别的是论证图式而非谬误,须审计有效类的图式匹配覆盖。
突破边界:面向渐进式大语言模型演化的统一自学习框架
提出STRETCH框架,动态对齐难度,双角色协同进化,稳定训练并提升推理。
大小很重要:面向捷克语 HTML 文档的基础模型
154M参数HTML感知基础模型,基于1亿捷克网页多目标训练,性能超越更大模型并已投产。
选择靠检索,弃权则不然:面向70个韩英双语动作的端侧工具路由
在600个韩英请求、70个本地动作上,检索擅选工具但不擅弃权;弃权需神经编码器,端侧受延迟内存约束。
对齐、整合与发放:面向零样本语音大语言模型的高效词元级对齐
提出对齐连续整合发放框架,动态压缩声学帧至文本词元长度,无需LLM前向,单层蒸馏,零样本语音任务领先。
基于统计机器学习的英语与叙利亚语(东叙利亚方言)机器翻译
首个英-叙(东叙利亚方言)统计机器翻译模型,基于圣经语料,最佳BLEU 23.54,数据模型公开。
超越词频度量:上下文嵌入能否捕捉科学文本中的语义变化?
比较词频与上下文嵌入追踪科学文本语义变迁,二者互补,嵌入可发现词频遗漏的概念演进。
面向密集健康叙事的结构化主张级话语表示
提出主张级结构化话语表示框架,构建四领域1191条标注基准;大模型擅主题与立场,高维语用刻画仍难。
EviGen:面向可验证临床推理依据生成的预测性证据脚手架
EviGen 以预测归因检索证据为脚手架,助大模型生成临床推理并逐步验证,提升预测性能与忠实性。
PersonaPath:面向以知识为中心的个性化学习路径规划
提出PersonaPath基准,含2000学习者画像与347本教材知识图谱;评测显示大模型个性化路径规划适应性不足。
在不断变化的领域中追踪个体知识轨迹:以广义相对论与引力为例
通过比较研究者著述与领域文献,追踪广义相对论与引力五十位作者,发现语言、语义与引用轨迹分化。