全语言SONAR:跨语言跨模态句子嵌入,桥接海量多语言文本与语音
提出OmniSONAR模型,支持数千语言与多模态,渐进训练实现SOTA,翻译和检索误差大幅降低。
基于音频和IMU的主动式程序性任务对话助手
首次提出用音频和IMU实现实时对话助手,指导程序任务,微调后回答召回率提升150%,精度提升50%。
OpenLID-v3:提高近亲语言识别精度的经验报告
通过增加数据、合并变体、引入噪声标签改进近亲语言识别,但集成方法降低低资源语言覆盖度。
TSAssistant:一种用于自动化靶点安全性评估的人机协同智能体框架
TSAssistant多智能体框架实现自动化靶点安全性评估,通过人机协同和子代理分解,提升可重复性与准确性。
S2D2:免训练自推测加速扩散大模型解码
提出S2D2,利用块扩散模型变自回归特性,混合并行解码与自回归验证,无需额外训练,显著提升速度与准确率。
质量优先于点击:面向早期电商查询建议的迭代强化学习
提出质量优先迭代强化学习框架QualEQS,定义可回答性、事实性和信息增益三维度,无点击监督优化,离线指标与在线性能强相关,提升ChatPV 6.81%。
韩语口语问答中ASR-LLM级联的错误传播分析
韩语ASR单字符错误会改变问题意图,导致下游QA性能下降;直接音频模型比级联更抗噪声。
词嵌入迁移学习的组稀疏矩阵分解
提出组稀疏矩阵分解法,利用大规模语料和少量领域文本高效迁移词嵌入,理论证明局部最优等价全局最优。
SIGMA:面向智能体数学推理的搜索增强按需知识集成
SIGMA多智能体按需知识集成框架,通过独立推理与靶向搜索综合,在数学推理基准上性能提升7.4%。
IdealGPT:通过大型语言模型迭代分解视觉与语言推理
IdealGPT迭代分解视觉语言推理,利用LLM生成子问题并推理,零样本下VCR提升10%,SNLI-VE提升15%。
大型语言模型中的在线策略蒸馏综述
在线策略蒸馏通过教师反馈学生实际输出,将暴露偏差从二次降为线性,使蒸馏成为迭代修正过程。
CogniFold:通过认知折叠实现始终在线的主动记忆
CogniFold受大脑启发,将事件流自组织为认知结构,实现主动记忆,在多个基准上表现优异。
EndoCoT:扩展扩散模型中的内生链式思维推理
提出EndoCoT框架,通过迭代思想引导与终端接地激活MLLM推理,使DiT逐步执行复杂任务,平均准确率92.1%,超越基线8.3%。
Vero:面向通用视觉推理的开放强化学习方案
Vero提出开放RL方案,构建600K数据集,在30项基准上平均提升2.9-5.4分,开源模型超越同类。
NIM4-ASR:迈向高效、鲁棒且可定制的基于LLM的实时ASR
提出NIM4-ASR框架,2.3B参数实现SOTA,支持百万级热词定制,解决效率与鲁棒性问题。
词句背后的声音:量化语音大语言模型中的交叉偏见
通过2880次交互评估三种语音LLM的交叉偏见,发现东欧口音女性声音帮助性评分较低,人类比LLM更敏感。
可能还是确定?评估临床文本中诊断不确定性保留的基准
LLM保留诊断不确定性不足50%,且难以区分相邻级别,揭示标准评估未捕捉的失败模式。
编辑还是保留?教育对话去标识化的全本地AI级联框架
提出全本地AI级联框架,将去标识化重构为隐私分类,达0.958 F1,优于LLM和商用API,证明问题设计比模型规模更关键。
面向大型音频语言模型的连续音频思考
CoAT通过连续潜空间和专家蒸馏,使模型在生成前保留声学信息,提升多任务性能且无需额外解码成本。
想要更好的合成数据?引导它:面向低资源语言生成的激活引导
提出激活引导方法用于低资源语言数据生成,早期层引导提升多样性与下游性能。
SproutRAG:面向长文档检索增强生成的注意力引导树搜索与渐进式嵌入
SproutRAG通过注意力引导构建二叉树实现多粒度检索,无需额外LLM调用,平均提升信息效率6.1%。
JetFlow:用并行树草稿打破推测解码的规模上限
JetFlow通过因果并行草稿头突破推测解码规模瓶颈,实现最高9.64倍加速。
CoreMem:基于黎曼检索和费希尔引导蒸馏的对话智能体长期记忆
CoreMem采用黎曼检索和费希尔蒸馏,在8GB VRAM下提升对话长期记忆,开放域与时间推理准确率显著提高。
VISUALSKILL:面向计算机使用代理的多模态技能
VISUALSKILL多模态技能库,含文本与图像,帮助代理识别UI并验证状态,在基准测试中比无技能基线提升15.3个绝对分。
跨语言的数学LLM参数:共享还是分离?
数学推理参数跨语言部分重叠,中间层最强;英语多、低资源少,非完全共享或分离。
蒙特利尔强制对齐器与2026年语音到文本对齐的现状
MFA 3.0在多语言基准上达先进水平,平均边界误差<15ms,适配和跨语言映射有效。
PreUnlearn:大语言模型遗忘前的附带知识损伤审计
研究LLM遗忘的附带损伤传播模式,发现损伤随语义距离衰减但不消失,并基于数据特征实现预遗忘审计。
中文标题:面向企业应用的多智能体系统可扩展定制与部署
中文摘要:提出多智能体系统定制与部署框架,通过模型定制和推理优化实现4.48倍吞吐量加速。
PragReST:面向语用语言理解的自增强反事实推理
提出自监督框架PragReST,通过反事实推理构建训练数据,提升大模型语用推理,在四个基准上准确率提升超5%。
MCompassRAG:主题元数据作为段落级检索的语义指南针
MCompassRAG用主题元数据作为语义指南针,通过LLM蒸馏训练轻量检索器,平均信息效率提升8.24%,延迟降低5倍以上。
基于迁移学习和数据增强的低资源中文方言辨别
提出CDDTLDA框架,利用迁移学习与速度、音调、噪声增强,结合自注意力捕获语义特征,提升低资源方言辨别性能,优于现有方法。
语音驱动的端到端中文方言鉴别
提出语音驱动的端到端中文方言鉴别方法,利用HMM-DNN和注意力机制,在基准语料上表现优异。
可引导的文化偏好优化奖励模型
提出SCPO算法,平衡多样文化偏好,提升少数群体模型性能达7%,数据效率提升280%,有效减轻偏差。
LLMs 是否已准备好协助医生?面向医患-电子病历交互式辅助的 PhysAssistBench 基准
提出PhysAssistBench基准,评估LLM在交互式医患-EHR场景中的辅助能力,发现现有模型因缺乏多维度协调而不可靠。
局部与全局注意力的双重维度
提出距离自适应表示(DAR):局部全维、远程降维,效果接近全维基线,均匀降维则差。挑战K/V维度统一假设,为自适应分配表示容量提供新方向。
BCL:面向信息抽取的贝叶斯上下文学习框架
提出BCL框架,用粒子滤波和贝叶斯更新优化标签表示,显著提升信息抽取性能。
错误的正确:量化和定位大语言模型中的误触发对齐
安全对齐使LLM拒绝证据支持的结论,新指标MAR显示所有模型均有误触发(4.7-18.9%),人类为0%。
大语言模型难以衡量区分不同水平学生的指标:阅读理解评估中题目区分度研究
LLM难准确评估题目区分度,直接预测与人类校准弱相关(最高0.152),响应校准稍好(0.241),仍为开放挑战。
修订基准
RedactionBench是含200文档11领域的人工标注基准,引入R-Score,揭示上下文PII修订仍未解决且具主观性。
PEC-Home:智能家居中渐进式省略命令的解析
现有家居助手难以准确解析渐进省略命令,存在引用和意图歧义,执行准确率低于完整命令。
LegalWorld:面向法律代理人的全生命周期交互环境
LegalWorld基于7.5万判决构建五阶段民事诉讼全生命周期环境,解决跨阶段依赖,揭示模型能力差异。
RegMix-D:基于代理训练轨迹的动态数据混合
RegMix-D利用代理训练的损失轨迹动态调整数据混合,在节省计算资源的同时提升下游任务表现。
Morpheus:面向土耳其语的形态感知神经分词器与词嵌入器
Morpheus实现可逆无损分词,形态对齐F1达0.61,GPU内存节省19%,词汇检索和同根验证性能领先。
大语言模型中缓解记忆化的输出向量编辑
提出输出向量编辑抑制记忆化,7B模型达87.9%抑制率,覆盖96.5%序列,注意力头可辅助恢复。
TW-LegalBench:评估台湾法律理解能力
TW-LegalBench评估LLM在台湾法律上的表现,发现模型通过律师考试但未达法官检察官标准,且法律条文引用困难。
迷失在单一向量中:利用片段证据聚合改进长文档检索
DICE方法通过分割文档片段、独立编码再聚合,解决长文档检索中关键证据被稀释问题,显著提升性能。
使用上下文限制的半硬负样本挖掘对齐隐含语句以提升隐晦仇恨言论的泛化能力
提出ImpSH框架,通过对齐隐含语句和上下文限制的半硬负样本挖掘,提升隐晦仇恨言论的跨域泛化能力。
超越单一分数:探索基于大语言模型的放射学报告临床意义评估指标
LLM评估存在判别偏差,训练轻量指标可优化临床意义边界,单次推理更实用。
ScholarSum:基于知识图谱推理与反思优化的师生式生成式摘要
提出ScholarSum框架,通过知识图谱组织与师生迭代精炼,生成流畅且事实一致的学术摘要。
序列标注的近似结构化扩散
利用扩散训练条件于含噪标签序列的CRF,结合近似推理,使词性标注错误率降低16.5%。