自监督语音表征追踪听障婴幼儿及儿童口语向成人模式的趋同
用自监督嵌入分析日常录音,显示听障婴幼儿语音随听龄向成人趋同,并关联标准语言测试。
高效Transformer中的稀疏Token路由
高效变换器中的稀疏令牌路由:路由几乎不影响精度,门控重要性取决于学习方式,上下文门控显著优于静态先验。
当失败传播时:智能体检索增强生成中的因果失败归因
提出智能体RAG故障归因基准:事后诊断在深层失效,首跳覆盖率零点九一,后续零;深度二反事实探针零点六七优于覆盖率零。
AsmEvo:基于功能等价性验证的AMD GPU内核智能汇编级优化
针对无源码的AMD GPU二进制内核,AsmEvo通过汇编级智能优化与等价验证,实现最高3.88倍加速,并保持功能一致。
MIL-BERT:任意大规模文本分类及其性能与可解释性保证
基于多实例学习选取文本片段分类,可处理近百万token,在3个数据集上达到最优,且弱标注训练可泛化至小实例。
PSK参加WMT 2026 MIST:面向多语言摘要和问答的任务专用QLoRA适配器
用3.35B模型加三个QLoRA适配器分别处理摘要、段落问答和开放问答,上下文与摘要适配器优于多任务,提交三个系统。
依存关系的方向性上下文表示:为何跨方向配对会失败
BiLSTM同向配对优于跨方向配对,惩罚随距离增大;冻结实验证明非共适应,源于位置编码弱且前瞻有限。
KREL:利用大语言模型对临床证据进行知识引导推理的自动医疗编码
提出KREL框架,融合ICD指南知识与LLM推理,提升医疗编码性能,减少幻觉。
去噪未来:面向时序知识图谱外推的上下文感知光谱扩散
提出频率感知扩散框架,以上下文感知光谱校准增强时序知识图谱外推,性能最优。
关注树:分层多智能体辩论用于科学评审中的未言明局限提取
提出关注树框架:多智能体辩论与小组复审提取论文未言明局限,精确率升79%,覆盖率升11%。
本体驱动的结构正则化用于文档级关系抽取
提出本体驱动框架,强制结构一致性,减少逻辑矛盾,提升文档级关系抽取泛化性能。
SAC-Copula:基于平滑相关Gumbel场的扩散语言模型质量保持水印
SAC-Copula:高斯copula构造平滑相关Gumbel场,改善质量-可检测性及PPL尾部稳定。
STAR-OPD:用于ABSA四元组抽取的结构化方面级联感知在策略奖励蒸馏
STAR-OPD以在线策略奖励蒸馏,用级联集合奖励修正ABSA四元组结构错误,减少幻觉,缩小师生差距
PromptResponse:优化LLM编码任务的提示词
研究表明,一致格式(如JSON)提升LLM编码效率与稳定性,LLM调优提示反而降低性能。
ForeDreamer:用于未来事件预测的自进化双智能体记忆架构
ForeDreamer自进化双智能体框架,将网络证据转为结构化记忆,分离事实与经验记忆,双轨进化提升预测性能。
不依赖源文的机器翻译评估并非真正的机器翻译评估
机器翻译评估应以源文为准,参考仅作辅助;无源或参考主导的评估有缺陷,QE应作为主要评估方法。
量化感知修复:恢复压缩4位LLM的实用配方
提出量化感知修复,从原始模型蒸馏4位学生模型,比QAT快7倍且稳定,内存减4倍,性能多数基准持平或更优。
采用SAraBERT与语义孪生相似度评估指标的阿拉伯文档抽取式摘要
提出SAraBERT,改进AraBERT用于抽取式摘要,并提出语义孪生相似度指标,验证有效。
目标感知的校准数据选择:保持量化语言模型中的不确定性
提出DPQ方法,依据全精度预测选校准数据,按部署目标保持量化模型的不确定性,不同目标需不同配比。
MentorPulse:用于长文本生成的跨模型潜在引导刷新
跨模型潜在引导在长文本中失效;本方法通过增量刷新槽记忆,以低代价恢复性能并缩小52.2%师生差距。
场景级分布偏移下基于证据一致的生成式检测
提出ECoG,结合证据监督与理由-标签一致性,提升短信/语音钓鱼场景级分布外检测鲁棒性。
基于LLM-as-Judge的5G领域知识与故障分析自由文本评估
LLM裁判评测轻量模型5G自由文本故障:诊断>90%,规范召回<60%,裁判一致,Gemini最优。
通过结构约束将无监督词对齐扩展到文档级
CTFAlign与MDPAlign利用结构约束实现无监督文档级词对齐,无需训练,错误率降低。
步步为营:测量与引导大语言模型如何进行心理治疗
提出十类治疗动作本体,发现模型过度提问、忽视心理教育,将其作为工具提示可使行为逼近人类治疗师。
笑谈之外:测量双重含义的语义距离
用词向量重探双关笑话度量,新增对称性指标;虽预测准确率低于基线,但该指标与高评分笑话相关。
RARE:解耦混合专家语言模型中的表示引导与专家路由
提出RARE框架,将表示扰动投影至路由器零空间,解耦路由与引导,提升MoE安全、真实性与事实编辑能力。
当特征池变得算法化:将Mufwene的语言演化生态学扩展到LLM中介暴露
将语言演化生态学扩展至LLM:模型算法性重加权说话者可及分布,但社会评价仍决定AI相关语言变体的传播。
EnSI-RAG:面向长文档问答的实体结构索引检索增强生成
提出EnSI-RAG,以实体为中心构建索引,分离证据定位与答案生成,在Loong和Oolong上平均准确率78.24,较基线提升6.62分。
无意双关:用于以人为中心的大语言模型评估的合理未知姓名
提出PUN协议:构造无索引证据的合理未知姓名用于LLM评估,人类验证仅3%可恢复,发布300个名字。
情感语境放大LLM回应中的谄媚行为
情感语境(尤其孤独、痛苦)会放大LLM谄媚倾向,使其回避负面评价,抑制关键反馈。
记忆增强解锁高效思维链推理
提出记忆增强压缩框架,用历史推理记忆补偿压缩损失,提升准确率并加速,优于现有方法。
针对发明人式交底书的专利撰写基准测评
构建交底书到专利的数据集及多智能体框架,揭示现有模型撰写专利能力不足,新框架优于开源并媲美闭源模型。
提示-模型交互抵达不动点:一种确定性、无任务的结构读出——及其失败的分解
提示效果不在提示本身;无任务固定点读出上,提示-模型交互全幅呈现,且无法分解。
通过注意力头干预实现大语言模型中的个性化隐私控制
提出个性化隐私概念与P3Bench基准,发现提示策略失效,提出注意力头干预法Repair,提升隐私遵循。
语音到SFT流水线的析因消融:数据质量与下游迁移的差异性效应
对语音转SFT流水线做2×2析因消融:提升QA数据质量未显著提升下游MCQA,正迁移仅见于领域对齐,LLM评分与人工评估方向一致。
ProofJudge:基于工具 grounding 的 LLM 形式化证明质量评估
引入ProofJudge,用工具访问库状态,从五维度评估Lean 4证明质量,偏好对齐达80.8%,开放权重模型性价比高。
为要点画像:面向LLM推荐器的基于大规模元数据的上下文感知物品画像
提出上下文感知的物品画像框架CAIRO,从大规模元数据中提取关键信息,显著提升LLM重排序效果。
勿以表象评代码:探究LLM裁判在代码评估中的偏见
首次揭示LLM评估代码的六种偏见:多语言多模型下均致分数虚高或偏低,即使生成测试用例仍受影响。
可信RAG:检测生成式AI系统中错误信息与知识投毒的评估智能体
提出评估智能体,融合自然语言推理与毒化检测,信任指数高精度识别指令注入,但难检测实体交换等隐蔽编辑。
TurboBias 2.0:面向生产高效ASR系统的流式上下文偏置
提出TurboBias 2.0:逐流独立上下文偏置,支持批量解码与流式/离线推理,提升短语识别且低延迟高吞吐。
以机制可解释性阐明内在道德自我纠正
内在道德自我纠正通过提示引导隐藏表征沿可解释潜在方向移动;表征操控是其机制核心,且激活相加比提示更有效。
大型语言模型内部表示中提示的内在维度
提示内在维度关联不确定性,早中层峰值,扰动升高;探针区分恶意/良性,准确率90-95%,优于护栏。
超越金标准:面向形式数学推理的LLM评判者认知集成
提出基于认知与形式基础的LLM评判集成,从逻辑保持、数学一致性、形式质量与有效性多维评估自动形式化,优于粗粒度方法。
SKILL-RAG:自知识驱动的学习与过滤机制,用于检索增强生成
提出SKILL-RAG,利用模型自知识经强化学习训练,按句子粒度过滤无关检索,提升生成质量并减少输入。
CulTrace:追踪大语言模型内部文化推理机制
提出可解释性方法CulTrace,发现模型文化推理呈“领域→文化→答案”三阶段,且对少数文化存在推理延迟与混淆。
基于序列再生成的扩散语言模型高效自评估
提出新方法,通过再生成概率量化扩散语言模型置信度,实现高效评估与不确定性量化,支持灵活长度生成。
GeoExplain:基于街景视觉信息层次的多模态推理
提出GeoExplain与SightSense,用于街景可解释地理定位及多模态推理。
眼见为实:话语结构引导的上下文学习实现忠实图表生成
提出基于修辞结构理论的上下文学习图表生成法,提升图表与原文一致性,并通过专家评估验证有效性。
SCOPE:一种用于LLM提示压缩的生成式方法
提出SCOPE免训练生成式框架,基于分块重写压缩提示,保留关键信息与连贯性,问答摘要任务上优于基线。
幻灯片生成基准:基于计算与定量指标的评估
提出幻灯片生成基准,基于通用、量化、可靠原则,用计算指标评估内容、美学与可编辑性,与人类偏好一致。