The Impact of Editorial Intervention on Detecting Native Language Traces
无需对齐数据的同步语音翻译
Hibiki-Zero模型无需词级对齐,基于句子级训练与GRPO强化学习优化延迟,实现同步语音翻译的SOTA性能。
设计性缺失:面向可撤销多模态情感分析的可证明模态删除
提出MBD框架,实现可撤销多模态情感分析,能在模态删除时保持性能并提供隐私-效用权衡。
内部知识无外显表达:探究古典中文语言模型的泛化边界
纯文言文模型内部能区分真假事件,但从不表达不确定性,元认知需额外训练。
EssayCBM:基于评分标准的概念瓶颈模型实现透明作文评分
EssayCBM将作文评分分解为8个可解释概念,实现透明可编辑的评分,性能匹配神经基线。
K12-KGraph:面向教育大语言模型评估与训练的课程对齐知识图谱
提出课程对齐知识图谱K12-KGraph及基准K12-Bench与训练集K12-Train,实验证明领域监督可提升模型性能。
基于量规的大语言模型评估中的自我偏好偏差
首证基于量规评估中的自我偏好偏差:客观标准下错误率超50%,主观场景偏差达10分,影响模型排名。
AugAbEx: 桥接抽象式与抽取式法律摘要生成
提出AugAbEx流水线,通过增强数据集引入银标准抽取摘要,提升法律摘要质量,在七个数据集上超越现有方法。
抽象促使语言模型和语音模型与大脑对齐
模型与大脑对齐源于共享意义抽象,中间层内蕴维度峰值预测脑信号,体现语义丰富性。
STEMTOX:从协作标签到细粒度有毒模因检测的熵引导多任务学习
提出TOXICTAGS数据集和STEMTOX框架,利用协作标签增强多模态毒性模因检测,显著提升性能。
SHOVIR: 评估放射学报告生成中视觉捷径学习的基准
SHOVIR基准通过局部遮挡实验检测视觉捷径,揭示高报告质量模型可能依赖浅层视觉证据。
流内智能体系统优化以实现有效规划与工具使用
提出AgentFlow框架与Flow-GRPO算法,通过流内优化协调四模块,显著提升规划与工具使用性能,超越GPT-4o。
大型语言模型文化偏见与对齐的提示编程
本文用DSPy提示编程优化文化对齐,减少LLM偏见,实现更稳定迁移。
情感对撞机:基于反情感反射的双曲镜像流形用于情感恢复
EC-Net双曲超图框架通过对比学习与超图融合,在模态缺失或噪声下显著提升情感识别准确率。
虚假共振:对语音生成评估中情感嵌入相似性的批判审视
批判语音生成评估中情感嵌入相似性指标,指出其受语言和说话者干扰,与人类感知错位。
基于LoRA微调的大语言模型通过多视角语音特征检测痴呆症
提出LoRA微调LLM,融合转录、主题、流畅度、音韵四种语音特征多视角推理,ADReSSo上F1达90.14%,各视角互补。
自我教学的分类器:用于动态文档分类的自我改进冻结门训练(SIFT)
SIFT通过廉价模型与LLM法官的自我教学循环,实现低成本高精度动态分类,并设安全门控防退化。
解码脑电信号以探究人脑中单词预测性
用EEG解码发现,词预测性对N400影响因词类而异:内容词强于功能词,动词强于名词,但名词预测信息更独特,解码技术优于传统分析。
构建欧洲多语言评估数据集:EMT网络内的MMLU本地化项目
DGT与EMT合作本地化MMLU至11种欧洲语言,为学生提供真实项目培训,突出方法论与工作流挑战。
Search-on-Graph-R1:使用强化学习训练大语言模型搜索知识图谱
通过监督微调和强化学习将知识图谱导航内化至8B小模型,无需昂贵推理,在多个数据集上超越前沿大模型,搜索效率更高。
面向大语言模型的卷积
深度卷积作为自注意力的轻量补充,在QKV前应用,提升下游性能且参数微增。
具有意义与表达替代灵活生成的语用推理计算模型
SAGE框架融合认知模型与语言模型,在语用任务中表现优异,但语言模型评估者可靠性不及生成者。
Relay-Bench:评估LLM的多领域推理链基准
Relay-Bench测量LLM跨多领域完成复合任务的能力,当前最优模型GPT-5.5得分43.3%。
使用微调大语言模型识别英国警方事件日志中的脆弱性指标
研究显示LLM可识别英国警方日志中的脆弱性指标,但直接输出不可靠,需人工校正与统计调整。
结构化输出导致44种语言模型的答案多样性下降
要求JSON格式回复时,模型答案趋同,模态答案占比从41%升至64%,多样性降低,机制在于寄存器而非解码器。
PathReportEval:病理报告生成的系统性基准
提出标准化基准和临床报告质量评分(CRQS),从临床事实覆盖、召回、幻觉率等维度评估病理报告生成,揭示临床正确性。
推理微调引发持久潜在策略状态
推理微调使模型产生持久潜在策略状态,具备功能特化与时间组织,可通过干预和剪枝提升性能。
RF-Agent:用于RFIC设计的语言Agent构建实用框架
RF-Agent通过教科书蒸馏构建RF推理数据集与基准,验证领域微调与语义检索可提升电路设计推理。
LatentMT:基于隐式推理的机器翻译
LatentMT利用隐式推理循环计算,使2.6B小模型在32个翻译方向上达到3-5倍大模型性能,中低资源语言SOTA,且计算更高效。
故事塑造智能体:LLM行为中的叙事先验
叙事框架比人物设定更能影响LLM行为,叙事先验解释方差能力数倍于人物,且大多与任务成功负相关。
缘何?解释模型对因果关系与对立关系的编码
通过可解释性分析,发现指令调优Transformer模型在编码因果关系与对立关系时,早期层与中层决策时机不同,且存在不对称偏好。
跨语言立场检测的推理引导知识蒸馏
用思维链引导大模型生成推理,蒸馏至小模型,双路径对齐表示与分布,对比学习增强判别,提升跨语言立场检测性能。
随机元遗忘:桥接语言主干与多模态遗忘
随机元遗忘(SMU)利用VLM级反馈学习遗忘初始化,实现最佳遗忘-保持权衡及可迁移性。
融合嵌入:文本、图像、视频和音频的统一嵌入空间
提出Fusion Embedding,在冻结视觉语言基础上添加音频模块,实现四模态统一嵌入,无需配对数据,单GPU训练数小时。
双注意力残差
提出双注意力残差,通过双向跨流交互改进历史检索,提升Transformer验证损失,保持深度多样性。
先诊断后微调:面向网络安全问答的小型LLM诊断研究
提出FiT框架,发现微调损害小型LLM的词汇与参数知识,指令微调更甚,诊断可预判微调效果。
AILQA:面向印度法律体系的AI法律问答系统评估
提出AILQA系统,利用检索增强生成提升印度法律问答质量,在律师资格考试中表现优异,但需应对模型幻觉挑战。
已知事实中的推理错误:面向大语言模型的步骤级自一致性组相对策略优化
提出SSC-GRPO,通过步骤级自一致性分数奖励,有效缓解LLM推理中的上下文敏感事实幻觉,实现SOTA性能。
HPD-Parsing:分层并行文档解析
提出分层并行解码,布局全局分析、内容并行解析,速度提升2.6倍以上,精度相当,开辟高效文档解析新方向。
从多语言流式ASR骨干到肯尼亚语言系统:以数据为中心的Nemotron 3.5适配基库尤语、多洛语和卡伦金语
本研究将Nemotron 3.5适配三种肯尼亚语言,通过数据审计与流式微调,Kikuyu和Dholuo的WER分别达42.97%和33.98%,Kalenjin仍有待改进。
CASE:因果对齐与结构增强提升思维链忠实性
CASE框架通过因果对齐和结构约束解决思维链不忠实问题,平均提升37%忠实性。
转录策略作为潜在变量:通过词级时间控制激活可控逐字ASR
将转录风格作为潜在变量,实现可控逐字ASR,提升零样本/微调效果与词级时间戳,提出verbatimize任务。
约束CTC解码的高效变音符恢复
提出约束CTC解码高效恢复阿拉伯语变音符,降低错误率,提升性能与效率。
解析NLP中的课程学习:迈向统一分类法
提出细粒度分类法,区分难度评估与训练调度,揭示NLP课程学习中的系统不可比问题,支持策略设计与分析。
基于未来反馈预测的开放域对话技能可验证自我进化
提出未来反馈预测方法,将对话反馈转化为固定离线目标,实现可验证的自我进化,准确率超75%。
AutoJourn:自动化新闻中LLM生成新闻的多视角摘要、偏见检测与中和
AutoJourn系统实现多视角摘要、偏见检测与自动中和,提升新闻多样性与公正性。
多样化语音的人类与自动语音识别基准测试:初步结果
人类与ASR在多样化语音识别上表现相近,ASR有时更优;未来需增强对年龄和口音变化的鲁棒性。
中文标题:内容即剩余:基于并行话语的不变语音分词
中文摘要:通过并行话语对齐,让语音分词仅保留共享语言内容,消除声学变异,大幅降低说话人识别准确率与语言模型困惑度。
超越分数预测:基于LLM的论文评分与反馈生成——通过带有评分标准奖励的强化学习
提出RLAES框架,用强化学习联合优化评分与反馈生成,引入RFE评估反馈质量,在ASAP基准取得最佳评分性能(QWK=0.803)。
翻译即增强:翻译数据对难度评估的影响
通过机器翻译将高资源语言标注数据迁移到低资源语言,增强训练集,显著提升难度评估准确性。