高效扩散语言模型的生存引导长度控制
提出免训练长度预测器,为扩散语言模型动态确定序列长度,推理提速7倍且精度不变。
“不太可能”究竟有多不可能?——大语言模型言语概率感知评估
大模型概率词语感知与人类基准大体一致,但负面词有系统性偏高;解释生成降低模型内方差,却加大模型间分歧。
MoganColBERT-TR:一种用于土耳其语的后期交互多向量检索模型
提出土耳其语多向量检索模型MoganColBERT-TR,采用后期交互与蒸馏训练,零样本在五个BEIR集上超越两倍参数模型,排名第二。
神经符号PRM:通过结构化轨迹与符号验证增强科学推理
提出神经符号框架,将推理分为符号有效性与语义依据,用验证器硬过滤,训练PRM评估语义,显著提升推理可靠性
基于质心干预融合的跨语言表示学习
提出质心干预融合,整合多语言干预投影为共享算子,提升低资源跨语迁移,平均超基线3.378个百分点。
冲突激励下LLM智能体的知识验证涌现性欺骗
提出KnownLieBench基准:先验证模型知晓用户权益,再评估冲突激励下是否说谎,以区分欺骗与无知。
SPEAR:通过强化学习中的序列符号对齐蒸馏领域自适应推理骨架
提出SPEAR,免训练过程奖励法,用符号里程碑与最长公共子序列对齐,提供密集有序奖励,无需神经验证器,缩小师生推理差距。
语言模型中结构化知识与推理的协同演化
提出KBevo协同演化框架,联合构建知识库与推理,端到端优化提升问答,增强组合推理与可控性。
LowRankArena:基于SVD的大语言模型压缩标准化评测平台
提出基于SVD的LLM压缩标准化评测平台,统一协议后重估五种方法,发现先前结论高度依赖条件,加速收益有限。
RAG为何产生幻觉:基于知识缺口金丝雀的检索增强生成系统惩罚感知评估
提出惩罚感知框架,用知识缺口金丝雀评估RAG:各系统答题准确率相近但违规率差六倍,惩罚评分重排排名。
Case2Flow:通过多模态检索桥接患者病例与指南流程图
提出病例-流程图检索任务,构建语料,改进多模态检索,首位召回率提升18.71个百分点。
AfriSwitch:真实场景非洲语码转换语音识别基准
AfriSwitch基准:61.36小时16种非洲语言真实语码转换语音,含切换标注;5个ASR零样本评测最佳WER35.93%,定向训练最关键。
谄媚抑制可能损害理性更新:反谄媚应保留更新能力
反谄媚需平衡两类行为:抑制无依据让步,同时保留理性更新能力,而非简单压制。
在范畴论框架下通过结构识别实现组合泛化
以函子表示句子,用坍缩与凯恩扩张判定COGS留出样本的可容许性,无需训练模型即可诊断数据支持的泛化。
元音符号不是字母:多语言分词器词元率的预分词上限
预分词把元音附标符号当分隔符,导致分词器词元率最高增至9倍;修正字符类后,同算力下性能显著提升。
开放域对话中成对LLM评判的多专家共形风险控制
提出多专家共形风险控制方法MC3,解决异构LLM评判尺度差异,提升开放对话成对评估的准确率与接受率。
大语言模型理解人格吗?通过结构化行为推理重新思考人格保真度评估
提出PRISM框架,将人格保真度评估重构为结构化逆向推理,其判断比整体评判更准确稳定。
SPT:技能作为智能体语言模型的预训练数据
提出技能预训练(SPT),将公共技能包作为训练数据,增强智能体性能,且基本保持通用能力。
大语言模型临床诊断中知识图谱训练的精准对齐
提出梯度干预密度与失真指标,发现KL正则下的KG判断训练产生稀疏局部更新(精准对齐),提升推理质量。
不只是推理,不只是扫描:面向学术论文主动科学错误验证的强化学习
提出VERA-RL,用强化学习让模型主动发现论文错误,构建13K数据集与细粒度奖励,提升可验证推理能力。
信息引导的前沿解码:扩散多模态语言模型中的上下文效用驱动提交
IGFD无需训练,按置信度、邻域不确定性和结构风险排序,优先语义锚点、延迟易错结构词,提升解码效果。
大型语言模型临床决策路径遵循度基准测试
提出MEGA-CDP基准评估LLM遵循临床决策路径基于2274指南生成42353病例显示现模型有挑战
哪些指标最节省人工标注?预测驱动评估与元评估
提出预测驱动评估,结合少量人工与大规模自动评分,实现无偏比较;引入PPSR衡量标注节省,重新定义自动指标。
任务条件的逐层压缩专家分配:元学习专家分配位置
提出MetaNet,逐层预测专家保留阈值与路由偏置,减少激活专家数,精度可调,并能跨任务迁移。
双重困境:双语预训练在共享语言表征中遗留语言条件效应
双语预训练后,共享词嵌入相似但深层隐藏状态不一致,嵌入对齐会掩盖真实差异。
面向高效扩散大语言模型推理的依赖感知可撤销解码
DARD:选择性上下文验证候选令牌,提升速度质量,2.71倍加速,CIDEr+4.35。
Behavior2Trip:基于用户行为轨迹的个性化旅行规划
提出行为感知旅行规划任务及基准,B2T-Agent基于强化学习利用行为轨迹超越基线并展现强泛化。
基于不确定性校准的MOPD在领域特化中保持通用能力
提出不确定性校准MOPD,用双温度采样和熵校准筛选可靠更新,角色扮演和医疗域通用能力提升4.73%/10.84%,且保持垂直性能。
超越反映:肯定作为文本咨询质量的有前景行为标记
研究发现,在文本咨询中,肯定策略比反映策略更稳定地关联会话质量,跨数据集验证支持,为咨询培训与情感支持系统提供实证启示。
FOCUS与RePAIR:通过Token级引导缓解剪枝大语言模型的文本退化
针对剪枝加剧文本退化,提出FOCUS与RePAIR两种Token级引导,降低重复循环,提升生成质量。
通过自我改进RAG迈向专家级金融问答
提出Self-Improving RAG框架,用检索、推理、评判三角色协作与反馈纠错,在FinanceBench达86%准确率,实现可解释审计。
PragAlign:跨中日得体性判断的基于证据的回复辅助
提出PragAlign,分离上下文阅读与选择性澄清。中文评估中优于基线,日文评估无显著差异,识别了跨语言共享与特定判断模式。
相同的排序质量,不同的决策:训练顺序一致的LLM评分器
LLM评分器存在顺序依赖:排序质量相同但决策不同;OC-SFT保持排序质量并提升决策稳定性。
指令质量至关重要:优化指令以实现有效的偏好学习
指令质量是偏好学习的关键瓶颈;提出指令精炼流程,利用奖励信号与规则引导反馈改进指令,显著提升对齐效果。
文字掩盖了眼前的真相:英语同音词具有有意义的语音实现差异
研究一万四千个英语同音词,发现其语音实现随语境意义系统不同,且独立于时长;时域归一化声谱图揭示真相。
规模化基于音素的TTS增强以改进ASR:统一流程与受控研究
音素文本转语音增强语音识别流程,含音素频率引导选择与参考过滤;六成合成预算下优于随机选择,词错率降近两成。
韩语成分结构的粒度分级表示与解析
比较宾州韩语树库三种表示,发现细粒度形态与XPOS表示显著提升成分解析性能,但语言设计上更宜以eojeol为稳定表面单位。
用匹配轨迹回放评估置信门控检索
提出匹配轨迹回放评估置信门控检索:校准提升已承诺答案准确率但降低覆盖率,不能估计额外检索的收益。
在自然文本中植入潜在变量:对LLM信念状态及其与概念几何关联的更现实测试
在自然文本中植入可控潜在变量,训练小模型,发现其能追踪贝叶斯信念,并按马尔可夫链顺序排列概念,支持概念几何源于潜在变量统计动态。
RuleWeaver:面向大语言模型的以规则为中心的场景推理基准测试
提出RuleWeaver基准,评测大模型基于复杂规则的场景推理,最优模型得分仅约50%。
KinyaEmbed:通过多阶段课程训练实现基尼亚卢旺达语的对比句嵌入
首个基尼亚卢旺达语句嵌入模型,多阶段课程训练,在SemRel2024-rw超越mE5-large 20.9%,并发布新基准Wiki-RW-STS。
仅凭视觉基础实现跨语言词汇从书面到口语的映射
仅凭视觉基础,利用自监督语音对齐,跨语言映射书面词到语音,优于注意力神经模型,加入负例更佳。
递归Transformer:从有限数据中榨取更多价值
数据有限时,标准Transformer扩展性差,最优参数量取决于数据量和下游任务。递归Transformer重用块并分解嵌入,在10M和100M词预算下优于标准模型。
TabuLM:面向低资源语言的形态感知表格预训练
提出首个基尼亚卢旺达语表格预训练模型TabuLM,以62%精确匹配在表格问答上超越基线。
ITL:基于结构化参考框架的可解释文档对齐
ITL从结构化参考框架构建术语画像,量化文档与概念对齐,结果可追溯;经SDGs验证区分度高。
JudgeStealer:跨评估协议提取LLM评判能力
提出首个查询高效大模型裁判提取框架,跨点式/成对/列表协议,利用跨协议一致性转化监督,动态选样,超越基线且抗防御。
社会科学研究设计追踪与评估
提出自动研究设计追踪与评估任务,用RAG管道检测论文设计并评估质量,发现段落长度是性能主因,人机难点不一致。
DocTalkBN:孟加拉语专家远程医疗对话新数据集
构建孟加拉语远程医疗多模态数据集,含557小时对话,支持分诊、安全评估及命名实体识别等任务,助力低资源医疗NLP。
当文本误导:面向音频对话的不一致感知推理
针对文本误导,构建矛盾感知基准与音频孪生框架,揭示语音对话推理在冲突场景准确率骤降,显式聚合音频证据可提升。
无需联合训练的跨语言对齐:单语语言模型会收敛于通用表示吗?
研究表明单语模型无需联合训练也能形成跨语言对齐表示,且可通过旋转映射迁移功能。