PAST-TIDE:基于原型锚定的语句调优与主题不变归一化的立场检测方法
采用语句调优、原型对比和主题不变归一化,低资源立场检测取得0.75/0.74宏F1。
意大利流行音乐中的语义同质化:一项历时分析
研究揭示意大利圣雷莫歌曲歌词语义多样性下降,开发新方法,证实全球语义同质化趋势。
评估语言关联性对大型多语言自动语音识别中跨语言迁移的影响
大型多语言ASR中,语言关联性预适应对低资源语言无实质提升,不能可靠预测迁移增益。
LP-SFT:基于多模态熵结构的局部保持有监督微调
提出LP-SFT,通过局部保持预训练熵结构,缓解微调能力退化,平衡准确率与多样性。
奥塞梯语COT:设计形态标注语料库与形态分析器
首个铁奥塞梯语形态标注语料库,基于BERT分析器准确率达95.60%。
评估大型语言模型用于反犹事件分类
LLM分类反犹事件有潜力但需改进,提供定义和示例可提升性能,可辅助早期监测。
DuplexChat:大规模构建说话人分离的全双工对话语音用于口语对话建模
提出DuplexChat语料库及流水线,从播客生成双通道对话语音,含英日共41.5万小时,支持全双工对话模型训练。
你框架它:概念表征如何影响LLM对反犹主义的检测与推理
概念表征影响LLM反犹检测:细粒度提升召回但降精度,大资源无额外收益,模型存在局限。
不失文本智能的统一音频智能
Audex统一音频文本LLM,多任务达SOTA且不损原文本LLM的推理、对齐等能力。
超越独立标签:基于施瓦茨几何的解码用于人类价值观检测
提出施瓦茨几何解码器,使价值观检测标签集更符合理论连续统,不牺牲F1,且仅对真实排序有效。
幕后黑手是谁?从德国Telegram帖子中标注与提取阴谋论行动者
针对德国Telegram帖子开发标注指南与语料库,用Transformer模型自动提取阴谋行动者,准确度合理,支持大规模分析。
MIRAGE:防御长篇RAG免受虚假信息污染
MIRAGE通过跨文档声明图与防御门控,无需训练即有效抵御检索污染,恢复长文本RAG事实性。
Rating the Pitch, Not the Product: User Evaluations of LLMs Reflect Expectations More Than Performance
EdgeBench:揭示真实世界环境下学习的缩放定律
基于38,000小时交互,发现agent环境学习遵循log-sigmoid缩放定律,速度每季度翻倍,开源51个任务。
知识内蕴,言语外显:解耦LLM数学可解性的潜在方向
LLM中数学可解性知识与言语化编码分离,伪造主因言语化变化,操纵言语化可提升模型拒答能力。
RABBiT:基于脑调谐的快速自适应BOLD基础模型,实现语音诱发脑反应的精准零样本与少样本预测
RABBiT通过区域注意力和成分分解,实现语音fMRI零/少样本精准预测,10分钟数据微调即可超越现有模型。
多大型语言模型协同临床记录严重程度评估
MOSAIC框架利用多LLM协同评估2型糖尿病严重程度,生成有临床意义的表型,优于传统规则方法。
也门伊比阿拉伯语中疑问词一致现象的句法研究
通过跨阶段一致分析,揭示疑问词一致中匹配与特征赋值的分离,为普遍语法提供有力证据。
还剩多少?大语言模型线性编码剩余输出长度
研究发现,LLMs能从提示最后隐藏状态线性解码总响应长度,该编码跨数据集通用,且能捕捉模型撤回重试行为。
FOI-O: 新西兰首个信息自由流程建模本体与验证方法包
FOI-O是新西兰首个可复用的信息自由流程建模方法及验证包,支持多种标准格式,但非官方法律建议。
拒绝忠实性:神经元选择器的因果审计
因果审计发现,归因分数可识别重要神经元行,但秩稳定选择器可能因果无效;拒绝由冗余子空间实现。
REDDIT:基于回放分布编辑的ASR模型生成时间戳漂移校正方法——避免遗忘
提出REDDIT框架,通过回放分布编辑校正ASR时间戳漂移,避免灾难性遗忘;仅更新1.6%参数,长间隔mIoU从38.7%提升至95.0%。
SPEARBench:流式语音到语音语言模型自然度评估基准
SPEARBench评估流式语音到语音模型自然度,发现模型在延迟、方言保持等方面与人类存在差异。
超越满意度:学习内容、评论与幸福感之间的关联
研究表明评分和情感仅部分反映幸福感,内容主题与幸福感有特定关联,推荐系统应超越满意度目标。
愤怒但准确:检测与描绘推特上的反错误信息生态系统
反错误信息帖子情绪更负面(愤怒等),且来自更成熟的用户账户。
渐进式精炼:一种面向中英混合语码转换语音识别的迭代伪标签方法
首次将迭代伪标签法用于中英混合语音识别,三阶段训练降低混合错误率6.35%-8.29%。
基于时间不变表示的流式神经语音编解码器
TiCodec分解时间不变表示,中间层捕获说话人/环境信息,Dual-TIRE提升重建质量,流式推理低延迟可行。
SalAngaBhava:一个基于方面的情感分析的僧伽罗市场数据集
发布首个僧伽罗语方面级情感分析数据集,含产品评论的方面-情感标注,推动低资源NLP研究。
TokenScope:面向大语言模型代码任务的令牌级可解释性与可理解性
TokenScope通过令牌级度量、注意力模式和AST聚合,交互式探索LLM代码生成决策路径。
在词边界突破安全防线:BPE分词如何产生LLM对齐的可利用漏洞
BPE分词将安全词拆成子词,形成对齐漏洞,可翻转80-100%的拒绝触发,48%产生有害输出。
基于溯源分析的LLM代理对齐防护
提出ProvenanceGuard,通过溯源分析检测代理工具调用是否与用户意图对齐,将误判率从42.9%降至1.8%,有效防护对齐失误。
SPARCLE:通过对比语言嵌入实现说话人感知的对齐表示
SPARCLE通过对比学习对齐字素与声学表示,在低资源TTS中将词错误率减半。
Kara:通过滑动窗口KV缓存压缩实现高效推理LLM服务
提出Kara滑动窗口KV缓存压缩,利用双向注意力选择信息对并扩展为块,结合KvLLM框架提升LLM推理吞吐量。
提示框架扭曲了基于计数的LLM错误检测评估:来自数值锚定的证据
提示中的数值锚定导致LLM错误检测F1分数虚高,与实际定位脱节,建议采用跨度感知指标。
将文本映射到多重图:莱维行走引导的提示压缩图剪枝
RAGP将提示压缩建模为多重图冗余感知剪枝,以莱维行走平衡局部与全局搜索,4倍压缩下平均分49.3,超越现有方法。
办公理解基准
首个公开基准OCB,评测LLM对Word、Excel、PowerPoint文件理解,最强系统仅达59.3%。
TurnNat:双人对话中话轮转换自然性的自动评估
提出TurnNat框架,基于似然自动评估双人对话话轮转换自然性,有效识别异质时序扰动。
RuleChef: 基于人类可编辑规则融入LLM任务知识
RuleChef利用LLM将任务知识转化为可编辑规则,通过迭代优化和人类反馈生成快速、可解释的规则系统。
基于互信息的多目标探索与偏好优化
通过最大化联合条件互信息统一多目标探索与对齐,实现可控生成和稳定权衡。
语言模型真的能进行上下文检索吗?在百万级token的文档中陷入困境
首次系统研究百万token上下文检索,揭示注意力稀释效应,通过长度感知调整和稀疏注意力,使模型匹配甚至超越密集检索。
RusFinChain:面向金融领域可验证思维链推理的俄语基准与模糊对齐评估
提出俄语金融可验证思维链基准RusFinChain,含5280示例及新指标;评估8个LLM发现推理差距,新指标与答案正确性相关性更强。
Grounded Optimization: 一种用于减少自动个人文档重写中LLM幻觉的分层工程框架
提出五层工程框架减少LLM文档重写幻觉,实验将幻觉率降至0.04-0.24。
MultAttnAttrib:长文档问答中的无训练多模态归因
提出无训练多模态归因方法,利用注意力定位证据,性能优于强基线,延迟低至1/7。
IsoSci:评估大模型推理与知识检索的同构跨域科学问题基准
IsoSci显示LLM推理增益91.3%依赖领域知识,链式思维提升不足5%,推理专用模型反而不如标准模型,挑战了推理的通用性。
从单语到多语:评估Mamba在南非语言语音识别中的应用
Mamba在单语ASR中与Conformer精度相当但资源更省;多语训练提升性能,语言嵌入增强跨语料鲁棒性。
FaithMed:训练大语言模型实现可信的循证医学推理
提出FaithMed框架,用步骤级奖励与优势分组强化学习,提升医学LLM推理忠实度,平均提高9%任务成功率。
监督式政治立场标度架构比较
本文整合文本标度方法,探究联合预测能否提升性能及分类与回归间是否存在中间地带。
参数高尔夫:什么真正有效?
资源受限下分析84种优化技术,多数贡献微小,仅少数方法降低13.6% BPB。
重新思考语音-LLM集成用于ASR:通过交错实现有效的语音-文本联合训练
提出JSTIP交错预训练,在ASR中提升实体识别,减少模态差距,保留LLM先验。
超越怀疑:用适应性教学警惕框架评估LLMs的教学意图推理
提出APV框架,提升LLMs教学意图推理,与人类判断高度相关(r=0.958),稳健处理自然数据。