幂律的威力:不对称性赋能组合推理
幂律分布训练在组合推理中优于均匀分布,因不对称性改善损失景观,高效学习长尾技能。
DeepTutor:面向智能体个性化辅导
DeepTutor开源智能体辅导框架,混合个性化引擎,在TutorBench上提升指标10.8%,推理能力29.4%。
中文标题:通过蒸馏与跨模态集成生成的多语言转录本进行音频情感分析
中文摘要:提出跨模态Transformer集成音频与自动生成的多语言文本,通过蒸馏增强音频模型,显著提升情感分类性能且推理无额外开销。
从文本到参数:结合可靠性与设计上限的嵌入正则化预测项目参数
提出评估框架,用文本嵌入预测项目参数,难度可预测(达信度上限57%),强调重复交叉验证和尺度无关指标。
使用自批评掩码语言模型的广告标题生成
提出基于自批评掩码语言模型和强化学习的广告标题生成方法,联合多产品条件,性能优于现有模型和人工标题。
更健康的LLM:检索增强生成在公共卫生问答中的应用
本文扩展公共卫生问答基准,系统评估检索增强生成配置,表明混合检索提升召回与准确性,检索质量是关键。
LLMs无声纠正非裔美国人英语:通过激活导向审计和缓解方言偏见
LLMs系统性将非裔美国人英语重写为标准英语,提出cDGI审计和激活导向缓解偏见,发布最大AAE平行语料库。
大型语言模型响应的综合评估:一个多因素评分系统
提出整合五维度的多因素评分系统,揭示LLM推理优势(0.6104)与事实局限,为模型评估提供透明框架。
基于梯度的语音到文本对齐方法,适用于任意ASR模型:从CTC到语音大语言模型
梯度对齐法适用于任意可微分ASR模型,无需训练,在原生对齐弱时更优,但需逐token反向传播。
MILES:面向自改进大语言模型推理的模块化指令记忆与可学习选择机制
MILES通过可学习选择头实现粗到细记忆检索,动态扩展并优化组合指令,提升LLM推理准确率与效率。
预训练语言模型嵌入的黎曼几何
提出黎曼均值池化,通过提取token嵌入的黎曼几何聚合分类信号,优于欧氏池化,增益源于几何聚合。
多教师同策略蒸馏中的行为杠杆不平衡
多教师蒸馏中行为杠杆不平衡致工具过度调用,Soft Clamp方法可降低过调并保持准确。
视觉语言模型中空间指示表达使用的多语言能力评估
开发四语言基准评估VLM空间指示词使用,发现模型在基于距离选词上与人类不同。
R^3:通过群体相对经验提取器和课程强化学习的广告合规修正
R^3框架融合群体相对经验与课程强化学习,在修正视频广告违规时兼顾合规性与语义保留,工业数据集表现优异。
大处着眼,小处搜索:分层搜索智能体中的容量关键何在?
分层搜索中任务分解是瓶颈,集中容量于委托角色、精简执行子智能体可提效增准。
商羯罗注《三经》词级数字读本:语料、方法及不二论吠檀多经典的开源离线阅读辅助工具
开发了开源离线词级读本,覆盖商羯罗注《三经》全文,支持点击分析、词典检索,高置信度分析准确率超99%。
有害在线交流中的解读困难研究:网络犯罪社区的启示
探索Discord网络犯罪聊天解读困难,发现局部语境不足,外部知识可提升人类与LLM解读,并分类了困难因素。
Evaluating RAG Metrics in Applied Contexts: An Experiment, Its Findings and Its Limitations
基于Transformer的巴西葡萄牙语韵律边界分割
提出SAMPA模型,微调Whisper实现巴西葡语韵律边界分割,F1达0.731/0.796,融合多线索检测。
TF-Engram:一种基于SSD存储且无需训练的Engram记忆系统,用于大型语言模型
TF-Engram通过SSD分层存储与预测预取,无需训练即提升LLM性能,降低GPU内存需求。
DeLS-Spec: 用于并行推测性草稿的解耦长短期上下文
DeLS-Spec解耦长短期上下文,以轻量局部头独立训练,提升推测解码效率。
SynthAVE:基于LLM竞技场验证的可扩展电子商务合成标注
SynthAVE用多LLM投票验证合成标签,与人类专家一致性达95.2%,实现大规模低成本高质效的电商属性标注。
边界的树:基于分解先验的自回归草稿
Weaver利用分解草稿边缘构建候选树,恢复条件依赖,实现4.37倍加速,超越基线24.7%。
Co-LMLM:连续查询受限记忆语言模型
CO-LMLM将连续键与文本知识配对,生成向量查询,优于先前模型,360M规模性能比肩gpt-4o-mini。
从杂乱轨迹到根因:面向智能体优化的结构化轨迹分析与因果提取
STACE框架通过过滤冗余轨迹与定位因果根因,显著提升智能体优化,成功率从42.5%提至58.5%。
基于深度原生结构推理的精确、跨学科且透明的构效关系理解
SciReasoner多模态科学基础模型实现跨蛋白质、小分子、晶体结构推理,在67/86项基准达最优,98%案例推理质量媲美前沿大模型。
最终检查点并不足够:沿训练轨迹分析潜在推理的忠实性
潜在推理的忠实性随训练阶段和答案格式变化,因果贡献衰减。
大型语言模型中的未来置信度蒸馏
通过后解置信度蒸馏预解表示,实现低成本可靠置信度估计,揭示回答过程中置信信息可提前预测。
无需重新标注的可重构放射学标签
无需重新标注,通过字典编辑重构标签模式,196秒替代$6.6K成本,捕获43%额外发现。
DiaLLM:英语方言适应中鲁棒性与生成能力差距的研究
DiaLLM揭示方言鲁棒性与生成分离,显式适应输出可识别但非最优,需改进奖励设计。
PALS:面向大语言模型剪枝的百分位数感知逐层稀疏性
PALS按激活值百分位数调整每层剪枝率,困惑度降至10.96,无需微调,但效果因架构而异,梯度分配法反不如随机。
Bielik知道它不知道什么吗?激活离散度跨模型规模区分实体熟悉度与事实可靠性
激活离散度可高效区分已知与虚构实体(AUROC>0.95),但实体熟悉度与事实可靠性在不同模型规模上分离,内部意识不触发拒答。
数十亿素描揭示人类概念中隐藏的文化差异
通过26亿幅素描分析,发现视觉概念存在文化差异,触觉相关概念差异最大,跨文化相似性比文本高45%。
Agon:竞争性跨模型强化学习与隐式对手推理评分
Agon通过双模型竞争互评隐式奖励推理质量,无需过程标签,在数学和编程任务上显著提升性能。
大型语言模型(LLM)与生成式人工智能在网络安全与隐私中的应用:双用途风险、AI生成恶意软件、可解释性与防御策略综述
LLM在网络安全中呈现双用途风险,AI生成恶意软件从2%激增至50%,综述防御与可解释性策略。
几何自蒸馏用于推理泛化
GeoSD降低自蒸馏漂移,数学推理OOD准确率提升5.7-8.6%。
超越攻击成功率:面向使用工具的AI智能体的行动分级严重程度量表
提出七级严重程度量表(L0-L6),依可逆性等评分,揭示二进制指标隐藏的危害,法官与神谕一致性高但存在盲点。
大型语言模型中谄媚行为的内部表征分离研究
将谄媚行为分解为事实与观点子类型,发现不同模型内部表征存在统一或分离差异,为研究复杂行为提供框架。
使用语音活动相关预训练编码器的社交机器人话轮转换多模态语音活动投影
提出多模态语音活动投影框架,结合预训练编码器与低秩适应,提升社交机器人话轮转换预测性能。
最大化GRPO信号:针对困难推理问题的自适应迹前缀控制
AdaPrefix-GRPO动态调整前缀长度,保持成功率50%以最大化梯度,在同等算力下使困难问题准确率翻倍,迹长度减半。
FourierQK: 查询-键投影的频谱预处理提升Transformer注意力
频谱预处理Q/K投影大幅提升字符级注意力,四个学习频率对应多尺度,性能提升79%。
变分贝叶斯变量选择后恢复潜在结构:部分探索性因子分析中的拟合评估与因子数选择
提出后选择评估框架及尺度无关增益规则,有效恢复负载结构与确定因子数。
通过LLM提取的语义实体三元组图监测变革性技术融合
提出利用大语言模型从文本提取语义三元组构建图,通过图指标检测技术融合信号,在多数据集验证。
大语言模型的快速、慢速与工具增强思维:综述
基于认知心理学,提出LLM推理策略分类:快慢思考与内外知识边界,综述自适应推理方法及未来方向。
网络代理中不同人类交互行为的建模
建模人类干预模式后,网络代理预测干预准确率提升61-63%,实用性提升36.8%,实现更适应性协作。
RIMRULE:通过MDL引导的规则学习改进工具使用语言代理
RIMRULE通过MDL引导自动学习规则,注入提示提升工具使用准确率,无需修改权重且规则可跨模型复用。
Simulstream:用于流式语音到文本翻译系统评估与演示的开源工具包
首个开源流式语音翻译评估演示框架,支持增量/重译、长语音、细粒度评估和交互界面。
思考精炼:一种用于嵌入模型推理的测试时推理方法
RT方法通过多次前向传播激活预训练推理能力,提升语义推理任务,通用任务性能不变。
大规模语言模型中的跨度标注策略
总结三种跨度标注策略并引入LogitMatch方法,提升匹配性能。
聚焦医疗健康大语言模型问答中的差异
跨语言医疗信息差异显著,LLM回答更偏向英文,使用非英文语境可改善对齐。