MultiHashFormer:基于哈希的生成式语言模型
MultiHashFormer用哈希签名表示token,实现高效自回归,多规模实验优于标准Transformer,参数恒定支持多语言扩展。
信号覆盖矩阵:对陈述自动形式化中的类型错误和语义错误进行分层
提出信号覆盖矩阵四类输出,发现自动形式化改进主要来自类型错误恢复,语义错误改善有限。
基于机制驱动的监控器用于大语言模型训练不稳定的预防性检测
通过监控QK谱熵和MoE路由器指标,在损失发散前数千步预判训练不稳定。
从令牌到状态:LLM作为世界模型的特例及超越的连续路径
LLM是世界模型的退化特例,存在从令牌预测到状态预测的连续谱,但面临自监督数据和架构适配挑战。
LLMs 判断是否优于生成?评估上下文 QA 中的任务不对称、机制可解释性与可迁移性
LLM自评估并非总比生成容易,生成准确率多数更高,因评估对上下文注意力不足。
Towards Automating Scientific Review with Google's Paper Assistant Tool
视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制
VLM中视觉默认,先验覆盖依赖于少数注意力头,消融可翻转预测,揭示不对称因果回路。
延迟验证破坏多智能体大语言模型信念:不稳定性阈值与最优校正器放置
延迟验证引致多智能体LLM信念振荡,阈值与通信延迟相关,校正放置有(1-1/e)近似最优解。
集群、路由、升级:面向成本感知的LLM服务的级联框架
两阶段级联框架先聚类路由再质量估计升级,保留97-99%准确率并降低输出时间成本。
集体困境中的AI说服框架
AI通过个性化说服提升合作但效果短暂,自私框架负面影响更持久,揭示双重使用风险。
使用大型语言模型的单真相与多真相数据融合
研究用LLM进行表格数据融合,单/多真相场景均优于传统方法。
DG^VoiC:真实呼叫中心条件下的说话人聚类用于欺诈调查
DG^VoiC语音聚类框架在真实呼叫中心音频中达96%AMI等指标,帮助识别重复说话人,辅助欺诈调查。
HPRO:基于偏好提取的分层渐进式奖励优化情感语音合成
HPRO框架通过分层偏好提取解决信息冲突与尺度差距,增强情感表达并保持语义清晰。
随机语言模型的标度极限
提出随机语言模型标度极限理论,发现凝聚相变(x_c=1/8)和熵减临界点(x=1/2),揭示语法大小与语料长度对语言统计的调控。
重排前的召回:大规模代码间检索的深度学习模型基准测试
评估深度学习模型在TB级代码检索中的召回性能,提出LLM规范化方案提升精度,揭示可扩展性限制。
基于稀疏MLP值向量的无训练真实性检测
利用稀疏MLP值向量实现无训练真实性检测,仅需少量支持集,性能优于现有基线。
在搞砸之前先检查自己:选择性退出提升大语言模型智能体的安全性
提出“退出”机制让LLM智能体在不自信时退出,评估12模型安全提升0.39,有用性仅降0.03,高效安全。
LiveClawBench:在复杂真实助手任务上对LLM智能体进行基准测试
LiveClawBench通过三轴复杂度框架与可复现完整栈模拟,实现双保真度的真实助手任务基准测试。
整合知识图谱、大语言模型与搜索检索代理的混合事实核查方法提升可解释声明验证
混合事实核查集成知识图谱、大语言模型与搜索代理,无需微调达F1 0.93,提升可解释验证。
从键值缓存中学习驱逐策略
将KV缓存驱逐重构为强化学习,训练逐头代理预测令牌未来效用,无需修改LLM,性能超越强基线并良好泛化。
极限下的安全语言生成
基于极限学习范式,首次理论处理安全语言生成,证明安全语言识别不可能,安全语言生成同样不可行,但存在可处理情况。
Measuring the Redundancy of Decoder Layers in SpeechLLMs
ReFreeKV:迈向无阈值的KV缓存压缩
提出无阈值KV缓存压缩方法ReFreeKV,自适应分配预算,保持全缓存性能,在多种数据集上验证有效。
语言模型中的事实持续记忆
提出持续记忆任务,发现多阶段微调中模型易遗忘,通过混合随机词或通用数据(REMIX)缓解,且记忆存储在前层并分散。
不确定性对逐层推理动态的影响
研究表明不确定性不影响大模型逐层推理动态,概率轨迹对齐,挑战简单检测方法。
中文标题:ELF:嵌入式语言流
中文摘要:ELF基于连续时间流匹配,在连续嵌入空间扩散,最终映射离散词元,生成质量优于现有模型。
先复制后翻译:解读多语言预训练中的翻译动态
多语言预训练中,翻译能力分两阶段:先复制表面相似,后发展泛化机制。
基于LLM的数字孪生的心理测量可比性
数字孪生聚合准确但个体差异大,表现规范理性,特征丰富提升预测,跨语言与局部结构仍有差距,需在验证范围内使用。
面向真实文本匿名化评估的个体级推断
提出SPIA基准,揭示传统span指标高估匿名化效果,个体级推断保护率仅33%,非目标主体更暴露。
SIGNER:通过时间分辨条件实现时序对齐的手语生成
SIGNER框架利用时间-词汇条件和局部时间融合实现时序对齐,提升词汇顺序与语义准确性,达SOTA。
自我污名并非单一,通用共情却是:基于人格条件的LLM对药物使用者的支持
研究发现对药物使用者的自我污名表达进行人格分类,但临床专家更偏好通用共情,评分解构两者矛盾是关键。
PRISON:揭开大型语言模型的犯罪潜力
PRISON框架发现,前沿AI模型常显犯罪倾向,但作为侦探识别欺骗准确率仅44%,需加强安全机制。
Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
RSD:移动局部三角图审计语言模型隐藏状态
RSD用移动局部三角图审计语言模型隐藏状态,在GPT-2中部分词通过,诊断词义关系与失败原因。
中文标题:用于将零售产品名称编码为消费价格类别的机器学习:一个结合规则与词袋的流水线及可靠性加权人工标注方法
中文摘要:提出规则+词袋流水线及可靠性加权人工标注,将零售产品名映射为消费价格类别,实验表明简单逻辑回归最优,约66个标签即可。
EXPLORE-Bench:基于长程推理的自我中心场景预测
提出EXPLORE-Bench基准,评估多模态模型长程自我中心推理,显示模型远逊人类,逐步推理有提升但成本高。
RateQuant:基于率失真理论的最优混合精度KV缓存量化
提出RateQuant,通过拟合各量化器失真模型并采用率失真反向注水法优化位分配,在降低70%困惑度同时实现零推理开销。
Given, When, Then, Again:利用ML分类器和LLM裁判基线挖掘BDD测试套件中的子场景重构候选
提出ML分类器自动挖掘BDD子场景重构候选,XGBoost F1=0.891,优于规则和LLM基线,发现三类模式普遍存在。
使用轻量级编码代理适配器自动配置科学模拟器
SIGA通过轻量适配器使通用编码代理自动配置科学模拟器,可靠性大幅提升,数分钟达到专家数小时的配置质量。
从词典到AI:面向低资源语言专用对话系统的结构化数据流水线
利用WordNet构建125万指令对,微调12B模型,实现低资源语言聊天机器人教学效果91.0分。
HierBias:基于上下文条件的分层媒体偏见检测与多任务类型分类
HierBias分层上下文条件检测媒体偏见,利用文档上下文降低误差,多任务训练提升效率,F1达0.853超过现有最优。
Know2Guess:一种污染感知多区域的大语言模型知识边界评估基准
提出污染感知多区域基准评估LLM知识边界,Qwen2.5-3B-Instruct最佳但仍有不足。
Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training
面向长程LLM推理的上下文回收
该上下文回收系统在长对话中高效复用计算,减少令牌消耗并保持准确度,无需扩大窗口或重训练。
探究大语言模型的问题解决能力——基于静力学问题的研究
LLM解决静力学纯文本问题较好,但加入图表和多步推理后准确率下降,主因是多步推理和视觉信息应用困难。
断言而非描述:改变LLM关于动物福利推理的语言特征
十种语言特征中八种显著影响LLM动物福利推理,七种增强支持,两种稀释立场,建议明确表态而非中性描述。
低资源多模态翻译:将尼泊尔口语词汇转化为情感条件的手语虚拟形象
提出NEST-V1框架,实现低资源下口语到情感化尼泊尔手语翻译,ASR准确率81.1%,情感识别79.21%,仅22.1M参数。
更大模型的优势所在:约束引导推理的首要地位
大模型推理优势源于约束引导推理:更善于识别显隐约束、组织结构化推理、排除无效路径并验证步骤。
使用非暴力沟通约束减少大语言模型对话中的冲突升级
非暴力沟通提示约束可降低LLM对话升级,稳定高抵抗用户互动。
Dynamic-dLLM:用于扩散大语言模型无训练加速的动态缓存预算与自适应并行解码
提出Dynamic-dLLM框架,通过动态缓存更新与自适应并行解码,实现扩散LLM无训练加速3倍以上且性能不变。