探索多语言多模态大语言模型的对抗鲁棒性与安全对齐
系统研究发现多语言模型存在跨语言可转移攻击,低资源语言表面安全实为理解失败,深层训练才能实现真正安全对齐。
别忘记你的嵌入层:通过精确编辑嵌入实现鲁棒的知识擦除
嵌入擦除模块EMBER用稀疏矩阵分解精确移除概念特征,增强鲁棒性,将重学习恢复准确率降至35%。
通过归因视角进行重排序以提升法律问答中的引用质量
利用扰动归因分数训练轻量交叉编码器重排序,显著提升法律问答引用忠实度,且跨模型迁移可行。
KletterMix:迈向高质量德语预训练数据
通过翻译英语语料构建高质量德语预训练语料KletterMix,显著提升德语下游任务性能。
Framing Migration News with LLMs: Structured CoT as a Support for Human Interpretation
熵门:面向大语言模型流水线中近无损令牌压缩的熵淬火
熵门框架用熵淬火实现LLM近无损令牌压缩,能量筛选达40-60%且保真>0.8,结合去重和外部记忆可达88-96%。
HybridThinker:通过压缩记忆与临时思考步骤实现高效思维链推理
HybridThinker以混合训练保留临时思考步骤,平均准确率提升5.8%,接近无压缩基线。
语法推理:合成语言推理轨迹能否增强低资源机器翻译?
自动生成语法推理轨迹,在上下文学习中提升低资源翻译,但作为训练数据效果有限,生成可靠分析仍是瓶颈。
后门遗忘泛化:消除大语言模型中未知触发器的路径
遗忘一个后门可泛化抑制未知后门,引入交叉激活偏移距离,开创主动注入移除的防御新方向。
稀疏MoE语言模型中事实回忆的专家感知因果追踪
提出稀疏MoE模型专家感知因果追踪,在Qwen3定位到具体专家,Mixtral需多专家协作,表明方法有效但依赖模型。
重新思考习语可分解性假设:来自分布学习的证据
用分布学习模型检验习语可分解性假设,发现模型分解性与人类判断弱相关、与句法灵活性负相关,预训练中可分解性影响最强。
智能体链式思维引导:高效可控的大模型推理
通过控制器智能体自适应引导推理策略,实现预算感知的高效推理,节省token并保持性能。
一致性训练可能固化不对齐
一致性训练非对齐中性:抑制奖励黑客与紧急失配,但放大谄媚。
聚类自评估:一种简单而有效的大语言模型不确定性量化方法
提出聚类自评估方法,将生成样本聚类为选项,用模型概率量化不确定性,高效且仅需少量样本。
基于大语言模型和知识图谱的免训练多代理多文档摘要框架
提出免训练混合代理框架,利用LLM和知识图谱分解多文档摘要任务,通过多视角一致性机制,在英越数据集上取得先进性能。
RealClawBench:来自真实开发者-代理会话的实时OpenClaw基准
基于真实会话构建的代理基准框架,通过重构环境和可验证评分器,揭示当前模型解决实际任务仅达65.8%的性能差距。
遮蔽扩散语言模型中的知识编辑
研究将知识编辑迁移至遮蔽扩散模型,发现多词元编辑失效因中间状态未优化,提出修正恢复性能。
合成与奖励——实时环境中多步工具使用的强化学习
提出PROVE框架,通过20个有状态服务器、自动数据合成和多组件程序化奖励,使多步工具调用性能提升达10.2点。
用未发生的对话实现高效ASR训练
提出用LLM生成对话+TTS合成语音增强ASR训练,仅67小时真实+636小时模拟数据超越2700小时训练效果。
作为CUNI提交至IWSLT 2026的袖珍式离线同声传译模型
基于Canary与AlignAtt的同声传译系统,仅1B参数,支持25种语言对,计算需求低且翻译质量高。
量化大型推理模型中的忠实置信表达
大型推理模型忠实置信表达面临显著挑战,新框架揭示其与内部不确定性对齐困难。
ZX演算:迹索引依赖类型与认知语义学
提出ZX演算,扩展马丁-洛夫类型论,集成迹索引类型与AGM信念修正,Coq验证核心结果,揭示路径依赖与函子一致性的张力。
Language Models Compare Quantities Using Number-specific and Unit-specific Heuristics
WUSH:面向大语言模型量化的近最优自适应变换
提出WUSH,结合Hadamard与数据依赖的非正交变换,实现LLM量化近最优,大幅提升精度和吞吐量。
AlignAtt4LLM:面向仅解码器LLM的快速AlignAtt——IWSLT 2026同声传译任务
首次将AlignAtt应用于仅解码器LLM,通过源跨度、对齐头、选择性重放和查询/键捕捉实现高效同声传译。
神经检索器对文档有偏好吗?来自学习相关性先验的证据
监督神经检索器隐式学习文档偏好,低先验文档即使相关也更难被检索,形成可发现性差距。
位置公平稠密信息检索中的注意力校准
提出推理时注意力校准,通过λ插值实现部分校准,默认配置同时提升位置公平性与检索效果。
SCOPE:边缘端实时自然语言摄像机智能体
SCOPE实现边缘端实时自然语言PTZ相机控制,通过模拟和实物验证,MoE和量化优化性能。
多段注意力:实现高效KV缓存管理以加速大语言模型服务
AsymCache通过计算延迟感知的KV缓存管理,利用多段注意力等组件,将TTFT降低达2倍,TPOT降低达1.7倍。
QUBRIC:面向超越可验证奖励的强化学习的查询与评分标准协同设计
QUBRIC通过协同设计查询与评分标准,破解规则质量受查询结构限制的瓶颈,在推理任务上平均提升6.3点。
解耦式智能合约审计:基于蒸馏与聚合的轻量级LLM框架
提出轻量级LLM框架解耦智能合约审计,通过蒸馏与聚合实现98.25%检测准确率,优于大模型。
推理模型的价值感知随机KV缓存驱逐
VaSE方法通过保护大数值价值状态并引入随机驱逐,在4倍压缩下准确率超越现有方法,桥接了效率与精度鸿沟。
PsychoPass:多轮对抗性大语言模型对话的几何轮廓分析
PsychoPass通过提取对话轨迹几何特征,在早期预测多轮越狱攻击,信号早于有害内容且编码器无关。
CAPER:面向文本到SQL的从句对齐过程监督
CAPER通过反事实干预自动获取从句级监督,训练轻量级Clause-PRM,大幅提升SQL执行准确率和故障定位能力。
使用基于注意力的带残差连接LSTM网络的语音情感识别
轻量ResLSTM-SA架构结合残差与注意力,仅46.8k参数实现UAR 0.6517,适合边缘设备。
动态短卷积提升Transformer性能
动态短卷积作为可扩展、高效的原语,在语言模型中优于静态卷积和标准Transformer,且适用于线性RNN和MoE架构。
CauTion:判断何时信任大语言模型进行集成因果发现
提出CauTion框架,通过共识过滤和信任校准集成LLM与统计算法,实现鲁棒高效的因果发现。
大语言模型重排序器能否预测自身排序性能?
自一致性可预测排序性能,接近SOTA且校准更好;直接口头置信度过自信;Verb-Num/List可校准。
视觉指令调优通过抽象对齐模态
视觉指令调优将视觉特征嵌入LLM中间抽象层,绕过单模态层,局部调优即可保持性能。
太极:面向工业LLM增强推荐的语义与ID权衡的帕累托最优策略优化
提出Taiji框架,通过逆向推理生成高质量CoT数据,并用帕累托最优策略优化平衡语义与ID偏好,部署于快手,日服务4亿用户,显著提升商业效益。
UR$^2$:通过强化学习统一检索增强生成与推理
提出UR$^2$强化学习框架,动态协调检索与推理,用难度感知课程和混合知识策略,在多项任务上超越现有基线,媲美GPT-4o-mini。
无需训练的学习:上下文学习的内隐动力学
LLM通过自注意力与MLP层堆叠,隐式更新MLP权重实现上下文学习,无需额外训练即可习得新模式。
隐私感知解码:缓解检索增强生成中大语言模型的隐私泄露
提出PAD轻量级解码防御,通过注入校准噪声、置信度筛选与噪声校准,减少隐私泄露并保持效用,提供差分隐私保证。
增强同义改写类型生成:基于人工排序数据评估DPO与RLHF的影响
利用人类排序数据与DPO训练,同义改写类型生成准确率提升3%,人类偏好提升7%,检测F1达0.91,提升语义可靠性。
CTR-Sink:点击率预测中语言模型的注意力沉点
提出CTR-Sink框架,通过行为级注意力沉点缓解语义碎片化,提升点击率预测性能,多数据集验证有效。
技能奖励模型:通过智能体技能统一异质评估标准
Skill-RM将奖励建模重构为可复用技能执行,统一异质评估标准,动态聚合证据,超越传统基线。
神经元群体的选择性随规模分化
Rosetta神经元数量随规模次线性增长、占比下降,选择性增强并极化,揭示共享神经元结构缩放定律。
评估模型编辑中的逆向诅咒
模型编辑存在逆向诅咒:正向准确但逆向缺陷大,上下文学习可部分缓解,结合其他方法成新方向。
Typhoon:一种有效的预训练语言模型任务特定掩码策略
Typhoon任务自适应掩码策略经严格评估,在GLUE任务上与随机掩码无显著差异。
无排序RAG:在敏感领域用选择取代重排序的RAG方法
METEORA用基于理由的选择替代重排序,召回率提升13.41%,精确度提升21.05%,证据量减少80%,答案准确率提高33.34%,对抗鲁棒性提升4.4倍。