EntmaxKV: 支撑感知的Entmax注意力解码
EntmaxKV利用entmax精确零点实现支撑感知稀疏解码,大幅减少KV缓存并加速,误差可控。
放大而非学习:微调AI文本检测器放大了预训练方向
AI文本检测器放大预训练典型性轴,而非学习新边界;该轴在非母语写作中反转,校准偏移主导微调差异。
Value-Gradient Hypothesis of RL for LLMs
X-Token:投影引导的跨分词器知识蒸馏
提出X-Token方法,通过稀疏投影矩阵消除分词不匹配,解决未常见词失效和过度保守匹配问题,在多教师蒸馏中性能提升显著。
分布偏移下基于词典的可解释性保真度的几何自适应解释器
提出GAE方法,无需梯度更新,通过几何对齐减少分布偏移造成的词典解释器保真度下降。
能量门控注意力:谱显著性作为Transformer注意力的归纳偏置
提出能量门控注意力(EGA),用学习到的谱能量门控注意力,使信息密集token获得更多关注,少量参数即提升语言模型性能。
LLM时代的规划:构建可靠性与高效性
LLM规划从单次生成转向可验证的符号求解器,实现推理时的高可靠与高效率。
Echo:通过用户驱动的精炼从经验数据中学习
Echo框架利用用户对智能体输出的精炼,将原始交互转化为训练信号,持续对齐真实需求,性能接受率从25.7%提升至35.7%。
Maestro:层次化模型-技能集成的强化学习编排
提出强化学习编排框架,动态组合专家模型与技能库,以4B参数量超越GPT-5等,泛化至未见模型。
Reflecti-Mate:一种通过系统1和系统2思维实现自适应决策支持的对话代理
提出适应个体思维模式的对话代理,促进快慢思考整合,优于基线代理,提供更个性化反思支持。
中文标题
5行代码SVD分解LLM权重,揭示训练数据、语义子空间及不当内容,无需模型推理。
通过自我调节的模拟规划实现高效智能体推理
提出三系统推理架构(SR²AM),实现高效规划,减少25-95%推理令牌,RL提升规划深度而非频率。
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
生存还是崩溃:数据门控与奖励锚定在自对弈强化学习中的非对称作用
数据门控而非奖励校准是自对弈稳定性的关键约束,严格门控可确保稳定,移除门控后奖励无法挽救。
棘轮:一种用于自进化LLM智能体的最小化卫生配方
Ratchet通过四机制管理技能库,使冻结LLM性能提升32.8%,远超无技能基线(+0.2%)。
面向边界的安全分类器成员推断攻击
提出边界目标策略,利用低置信度例子放大成员信号,恢复率提升3.5倍,内容过滤无效,噪声可缓解。
用于实体跟踪的结构化稀疏注意力,具有次二次序列复杂度
提出块状评估方法,利用注意力稀疏性实现次二次复杂度,在实体跟踪中速度提升达2.4倍且精度不变。
Epicure:探索食材嵌入中涌现的几何结构
提出Epicure家族多语言食材嵌入,通过混合共现与化合物图游走,在化学与食谱上下文间取得平衡。
通过灵活术语定义表示语境变化
认知语言学应用于术语定义,提出灵活定义反映语境变化,实证分析三种现象并给出构建指南。
AnyMo:几何感知、不受设备设置影响的野外人体运动建模
AnyMo通过物理模拟和图形编码,实现与设备设置无关的人体运动建模,显著提升零样本识别、跨模态检索和运动字幕任务性能。
双奖励胜于单奖励:一种无崩溃的多奖励RLIF训练框架
提出双互补内部奖励与正则化的多奖励RLIF框架,避免熵崩溃,性能接近监督RLVR。
Search-E1:自蒸馏驱动搜索增强推理中的自我进化
Search-E1仅用GRPO和离线自蒸馏实现自我进化,无需外部监督,在7个QA基准上超越开源基线。
多任务放射学报告生成中的双重困境:梯度动力学分析与解决方案
提出CAME-Grad优化器,解决线性标量化导致的梯度漂移与衰减困境,在多种方法上平均提升临床性能约2%。
扩散理论教程:从微分方程到扩散模型
从微分方程视角讲解扩散模型,涵盖前向/逆向过程、分数匹配训练、采样方法及DDPM/DDIM与SDE/ODE关系。
AMEL:累积消息对大语言模型评判的影响
AMEL发现LLM评判受历史偏向,负向偏误更重,建议每项独立上下文。
超越声学情感识别:基于LLM和声学情感模型的政治演讲多模态悲情分析
LLM多模态分析比纯声学模型更有效捕获政治演讲情感;Gemini效价与悲情评分强相关(ρ=0.664),声学模型不相关。
SpaceDG:在视觉退化下评测空间智能
首个退化感知空间理解基准,揭示多模态大模型视觉退化下空间推理鲁棒性差,微调可提升至超人水平。
向量策略优化:训练多样性以改进测试时搜索
VPO算法通过训练多样化解并利用向量奖励,显著提升测试时搜索性能,尤其随搜索预算增加优势扩大。
MAP4TS:面向大型语言模型时间序列预测的多视角提示框架
提出MAP4TS框架,融合经典时间序列分析于提示设计,通过多视角提示和跨模态对齐模块,显著提升预测性能。
用全科医学基准评估大型语言模型的临床能力
提出GPBench基准评估LLM,发现现有模型不适合自主全科医疗,需人类监督与优化。
内部叙事参数化情感状态
内部叙事的结构和动态可量化情感状态,预测抑郁评分,叙事变化驱动情感改变,基线严重度预测后续波动。
框架入,框架出:衡量LLM生成新闻摘要中的框架偏差
首个大规模基准FIFO揭示:LLM摘要框架率高于人类,科学和健康类尤甚,框架偏差成摘要质量新维度。
基于无模型推测采样的加速测试时扩展
提出STAND无模型推测解码法,利用推理轨迹冗余加速测试时扩展,降低延迟60-65%且不损精度。
MTR-Bench:多轮推理评估的综合基准
提出MTR-Bench基准,含4类40任务3600实例,全自动评估,揭示大模型在多轮交互推理上表现不足。
面向问答的实体链接代理
提出基于大语言模型的实体链接代理,模拟人类认知流程,解决短问题实体链接难题,实验验证有效。
LightReasoner:小语言模型能教会大语言模型推理吗?
利用强弱模型差异,LightReasoner通过关键推理时刻采样与微调,大幅提升大模型推理性能,资源消耗降低90%以上。
StructSense: 任务无关的智能体框架,用于结构化信息提取,集成人在回路评估与基准测试
StructSense框架通过本体引导、智能体自评估和人在回路验证,实现高精度结构化信息提取,跨任务通用。
RAGCap-Bench:基于智能体的检索增强生成系统中大语言模型能力基准测试
RAGCap-Bench评估智能体RAG中LLM的中间推理能力,实验表明增强该能力可提升端到端效果。
训练轨迹感知的令牌选择
提出T3S方法,解决蒸馏中模仿锚令牌与待学令牌不共存问题,仅用少量示例即显著提升推理性能。
MemEvoBench:评估LLM智能体记忆误进化的安全风险基准
首个评估LLM智能体长期记忆安全基准,发现记忆误进化导致安全退化,静态防御不足。
SimCT: 恢复跨分词器策略蒸馏中丢失的监督
SimCT用共享token加短多token延续恢复跨分词器蒸馏丢失的监督,提升数学推理与代码生成性能。
修复结构瓶颈:通过显式信息传输进行上下文压缩
ComprExIT通过自适应跨层特征选择和全局协调传输解决压缩的结构瓶颈,性能提升18.5%,参数仅增1%。
超越基准孤岛:面向自主AI的代表性可信度评估
定义自主AI可信度五属性,提出HAAF评估框架,通过分布感知采样与跨模型迁移实现代表性评估。
中文标题:迈向真实世界人类行为模拟:在长期、跨场景、异质行为轨迹上基准测试大型语言模型
中文摘要:提出首个真实数据用户模拟基准OmniBehavior,揭示LLM存在结构性偏差,丢失个体差异及长尾行为。
当大语言模型不再遵循步骤:语言模型中程序执行的诊断研究
LLM执行程序时随步骤增多准确率骤降,存在缺失、过早、自我修正、未执行和幻觉,忠实执行薄弱。
TingIS:企业级规模下从嘈杂客户事件中实时发现风险事件
TingIS多阶段事件链接引擎结合LLM,从噪声客户事件中实时发现风险,延迟3.5分钟,发现率95%。
UniSD:面向大型语言模型的统一自蒸馏框架
提出UniSD统一自蒸馏框架,集成多教师一致性、EMA稳定、对比学习等机制,在多个LLM上性能显著提升,比基线高5.4分。
SpecBlock: 块迭代式推测解码与动态树草稿
SpecBlock通过块迭代与动态树草稿,兼顾路径依赖与低开销,比EAGLE-3加速8-13%,草稿成本降低一半以上。
DocAtlas:跨越80多种语言的多语言文档理解
DocAtlas构建覆盖82种语言的高保真OCR数据集,通过双流水线产生精确结构注释,无需学习模型,DPO适配多语言,最佳变体提升1.7%。
使用语义级奖励校准大语言模型
CSR框架在语义空间直接校准模型,无需置信度接口,ECE降低40%、AUROC提升31%。