从统计学视角重新思考跨语言差距
从统计视角揭示跨语言误差源于目标语言响应方差,通过控制方差缩小差距,集成方法提升迁移分数达12绝对点。
FutureOmni:从全模态上下文中评估多模态大语言模型的未来预测能力
首个评估多模态模型音视频未来预测的基准,发现现有模型不足,提出OFF训练策略提升效果。
复述、奖励、重复:基于叙事理论的强化学习故事复述
RRR方法结合叙事理论与强化学习,无参考输出下提升故事复述逻辑性与完整性,成本低且有效。
DSB:扩散大语言模型的动态滑动块调度
DSB提出动态滑动块调度,无需训练,配合缓存机制,提升扩散LLM生成质量和推理效率。
利用用户日志改进大语言模型系统
提出UNO框架,从用户日志中提取规则与偏好,过滤噪声并量化认知差距,高效提升大语言模型系统性能。
基于叙事理论的大语言模型方法在自动故事生成与理解中的应用综述
叙事理论驱动LLM在故事生成理解中,生成落后于理解,未来应聚焦理论指标、情景化生成与理论验证。
MemRerank:用于个性化商品重排的偏好记忆
提出MemRerank框架,用强化学习训练记忆提取器,提升个性化重排的1-in-5准确率最高达10.61个百分点。
DiFlow-TTS: 基于离散流匹配的紧凑低延迟零样本文本到语音
提出DiFlow-TTS框架,采用离散流匹配与分解生成,平衡零样本语音合成质量与推理速度。
TopBench:面向表格问答中隐含预测推理的基准测试
TopBench评估大模型在表格问答中的隐含预测推理,发现模型常默认查找,意图识别是关键。
FLiP:理解与解释多模态多语言句子嵌入
FLiP模型可从多模态多语言句子嵌入中召回超75%词汇,揭示编码器偏差,无需下游评估。
主动学习中的敌对检测:人类与LLM标注比较——我们还需要人类参与吗?
LLM标注成本仅人类1/10,效果优于人工,但主动学习无优势;GPT-5.2双问题接口接近人,其他LLM过度标记。
从概念对齐的令牌到脆弱特征:越狱攻击的机制定位
通过令牌驱动SAE特征子组分析,单个有害令牌即可定位越狱脆弱特征,集中于中后期层。
MORTAR:面向大语言模型对话系统的多轮蜕变测试
提出MORTAR多轮蜕变测试方法,自动生成用例,比单轮测试多发现150%以上bug,提升测试效率与质量。
RCEM:分布偏移下的鲁棒对话搜索嵌入器
RCEM利用LLM重写查询对齐对话,保留原嵌入空间,减少过拟合,无需新标签,分布偏移下性能提升30%。
ScholaWrite:端到端学术写作过程数据集
首个追踪多个月学术写作全过程的数据集,揭示写作认知微动态与LLM辅助差距。
Transformer在图任务算法推理中的深度-宽度权衡
线性宽度下常数深度可解众多图任务,优于对数深度,但部分任务需二次宽度。
信任区域在线策略蒸馏
提出信任区域在线策略蒸馏(TrOPD),通过信任区域学习、异常值估计和离策略引导解决分布不匹配问题,性能优于现有方法。
个性化陷阱:用户记忆如何改变LLMs的情感推理
个性化记忆导致LLMs对不同用户的情感推理出现系统性偏差,可能强化社会不平等。
基于约束二进制优化的块移除实现大语言模型压缩
将LLM块移除压缩形式化为约束二进制优化,映射为Ising系统,深度压缩下MMLU提升23个百分点,轻压缩持平SOTA,高效通用。
GrowthHacker:使用代码修改的LLM代理实现离线策略评估自动优化
提出GrowthHacker基准,评估LLM代理自动优化OPE,two_agent成功率98%+,CrewAI平均改进37.9%,证实自动优化可行性。
Hilbert-Geo:通过神经符号推理求解立体几何问题
首个立体几何统一形式语言框架Hilbert-Geo,结合Parse2Reason方法实现SOTA推理,超越GPT-5等模型。
Continual Adaptation for Pacific Indigenous Speech Recognition
LLM搜索代理的可信度几何?评估其面对网络内容操纵时的认可脆弱性
提出SearchGEO框架,发现13个LLM后端的攻击成功率从0%到31.4%不等,模型间差异显著。
循环绑定——混合专家语言模型中的专家层绑定
提出专家绑定方法,跨层共享专家参数,内存占用减半且质量几乎无损。
对比差异CKA揭示跨语言模型架构的概念特定结构对齐
对比差异CKA通过样本对比差异核对齐,隔离概念特定结构对齐,揭示几何与功能分离,实现无训练跨架构诊断。
鲁棒双信号融合:混合神经符号门控与压缩思维链精炼用于社交媒体文本讽刺检测
RDS框架融合神经符号门控与压缩思维链,零样本讽刺检测性能媲美微调模型,三信号并发融合是关键。
遵循潜在路线图:利用锚定令牌导航扩散语言模型的可撤销解码
提出ASRD框架,利用锚定令牌解耦上下文,通过锚引导生成和扰动验证,提升扩散LLM解码精度6.4%、速度7.2倍。
再探上下文学习时代下的否定系统性
LLM通过上下文学习可部分识别否定表达与范围,但表现不完美;函数向量能提取否定线索,但范围识别更难。
中文标题:组合推理深度预测临床AI失败:电子病历问答中与Transformer组合性限制一致的实证证据
推理步骤增加导致大模型在电子病历问答中准确率单调下降,验证了Transformer组合性限制。
遍历顺序重要吗?Transformer文法中树遍历方法的系统性研究
探讨遍历顺序对Transformer文法的影响,提出BFT与混合策略PRT,揭示嵌套与前瞻权衡,提供任务感知建议。
从Reddit自我披露叙述中理解诈骗趋势与阶段路径
分析2023-2025年Reddit诈骗帖,发现诈骗多阶段且趋势随年份变化,路径复杂度因类型而异,社区支持行为日益细化。
罗素情感环状模型的数据驱动解码
多模态融合嵌入完美对齐罗素模型,零样本下情感词接近人类坐标,验证了环状结构是内在编码而非人工标注。
探索代码解释器有效推理的外在属性与内在属性
研究发现强模型的关键token和认知行为特征可提升部分推理性能,但存在局限。
TokenPilot: 面向LLM智能体的高效缓存上下文管理
TokenPilot通过双粒度框架,全局压缩与局部驱逐,降低推理成本61%-87%,性能持平。
价值轴:语言模型编码其当前轨迹是否正确
研究发现语言模型内在编码当前策略达成目标的可能性,价值轴可调控自信、纠错和探索行为。
说科学的语言:迈向通用自然科学生成基础模型
提出LOGOS统一框架,将科学对象编码为序列,实现多域任务,模型规模与性能正相关,主张AI4S与LLM深度对齐。
LESS即更多:扩散语言模型的互稳定性采样
提出LESS自适应采样器,基于互稳定性规则动态决定解封时机,减少72.1%逆向步骤并提升准确率。
IMPACTeen:青少年沟通数据集中的意图、操纵、说服、标注与后果
IMPACTeen是青少年社交影响文本数据集,含1021篇文本,从五视角标注,支持影响检测与跨语言建模。
KVEraser:学习引导KV缓存高效实现局部上下文擦除
KVEraser通过两阶段训练实现高效局部擦除,性能接近全重算,延迟仅增24%,支持长上下文。
DEEPRUBRIC: 证据树评分标准监督实现深度研究智能体的高效强化学习
DeepRubric用证据树生成查询-评分对,训练8B模型性能媲美先进系统,RL耗时仅1/13。
基于Nature Portfolio元分析文章的LLM代理基准测试
引入MetaSyn数据集,含442篇元分析。测试12种配置,发现系统最多恢复52.7%真阳性,LLMs难筛除PI/ECO干扰。
面向智能体和多模态大语言模型的上下文感知强化学习
提出ContextRL,通过奖励上下文选择提升长程推理与多模态性能,平均涨点2.2%和1.8%。
必要时刻聚焦:用于免训练视觉定位的自适应路由与协作定位
LazyMCoT动态免训练,根据样本难度自适应分配定位资源,提升准确率并降低延迟。
时频谱干扰混淆空间音频基础模型中的相位编码
通过心理声学基准评估,发现通用双耳SSL模型依赖时频谱干扰而非真实相位编码。
Human genetic evidence is associated with drug approval across therapeutic areas: an observational analysis of 26,278 target-disease pairs with temporal validation and feature ablation
An Empirical Study on Learning Latent Representations for Emotional Speech Synthesis
Cloze:一个用于研究心理健康背景下人机对话的开放研究平台
Cloze是用于心理健康人机对话研究的开源平台,支持受控实验、多模型接入和全数据溯源。
MAGE-RAG:面向长文档问答的智能体多模态RAG的多粒度自适应图证据
提出MAGE-RAG,通过离线构建多粒度证据图与在线自适应控制,平衡长文档多模态问答中证据覆盖与噪声,准确率可达52.75%。
中文标题
多模态模型中,文本路径获取的音乐知识比音频路径更易遗忘,表明遗忘具有路径依赖性。
实体标签并非实体信号:文档重排序中可观测相关性的框架
实体标签与实体信号不同,概念相关性与可观测相关性几无重叠,基于可观测相关性训练可大幅提升重排序效果。