MemGym:面向LLM智能体的长周期记忆环境
MemGym是长周期记忆基准,涵盖对话、搜索、编码等任务,隔离评估记忆能力,适配真实环境。
消费级硬件上的GraphRAG:面向医疗保健EHR模式检索的本地LLM基准测试
消费级硬件上GraphRAG可行,但模型需≥7B,本地检索优于全局摘要。
提升科学话语:面向科学领域的机器翻译
为促进跨语言科学交流,开发了西-英、法-英、葡-英科学语料库,涵盖通用及四个子领域,用于微调并评估神经机器翻译系统。
Terminal-World:通过智能体技能扩展终端智能体环境
Terminal-World自动化流水线以技能为中心合成任务、环境与轨迹,用1.2%训练数据超越基线,Terminal-Bench 2.0上Pass@1达31.5。
校准与决策:重新审视遗忘学习语言模型中的可靠性悖论
机器遗忘中,低校准误差可与捷径决策共存,可靠性悖论延伸至该场景。
基于认知评价的任务路由混合专家模型用于隐式情感分析
提出认知评价感知的多任务学习框架,用任务级混合专家模型减少干扰,在隐式情感分析上取得领先效果。
用发音音素识别评估语音发音合成
提出用发音音素识别评估语音合成,证明发音特征更能捕捉发音细节,助力新维度探索。
策略归纳:面向指令生成的任务级策略归纳
Strategy-Induct框架仅从问题示例推导任务指令,无需标签答案,显著提升LLM推理性能。
法律领域细粒度声明级RAG基准
提出法律RAG细粒度评估数据集ClaimRAG-LAW,双语覆盖专家与非专家,发现检索与生成局限。
记忆嫁接:通过离线条件记忆扩展语言模型预训练
提出记忆嫁接法,利用离线条件记忆扩展模型容量,降低开销并提升预训练性能,实验优于MoE和Engram基线。
单次通过、深度选择性读取的多方面情感分析
提出DABS单次编码框架,通过深度选择性读取实现高效多方面情感分析,性能相当且计算量减少高达60%。
面向上下文不变的大型语言模型安全对齐
提出锚定不变性正则化AIR,仅优化开放变体,显著提升安全鲁棒性。
JobArabi:来自社交媒体的阿拉伯语招聘公告语料库与分析
构建了20528条阿拉伯语招聘公告语料,揭示了性别化语言、地区需求差异等社会语言学模式。
ArPoMeme:一个用于政治意识形态和极化的带标注阿拉伯语多模态数据集
首个大规模阿拉伯政治表情包数据集,标注意识形态与极化维度,揭示对抗性框架差异。
从零开始利用招聘信息构建AI技能与任务的自定义分类法
利用LLM构建分类法时,过滤输入数据可提升领域覆盖,TaxonomyBuilder验证了该设计策略。
跨语言鲁棒性的大语言模型-大脑对齐及其计算根源
跨语言大脑-LLM对齐稳定,非预测或几何解释,源于词汇语义对应。
Beyond Text-to-SQL: An Agentic LLM System for Governed Enterprise Analytics APIs
APM:评估大语言模型中基于任意偏好映射的风格个性化
引入APM基准,通过隐藏随机映射评估个性化,发现路由最可靠,RAG依赖强基模型,软提示优化效果不佳。
LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control
GradeLegal:德国法律案例自动评分系统
研究27个大模型自动评分德国法律案例,公法评分最高0.91,刑法仅0.60,集成可提升15%。
LamPO:面向推理语言模型的Lambda风格策略优化
LamPO用成对分解优势替代标量优势,结合置信权重与辅助奖励,提升推理模型训练稳定性及样本效率。
WCXB:多类型网页内容提取基准
提出WCXB基准,含2008页七种类型,评估13系统,揭示结构化页面提取性能差异显著。
ACL-Verbatim:面向研究的无幻觉问答
提出基于VerbatimRAG的提取式问答系统,构建人工标注基准,150M参数模型F1达53.6,优于LLM提取器。
更智能的编辑?带有错误高亮和翻译建议的译后编辑
自动译后编辑的错误高亮和纠正建议未提升效率质量,但更受欢迎并改善用户体验。
精神科诊断的自动ICD分类:从经典NLP到大型语言模型
基于西班牙语精神科描述,利用从经典NLP到LLM的方法实现自动ICD分类,e5_large微调达最高F1=0.866。
中文标题:文学译后编辑中的隐喻:打开潘多拉魔盒?
中文摘要:研究表明文学译后编辑中三分之一隐喻被修改,质量差且比重新翻译更费力,支持了译后编辑限制创造力的观点。
Manga109-v2026:为现代漫画理解重新审视Manga109标注
修正Manga109约2.9万处对话标注,构建v2026版本以解决转录错误等问题,适配现代漫画理解。
大型语言模型是否了解卢森堡语的借词?探针低资源多语言模型中的词汇新词
通过知识图谱提示,借词分类准确率从25-35%提升至71-81%,但新词检测仍困难,且受少量样本设计影响。
Tracing the ongoing emergence of human-like reasoning in Large Language Models
西班牙临床笔记中的可靠自动分诊:风险感知型HIV疑似识别的混合框架
提出风险感知混合框架,双重验证解耦不确定度,实现可靠HIV疑似识别。
量化形态融合对一致吸引的跨语言影响
大模型指标证实:形态融合增强英、德语一致吸引,不影响土耳其语,部分解释俄语模式。
TextReg:通过正则化文本空间优化缓解提示分布过拟合
TextReg框架通过正则化文本空间优化,有效缓解提示分布过拟合,在多个推理基准上提升OOD泛化,准确率最高提升16.5%。
文本分析评估框架:以大语言模型与社交媒体为例的研究
提出含470问题的评估框架,测试LLM对社交媒体文本的理解与推理,发现输入超500时性能显著下降,尤其数值任务。
符号光V1:尖峰门控双路径语言模型——高激活稀疏性与亚十亿级预训练证据
提出尖峰门控双路径语言模型,194M参数训练后达>89%稀疏性,困惑度接近GPT-2,验证了时间积分而非稀疏性本身驱动性能,为神经形态部署奠定基础。
第五届多语言共指消解共享任务的结果:扩展面向长距离实体的数据集
第五届任务聚焦长距离实体,新增5数据集和2语言,10系统参赛,LLM潜力大,传统仍领先。
中文标题
提出CoTrace框架衡量AI目标级贡献:模型仅占11-26%,间接影响显著,用户感知存系统偏差。
LASH:面向大语言模型黑盒越狱的自适应语义混合技术
LASH自适应混合多种攻击策略,黑盒越狱成功率84.5%,仅需30次查询
借助条件尺度熵事后理解仅解码器语言模型中的隐喻处理
条件尺度熵揭示隐喻token在解码器模型中频谱广度更高,表明多尺度协调是隐喻处理标志。
Mem-π:通过学会何时生成以及生成什么来实现自适应记忆
Mem-π框架让智能体按需生成上下文相关指导,通过决策-内容解耦强化学习训练,在网页导航等任务中性能提升超30%。
利用大型语言模型进行语法适配:元模型-语法协同演化研究
提出LLM自动语法适配方法,测试集一致性达100%,优于规则方法,但大规模语法适配不足90%。
DASH:单GPU上几分钟内快速可微分混合注意力架构搜索
DASH框架实现分钟级可微分搜索,仅用12.3M tokens,20分钟即可发现优于现有方法的混合注意力架构。
隐藏在众目睽睽之下:在 Reddit 上寻找 MAHA
发布涵盖12个MAHA主题的Reddit数据集(2020-2025,1940万帖),用于研究运动动态。
Lean Refactor:通过智能策略搜索实现多目标可控证明优化
提出即插即用检索增强框架,实现多目标、版本鲁棒的Lean证明重构,显著压缩证明并减少编译时间。
AgentAtlas:超越基于结果的LLM智能体排行榜
提出AgentAtlas框架,通过六状态决策、九类失败、提示监督测量及基准审计,实验表明模型依赖标签菜单,无单一模型全能。
验证器严格性的隐藏信号:通过选择性潜在引导控制和改进逐步验证
发现验证器严格性隐藏信号,通过选择性潜在引导控制验证行为,无需微调即可平衡错误检测与正确认证。
多智能体协作中的状态管理
STORM通过状态管理实时检测并解决多智能体代码冲突,性能优于工作空间隔离,成本效率相当,可无缝集成。
分布感知奖励:基于预测分布的强化学习用于大语言模型回归
提出分布感知奖励,通过优化预测分布提升LLM回归校准性与鲁棒性,Spearman最高提升6点。
中文标题
在1-3B参数规模下,20种最新Transformer改进仅2种有效,注意力输出改进的损失-下游差距显著扩大,需噪声基线、下游评估和跨规模稳定性测试。
SMoA:用于参数高效微调的频谱调制适配器
提出SMoA,通过频谱块划分与Hadamard调制低秩分支,在低参数预算下提升微调性能,优于LoRA。