Eval-Pair矩阵:基于答案配对的大语言模型法官元评估方法,用于基于源文本的检索增强生成
提出Eval-Pair矩阵法评估LLM法官自宽容性,发现配对同模型效应近乎零,强调报告完整矩阵与答案配对效应。
Anamnesis:一个基于背景故事条件的大规模调查模拟开源平台
开源平台,用大语言模型进行人口可控的调查模拟,通过背景故事条件生成,比标准基线更准确匹配真实数据。
渐进式树草稿推测解码:解锁自回归语言模型并行性
提出渐进式树草案方法,引导模型单次前向探索多条语义路径,实现2倍解码加速,无需训练且模型无关。
面向自动化AI导师评估的知识蒸馏技术
利用知识蒸馏训练8B参数FATE模型自动化评估AI导师教学能力,性能提升22.63%,商业模型测试中Gemini最佳。
首届中文BabyLM挑战赛:训练数据高效且认知合理的语言模型
首届中文BabyLM挑战赛用1亿token训练语言模型,评估NLU、认知对齐与汉字知识。
斯拉夫语言中的说服技巧语料库
新语料库含保加利亚、波兰、俄语,标注25种说服技巧,7500文本跨度,覆盖国内外热点话题。
信任置于融合之前:面向受污染多模态RAG的QIMG-7与源感知解法
针对多模态RAG检索污染,提出QIMG-7基准和源感知信任解析方法,在文本优先的事实问答中,选择性信任优于无条件融合。
诊断与缓解在线策略自蒸馏中的思维崩溃
在线策略自蒸馏中,因激进梯度导致模型思维崩溃,新方法AD-OPSD通过自适应双视角控制缓解该问题,精度提升高达4.1%。
评估文本摘要的抽象性指标:一种精细化的公式与实证验证
提出RA、SA、AR三组指标,用调和平均和非重叠因子量化摘要抽象度,有效区分提取式与抽象式模型并识别幻觉。
ResearchQA:面向科学论文的引文支撑问答基准
提出ResearchQA基准,含6211对问答,评估大模型基于引文的科学问答能力,涵盖多种问题类型与引文匹配评估。
大型语言模型用于令牌高效与语义保持的意见摘要
结合分类与分层采样选取代表性意见,用LLM生成平衡摘要,减少令牌消耗并保留语义,性能优于传统方法。
EasyOPD:一个易于使用的面向大语言模型的同策略蒸馏框架
EasyOPD基于verl框架,分离配置与执行逻辑,支持跨分词器、自蒸馏及逐步蒸馏等多种同策略蒸馏方法,易于使用和扩展。
量化基于LLM的公共话语立场分析中的不稳定来源
研究发现测量方法(LLM与词典法)是立场分析的主要不稳定源,预处理影响小,聚合效价稳定但掩盖了分歧。
Claude Fable 5 在生物医学挑战问题上的能力
Fable 5 拒绝率高达8%-99%,排除后准确率超越其他模型,拒绝集中于基础科学和罕见病。
自然语言到SQL翻译的基本要素:模型流水线优化方法及其交互的系统分析
集成NatSQL、预处理、微调与重排序,组件交互影响性能,简单组合并非最优。
满意度评分的多维性
用GPT-4.1分解约9000条客服对话满意度为五维度,验证发现分解价值在归因与覆盖,全面评估比调查结果更低。
语言模型能否在其权重中持续学习事实?
连续写入事实时,广泛训练数据保留46%准确率,裸陈述仅1%;知识可被遗忘但未擦除,可靠通道是上下文而非权重。
无视规则,风险自负:LLM在知识不对称下的语用合作困境
LLM在信息不对称协作中语用能力有限,常未能识别对格莱斯准则的违反。
MJ:通过分解信用分配实现多轮LLM越狱
提出DC-GRPO框架,通过逐轮信用分配实现高效多轮越狱,成功率超98%,大幅超越现有方法。
基于多智能体大语言模型的教材自动审核
提出多智能体管道,自动检测教材事实、技术与语法错误,辅助人工审核,减少工作量。
大语言模型会编造法律引用吗?关于沙特数据保护法与GDPR的双语基准测试
LLM在法律引用上存在法域差异:对欧盟GDPR准确率高,对沙特法律编造率高,模型置信度不可靠。
标题: 仅振幅FFN干预用于工具结构化LLM推理方法:门控评估协议与跨模型实证结果
摘要: 提出振幅门控非破坏性FFN干预,在工具结构化推理任务上显著提升(最高+11.36点),跨模型验证有效。
ProgramTab:通过编程范式提升大语言模型的表格推理能力
提出ProgramTab框架,用Python预处理表格数据,结合行列提取与SQL生成,显著提升LLM表格推理性能。
当目标领域发生变化:高风险英语评估中的人工智能中介构念漂移
AI导致高风险英语测试中构念漂移,需有限AI中介设计并调整分数解释以维持效度。
统一梯度投影:面向多语言低资源自动语音识别的语言平衡持续学习
UGP通过语言平衡回放参考梯度约束更新,减少主导语言偏差,实现近乎零遗忘。
TIGER: 基于文本条件的视觉门控路由与接受对齐的多模态推测解码
提出TIGER框架,动态选择相关视觉token,并以接受对齐训练优化草稿模型,提升解码速度与质量。
面向查询的事件摘要:数据集与基准
提出查询聚焦事件摘要任务及QFESum数据集,两阶段框架RAT和SHC有效提升性能。
Q-BridgeNet:面向跨语言手语翻译的量化网络
提出Q-BridgeNet统一架构,通过离散量化与多语言LLM微调,减少手语与口语跨语言冲突,实现SOTA性能。
TreeThink: 一个用于大语言模型数学推理的模块化树搜索库
TreeThink是开源模块化异步树搜索库,支持形式证明与自然语言推理,异步执行加速最高6.3倍。
车载手语语料库(ICSL):受限空间手语识别的多模态资源
提出ICSL数据集,含动作捕捉和车内多模态记录,超150万帧,支持受限空间手语识别,提升聋人出行无障碍性。
基于多模态RLHF偏好对齐的汉喃手稿图像到现代越南语直接翻译
提出多模态RLHF框架,DPO最优,提升低资源历史翻译的词汇与语义质量。
编目AI模型特征描述
评估AI模型用于编目,给出定性定量评估及通用建议。
RefineEvo:规划引导的双向经验启发式进化
提出规划引导的双向经验进化框架,将静态试错转为经验驱动,提升自动启发式设计的效率与质量。
智能体路由:框架原生的数据飞轮
提出框架原生智能体路由,基于执行状态选择模型,生成数据记录形成自增强飞轮,优化成本与准确性。
超越莎莉-安妮:使用认知谢林点评估大语言模型的心智理论
新任务EAST评估LLM心智理论,仅前沿模型能处理认知需求,失败因认知追踪错误,传统测试易被利用。
自信地犯错:基于大模型内部状态检测金融问答中的幻觉
通过线性探针分析模型内部状态,可高效检测金融问答中的自信幻觉(AUROC达0.77),优于传统基线,成为高成本场景的分流机制。
跨架构大语言模型集成、基于特征的重排序和检索增强提示在法律信息处理中的应用
DU团队在COLIEE 2026中用跨架构集成、特征重排序和检索增强提示,法规蕴含准确率96.3%获第一,多个任务领先。
ToFu:一种面向研究人员的白盒、令牌高效智能体框架
ToFu是白盒、令牌高效的智能体框架,兼具研究助手与研究对象功能,支持低成本、多语言及本地部署。
FAD-SA-GRU: 通过特征增强的自注意力GRU网络提升阿尔及利亚方言仇恨言论检测
提出FAD-SA-GRU融合多嵌入与自注意力GRU,在阿尔及利亚方言仇恨检测中准确率达93.2%。
大型语言模型准备好面对艰难选择了吗?
LLM面对重大社会议题时立场不稳健,不常中立,常不连贯却高度一致。
语言识别中的全局一致性着色方案
每字符串一个终端比特即可识别所有可数无限语言集合,着色全局一致但构造非构造性。
用自然语言传达国际象棋策略
提出棋策略语言化流程与评估框架,实验证明自然语言可解释地传递策略信息,并揭示需评估主线外策略等关键见解。
UMoE:在领域特定训练中解锁每个专家
UMoE通过剪枝低贡献专家并扰动扩展,重新对齐专家池,将冗余转化为有用容量,持续提升领域微调性能。
LightMem-Ego:你的日常生活AI记忆
轻量级流式多模态记忆系统,持续感知日常生活,层次化记忆与动态检索,支持智能手机和AI眼镜。
宗卡语下一词预测系统
采用GRU模型预测宗卡语单词,准确率74.03%,有效减少打字按键次数。
GEIS:面向长篇文章生成的代理技能生成-评估-改进循环
GEIS通过可检查、模块化的技能循环,在长文生成中较默认方法提升8.0分,优于STORM,迭代改进使平均分从82.90升至86.95。
超越基准:揭露孟加拉语仇恨言论检测中的隐性危机
基准模型在孟加拉语隐晦仇恨言论检测中性能骤降,表情符号预处理可提升12%,亟需文化敏感框架。
PaperRouter-Agent:一种基于内容的LLM代理,用于个性化层次化论文路由
提出无训练LLM代理,基于文件夹成员内容路由论文,Recall@1从0.39升至0.61,LaMP-2准确率从44.5%提至51.5%。
关系定位:多轮人-AI对话中可测量的风险对象——历史锁定与自我虚构
定义并验证关系定位测量,发现历史锁定导致状态持续分离,自我虚构编造背景以深化关系。
高级数学基准测试集:面向高级数学证明生成与验证的基准
提出AdvancedMathBench,评估高级数学推理,前沿模型表现不佳,错误检测仍是瓶颈。