通过信息增益改进掩码扩散模型的采样
提出Info-Gain Sampler,平衡即期不确定性与信息增益,提升掩码扩散模型采样性能。
BURMESE-SAN:用于评估大语言模型的缅甸语自然语言处理基准
首个缅甸语LLM基准BURMESE-SAN,覆盖理解、推理与生成任务,揭示模型架构与微调比规模更关键。
面向智能体AI的技能检索增强
提出技能检索增强(SRA)新范式,构建SRA-Bench基准,发现技能整合瓶颈,为智能体系统能力可扩展增强奠基。
TurkicNLP:面向突厥语系的NLP工具包
开源NLP工具包,统一API覆盖四种文字体系,集成多任务管道,解决突厥语系碎片化问题。
SemEval-2026 任务6:CLARITY——揭穿政治答非所问
提出CLARITY任务,含清晰度与回避策略两个子任务,LLM提示法最优,清晰度F1达0.89,回避策略仅0.68。
基于本地大语言模型与布局感知解析的表格PDF信息提取:可靠性评估
本地LLM与确定性方法结合可高效准确提取表格PDF信息,Camelot+LLM管道达到亚秒级处理,Qwen2.5模型性能最稳定。
池化与语义偏移:长文本嵌入与检索的根本挑战
池化操作引起嵌入坍缩,语义偏移是长文本检索性能下降的根本原因。
RoIt-XMASA:面向罗马尼亚语和意大利语的多领域多语言情感分析数据集
提出含3.6万标注样本的多语言情感数据集,采用多目标对抗训练,XLM-R达66.23% F1,提升4.64%。
语言模型处理差异论元标记中的类型学对齐差异
GPT-2模型模拟差异论元标记时,表现对人类标记方向偏好,但未重现宾语标记优势。
SciNet:面向关系感知科学文献检索的AI代理评估
首个科学网络关系数据集SciNet,揭示现有检索代理关系任务准确率不足20%,但赋能后文献综述质量提升25.3%。
中文标题:稳定行为与有限变异:城市情感感知中LLM代理的角色有效性
中文摘要:LLM代理对城市情感判断表现出稳定一致性,但不同人设间差异有限,性别无影响,无人物模型有时更准确。
句法引导的句子理解中的信息维持
句法结构引导选择性维持预测关键信息,成本受预测头数和未完成依存数影响,二者不可简化,日语数据支持,英语不显著。
冻结深层,训练浅层:面向持续预训练的可解释层分配
提出LayerTracer框架,发现深层稳定关键,训练浅层冻结深层优于全参数微调。
PRISM:面向长程智能体的意图感知结构化记忆上的帕累托高效检索
无需训练,通过图结构记忆的检索与压缩,在极小上下文预算下实现高准确度,兼顾答案质量与检索效率。
HalluScan:一个用于检测和缓解指令遵循大语言模型中幻觉的系统性基准
提出HalluScan基准,含HalluScore(专家相关r=0.41)与ADR(降本2x,AUROC仅降0.1%),NLI验证AUROC达0.88。
FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准套件
FINESSE-Bench提出分层基准套件,含8个专门任务共3993题,评估大模型金融知识与技术分析能力。
向量检索中的相似性与多样性:难度几何?
首次证明联合优化相似性与多样性的向量检索是NP完全问题,并提出无参数启发式算法,超越MMR等基线。
基础模型生成缺失模态:我们还有多远?
本文评估三种缺失模态重建范式,发现基础模型在细粒度语义提取与生成验证上不足,提出代理框架与自精炼机制,显著提升性能。
GradingAttack:揭露基于LLM的教育评分代理的安全漏洞
提出GradingAttack框架,揭示LLM教育评分代理易受对抗攻击,需加强安全防御。
MAS-Orchestra:通过整体编排与受控基准理解并改进多智能体推理
提出整体编排框架和受控基准,揭示多智能体系统收益的关键因素,实现高效改进。
SciHorizon-GENE: 从基因知识到功能理解的生命科学推理大模型基准测试
提出SciHorizon-GENE基准,含19万基因54万问题,评估LLM基因功能推理,揭示模型异质性与挑战。
PROGRESSLM: 迈向视觉语言模型中的进度推理
提出Progress-Bench与两阶段进度推理范式,多数模型进度估计能力弱,训练型ProgressLM-3B表现提升。
GT-HarmBench:通过博弈论视角评估AI安全风险
GT-HarmBench测试1535个高风险博弈场景,发现前沿模型38%失败,博弈论干预提升18%社会效益。
评估LLM智能体的记忆结构
提出StructMemEval基准,测试智能体组织记忆结构能力,发现提示可提升但LLM自主识别不足。
多模态推理的视觉引导策略优化
VGPO通过视觉注意力补偿和双重优势重加权,增强视觉焦点,提升多模态推理性能。
熵感知的在线策略蒸馏语言模型
熵感知在线策略蒸馏动态平衡反向与正向KL,解决教师高熵问题,提升生成多样性与知识迁移,数学推理性能显著提高。
熵-梯度反转:迈向大型推理模型的内部机制
识别熵-梯度反转作为推理能力指纹,提出CorR-PO正则化方法,有效提升推理性能。
移动世界模型如何引导GUI智能体?
移动世界模型以可渲染代码和文本指导GUI智能体,代码高保真、文本鲁棒,生成轨迹提升性能,后验反思对自信智能体增益有限。
利用生成式AI拓宽交通安全数据获取途径:一种基于模式的空间自然语言查询框架
提出基于模式的自然语言接口,结合生成式AI与确定性执行,拓宽交通安全数据访问,验证层纠正了29%的错误。
“略微”是否意味着“有点”?测量LLM数值行为中的模糊强度词汇
LLM将10个强度词压缩为5种数值输出,且解释受系统状态影响,边界附近行为不连续。
RankJudge:多轮LLM评判合成基准生成器
RankJudge生成含单处缺陷的多轮对话对,评估LLM评判能力,通过Bradley-Terry排名并动态筛选降低噪声。
通过语言模型函数调用的反思性提示调优
提出反思性提示调优(RPT),用函数调用诊断错误模式并迭代优化提示,在推理任务上提升12.9%并改善校准。
Sem-Detect: 语义级检测AI生成的同行评审
提出Sem-Detect方法,利用AI观点趋同而人类多样的原理,结合文本与语义分析区分评审,二分类TPR提升25.5%,LLM润色后误判率<3.5%。
概率归因用于大语言模型
使用贝叶斯规则计算条件概率比,得到模型无关的token归因分数,结合熵分析提升LLM可解释性。
PromptNCE: 仅使用大语言模型和对比估计提示进行点互信息预测
PromptNCE通过对比提示+OTHER,零样本估计点互信息,相关性达0.82,适用低数据场景。
CR4T:基于重写的青少年大语言模型安全护栏
提出CR4T框架,通过选择性重写不安全或拒绝输出为年龄适宜指导,减少风险并避免对话僵局。
面向文本到SQL集成模型的残差技能优化
DivSkill-SQL无需微调,通过残差技能优化提升集成模型Pass@K,显著提高准确率并减少幻觉引用。
中文标题:当病例变得罕见:面向非指南临床问答的检索基准
中文摘要:提出OGCaReBench基准,评估LLM处理罕见非指南临床问答,最佳模型仅56%正确,检索增强可达82%。
LatentOmni:通过统一音频视觉潜在推理重新思考全模态理解
提出LatentOmni框架,用统一潜在空间进行音频-视觉推理,超越文本链,提升全模态理解性能。
SpecHop:持续推测以加速多跳检索代理
SpecHop通过多线程推测与异步验证,在保证准确率前提下,将多跳检索延迟降低达40%。
高风险医疗检索增强生成的声明选择性认证
在混合证据下,将医疗RAG响应分解为可验证声明,评分后映射至完整/部分/冲突/弃权四种操作,实现证据关联的精确选择。
诊断并非处方:语言共同适应解释LLM流水线中的修补风险
诊断非修补处:路由模块修补有害,上游修补有效,语言共同适应导致风险,跨代理族验证。
比较LLM与微调模型在不同提示复杂度下对NVDRS情境提取的表现
研究提出混合架构:LLM处理罕见复杂情境,微调模型处理常见情境,有效提升提取性能。
ACC:编译智能体轨迹用于长上下文训练
ACC将智能体轨迹转化为长上下文QA对训练,在长距离依赖任务上显著提升,媲美更大模型且保持通用能力。
超图即语言
提出超图即语言视角,通过Hyper-Align框架将高阶关联结构序列化并映射到LLM,在域内和零样本评估中显著超越现有方法。
基于Token权重的直接偏好优化与注意力机制
提出TwDPO和AttentionPO,利用LLM自身注意力估计token权重,提升对齐性能。
从TF-IDF到Transformer:情感分类的比较与集成方法
比较多种模型,RoBERTa最优(93.02%准确率),软投票集成提升分类性能。
中文标题
幻觉源于承诺失败:大模型虽知答案,却因概率分散而错误,规模越大越显著。
Structure Retention in Embedding Spaces as a Predictor of Benchmark Performance
Hy-MT2:面向复杂真实场景的快速、高效、强大多语翻译模型系列
Hy-MT2系列多语翻译模型(1.8B/7B/30B),支持33语言,量化后仅440MB,性能超越DeepSeek等开源模型。