xKV:通过对齐的奇异向量提取实现跨层KV缓存压缩
xKV跨层共享低秩子空间压缩KV缓存,最高8倍压缩,结合选择性重建实现4.23倍加速,性能领先。
若你能说服我:评估大型语言模型说服效果与易受影响性的框架
提出PMIYC框架自动化评估多智能体说服力与易受影响性,发现Llama-3.3-70B与GPT-4o说服力相当,但GPT-4o抵御误导信息能力高50%,o4-mini兼具强说服力与高抗性。
Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
EVADE-Bench:用于评估和增强规避性内容检测的多模态基准
首个中文多模态基准评估26个模型,发现易误判,规则分类与多智能体分解可提升检测效果。
代码的回归语言模型
提出统一回归语言模型,直接从代码文本预测执行数值(内存、延迟等),在多个任务上超越领域特定方法。
SelfJudge:通过自监督评判验证实现更快的推测解码
SelfJudge利用目标模型自监督训练评判器,自动衡量语义保持,实现更优推理速度与准确率平衡。
超越外部监控:提升大语言模型透明度以简化监控
提出TELLME方法提升大语言模型透明度,帮助监控不当行为,在去毒任务中有效,改善泛化能力。
Camellia:面向亚洲语言的大语言模型文化偏见基准测试
Camellia基准评估9种亚洲语言LLM文化偏见,揭示文化适应困难、情感关联偏见及实体提取性能差距。
使用性别代词和社会群体探究中文大语言模型中的社会身份偏见
中文大模型存在内群体-外群体偏见,女性标记代词毒性更高,语言结构揭示英语不可见的偏见模式。
评估大型中文语言模型的生成能力
提出CG-Eval框架自动评估中文大模型生成能力,引入Gscore指标量化文本质量。
大型语言模型在数学辅导中接近专家教学质量,但教学和语言特征存在差异
大型LLM辅导质量接近专家,但策略和语言不同:缺乏专家策略、用词更丰富礼貌;准确性与推理正相关,礼貌语言负相关。
HGMem:基于超图的工作记忆提升多步RAG的长上下文复杂关系建模
HGMem将记忆建模为超图,动态构建事实与思路的高阶关联,增强多步推理与全局理解,显著提升RAG性能。
知而忘之,用而记之:面向大型语言模型的上下文感知遗忘
现有遗忘方法损害上下文效用,新方法添加插件项恢复之,兼顾遗忘与效用。
JMedEthicBench:用于评估日语大语言模型医疗安全性的多轮对话基准
首个日语医疗多轮安全基准JMedEthicBench发现:医学专用模型更脆弱,安全评分随轮次显著下降,跨语言评估揭示对齐缺陷。
我们在衡量NLG的什么?——2020-2025年评估趋势的元分析
NLG评估存在指标惯性、映射问题及验证差距,LLM评判者激增但缺乏人类验证。
识别与缓解角色扮演代理中的瓶颈:角色档案轴解耦的系统研究
系统解耦角色档案三轴,发现道德倾向性为性能瓶颈,提出无训练策略FACD有效缓解差距。
大语言模型中句法与语义的差异性编码
研究发现LLM内层表示中句法与语义信息可线性分离,跨层编码不同,表明二者差异性编码。
医疗多智能体AI审计揭示虚假共识风险
审计框架发现多智能体系统存在过程失败,如权威偏见、未检查证据等,呼吁转向过程安全评估。
论口语语言模型评估中全局标记困惑度的谬误
指出全局标记困惑度评估口语模型失效,提出新方法更反映感知质量,重塑排名并缩小与人类差距。
InfiMed-ORBIT:通过基于评分标准的增量训练对齐大语言模型以处理开放式复杂任务
提出ORBIT框架,用动态评分标准指导增量强化学习,仅需2k样本即可显著提升医疗对话模型性能。
教导与评估大语言模型在聚合物设计任务中的推理能力
PolyBench含12.5万聚合物设计任务,通过知识增强推理蒸馏训练,7B-32B小中模型表现优异。
中文标题:公式一提示:面向应用数学的可组合方程优先前缀
中文摘要:提出方程优先提示法,在应用数学问题中先提取控制方程,比思维链和程序思维平均提升5.76和8.42个百分点,仅需68提示词开销。
外生锚点的注意力投影混合
ExoFormer通过学习外生锚点解决结构冲突,动态变体用更少令牌提升精度,归一化混合框架是关键。
大语言模型作为细粒度观点分析的自动标注器与标注裁决者
LLM在细粒度观点标注中跨度可靠,但关系结构不佳,更适合作辅助工具,难以完全替代人工。
读者是否更偏爱AI生成的意大利短篇小说?
AI生成的意大利短篇小说在盲评中获略高评价,但差异微小,挑战人类创作偏好。
PEAR:机器翻译中自动相对评分的成对评估
PEAR用成对比较预测翻译质量差异,以更少参数超越大模型,适用于无参考评估和最小贝叶斯风险解码。
基于嵌入的主题建模与大型语言模型分析癌症患者经历
研究用BERTopic和LLM分析13名癌症患者访谈,发现BioClinicalBERT模型最佳,揭示出协调沟通与治疗决策两大主题,可为临床提供反馈。
BEAR:多文档推理中的预算化证据分配
BEAR通过层级索引和粗到细证据访问,在有限预算下实现高效多文档推理,性能领先。
CALM-IT:通过双角色对话动态追踪生成逼真的长形式动机性访谈对话
CALM-IT框架通过追踪双角色动态生成逼真长对话,来访者接受率达64.3%,性能随长度增加退化小。
信任我,我是专家:解读与引导大型语言模型中的权威偏见
大型语言模型易受高权威误导,但该偏见可被引导消除,从而提升性能。
探索大型语言模型中的知识归因
通过隐层线性探测分类LLM知识来源,自监督生成数据达0.96 F1,零样本领先基准。
Transformer的语法:语言模型中句法知识可解释性研究的系统综述
综述337篇文献发现,Transformer模型编码可观句法知识,但在句法-语义接口及低资源语言上较弱,研究集中于英语和BERT。
注意力沉没催生注意力层中的原生MoE:针对头部崩溃的沉没感知训练
本文证明注意力沉没天然形成MoE并解释头部崩溃,提出沉没感知训练实现负载均衡提升性能。
句子曲线语言模型
提出句子曲线语言模型(SCLM),用连续曲线表示替代静态词嵌入,促进全局结构建模,在翻译任务上达到最优。
RMPL: Relation-aware Multi-task Progressive Learning with Stage-wise Training for Multimedia Event Extraction
停止奖励幻觉步骤:面向小推理模型的忠实感知步骤级强化学习
提出FaithRL方法,通过步骤级忠实奖励和截断重采样,减少小推理模型中间步骤幻觉,提升推理可靠性。
Persona2Web:基于用户历史的个性化Web智能体上下文推理基准
首个基于用户历史推断偏好的个性化Web智能体基准,含模糊查询与推理评估框架。
我们真的在创新吗?人工智能研究论文原创性的定性与定量研究
基于10万份评审报告,揭示AI论文原创性评估关键维度与框架;LLM易高估新颖性且难查概念抄袭。
质量约束的熵最大化策略优化提升LLM多样性
提出QEMPO框架,在质量约束下最大化熵以提升LLM多样性,理论最优,实验证实不牺牲质量甚至双赢。
CodeGENCAT:面向开放式编程问题的生成式计算机自适应测试
通过预测学生代码响应选题,生成式IRT模型提升编程自适应测试早期AUC达4.32%。
论语言:对NLP中元语言研究的反思
定义元语言,关联NLP与LLM,探讨元语言维度与任务,提出未来研究方向。
DRTriton:大规模合成数据驱动的强化学习用于Triton内核生成
DRTriton用合成数据和强化学习训练LLM生成高效Triton内核,在92%任务中速度超越PyTorch。
面向可靠专利权利要求生成的自适应成本高效评估
提出ACE框架,基于熵路由实现不确定感知评估,成本降78%,推理时间减60%,保持竞争力。
矛盾协调解释生成
提出LLM矛盾协调解释生成任务,实验发现多数模型能力有限,扩展计算收益随规模增大而饱和。
ClinicalAgents:基于双记忆的多智能体临床决策编排系统
ClinicalAgents框架通过蒙特卡洛树搜索动态编排多智能体,结合双记忆架构,显著提升临床诊断准确性与可解释性。
高斯扩散模型为何难以处理离散数据以及如何规避?
离散数据多模态低密度区导致高斯扩散模型采样失败,自条件与q采样结合可提升生成质量。
弧标准依存推导的树形解释
弧标准推导可增量构建有序树,仅投影树有连续表示,提供树论解析视角,支持非投影输入。
购物助手:面向长期偏好驱动的电子商务任务的大语言模型智能体基准测试与训练
提出跨会话偏好记忆的购物基准和工具级奖励,训练4B模型在长期任务上超越GPT-5等强基线。
ClinConsensus:面向中文医疗大语言模型的临床评分标准覆盖度的医生校准基准
提出ClinConsensus基准,含2500病例与评分标准,评估11个模型发现覆盖率仅17.8%-32.9%,建议用阈值化覆盖评估。
多方言、多语言、同一文化视角:评估多语言VLM在跨历史关联语言与区域方言下的孟加拉文化理解
《BanglaVerse》基准揭示:仅评估标准孟加拉语会高估模型,方言下性能下降,文化知识缺失是主要瓶颈。