ImProver:基于智能体的自动化证明优化
ImProver是自动化证明优化代理,利用LLM和Chain-of-States等技术,重写证明以优化长度、可读性等指标。
MixSD: 混合上下文自蒸馏用于知识注入
MixSD通过混合模型自身条件构建监督,对齐原生分布,实现知识注入中近100%能力保留,远超标准微调的1%。
增强大语言模型的因果推理:一种用于精准微调的因果归因模型
提出因果归因模型,利用干预量化LLM推理贡献,发现其依赖上下文和领域知识,微调模型有效融合知识与数值信息。
LLM智能体已知何时调用工具——无需推理
模型隐藏状态已编码工具必要性,Probe&Prefill读取并预填充引导,减少48%调用,准确率仅降1.7%。
VectraYX-Nano: 一个4200万参数的西班牙语网络安全语言模型,集成课程学习与原生工具调用
VectraYX-Nano是首个西班牙语网络安全LLM,42M参数,课程学习,原生MCP工具调用,低成本训练实现对话与工具选择性能。
中文标题:学习预见:揭示在线策略蒸馏的效率解锁
中文摘要:在线策略蒸馏的高效源于早期训练中的预见性,表现为模块分配与更新方向两层面的优化,据此提出3倍加速的EffOPD方法。
BEA 2026共享任务1中的Sakura:是什么让词汇变得困难?
提出高精度黑箱模型与可解释模型,分析词汇难度受拼写、测试构造影响,代码开源。
缩小CRAC 2026差距:基于LLM的多语言共指消解的两阶段适配
基于Gemma-3-27b的两阶段适配方法在CRAC 2026多语言共指消解LLM赛道夺冠。
用于目标导向主动对话中规划的伪孪生网络
提出前向聚焦双向伪孪生网络,利用双解码器双向规划路径,显著提升目标导向主动对话效果。
MedicalBench: Evaluating Large Language Models Toward Improved Medical Concept Extraction
Under Pressure: Emotional Framing Induces Measurable Behavioral Shifts and Structured Internal Geometry in Small Language Models
光鲜故事,隐藏挣扎:通过LLM视角探究残疾的表征
LLMs描绘残疾人时存在过度理想化和负面偏见,未能真实反映其困境与多样性。
借助大语言模型的情感分析:Decentraland MANA代币的多模态分析
基于BERT分析Discord社区情感,结合多模态LSTM模型提升MANA代币价格预测精度。
数据缩放作为预测贡献谱的渐进覆盖
数据缩放由预测贡献谱渐进覆盖驱动,谱尾部斜率与GPT缩放指数强相关,有效秩与训练规模近线性。
FlowLM:通过扩散到流自适应实现少步语言建模
FlowLM将扩散模型微调为流匹配模型,以极少的步数实现高质量文本生成,性能媲美2000步扩散采样。
通过基于代理的思维链调优实现长上下文推理
提出ProxyCoT框架,将代理上下文思维链推理迁移至完整长上下文,提升推理能力,降低计算开销。
多遍提示验证提升量化模型在定性分析中的性能
提出多遍提示验证法,减少幻觉,提升低比特量化模型在定性分析中的稳定性和准确性,8-bit最佳,低比特也有改善。
并行LLM推理实现抗偏见、鲁棒的概念抽象
提出并行分块与证据锚定框架,减少遗漏误差84%,提升可追溯性130%,减少无依据主张91%。
全双工语音对话模型中的同步与话轮转换
研究全双工对话模型无噪声时表征同步强,内部状态可提前预测话轮转换。
Mix-Quant:面向智能体大语言模型的量化预填充与精确解码
Mix-Quant通过阶段感知量化,预填充用NVFP4加速3倍,解码保持BF16精度,实现高效智能体推理。
生物医学命名实体识别与实体链接基准测试衡量了什么?一个以语料库为中心的诊断框架
提出诊断框架分析9个语料库,发现性质差异大,揭示常见统计量不足以评估基准。
当推理监督适得其反:基于TTCW的长篇文学评论生成
构建26万篇长故事数据集,发现非推理微调效果更优,推理监督易致解析失败和重复生成。
DEL:面向大语言模型数值学习的数字熵损失
提出数字熵损失(DEL),以监督熵优化替代距离惩罚,实现浮点数数值学习,提升大模型数字预测精度。
偏见与推理的机制:解读思维链提示对大型语言模型中性别偏见的影响
思维链提示未真正缓解LLMs性别偏见,改进源于记忆而非理解,偏见仍嵌入隐藏表示。
ChatGPT让你困惑?别担心!一款提升AI素养与认知的拼图游戏
通过拼图游戏结合漫画信息图,寓教于乐讲解AI机制与影响,提升AI素养。
照我说的做,而非照我做的做:大语言模型中的指令-归纳冲突
大模型在指令-归纳冲突中遵循脆弱,输出多样性是鲁棒性关键,且模型低估自身抵抗力。
搭配启动:关于人类和神经网络学习主谓一致的一个假说
假设搭配共现规律辅助习得主谓一致,模拟与数据分析表明该策略可行。
Stage-Audit:面向跨维基表格的可审计源边界发现
Stage-Audit通过分离权限和12项审计检查,将源边界发现精度提升42%、F1提升35%,并实现行级可追溯。
Beyond Semantic Similarity: A Two-Phase Non-Parametric Retrieval Workflow for Corporate Credit Underwriting
When Irregularity Helps: A Subclass Analysis of Inductive Bias in Neural Morphology
手语之间的直接翻译
提出基于回译合成数据的直接手语翻译方法,联合训练模型,在三对手语间误差降20%,BLEU提50%,速度提2.3倍。
无害原则?网络部署的医疗大语言模型中的幻觉与行为者层面滥用
评估6233个医疗GPT模型,发现25-30%事实准确性低,33-54%违反操作阈值,需强化多指标评估与安全防护。
自我训练并非使语言扁平化,而是重构语言:表层标记增强,深层句法消亡
自我训练重构语言:表层标记增强,深层句法崩溃;结构深度决定衰减率,存在表层复杂度悖论。
HRM-Text:超越规模的高效预训练
HRM-Text以层级循环模型和任务目标,仅用40B tokens和1500美元即可实现高效预训练,性能媲美主流模型。
Auto-Dreamer:为语言智能体学习离线记忆巩固
提出离线记忆巩固方法,解耦获取与整合,跨会话抽象替换记忆,在ScienceWorld性能提升7%且记忆库缩小12倍,泛化至其他任务。
检索增强长上下文翻译用于文化图像描述:佛罗里达大学鳄鱼队提交AmericasNLP 2026共享任务
两阶段管道生成目标语言描述,超基线122%-164%,综合排名第一。
Divide-Prompt-Refine: a Training-Free, Structure-Aware Framework for Biomedical Abstract Generation
论AI评审员的局限与机遇:与45位专家科学家共同评审Nature系列论文的评审意见
AI评审员综合评分超人类最高分,能发现新问题,但重复性高且存弱点,是补充而非替代。
优化与重用大语言模型标注指南
提出迭代审核框架重用优化标注指南,提升零样本标注效果,但仍有改进空间。
MTR-Suite:一个用于评估与合成对话检索基准的统一框架
MTR-Suite通过LLM审计、低成本多智能体对话合成和严格基准,解决对话检索评估的稀疏与失真问题。
SCRIBE:面向印度语言语音识别的诊断评估与富转录模型
提出SCRIBE诊断框架,通过分类错误分解超越WER,并发布印地语等语言的富转录模型。
反图灵测试结果:AI生成文本检测
反图灵测试中二分类F1达1.0,模型归因识别挑战大,最佳成绩F1为0.9531。
分布对齐作为上下文学习中设计任务向量的准则
提出d_NTP度量任务向量与ICL预测分布差异,据此设计LTV线性映射法提升准确率9.2%,并发现跨模型迁移可增强小模型性能。
The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study
从文本数据评估社会经济气候影响
利用NLP从新闻等文本提取气候灾害社会经济影响,但方法缺乏规范,本文提出最佳实践建议。
DIVE:通过自限梯度更新实现嵌入压缩
DIVE适配器用自限梯度和多头对比损失,避免小样本过拟合,在BEIR数据集上全面超越基线。
从零构建阿拉伯语自然语言处理:二十年的经验、失败与未解难题
二十年阿拉伯语NLP经验揭示:数据构建是社会过程,社区重于任务,传统NLP缺社科能力;失败包括临床语料库未落地、任务过泛、标准语迁移方言不成立。
通过一致性和标签解耦实现可解释判别性文本表示
提出一致性检验与标签解耦标准,LLM辅助发现特征,提升文本分类可解释性与评估一致率。
Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation
PulseCol:用于加速扩散语言模型的周期性刷新列稀疏注意力
PulseCol通过细粒度列稀疏和周期性刷新模式,实现扩散语言模型推理加速,达1.95倍端到端提升。