听你所读:基于声学差异的无参考假设评估
提出READ指标,利用预训练TTS模型计算声学差异,无需参考即可评估并改进ASR,噪声下错误率降低20%。
回答引擎优化与平台增长的解耦:基于ChatGPT推荐流量的日志自然实验
通过域内对照实验发现,AEO实际效果约1.8倍但统计不显著,原始增长主要源于平台自身增长,且未损害SEO。
基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测
提出可控黑客环境CHERRL,用于研究基于评分标准强化学习中的奖励黑客,实现稳定复现、明确观察和精确检测。
上下文图推理
提出ICG-I自回归图Transformer,结合变量消除与张量列压缩,实现图模型高效准确推理,性能达SOTA。
Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models
音频交互模型
提出音频交互模型,实现统一在线流式模型,支持实时音频指令跟随与主动干预。
通过双向梯度优化的大语言模型数据归因
提出双向梯度优化方法,扰动模型并测量损失变化,实现大语言模型训练数据归因,提升可解释性。
CARE-link:用于糖尿病管理的基于Web的电子健康记录临床支持软件
开源网络平台,利用LLM连接医患管理妊娠糖尿病,汇总数据提供决策支持与患者指导,减少门诊负担。
中文标题:失败的推理轨迹告诉你什么问题可以修复(但并非通过阅读它们)
从失败轨迹分布中提取三个特征,实现故障分类与无训练路由,修复成功率提升12.2%。
基础模型研究中的效度威胁
基础模型研究采用近似实验以降低成本,但引入统计、内部、外部及建构效度威胁,需通过因果推断框架评估。
使用分布化DAgger的丰富反馈强化学习
通过前向交叉熵实现单调策略改进和后悔保证,提升Pass@N,在科学推理、编码和数学等领域优于基线。
STRIDE:通过子集扰动的稀疏恢复实现训练数据归因
STRIDE框架将训练数据归因转化为稀疏恢复问题,在激活空间建模,速度提升13倍并达最优性能。
LiSeCo: 语言生成的线性语义控制
提出轻量级线性语义控制方法,无需梯度,基于控制理论动态调整生成轨迹,确保语义进入预定义安全区域,实现精细属性控制。
ChatSOP:SOP引导的MCTS规划框架用于可控LLM对话智能体
ChatSOP框架通过SOP引导MCTS规划增强LLM对话可控性,动作准确率提升27.95%。
大语言模型 + 个人角色插件 = 个性化LLM
提出PPugg模型,用轻量用户嵌入模块构建用户特征,无需微调即可实现LLM个性化输出,显著优于现有方法。
WETBench:维基百科特定任务机器生成文本检测基准
WETBench评估维基百科编辑场景中机器文本检测,训练型准确率78%,零样本58%,凸显任务特定数据评估重要性。
SSSD: 简便可扩展的推测解码
SSSD免训练,结合n-gram匹配与硬件感知推测,加速2.9倍,性能媲美训练方法,鲁棒性强。
通过噪声注入增强幻觉检测
通过扰动模型参数注入噪声采样,基于贝叶斯不确定性显著提升大语言模型幻觉检测效果。
推测性思维:推理时利用大模型指导增强小模型推理
无训练框架下大模型推理引导小模型,准确率提升6.2%,输出长度缩短15.7%。
SoLoPO: 通过短到长偏好优化释放大语言模型的长上下文能力
SoLoPO将长上下文偏好优化解耦为短上下文PO和短到长奖励对齐,显著提升长上下文泛化与效率。
100-LongBench:现有长上下文基准真的在评估长上下文能力吗?
提出长度可控基准与新度量,分离基线能力,有效评估长上下文能力。
超越正确性:在检索增强生成中奖励忠实推理
提出VERITAS框架,用细粒度忠实奖励提升检索增强生成推理忠实性与任务性能。
SSA:在特征空间中对齐全注意力和稀疏注意力输出的稀疏稀疏注意力方法
提出SSA框架,通过对齐全注意力和稀疏注意力输出,解决注意力与能力差距,实现高效长上下文处理。
Graph-R1: 通过端到端强化学习迈向智能体图检索增强生成框架
端到端强化学习驱动智能体图检索增强生成框架Graph-R1,降低构建成本,提升推理检索与生成质量。
从图检索到模式实现:异构知识图谱上文本到SPARQL的反事实验证
提出SchemaForge框架,通过模式切片对齐和反事实验证,将异构KG的文本到SPARQL准确率提升平均11.5个百分点。
推理路径作为输入仍有效吗?连接后推理与思维链压缩
提出后推理范式UCoT,用轻量模型生成软token CoT,压缩推理路径,节省50% token且性能提升3.08%。
边界推理:通过测试时推理增强规范对齐
提出Align3方法,通过测试时推理增强LLM规范对齐,构建SpecBench基准,实验证明其高效优化安全-有用性权衡。
语言模型中符号接地性的机制涌现
研究揭示符号接地性涌现于中层计算,通过注意力聚合环境线索实现,为生成可靠性提供机制证据。
DEER:面向可泛化机器生成文本检测的解耦专家混合与实例自适应路由
DEER通过解耦领域知识专家和强化学习路由,显著提升机器生成文本检测的域迁移泛化能力。
OckBench:衡量大语言模型推理的效率
OckBench首次联合衡量LLM推理准确性与token效率,发现效率未优化导致成本膨胀,呼吁避免多余token。
通过语义相似释义评估自动形式化鲁棒性
语义相似的释义会导致自动形式化性能波动,微小自然语言变化显著影响模型输出。
线性探针检测到的是任务格式,而非语言模型隐藏状态中的推理模式
线性探针高准确率源于任务格式而非推理模式,去混杂后降为随机,揭示格式混淆。
比人类更环保?大型语言模型中的环境态度
许多LLM比人类更倾向环保态度,但易受用户立场影响,存在可靠性隐忧。
IdiomX:多语言习语理解、检索与解释基准
IdiomX是一个多语言习语基准,含19万示例、1.2万习语,覆盖检测、检索与解释任务,验证了混合检索及语义检索的有效性。
On the Persistent Effects of Lexicality in Large Language Mod
主题作为社会人口统计特征的代理:对话语境如何影响LLM回答
LLM难从单次对话推断用户社会属性,对话主题是影响建议的主因,但影响不可预测,需警惕。
深层中的价值向量是否需要来自残差流的上下文?
发现深层无上下文价值向量提升性能,提出Bank of Values方法,以查找表计算注意力价值向量,减少计算与内存。
修正FOLIO和MALLS:经过验证的标注与LLM辅助框架以聚焦人工重新标注
发现FOLIO和MALLS形式化错误率高,修正后LLM准确率提升9-22个百分点;提出LLM辅助框架,审查少于24%实例即可达90%准确率。
古典诗歌的现代散文翻译
介绍Padyam2Gadyam数据集,用于古典诗歌到现代散文翻译,评估5个LLM显示性能需大幅提升。
思维经济:经济互动中涌现的多智能体智能
受哈耶克启发,智能体通过经济信号自协调,去中心化激励涌现集体智能,自动产生多步推理,超越强基线。
自适应潜在智能体推理
ALAR自适应选择潜在或显式推理,在保持准确率下大幅减少生成token(搜索减43.6%,工具使用减84.6%)。
Pretraining Language Models on Historical Text
中文标题:幽灵标注者:通过共形预测探索内容审核中人类标签变异的框架
中文摘要:引入幽灵标注者框架,结合共形预测量化模型与人类标注分歧,发现大模型对无共识文本更自信,揭示结构性人口统计偏差。
WRIT:面向多轮用户交互代理的写-读密集型轨迹合成
WRIT沿写决策数与读证据负担两轴合成轨迹,仅2000条数据训练4B模型超越GPT-5.1,大幅降低推理token消耗。
大语言模型的语言创造力:模型能强制,但无法抢先
大模型能识别强制结构,但无法利用负证据避免过度泛化。
Fast-dLLM++: 弗雷歇剖面解码加速扩散大模型推理
利用异构置信度选择并行提交集,不改变模型,吞吐量提升高达37%。
聊天机器人输出有意义(但有问题)的语言
聊天机器人输出有意义,但无需假设其拥有心理状态或意图,这对理解人类与AI文本有重要启示。
面向变化偏好的记忆检索
提出基于贝叶斯因子的记忆检索框架,通过效用估计识别用户偏好变化的证据,优于传统方法。
基于RAG的本地部署课程选择学术咨询系统
提出本地部署RAG学术咨询系统,结合大模型与结构化大纲数据,支持选课与个性化计划,保护隐私。
EURO-5K:领域预训练何时重要?欧盟报告义务提取的Transformer基准测试
创建EURO-5K数据集,评测BERT与LLM微调策略。全微调下通用与Legal BERT性能相近,参数高效时Legal预训练更优,3K样本后收敛。