级联批量提示
级联批量提示:解耦复杂推理与符号接地,解决性能不稳定。问答和自然语言推理优于基线,加速随批量增加,达帕累托前沿最优。
说与读的错位:多模态模型中的跨模态不稳定性
新基准揭示多模态模型跨模态与跨语言不稳定性,语音加剧碎片化推理,且总体准确率无法完全反映。
预测的预测(PoP):层间激活融合用于大语言模型单次前向幻觉检测
提出PoP方法,单次前向融合层间隐藏状态检测事实错误,AUROC达75.5%,延迟增加小于1.2%。
STAR:文档到文档机器翻译的句子翻译对齐率
提出STAR量化句子级结构对齐,结合StarPO优化错位片段,提升文档翻译质量,小模型超越GPT-4o。
关于机器翻译中上下文样本的推理
提出基于片段的推理框架,从相似示例提取平行片段作为推理轨迹,提升大模型机器翻译性能,优于标准k-shot方法。
TwinKV:基于成对键冗余的KV缓存驱逐可组合修复机制
TwinKV基于成对键冗余,作为可组合修复通道优化KV缓存驱逐,免训练免注意力,多数长上下文配置有提升。
D2C-Routing:混合来源AI生成文本检测的维度到组合证据路由
提出D2C-Routing,先推断内容与表达来源再组合,在MixD2C上四路检测达0.8603,较基线高6.5点,代码开源。
截断评分量表上的双重差分可制造效应:预注册大语言模型评审审计的证据
截断评分量表上的双重差分会因截断差异制造伪效应;预注册审计显示显著交互并非真实偏好,而是量表底线所致。
十八世纪书籍与报纸中碎片化文本重用的篇级再版与复用:一项工作流研究
针对碎片化文本重用证据,提出篇级证据整合方法,在十八世纪休谟文献中验证,平衡精度与召回,产出可审计候选集。
意图即工具:让追踪智能体失范变得容易
提出意图工具,以调用概率为无裁判细粒度信号,补充思维链监控并识别干预关键步
BTS-AgentBench:从只读遥测日志到智能体基准的确定性、可重放流水线
提出从只读遥测日志到智能体基准的确定性可重放管道,含532条数据,独立构建完全一致。
RCMN:有影响力公共话语中的误导性理解
提出RCMN五维框架;发现误导多源于无据推断、夸大、省略,且轻量表示可捕捉读者解读,但机制理解需丰富语境。
你的语音克隆系统其实是个语音匿名器
将语音克隆模型XTTSv2复用为语音匿名器,无需重训,在近最优隐私保护下保持可懂度和语音质量。
BALMS:用于纵向心理健康感知的智能体大语言模型基准测试
首个纵向心理健康感知智能体基准,揭示零样本智能体难胜简单基线,需增强时间证据推理。
SCIT:测试潜在思维链模型中的因果缓存载体
提出SCIT测试,发现算术经值缓存后缀传递;充分性均立,必要性仅CODI-GPT2,且能力决定载体。
Puro-2B:穷实验室的Qwen2-1.5B,在RTX 5090上以5090美元训练
开源低耗预训:RTX5090上FP8训Puro-2B,耗资<7千美元,媲美Qwen2.5-1.5B.
评估RAG中证据感知检索的下游实用性
证据感知检索评估下游价值不一:训练与预测不稳健,过滤效果评估有分歧,需按用途衡量。
RATIO:科学文献中类型化构思操作的检索基准
提出RATIO基准,用三种构思操作检索科学文献以激发灵感;实验显示专用微调有效但仍有提升空间。
TTPO:测试时策略优化
提出TTPO,非对称目标+投票伪标签,无标签测试时训练,数学推理媲美有监督。
跨领域整合RLVR能力:融合范式深度解析
RLVR融合三范式:平均差≤1.4,单基准差8.6。有专家用合并,无专家用混合RL,需保增益用蒸馏。
通过弱模型引导增强RLVR中的LLM探索
提出用弱模型部分推理轨迹引导目标模型缓解RLVR熵坍缩提升推理多样性无需额外监督微调性能优于基线
缓解多阶段LLM招聘流水线中的虚构问题:提示护栏与人工介入检查点的实证评估
提示护栏降低虚构密度但仍有半数输出造假;人工检查点消除身份虚构并显著减少捏造,建议分层防护。
使临床语言模型可审计:概念引导的微调实现稳健预测
提出CAST框架,用稀疏自编码器暴露可审计特征,微调时抑制模板等伪影,提升部署鲁棒性并留审计轨迹。
转导语言模型的随机估计
提出基于不放回重采样和包含概率倒数的递归加权,得到目标前缀概率的无偏估计,计算-方差更优,比阈值剪枝快数个数量级。
语言模型如何组织与结构化道德知识
语言模型对道德知识的表征既非单一检测器也非彼此孤立,而是共享正成分的多维几何结构,且早于训练饱和形成。
CritICL:利用小语言模型失败模式的推理时弱到强泛化
CritICL利用小模型失败模式作指导,通过批判式上下文学习提升推理,性能优于标准ICL,媲美测试时扩展,成本更低。
大语言模型回复语义变异性:对基于对话评估设计的启示
换用不同大模型时回复语义不稳定,仅靠提示与对话历史不够,需新架构保障评估一致性。
微调会撤销激活引导吗?行为恢复而无需权重编辑逆转
激活引导嵌入权重后,微调虽致行为退化,但权重编辑几乎未变,机制耐久而功能脆弱,需重新验证行为。
方言税:方言偏见贯穿语言建模流水线
研究发现语言模型从分词、预训练到推理各阶段,均对方言文本编码不均,导致方言性能差距持续存在。
人工智能系统计算语义学入门
本文介绍语言意义的跨学科视角,解析形式、具身、分布三种语义理论,并对比变换器模型与人类学习语言的差异。
基础模型的无监督后训练:综述
无监督后训练综述:用同源模型信号适配未标注数据,分四类共80种方法,信号选择决定改进还是误差放大。
未完成体悖论未必存在于大语言模型中:基准失败先于模型失败
原基准存在概念与评估错误,模型并非必然推断完成,实为充足性偏差,提示干预仅致标签偏移。
检测≠可靠控制:可解码的共情方向在自动化共情分数上至多产生部分偏移
检测不等于可控:共情方向干预在自动评分上仅产生部分变化,认知共情未见效果,需检验测量灵敏度。
在[MASK]背后:解耦DAPF痴呆症检测中的表征与忠实性
DAPF痴呆检测性能优异,掩码表征可诊断,但词级解释不忠实,归因受语言伪影干扰。
Padamitra:古典梵语的有依据术语表生成
提出有依据术语表生成任务,构建3.1万条梵语诗节三元组基准,发现指令微调优于提示,错误主因是过度切分复合词。
DataKernelBench:大语言模型能否在GPU上优化数据库查询?
提出数据库内核基准,评测大模型在GPU上优化数据库查询,较常规编译最高加速2.54倍,关键是内核融合与全查询特化。
SelfGraphRAG:用合成问答生成弥合基于图RAG的监督缺口
提出SelfGraphRAG,从知识图谱结构生成问答对训练图检索器,无需人工标注,提升多跳问答检索精度与推理性能。
HealthBench-Psych:OpenAI HealthBench 的心理健康子集
提出心理健康基准子集,筛选出610条对话,评测20个前沿模型,并发布资源。
苹果对苹果?迈向可比较的跨语言语言模型评估
跨语言评估中,常用归一化指标存在源于分词、编码等的偏差;句子级负对数似然能提供更一致的比较。
少即是多:通过证据前置与压力自适应预算缓解RAG瓶颈
提出PACE框架,以证据前置排序与压力自适应预算动态调整重排数量,提升证据召回并降低延迟,实现少而精。
Groundhog比特翻转攻击:通过比特翻转在混合专家大语言模型中引发无限生成循环
提出GBFA比特翻转攻击,翻转路由层比特让不足4个专家失效,输出膨胀5912%,形成针对MoE LLM的拒绝钱包攻击。
MTDiag:面向临床有意义的大语言模型评估的多轮诊断数据集
构建MTDiag多轮诊断数据集,融合多源临床数据并标准化至医学本体,新增临床知识指标评估LLM诊断能力。
信念级联驱动LLM智能体网络中的说服
多智能体说服受拓扑、竞争、主题和先验影响;直接暴露预测立场变化,中继传递影响,仅看文本会漏掉实际变化。
从记忆到吸收:面向持续知识注入的混合策略强化学习
提出GRIN框架,用混合策略强化学习进行持续知识注入,超越监督微调的复杂推理,基础召回持平。
BanglaMamba:探索状态空间模型用于孟加拉语假新闻检测
Mamba状态空间模型用于孟加拉语假新闻检测,性能接近BERT,吞吐量提升2.2倍,显存降低49%,适合资源受限场景。
语法的几何变迁:Transformer层间的维度与邻域重组
研究深度模型中词性如何塑造表示几何:封闭类词更早扩张和坍缩,几何特征可还原词性。
利用言语行为进行低数据和跨域对话偏离预测
用言语行为作辅助信号,提升低数据与跨域对话偏离预测性能。
路由图交接:多智能体大语言模型委派的自适应格式选择
路由图交接:轻量路由器自适应选择图或自然语言,压缩数倍且性能不降,消除纯图回退。
GUIDE:基于音视觉共享ID编码的生成式无监督中文查询纠错
提出无监督中文查询纠错框架GUIDE,用共享ID编码音视觉混淆字并重构查询,结合时间衰减频率目标,在真实数据上优于基线。
短视界与稀疏概念:J-lens读出的数学视角
将J-lens视为一阶因果传递算子,揭示其能量稀疏性,分解为短视界与稀疏概念预测,并提出改进策略以增强概念读出。