E-CONAN(蕴含、矛盾与中立)诊断数据集:探究阿拉伯语自然语言理解中的语言现象
提出阿拉伯语NLU错误分析层级及E-CONAN诊断数据集,评测14个模型,发现大模型常识强、句法弱。
学会从上下文学习:基于扰动公共文档的合成训练
用扰动公共文档合成训练数据,免人工标注,显著提升大模型从上下文学习能力。
考问翻译:一种基于证明器的自然语言→一阶逻辑评估指标
提出SIV,用定理证明器生成正反探针评估NL→FOL翻译,检测漏译与多译,评分贴合错误严重度并定位错误。
ManiEdit:从流形视角出发的语言模型序列化非结构化知识编辑
从流形视角重构编辑,提出ManiEdit,通过枢轴定位与流形感知保持,显著提升序列化非结构化编辑效果。
Tsubame:基于扩散的推测解码中的树重放
Tsubame采用两遍树推测解码:先冻结上下文感知拓扑,再重放采样节点,结合扩散草稿,无损提升接受长度与吞吐。
Jev 在语音神经假体重评分中媲美 7B 语言模型
Jev将重评分转为单次类型化决策,无需GPU,在ALS语音神经假体上词错率7.5%,媲美7B模型。
安全重构:通过掩码扩散生成式建模构建强大安全护栏
LLaDA-Guard用掩码扩散按标签重建文本,安全基准领先、校准更优,可定位并改写不安全提示。
重置不等于恢复:通过谄媚迟滞评估虚假对话上下文中的可恢复性
受用户错误压力后,普通重置难以消除谄媚偏差;仅删除/截断压力历史或引入可信证据可有效恢复。
一个模型不成众:多LLM与方面条件化的多样化评论生成
多模型与方面条件生成能更贴近人类评论多样性分布,在预训练与下游任务中均有效,但人类多样性仍难企及。
弥合跨方言鸿沟:以查询计划作为Text-to-SQL的可移植接口
让模型生成方言无关的关系代数查询计划而非SQL,可近乎一致地恢复跨方言可移植性,微调后效果优于SQL监督。
手握地图仍迷路:语言模型中的对话状态与行为可靠性
模型能读出对话结构却难解析值,旧值更新后仍影响行动;据此设计的控制器修正动作,显著提升查询与任务成功率。
智能体何时才有用?古典文本及其译本的嵌入、大语言模型与智能体对齐
七系统对比:生成式恢复率93-94%远超嵌入77%;智能体缺陷更少,但长文本优势经分块后消失。
从细粒度修改操作到有意义的修改单元:评估大语言模型在修改边界检测中的表现
微调Qwen3-32B识别学生修改单元边界效果最佳,优于提示式大模型与启发式基线。
理解激活解释中的虚构并重新思考重建
点重建解释易致虚构与写作缺陷;提出Flow-NLA建模激活分布,保留效用并抑制缺陷。
共享经验、分离学习:面向大语言模型的伴随式置信度校准
CoCal以共享轨迹、分离学习训练轻量伴随模型校准LLM置信度,不损任务性能,优于RL与事后校准,并可跨域泛化。
位置并非事实:KV 缓存与记忆之间的错配
更新KV缓存需保留单位、对象依赖与未变文本;重建旧位置会损历史准确率,识别需学习读出或查询访问。
渐进式指令交付对语言模型创意写作的影响
分多轮渐进交付写作要求会降低模型约束遵守度,结构连贯性受损最重,创意完整性仅存71.2%。
Unicode 中的约鲁巴文:一个问题概述
约鲁巴文 Unicode 缺预组合字符,跨平台显示、搜索和字体替换出错;呼吁联盟介入申请编码四个核心字符
语音识别中编码器-解码器模型的上下文自适应
编码器-解码器模型均能直接上下文自适应,最高相对提升30%,词法与说话人信息均起作用,拼接式演示最稳定。
LA-CPD:用于人类-LLM作者身份分段的局部证据感知变点检测
LA-CPD将句级噪声分数转为连贯作者分段,动态规划与AIC选变点,准确率升至0.796,边界定位更优。
大型语言模型在被训练预测自身准确率时学会不同形式的元认知
模型置信度分双信号:近训练分布追踪准确率,其他领域追踪输出一致性;后者早现可泛化,前者晚现且局限。
简单扩散语言模型作为少步生成器比报道的更有效
少步生成潜力被次优采样器掩盖:适度锐化无需重训,旧模型16步超越1024步,且需联合评估质量与多样性。
具无分布风险保证的更快块扩散推理服务
Redline用校准数据选配置,在风险预算内控制相对参考的失败概率,并部署最快通过者以加速块扩散推理。
论高效推理中的词元价值不平等
CoT推理词元价值高度不均,对数概率可区分核心与冗余词元;TokenProbe压缩冗余词元,省76%用量并保持质量。
量化误差是谱平坦的:单次随机探针即可作为校准、无数据的敏感度估计器,并应用于面向预算目标的混合精度量化
量化误差谱平坦,单随机高斯探针可无校准无偏估计敏感度,RAM按字节预算分配混合精度位宽。
NSV-Shift:面向语音到语音模型中非言语发声理解与响应适应的对比基准
NSV-Shift对比基准:评估语音到语音模型的非言语发声理解与响应适应,发现模型检测强于情绪解读与差异化回应。
SlopBench:我们能在多大程度上按“AI 废话”给语言模型排名?一项重复性 AI 写作的多领域基准
SlopBench用112项任务评测18个模型近2万输出,按四项表层特征评分;重加权后排名不稳,仅一项排名无歧义。
面向论述性文本语义相似度分析的高层文本预处理:框架与实证演示
提出高层文本预处理,用规则分离论述结构与核心主张;实验显示可降低语义相似度虚高,并提出语义扩散指数。
超越单智能体与一致性:通过条件渐进剪枝为多智能体辩论正名
提出条件渐进剪枝(CPP),轻量利用多轮辩论,在严格成本下超越单智能体、一致性及现有MAD框架。
系统1决策能自洽吗?一项概率一致性研究
Jev与Laya分类概率不一致:粗细预测分歧大,准确率反向变动,提升或伴随校准恶化。
RewardExplainer:从反事实偏好反馈中学习奖励模型解释
提出RewardExplainer,借反事实反馈训练可复用解释器,生成可干预评分机制,提升忠实度并助力去偏。
迈向大语言模型中信念稳定性的分级度量
提出分级信念稳定性指标,基于内部表征估计条件信念,发现低稳定性信念更易在对话挑战下动摇。
Opera:面向长周期编程智能体的语言评论家框架
Opera将每次纠正作为持久批注并跟踪至问题解决,择机审查、诊断并核验反馈,显著提升编程智能体解决率。
使用大语言模型理解临床认知对话
构建8250句认知评估对话语料,标注56类对话行为,并基准评测大模型的细粒度分类与生成能力。
评估自动语音识别中的机器遗忘
研究ASR机器遗忘:梯度上升法隐私-效用均衡好,复杂法过度遗忘,常规评估不足,序列与同时遗忘更差。
未知并非正常:将语言模型抽取与规则决策逻辑分离以计算临床风险评分
分离三态抽取与确定性决策逻辑,仅追问关键问题:提问减半、准确率99.4%,避免漏诊,小模型亦适用。
面向印度语言的词相似度数据集:标注与基线系统
发布六种印度语言人工标注词相似度数据集,并用最新模型给出三种语言基线。
基于预训练语言模型的近缘印欧语言间语言距离量化测量:以北日耳曼语支为例
用预训练模型从语义、正字、可预测性量化北日耳曼语距离,丹麦语-挪威语最近,与历史结论吻合。
忠实激活言语化:减少大语言模型表征解释中的幻觉
AVPO两阶段框架:从激活重构文本并评估,再以DPO优化,提升语义与字词保真,减少幻觉。
谁获得一个词元,它又承载着什么?大语言模型中不平等的姓名支持与概念可及性
匹配姓名并非等价词元输入;姓名支持不均会系统影响大模型概念可及性,并在招聘、贷款等任务中造成偏差。
大语言模型并非随机鹦鹉:来自类人造语言任务的意义中介抽象证据
类人造语言任务表明,大模型无示例仍能依约束做意义中介抽象,反驳强随机鹦鹉假说。
MAS-OPD:面向多智能体系统的同策略蒸馏
MAS-OPD以角色优势特化与特权归因协调,将协作信息转为同策略蒸馏监督,实现清晰分工与高效协作。
SALMONN-duo:面向全双工语音智能体的自适应双系统协同
提出自适应双系统全双工语音智能体:快系统实时交互并按需委派慢系统,提升推理与多轮任务表现,优化成本。
USA:面向语言智能体跨域在线策略蒸馏的更新感知SAM
USA将预热更新幅度转为逐坐标扰动半径,缓解跨域在线策略蒸馏更新耦合与负迁移,六方向均超单域基线逾4分。
面向开放式文本生成的连贯性感知分布评估
CHORD用冻结大模型隐状态与RBF-MMD比较文本分布,灵敏检测全局连贯缺陷,排名更贴合人类判断。
过度个性化是一种决策失败:大语言模型中的生成诱发应用偏差
LLM过度个性化是决策失败:生成目标诱发应用偏差,按logit减去偏差标量可减少泄漏并保持满足。
ReScraper:面向高效LLM预训练的统一网页数据抓取与清洗
0.6B模型ReScraper统一抓取与清洗网页,替代启发式规则,显著提升LLM预训练语料质量。
Dr.Credit:面向深度研究智能体的基于评分标准的过程信用分配
以评分标准为共享参照,对工具反馈给予过程信用,并结合GRPO结果优势,提升深度研究智能体表现。
LLM智能体评估的可认证选择性自动化
提出任务级自助认证,量化可安全自动化的智能体评估比例,并兼作自训练过滤,实现零标注跨域迁移。
生物医学问答中的递归式大语言模型退化:一项跨代研究
PubMedQA中递归合成数据训练使生物医学问答指标逐代下降,3B更明显,主为答案变长,未证模型崩溃