语义保持变换下的LLM对齐——效用不对称
在语义保持变换下,模型任务效用基本保留而对齐失效显著加剧,称为“对齐—效用不对称”。
语言模型中的角色人设效应能泛化多远?
人设效应可预测却难迁移:跨模型/提示需目标校准,正则更新更优,源关系须有增量价值。
C-HAT-Bench:超越完全生成文本的中文AI文本检测基准
中文人机协作文本检测基准含5千源文本、24万变体,21个检测器在协作模式下AUROC平均降12%。
ExpVoyager:面向动态智能体技能合成的直接经验导航
技能合成重构为经验动态导航,管理者按需多视角探索轨迹,边提取可复用知识边追踪剩余需求,提升下游表现。
聚焦条件:推理时自对比引导让LLM获得更优条件文本嵌入
提出推理时自对比引导SCS,以无条件嵌入精炼条件嵌入,免训练即插即用,提升LLM条件文本嵌入质量。
MixDetect:AI编辑的词级定位与量化
MixDetect实现AI编辑词级定位与量化,分别预测各词是否被编辑及强度,揭示编辑范围与强度模式。
论大语言模型智能体的行为特质
提出A-B-D法,从34万余条轨迹自下而上推断智能体特质,得六因子,揭示知识与行为差距。
OpenTumorBoard:多学科肿瘤委员会讨论轨迹的真实世界基准
从611例、1.9万轮真实肿瘤委员会讨论构建基准,评测14个大模型,最佳仅3.43/5,微调可提升。
ARSM:面向智能体推理压缩的自回归状态机
ARSM是免训练自回归状态机框架,借HAR微链与动态状态机压缩推理历史,保性能并降token消耗。
从知到弃答:弥合视觉语言模型中的表征—行动鸿沟
提出VAD-R基准与Rep2Act,将视觉语言模型潜在可答性转为弃答决策,显著提升拒答性能。
无需预训练文本嵌入的主导时间取向分类:一种新颖的形态句法清单向量方法
提出“形态句法元”清单向量编码句子,无需预训练嵌入,在1799个复杂句上三分类准确率达92%。
滞留与丧失:低比特语言模型中的知识崩塌
低比特三元模型训练中知识容量先升后崩,仅存fp16的6%;根因是输出头学习率滞留不稳定,改进调度可恢复。
无需权衡地提升大语言模型输出多样性
提出DAST,通过重排词元使语义相近者连续并结合算术采样,在不改变分布、近零开销下提升LLM输出多样性,ProtoQA显著提升。
TCMQA:一个含3.8万道题目的中医基准,附执业医师作答参考
TCMQA含3.8万道中医考题与101位医师作答,评测29个模型:预训练语料比规模更能预测中医能力。
OneSign:用一个模型统一手语理解任务
OneSign统一框架,单个模型完成手语识别与翻译,并用模态自适应混合专家弥合手语与文本模态差异。
关键交接:混合语言模型中的检索
两跳检索中,注意力层使桥接键可用并消耗;顺序混合模型由递归层携带键,其记忆可被查询并改写答案。
过度解读上下文:被动暴露即可左右大模型决策
无关理由的被动暴露也会左右大模型决策,偏差近50个百分点,甚至违背用户要求、采信虚假信息。
MedRouter:揭示医疗大模型间的知识差异,实现基于路由的推理
MedRouter 用嵌入路由选择专科医疗大模型,强化学习优化选择,八项医疗问答基准准确率提升 8%。
固定却仍不稳定:同一评委内部的判定方差与LLM评委排行榜的噪声底线
固定快照、零温度的LLM评委重复判定仍不稳定:约5%条目翻转,排行榜相邻位次多难区分,需多次复跑并公布稳定性。
你真的确定吗?谄媚基准中的两个混杂因素
审计SycEval谄媚基准:两个模板混杂,指定答案与格式指令随反对时机变化,可颠倒结论且可校正。
让语音语言模型成为多语言倾听者
构建覆盖23种语言、9200小时的1080万条语音问答合成数据集,低成本提升语音语言模型的多语言能力。
知道不等于选择:显式验证在生成式偏好之外带来了什么
生成正确答案不等于会选择;显式验证P(True)改善排序与准确率,但收益受实体和正确性定义影响。
给错误的问题打分:受限选项评估中的读出失败
受限选项评分误读模型:其常续写被引题目而非预测,排序近随机;预填答案主干可提升AUC。
超越校准:类型化决策模型的概率是否遵循概率公理?
免标注检验类型化决策模型的概率一致性;Jev与Qwen3.8-27B均违反概率公理,加和偏离1且失效模式不同。
语言模型预训练的泛化动态
预训练中模型在鹦鹉式与智能式计算间突然模式跳变,源于容量竞争,可优选检查点与数据。
识别转码器中用于时间敏感事实回忆的时间特征
首次用转码器电路追踪特征级时间召回,发现三类MLP节点并行交互,揭示现有方法遗漏的高层时间组件。
超越记忆构建:重新思考基于大语言模型的对话智能体的记忆访问
提出Threader,跳过LLM记忆重写,直接对原始交互做结构感知访问,提升准确率与证据召回并降低开销。
测试时扩展与训练在个体立场预测中何处失效?
研究测试时扩展与训练在个体立场预测的不足,发现四类失败模式,并提出结合直接评分与个人历史证据的方法。
CAME:面向可解释提前一季度营收预测的公司感知证据记忆专家
提出CAME,用语义证据和误差记忆修正无泄漏统计锚,提升提前一季营收预测并可溯源解释。
CoLMbo-SV:面向可解释说话人验证的声学接地语言模型
提出声学接地语言模型 CoLMbo-SV,兼顾高精度验证与可核查比较报告,EER 0.99%,错误降约80%。
校准而非答案选择:蒸馏推理模型的内部置信度
内部置信度校准优于答案选择;Probe-SD自蒸馏微调显著降低ECE,改善加权投票。
图像旁的文本:面向可信多模态医疗数据及更广领域的检测、效用与泄露
评估多语种医疗报告文本去标识化下的检测、效用与残余泄露,跨文档关联仍可重识别。
从位置风险到块存活:扩散语言模型的更快生成
提出BRISK-DLM,以风险奖励加权与前缀条件校正器优化并行生成,吞吐量提升37.4%且质量不降。
面向扩散语言模型的犹豫感知在线策略蒸馏
犹豫感知在线策略蒸馏将教师匹配扩展至所有掩码位置并按后见加权,无需额外前向,多基准最优且加速解码。
BaatCheet:面向印度语言对话翻译的多语言语料库
多语言对话翻译语料库含约4.9万对话、5个方向;微调开源大模型显著提升,自动、LLM与人工评估。
CHI:统一实体、关系与数量维度的摘要评估复合幻觉指数
提出CHI统一幻觉指标,融合实体、关系、数量三维度,与人类判断相关性最高,可分解、可解释。
学习预测世界有助于智能体行动吗?——世界模型后训练审计
错配观测使预测精度降15.3%-61.6%,任务收益仍存;随机奖励也提升表现,增益非源于世界预测。
语言辨别能力提升多语言语音模型的语言学习
多语言语音模型预训练中强化语言辨别,可缩小与单语模型的差距,且首轮引入效果最佳。
CertMark:具有认证解码的无失真多比特水印
提出CertMark:用消息种子精确采样保持原分布,支持认证弃权解码,保持文本质量并可靠恢复多比特消息。
NLPG:面向自进化语言智能体的自然语言策略梯度
NLPG通过外部策略记忆,不改冻结智能体参数,将失败转为局部自然语言修正,六基准平均超基线8.71个百分点。
大语言模型信任“自己人”:多智能体系统中基于身份的从众行为
多智能体系统中,大模型从众行为随同伴身份变化:内群共识增强从众,外群共识削弱从众,与答案对错无关。
TeacherGRPO:通过教师对齐弥合推理蒸馏中的容量差距
将教师向学生分布对齐重构为强化学习,提出TeacherGRPO,以课程选择性对齐与长度正则避免能力崩溃,显著提升推理蒸馏性能。
将记忆摘要锚定于效用意图
提出MemSuit,以查询-答案对引导教师生成效用感知记忆,自蒸馏使学生仅凭对话复现;分解条目防擦除,对比微调检索器,优于基线。
MIC:解释AI生成多模态虚假信息中的图像—声明不一致性
MIC框架用世界知识检测并解释AI图像与声明的不一致,融合SFT与GRPO,并发布MIC-Bench基准。
上下文跨越:一种面向全双工语音模型与外部大语言模型后端的通信框架
提出上下文跨越框架,通过实时分块预填充将外部信息原样注入全双工语音模型,提升对话与问答表现。
密集监督还不够:长时程同策略蒸馏的分层监督分配
长时程同策略蒸馏中,均匀监督分配低效;应按未来效用与当前可学性分层分配,定位、验证并精炼监督。
GSM:基于共享全局状态的高效语言建模
GSM在编码阶段将长程信息聚合为固定窗口共享状态,解码器各层复用,避免重复构建KV,注意力开销不随历史增长。
DISCO:基于定位-推理解耦的分布式长上下文扩展
DISCO将长上下文分片并行定位,强化学习Driver规划汇总,消除上下文衰减,低成本实现高精度长文本推理。
重新思考SFT的词元重加权:抑制、反转与外推已学特征
SCALE冻结SFT增量,以熵学习有界门控,抑制、反转或外推已学特征,提升数学推理与代码生成。
保留语素:面向尼泊尔语的形态学引导预分词
BPE前按尼泊尔语形态切分词干词缀,Papaya边界F1达0.96,比特率约降1%,下游提升有限。