仅在确定时信任你的引导:推理时不确定性感知的稀疏对齐
提出TUSA,仅在监督者自信且语义重要时干预,跳过约50%对齐步骤,安全偏好提升15.6%,通用偏好提升12.0%。
使用角色向量探究大语言模型用户模拟器中的助手偏差
提取用户角色向量可识别并定向分析LLM模拟器的助手偏差,但过度强化会夸大用户行为。
ExpArt-KG:通过知识图谱迭代探索生成艺术图像描述
提出RAG框架交替生成与检索,以正确性判断控制搜索,从艺术知识图谱获取事实,提升描述细节并降低检索成本。
多智能体辩论驱动的创意生成:辩论会抑制多样性吗?
创意生成需兼顾质量与多样性,但多智能体辩论因趋同设计抑制多样性。提出Creative-MAD,通过认知视角分配和嵌入同伴选择保持分歧,显著提升多样性且不损质量。
基于图像生成的新闻立场检测视觉框架
利用图像生成构建视觉框架,将新闻隐含立场显性化;方法优于现有模型,且用户研究证实其视觉显著性。
见好就收:Quit——机器翻译重排序中面向高效候选生成的提前终止策略
提出基于不确定性量化的增量终止策略覆盖机器翻译重排序的生成重排全程十九个语言对加速两至四倍质量不变
联合训练还不够:面向多模态文档理解的条件化跨粒度训练
条件化跨粒度训练在两个语料上优于单任务,混合联合训练不行;受控实验表明其收益源于提示结构而非内容。
TWIX:一种用于端到端命名实体识别与关系抽取的两阶段方法
提出两阶段信息抽取流水线TWIX,在GutBrainIE全部子任务上大幅超越基线,排名第一。
Instella-MoE技术报告
提出全开源MoE模型,160亿总参数/28亿激活,基于AMD GPU训练,多阶段优化后平均分76.7,超越先前全开源模型。
生成证书的等式蕴含级联:SAIR EQT2 第二阶段求解器
提出级联式求解器判定岩浆等式蕴含:假命题给反例,真命题给证明,均经机器校验,公开测试全部通过。
基于知识与安全的拒绝行为的统一机制分析
研究发现知识型与安全型拒绝共享拒答方向,但信号迁移不对称,呈“先承诺后细化”机制。
大语言模型能否预测研究者下一步研究什么?
提出研究想法预测基准,含52个主题624轮滚动实验;多模型对比显示,摘要策略更优,Qwen2.5成绩领先。
测量Transformer深度中的最优传输
研究发现末层按最优传输移动词元云,初层不然;中间层接近最优,训练增强该一致性。
TEIDAN:多语言多方对话语料库
TEIDAN是日英三方才对话多模态语料库,支持跨语言自然对话研究,可用于轮次转换、受话者识别及多模态互动分析。
SFAD:事实感知的推测解码
提出上下文忠实推测解码框架,用偏好数据训练草稿模型,以认知摩擦检测并修正幻觉,增强事实性同时提速2.48倍。
编译而非记忆:用于上下文学习的上下文编译架构(CCA)
提出上下文编译架构:将文本编译为结构化表示,用验证器与纠错循环提升上下文学习,在基准上超越基线。
分阶段语言播种:面向AI客服中心验证单元问答的扎根查询扩展
AI客服中心受延迟与错误成本约束,仅答验证单元。分阶段语言播种离线扩索引,混合检索R@1提升至0.881/0.930,超doc2query,并消除自由生成的未支持内容。
Inspicio:面向历史语言的开词汇、基于大语言模型的词义检索
提出Inspicio管道,无需源语言词表即可将历史语言词语映射到英语WordNet义项,经LLM生成候选并混合检索,最优配置Recall@50达96%。
微调扩散语言模型中的成员推断:基于词元级记忆不对称性
发现扩散语言模型训练中的词元级记忆不对称,提出分位数加权偏度指标Q-Skew,有效推断微调模型成员资格,并可用于提取个人隐私。
基于事实效用估计的搜索代理密集过程监督
用事实效用估计实现密集过程监督,将事实聚类并贝叶斯估计效用,转为步骤奖励,提升多跳问答。
面向迭代问题求解建模的数据集
构建含三百余万次编程提交的数据集;基准测试中,状态空间模型预测最优,大语言模型更擅生成而非预测。
DualStake:深度研究智能体中的双路径置信度校准
提出双路径校准法,利用检索后证据置信度与答案置信度联合对齐正确性,在8个问答基准上提升校准且不损准确率。
校准是瓶颈:多轮工具调用的动作类别诊断
多轮工具调用评测中,校准错误是主要瓶颈且被状态评分掩盖;建议用动作类诊断补充总准确率。
波斯语匿名化工具:评估LLM标注训练以实现高效基于NER的波斯语匿名化
比较三种LLM标注训练紧凑NER匿名化波斯语聊天,OSS_ZeroShot监督最优,单GPU约2分钟处理4万条消息。
上下文锚定增益由已有机制介导:审计GRPO、SFT与DPO
后训练提升上下文遵循增益主要依赖预存机制:GRPO小,SFT中,DPO近上限;去掉起始方向后收益消失。
面向伴侣智能体评估的披露门控用户模拟
提出披露门控用户模拟,防止模拟用户过度配合,提升伴侣智能体评估的稳定性与排名可靠性。
ClinTraceBench:基于EHR派生对话的可溯源纵向临床推理基准
提出ClinTraceBench基准,含385个带溯源EHR对话,评测8种历史表示策略,发现压缩致关系丢失,小模型全上下文反胜。
短语定位的语言对比引导:面向语码转换文本到语音的免训练局部口音控制
提出免训练的短语级语言对比引导方法,为语码转换短语恢复母语口音,无需外部对齐,并保持说话人一致性。
PCoMoE:将MoE推理从整体专家选择转向细粒度路径组合
PCoMoE提出路径组合执行框架,开发子专家复用结构,实现端到端推理加速1.31倍,模型精度提升10%。
框架选对,规则用错:文化线索反而暴露了其本应弥合的金融知识鸿沟
在规范多元情境下,文化线索让模型选择伊斯兰框架,却有过半乃至三分之二选答错误,暴露本欲弥合的知识缺口。
OUTLETS:基于推测解码主干预测输出长度
利用推测解码的潜表征预测输出长度,仅加轻量回归头,误差更低,服务调度中短请求P99延迟降低34.8%。
滞后耦合:内部表示先可读,后有因果效力
内部表示早期即可被线性读出,但多数尺度下因果干预无效;可读性远超因果性,表征形成先于因果读出固化。
超越幅度:模块化混合专家中的对比路由
对比令牌与层状态均值,聚焦路由信号,专家边界更贴合语言结构,零样本精度提升至多1.77点,开销极低。
LLM裁判与人类判断分布的事后对齐
LLM裁判硬标签预测接近人类,但软标签差;提出熵感知事后对齐(NAPHA)提升软标签预测,高熵样本尤佳。
StateSwap:探测多项选择题中支持-排除框架的隐藏状态
提出双框架协议,用[STATE]探测隐藏状态;交换激活改变预测并提升跨框架一致性,均值差引导更稳定。
当模态差距缩减失效:CLIP中的预测级枢纽性
模态差距缩减未必提升CLIP零样本精度,可能引发预测级枢纽性,使预测集中于少数类别,导致准确率下降。
EDRAC:阿拉伯语方言阅读理解基准评测
首个覆盖五种主要方言的阿拉伯语阅读理解与生成式问答大规模基准,揭示语义质量与方言保真度差距。
基于奇异值分解的最小贝叶斯风险解码过拟合缓解
提出SVD-MBR,低秩去噪解耦共识与噪声,缓解指标过拟合,提升泛化指标,神经指标更适用。
从基础生成到RL推理:预算搜索视角
研究发现RL推理收益源于采样效率改变,而非模型能力新增,提出BOPTR规则可近似换算,误差低至3.41百分点。
任务分解能否提升自动NLG评估?
比较有无任务分解的LLM评判法,发现分解不提升性能,先前增益来自人工标签而非分解。
子词分段BabyLMs:面向样本高效预训练的分词学习
提出两种可学习分词的子词分段语言模型,在训练中优化分词,提升BabyLM预训练样本效率。
PersuaRL:强化学习驱动的多专家选择用于保险领域说服性对话生成
提出PersuaRL框架,用强化学习让对话代理动态选择协调专家策略,在保险对话中提升说服力,优于基线。
中文标题:迈向AI辅助临床试验匹配:实践考量、多中心评估与真实世界部署
中文摘要:多中心评估显示,AI辅助试验匹配系统可减少55%筛查时间,并增加90.9%试验机会。
LLMPEDIA:浏览、验证与比较大语言模型的参数化百科知识
LLMPEDIA审计参数记忆 真实准确率68.4% 较MMLU低21个百分点 30.5%断言不可判定
CaRL-EM:面向大语言模型实体匹配的成本感知强化学习
提出成本感知强化学习控制器,动态选择大模型算子与容量,兼顾质量成本,跨域零样本迁移。
开口就绪:让大模型生成适合语音合成的文本
让大模型直接生成适合语音合成的文本,提出数据集与评估法,FaST效果最佳。
用训练数据干预探测事实知识迁移
多语言模型跨语言事实迁移有限:严格移除事实后,绝大多数知识无法迁移;简单负例虚高迁移表现,困难负例下表现更低。
先探索后承诺:面向深度研究智能体的假设引导搜索
先探索后承诺:针对智能体过早单一搜索问题,提出假设引导分支探索并比较证据,性能显著超越单轨迹并行方法。
探索稀疏自编码器在文本因果混杂调整中的应用
用稀疏自编码器迭代筛选最小特征集调整文本混杂,偏差更低、覆盖率更高、可解释,并引入更真实的多标签半合成评估。
有些情感藏得更深:大语言模型的逐层探测与因果干预
最佳探针层随语料从浅到深;干预所选层使准确率降5-6点,表征可跨集迁移,早退提升6.9点。