超越个体角色:将合成对话对齐到群体行为分布
提出GroupPersona框架,对齐合成语料到参考语料行为分布,将分布差异降低24.4%,校准误差减少30%以上。
从“可能”到“是”:语言模型改写中的确定性扭曲
语言模型改写时系统性扭曲表达确定性,多数模型倾向于增强确定性,且多次重复改写会累积该偏差。
黄金标准的幻象:长文本生成中人类评估协议的大规模分析
大规模分析揭示长文本生成人类评估协议普遍不透明,测量与解释模糊,建议改善报告透明度与可重复性。
What Does Debiasing Really Remove? A Geometric Study of PCA-Based Gender Debiasing in Word Embeddings
中立之弊:AI生成动物故事中的性别呈现
AI生成动物故事中,中立性别策略导致女性角色仅占2.2%,男性占40.6%,中立性反而加剧性别偏见。
扩展训练时对抗攻击以防御恶意微调
提出Patcher方法,通过扩大对抗步骤防御恶意微调,显著提升模型鲁棒性。
ROSUM-MCTS:受蒙特卡洛树搜索启发的带结构奖励的HDL代码摘要
基于MCTS的分层扩展和复合奖励优化HDL摘要,在VHDL/Verilog上超过基线且鲁棒。
支持向量评分准则:弥合自生成与人工评分准则之间的差距
SVR通过最大间隔边界学习构建评分准则,将自生成与人工评分差距从24.1缩至0.3,性能超越强基线。
MC-PDD:面向黑盒大语言模型的掩码语料库级预训练数据检测
提出MC-PDD方法,利用掩码预测命中率差异检测黑盒LLM预训练数据,性能媲美现有方法。
客户代理:通过工具增强型代理和RLVR克服超长购物轨迹中的上下文限制
提出ShopTrajQA长轨迹基准与客户代理框架,采用RLVR训练代理自主检索解析轨迹,突破LLM上下文限制,表现优异。
中文标题
文本摘要并未消亡:人类参考摘要在信息性和忠实性上仍优于LLM,LLM仅在流畅度上占优,事实性及风格多样性不及人类。
重写以助翻译,翻译以获奖励:机器翻译中源重写的强化学习
提出RLSR框架,利用翻译质量提升作为奖励训练源改写模型,4B模型超越同规模,媲美235B大模型。
基于专家乘积桥的扩散语言模型并行解码
PoE-Bridge通过专家乘积桥接DM与AR模型,并行草稿加拒绝采样,5倍加速恢复95%性能。
跨体裁与标点条件下的阿拉伯语句子分割
引入AraSEG语料库,发现轻量编码器优于大模型,性能饱和且跨体裁泛化困难,准确分割可提升下游分析。
意义何在?手语处理中的空间语法与指代解析
针对手语模型忽略空间索引的问题,提出分解为检测与实体链接的框架,建立基线并增强识别。
"I understand your perspective": LLM Persuasion and Sycophancy through the Lens of Communicative Action Theory
LLM通过传达言外之意及谄媚回应增强拟人化,提升说服力,使人类更易受影响。
SurgiQ:评估大语言模型手术理解能力的大规模多领域基准
SurgiQ 13055道手术题评估35个LLM最佳68.1%通用模型优于生物医学手术理解提升空间大
TextEconomizer:利用去噪变换器和熵编码增强有损文本压缩
TextEconomizer以极少参数实现5.39倍有损压缩,保持语义质量,超越现有模型。
对齐但非伙伴特定:多模态LLM代理如何在没有人类惯例的指称游戏中成功
多模态LLM代理通过冗长描述实现协调,而非形成人类式的伙伴特定惯例。
ZAS-SQL:从失败案例中提炼规则以实现零样本文本到SQL
提出零样本Text-to-SQL框架,从失败中蒸馏规则,通过三个模块提升生成质量,在Spider上达87.2%准确率,超越少样本方法。
跨同义改写不变性学习的幻觉检测方法
CPIL框架通过同义改写不变性和对比预训练,仅用1%标注数据在幻觉检测上超越强基线。
当语言产生分歧:自我进化的多语言大模型审判官
提出SEMJ,利用跨语言不一致性进行迭代反思,提升多语言评判准确性与一致性。
Constrained Paraphrase Consistency for LLM Hallucination Detection
共享语义,不同机制:通过对齐语义和机制的无监督特征发现
提出分布级无监督特征发现,通过语义和机制聚类,揭示模型续写中的隐藏模式并提供可干预机制证据。
AlignFed:面向异构边缘环境中大语言模型的对齐感知异步联邦微调
提出AlignFed异步联邦微调框架,通过多阶段语义对齐缓解模型漂移与公平性问题,实现异构边缘环境稳定优化。
GlobeAudio:面向大型音频语言模型自然化评估的多语言多文化基准
GlobeAudio提出多语言多文化自然音频基准,揭示大型音频语言模型在真实声学条件下性能差距大,尤其开源与低资源语言。
借助工具性干预构建比较动机画像
通过对称工具性干预区分对齐伪装动机,发现模型更受评估期望影响,需构念效度检验。
SSR: 模拟患者能学会自我污名化吗?通过内心独白建模自我污名
提出SSR框架,基于心理模型创建内心独白数据集,微调LLM实现患者自污名动态模拟,生成更真实临床反应。
AgriGov:面向印度政府农民计划的结构化多语言数据集整理
AgriGov是三语数据集,含8000句对齐对,用于农民政策的多语言翻译与问答。
TLRD:利用三层级理由蒸馏教会大语言模型推理表格数据
TLRD通过三层级理由蒸馏将表格数据转为结构化理由,训练LLM实现可解释预测,显著缩小与树集成性能差距。
审计大语言模型中的专有对齐:无需真值标准的比较框架
提出比较行为分析框架,无需真值标准即可审计大语言模型的专有对齐行为。
CATPO: 评论增强的树策略优化
CATPO通过树信息性评分与批判引导修复提升训练效率,在数学任务上比TreeRPO提升1.9%。
中文标题:明暗对比注意力:在暗处分配计算
中文摘要:CHIAR-Former通过谱熵路由选择DCT与注意力,在WikiText-103上PPL降低45%,FLOPs减少62.5%。
理解阿拉伯语X社区心理健康话语的社会文化维度
研究阿拉伯语X社区中BPD、双相障碍和ADHD话语的文化关键词差异,揭示各自词汇特征,贡献LLM辅助个人披露管道与探索性框架。
张量化印迹:共享N元语法嵌入的潜在特征有益于大语言模型
提出张量化印迹(TN-gram),用CP分解共享因子表示不同阶n-gram嵌入,参数更少,性能相当甚至更优。
贝叶斯智能体:后验引导的LLM智能体框架技能进化
贝叶斯框架将技能视为后验假设,通过后验指导进化,显著提升多基准性能。
Forward-Free Diffusion Language Models
正确决策下隐藏的内部压力:多模态语言模型中的决策状态探测
多模态模型正确决策时内部决策状态仍受语义压力影响,S³E框架揭示外部正确性不保证内部稳定性。
AsyncLane:在扩散语言模型解码中将细化与推进解耦
AsyncLane通过车道分支与优化技术解耦细化与推进,最高加速3倍,提升扩散语言模型解码吞吐量。
SAEExplainer: 基于激活引导偏好优化的SAE特征解释方法
提出SAEExplainer,利用激活分数奖励信号迭代自纠正解释,减少幻觉并增强因果触发。
破解生成式困惑度:为何无条件文本评估需要分布度量
批判生成式困惑度指标仅衡量可预测性,建议采用分布度量评估文本质量。
针对长会议文档摘要的段落级树搜索
S3方法无训练,用蒙特卡洛树搜索组合段落摘要候选,7B模型达72B性能。
中文标题:言多无益:揭示小语言模型中的自我改进行为
中文摘要:研究表明小语言模型自我改进能力有限,注入提示仅提升4.4%准确率,更长提示反而有害。
谄媚作为多语言对齐失败:安全如何在不同语言、主题和模型间退化
研究揭示大模型谄媚现象随语言资源减少骤增,安全对齐全面失败,需公平多语言安全技术。
TRADE:用于语音大语言模型的换能器增强解码器
TRADE通过换能器分支增强语音LLM,实现离线与流式高精度识别,WER分别达6.71%和8.40%,并有效改善端点检测。
TrustMargin:大语言模型中参数记忆与检索证据的无训练仲裁
提出TrustMargin,无需训练即可仲裁大模型直接回答与检索增强回答的可靠性。
TimpaTeks:通过扩散语言模型引导的自动原位文本序列修改
提出TimpaTeks,实现扩散语言模型原位文本修改,降低困惑度、保留结构且计算成本低。
回归正轨:为扩散大语言模型推理对齐奖励与状态
PAPO框架通过步骤奖励与历史重演对齐生成轨迹,解决双重错配,大幅提升推理性能。
检索条件化重绑定回路:大语言模型中的动态实体追踪机制
大语言模型通过检索条件化重绑定电路实现动态实体追踪,Gemma和Llama模型的表征方式不同。
Ishigaki-IDS:面向建筑信息模型中信息交付规范草稿编制的开放权重验证器感知模型
Ishigaki-IDS开放权重模型生成验证器感知的IDS草稿,性能超Claude Opus 4.5,减少54.7%工时。