BenSyc:孟加拉语境下大语言模型对话谄媚与人类对齐的基准测试
首个孟加拉语对话谄媚基准,发现LLM区分共情与谄媚困难,最佳F1仅61.8。
多智能体大语言模型能否识别同类?角色约束下政治分析中的风格计量指纹识别
研究表明多智能体LLM存在同类保护偏差,匿名化无法隐藏模型身份信号,T5识别准确率高达0.991,影响欧盟AI法案合规。
使用概率程序训练大型语言模型的归纳推理
PPT方法通过概率程序微调LLM,显著提升归纳推理准确性和校准性,效果优于后处理温度缩放。
更少上下文,更高准确性:面向LLM Agent的双时态记忆引擎,精简检索超越完整历史
Engram双时态记忆引擎:用约9.6k token检索切片超越79k完整历史,准确率83.6%提升10.4%,零错误。
基于LLM的文学翻译中的情感特征分析:机器翻译与译后编辑的系统性转变
研究发现LLM翻译存在模型特有情感指纹,译后编辑可调整至人类规范,但作者风格保存有限。
帕累托引导的教师对齐用于公平个性化文本生成
提出帕累托引导的教师对齐框架,平衡公平与个性化,证明公平缓解效果依赖目标与领域。
博弈AI辅助同行评审给科学界带来新风险
AI辅助同行评审易被低成本操纵,改写摘要可显著提升评分,威胁科学评估公正性。
CodeAlchemy: 大规模合成代码重写
提出CodeAlchemy框架,通过5种策略大规模生成合成代码数据,3B模型在多项基准上超越27B至32B等10倍大模型。
心理健康对话中的专家级危机检测
提出对话级危机检测基准CRADLE-Dialogue,模型识别风险有限,发布合成数据与32B模型表现优异。
早期令牌信心预测多智能体LLM辩论中的推理质量
研究发现,多智能体LLM辩论中,早期令牌(尤前几个)的信心值可可靠预测推理质量,优于全序列统计。
MIRAGE:LLM智能体中的极性翻转编码子空间
LLM隐蔽编码时存在低维子空间,极性翻转可区分执行策略,MIRAGE实时检测AUC达0.918。
TabClaw:用于电子表格操作与表格推理的交互式自进化智能体
TabClaw开源交互式智能体,支持自然语言表格操作、可解释流程、并行多表推理,并通过记录工作流、记忆与技能自进化。
顺序至关重要:对LLaMA进行序列微调以实现连贯的自动作文评分
序列微调按话语结构训练,自动作文评分效果最优,小模型可超越大模型。
面向混合专家语言模型中机器遗忘的路由感知专家校准
针对MoE模型遗忘与保留数据路由不匹配,提出TRACE校准专家激活频率,提升遗忘-效用权衡9%。
仅捕获五分之一:生产环境中多轮交易代理的LLM法官盲点
LLM法官仅发现22%缺陷,漏检跨回合状态问题,操作门零报告率,真实缺陷被低估3-6倍。
PADD:路径对齐解压缩蒸馏——无路由教师指导MoE学生学习
PADD框架通过两阶段四步骤将密集教师知识蒸馏至MoE学生并学习路由策略,数学推理上学生可超越教师。
多样性注入位置至关重要:多样化生成的统一框架
提出统一框架,揭示多样性注入位置关键,规范级注入有效提升输出多样性并保持质量。
自信的撒谎者:利用对数概率和大语言模型作为评判者诊断多智能体辩论
研究发现多智能体辩论中存在置信度轨迹和角色不对称性,构造者检测推理失败AUROC达0.804,远优于审计者0.634。
哪个LoRA?多语言指令微调中LoRA技术有效性的实证研究
复杂LoRA变体相比基础LoRA在多语言微调中无显著优势,跨语言适应改进有限。
LakeQA:一个面向百万级数据湖的探索性问答基准
首个结合搜索与推理的数据湖问答基准,基于9.5TB异构数据,当前最优模型仅得18.37%精确匹配。
LC-QAT: 通过线性约束向量量化实现大语言模型的数据高效2比特量化感知训练
LC-QAT用线性约束向量量化实现2比特端到端训练,仅需0.1%-10%数据即超越现有方法。
大语言模型作为语言学中的模态模型
LLM作为最小模型可提供“如何可能”的解释,但尚未实现对人类语言的“真实解释”,其解释力介于两者之间。
中文标题
使用递归神经张量网络检测生物医学文本中的推测性语言,RNTN略优于SVM(F1=0.885),段落向量效果差。
视觉语言模型是“看”还是“猜”?通过措辞控制基准衡量并减少文本先验依赖
构建540图像基准,四种问题变体控制措辞,发现所有模型在困难变体上性能下降,无图像消融降至纯文本水平,文本先验依赖可测量且部分可消除。
UniSVQ:2比特统一标量-向量量化
UniSVQ统一2比特量化,参数化码字为整数网格仿射变换,数据驱动微调,优于SQ、媲美VQ且推理更快。
KCSAT-ML:以全国考生人类难度探测推理模型
KCSAT-ML基准与DRG指标揭示:模型在难题上反缩放,易题上过度思考,相同准确率下难度对齐截然相反。
驾驭野外AI智能体的集体智慧实现新发现
AI代理通过开放互动在EinsteinArena平台协作,发现12个数学新最优解,证明去中心化科学发现的可行性。
WebChallenger:一个可靠高效的通用型Web智能体
通过架构设计模拟人类认知优势,利用PageMem表示和三个机制,以低成本实现接近专有系统的Web导航性能。
REAL:面向LLM长期记忆管理的推理增强图框架
REAL构建时间与置信度感知的有向属性图,采用非破坏性更新与混合波束搜索,结合反事实推理,使长期记忆性能平均提升22.72%。
自监督语音识别模型中的说话人群体编码
研究发现模型编码性别、年龄等群体信息,微调任务选择性保留或放大不同类型,公平性算法主要调整语音变异类信息。
小数据,大噪声:对抗训练实现鲁棒参数高效微调
SDBN框架将对抗训练引入PEFT,通过字符级或LLM生成变体提升鲁棒性,低资源和噪声下性能显著提升。
动态线性注意力
DLA框架通过动态状态合并与容量受限内存建模,解决固定策略导致的关键信息丢失与误差累积问题,性能超越现有方法。
使用自监督表示和学习的动态规划的多语言词级强制对齐
提出基于自监督表示与学习动态规划的多语言词级强制对齐,性能优于现有方法,可扩展到1100+语言。
中文标题:我们是在评估知识还是措辞?用ParaEval缓解MCQA敏感性
中文摘要:标准MCQA评分对答案措辞高度敏感造成虚假性能差距,ParaEval通过多释义评分消除此偏差,将差距降至1%以下。
使用逻辑规则的知识编辑基准测试
新基准测试发现现有知识编辑方法能插入直接断言,但无法处理逻辑蕴涵,性能差距高达24%。
隐藏的共识:人类反馈中的偏好有效性压缩
标准RLHF压缩多元判断致对齐误判,马来西亚数据中79%提示存在多个被丢弃的多数响应,需以有效性保留一致性替代单一优化目标。
Prefilling-dLLM: 扩散语言模型中长上下文推理的预测性预填充
分块缓存KV并稀疏选择相关块,复杂度从全序列二次降为解码二次,实现9-28倍加速,消除中间丢失。
ParaBridge:弥合语音语言模型中副语言感知与对话行为之间的鸿沟
ParaBridge通过自蒸馏将副语言指令支架转化为稳定行为,提升安全与共情响应,无需标注,保持通用性能。
通过经验知识整合与激活,突破LLM工具调用的极限
整合经验知识并扩展推理宽度,显著提升LLM工具调用性能。
注意力扩展:利用注意力增强上下文嵌入提升长文档关键短语提取
提出注意力扩展机制,利用预训练词嵌入增强PLM表示,高效提升长文档关键短语提取性能。
持续LLM升级循环:一种预测器门控银行级稀疏训练方法
研究通过预测器门控银行级稀疏方法,将密集LLM持续训练为4倍稀疏模型,并提出长上下文失败修复算法。
利用课程先验知识图从对话式AI交互中检测知识缺口
通过课程先验知识图将学生问题映射至主题,问题量反映知识缺口,准确率80%。
ArabiGEE:面向阿拉伯语语法错误解释的层次化分类体系
提出首个阿拉伯语语法错误解释层次分类体系,含27种错误类型和324个解释,支持大模型自动评估。
Dep-LLM: 基于证据引导的结构化多因素与可靠LLM推理的无训练抑郁症诊断
Dep-LLM通过多因素分解与置信度调制实现无训练抑郁症诊断,性能超越现有方法。
超越API:探察多模态大模型在物理工具使用中的局限
多模态大模型感知与规划物理工具能力不足,最佳模型仅识别58.7%工具、完成21.0%任务。
Attention-Discounted Adaptive Sampler用于掩码扩散语言模型
ADAS通过软注意力折扣重排序,提升并行解码质量,平均提高9-10%,仅增3.1%开销。
ConvMemory v2:一种保留召回率的Top-10证据重排序器,用于对话记忆检索
v2微调cross-encoder仅对已选top-10重排,保留召回率,在LoCoMo上将MRR从0.5824提升至0.6560。
Janus:大语言模型中目标导向信息扭曲的基准测试
提出JANUS基准,评估LLM在目标导向下对事实的选择性扭曲,发现现有模型缺乏抗误导保护。
VISTA:面向智能体评估的多功能交互式用户模拟工具包
VISTA提出六项指标与混合模拟器,弥补现有评估局限,实现更真实全面的智能体评估。
一例足以带偏:单次GRPO攻破安全护栏
单次GRPO训练即可攻破LLM安全护栏,导致系统性偏见,揭示后训练脆弱性。