WikiLoop:联合学习构建与导航智能体原生维基,融入下游反馈
提出WikiLoop框架,联合学习构建与导航维基,Builder从下游性能差异学习编辑,Navigator先充分后高效,最终模型在AuthTrace达62.6正确率,超基线6.3点。
重新审视投机解码中的有损验证:机制、权衡与失败模式
将有损验证分为截断与协作两类,指出截断法因分布扭曲性能下降,协作法需控制概率过冲。
音素级与字符级目标及选择性状态空间模型在脑皮层内脑-文本转换中的应用
音素级GRU解码器最佳,PER 12.62%、WER 21.19%,Mamba混合模型未超越。
立宪式中间训练:内容存在驱动对齐增益
立宪式中间训练通过插入原则性内容,在120B规模模型中持久增强对齐泛化,显著抑制黑mail倾向且不损害能力。
基于可解释Transformer模型的自动多标签猴痘研究分类
BERT模型以97.05%准确率自动多标签分类猴痘研究,辅助专家快速获取关键信息。
AtmosERC:建模对话级情感氛围以识别对话中的情绪
提出AtmosERC图框架建模对话级情感氛围,生成情感先验,提升轻量级及LLM的ERC性能,在四个基准上稳定预测。
多模态小样本知识图谱补全的双路径LLM推理
DuPLeR框架通过双路径LLM推理与结构增强,在数据稀缺下实现鲁棒知识图谱补全。
使用两步验证增强生成式信息抽取:一个产品属性用例
提出两步验证方法增强生成式信息抽取,利用LLM修正能力提高弱表达实体抽取,中等模型可媲美大型模型,并开发产品信息抽取应用。
中文标题
语言模型语义空间中,不对称关系几何更清晰,属性编码优于对称;因果模型重词汇,掩码/扩散模型重上下文。
梅蒂斯:记忆基础模型
提出记忆基础模型Metis,赋予模型原生记忆能力,实现高效无梯度记忆维护与冻结权重推理。
From Representations to Behaviors: Exploring the Person-Situation-Behavior Triad in LLMs
语言模型对不同语言的非规范分词并非同样鲁棒
模型对非规范分词鲁棒性因语言而异,分词碎片化越高越敏感,多分词训练可缓解。
SERPO:面向开放式测试时强化学习的自进化评分策略优化
提出SERPO方法,通过响应、评分标准、策略三环共同进化,无需外部反馈即可提升开放式生成任务性能。
从“发现”到“设计”:将概念作为大型语言模型的设计主轴
主张将概念作为LLM设计轴,提出两维度设计空间,呼吁从“发现”概念转向显式概念设计。
跨度引导去毒化何时有助?控制比较中的人类偏好与评估诊断
控制比较表明,跨度引导法偏好保留原意但残留风险,无引导法更彻底但易过度修改,需分别评估缓解与保留。
DIRECT:面向大语言模型的高效对齐序列标注直接解码框架
提出DIRECT框架,通过DPO和受控解码等优化,显著提升序列标注的性能与效率。
TREK: 面向复杂旅行规划的LLM智能体推理与评估工具包
TREK基准测试含800个多约束任务,评估LLM旅行规划可行性,最强模型仅46.2%成功,未明示需求成通用瓶颈。
OptimismBench: 语言模型判断中的预测偏差与对齐效应
OptimismBench检测语言模型概率判断的方向性偏差,发现多数模型乐观,对齐训练改变偏差符号,模型身份主导语言差异。
信用卡、困惑、计算与后果:语言模型推理真相探究
基于真实信用卡协议,CreditCardQA基准显示模型错误主因是金融规则误用而非算术,边缘案例影响弱势群体。
Latent-IM:面向语音大语言模型的潜在交互管理
Latent-IM框架通过解耦对话动作选择与实现,在LLM内部恢复状态控制,使动作准确率提升12.5%,效果媲美微调。
相同证据,不同目标:从语言模型状态解码诊断证据如何影响因果问题
诊断证据对因果问题的支持、挑战或无关可从语言模型隐藏状态线性解码,准确率超随机基准。
生成还是判断?基于LLM的对话情感-原因对抽取的范式视角
对级判断优于对话级生成,辅助检索器可提升情感-原因对抽取效果,F1提高0.50-1.46点。
评估大语言模型中的地域偏见:从抽象刻板印象到具体社会决策
S2D框架评估LLM对中国34省区的地域偏见,发现系统性差异与经济发展相关,需加强区域意识评估。
APEX会计基准测试
Mercor与Ramp构建的会计基准,评估前沿模型;最高得分56.4%,通过率不足3%,并发现辛普森悖论。
Pangram 4技术报告
Pangram 4模型AUROC达0.9916,错误率极低,泛化性与鲁棒性优异,能精准检测混合人机文本,达SOTA性能。
DenseOn与LateOn:面向多语言、长上下文和代码搜索的完全开放密集与后期交互模型
提出完全开放的DenseOn/LateOn模型,通过翻译训练实现多语言检索,密集模型强于支持语言,后期交互模型泛化更好。
传闻:无图像下的视觉语言医学诊断
前沿视觉语言模型在无图像时根据患者人口统计特征编造诊断,存在系统性偏差,需直接审计结构化输出。
心智世界建模
提出心智世界建模框架,将心理变量作为核心,耦合物理-心理状态,以预测人类行为。
混杂陷阱:文本因果推断中的治疗编码表示
提出掩码调整表示移除治疗词汇信号,避免表示混杂陷阱,改善重叠诊断并减少偏差。
基于神经音频编解码器令牌的自监督语音学习训练语言敏感性分析
研究发现,下游性能对编解码器训练语言不敏感,但对自监督预训练语言高度敏感,故编解码器可跨语言复用,预训练语言需与目标语言一致。
大语言模型时代的科学知识发现
综述34篇论文:生成式LLM助力文献检索与筛选,总结模型、技术、评估方法。
音频大模型中的韵律驱动越狱:一项受控研究与机制分析
固定文本仅变更韵律即可引发越狱,情绪语音比情绪文本更有效,语音传递是安全评估关键因素。
Living-Harness:交互式智能体演化器
Living-Harness是一种自演化智能体框架,利用轨迹和评估更新记忆与状态图,在交互任务中平均成功率提升超9.9个百分点。
SecRespond:面向真实世界妥协后事件响应的AI代理基准测试
SecRespond基准测试评估AI代理在妥协后事件响应中的能力,揭示其能发现警报但难以主动调查静默入侵与制定修复计划。
MediaWiki Code2Code搜索:面向开源软件实体语义发现的神经检索
提出MediaWiki Code2Code搜索系统,神经检索实现语义代码发现,索引130万实体,延迟1.85秒,P@10达0.87,远超BM25基线。
MindForge:通过无源程序合成教授小型语言模型全生命周期软件工程
MindForge自动化管道以无源环境合成训练数据,微调小模型,ProgramBench通过率提升11.53%,七个未见基准均获改善。
大型情感世界模型
将人类情感纳入世界模型,构建情感-原因-如何数据集,提升状态预测与推理效果,最高准确率提升45.72%。
SpecFirst:将行为规约获取作为从头开始的基于代理的程序合成中的首要步骤
提出SpecFirst两阶段框架,先获取行为规约再合成代码,显著提升测试通过率和探索覆盖率。
ML2B:跨语言机器学习流水线生成的大语言模型基准测试
ML2B首个评估大模型跨语言ML流水线生成的基准,发现性能下降高度依赖任务特性。
LLMs在医学诊断中的可靠性:一致性、操纵性与情境感知的检验
LLM诊断虽一致性高,但易受无关信息干扰,情境变化易致不当诊断,需临床监督。
ARC-Encoder:学习大型语言模型的压缩文本表示
ARC-Encoder通过编码器将上下文压缩为连续表示,替代token嵌入,减少推理成本,保持性能并兼容多个解码器。
集成LLM诱导的决策树以实现可解释且鲁棒的错误检测
利用LLM诱导决策树集成进行表格错误检测,可解释且鲁棒,F1提升16.1%。
MemAgent: 使用基于多轮对话强化学习的记忆智能体重塑长上下文大语言模型
MemAgent分段读取并覆盖记忆,扩展DAPO算法训练,超长文本性能损失<5%,512K测试准确率超95%。
自然视频与虚构对话中的统计规律与语言学差异
视频聊天与电影对话中,Heaps定律的词汇缩放因词类而异,反映沟通效率差异。
AgentSnare:学习延迟、转移和化解自主渗透代理
AgentSnare动态构建诱饵环境,吸收工具调用、转移轨迹、诱导完成报告,有效阻止真实目标被攻破。
AMEND++:临床试验中入组标准修订的基准测试
提出入组标准修订预测任务,发布AMEND++基准套件,采用CAMLM预训练策略提升预测,助力临床试验设计。
上下文如何塑造真相:LLMs中句子级真相表示的几何变换
LLMs中真相向量随上下文变化:中层对齐,上下文增强真假分离,大模型通过方向区分相关性,冲突知识引起更大变化。
将省略三段论中的隐含前提显式化
提出LLM与SAT求解器结合的流水线,自动生成并验证省略三段论的逻辑蕴涵。
MICA:面向长程情感支持对话的多粒度跨期信用分配
提出无评论家RL框架MICA,用增量距离奖励结合蒙特卡洛回报实现多轮情感支持对话逐轮优化,显著提升性能。
DialectLLM:超越标准美式英语的方言感知对话生成框架
DialectLLM生成多方言对话数据,揭示LLM不应复制方言语法特征,基准测试显示方言识别准确率低。