别在我面前“其实吧”除非你真懂:弱预设验证损害通用问答性能
现有问答方法过度关注假预设问题,忽略普通问题,且其事实核查模块较弱,导致真预设也被拒,反而降低真实场景下的问答性能。
因子化假设搜索用于证据到分类法检索
提出因子化假设搜索(FHS),利用多维度假设与结构化检索,在金融和临床编码任务上显著提升召回率与准确率。
TradeVerse:国际贸易中政治谈判的纵向基准
提出TradeVerse基准,基于世贸组织争端记录构建纵向谈判数据,设三项任务考验大模型,揭示其应对挑战。
超越‘AI语言’:论大语言模型输出的个人言语特性
大语言模型输出非统一‘AI语言’,各模型具独特个人言语风格,随代际变化,影响文本检测与法务语言学。
时间跨度鸿沟:面向长时程LLM智能体的规划、记忆、执行、训练与评估
综述界定“时间跨度鸿沟”:长时程任务使结果信号失效,需制造密集步骤级信号;并梳理规划、记忆、执行、训练、评估与开放问题。
跨主题与媒体类型的概念隐喻发现
提出无监督方法,从语料中提取语言隐喻并聚类为概念隐喻,揭示左右派播客的议题与框架差异。
TA-RAG:语气感知作为检索增强生成的设计要义
提出语气感知RAG框架,将交际对齐与事实准确并重,解决检索内容风格导致系统忽视用户语气要求的问题,适用于高敏感场景。
成本高效文档字段提取的预推理路由
预推理路由:仅当廉价模型易错且错误可预测时,可降本31-77%质量近无损;否则无益。
音频语言模型是否使用副语言证据?用于响应评估的反事实审计
提出反事实审计,发现音频语言模型评委常忽略副语言线索,仅凭准确率评估不可靠。
多视角三元交互图神经网络用于认知扭曲检测
提出MTI-GNN模型,融合贝克认知三元组,用多视角图神经网络与三元交互模块检测认知扭曲,在四数据集上优于现有方法。
头部自主性:基于冻结查询-键几何的无数据稀疏注意力
提出AoH无数据法,用查询-键谱几何识别检索/流式头;50%稀疏度保持96.5%性能,延迟降41.4%/66%,KV缓存减半。
Stockmark-Nemotron-3-Nano-Omni-JapanDocReader:通过能力注入与遗忘控制的结构化文档解析
提出日本文档理解模型,注入解析能力并控制遗忘,混合SFT保VQA,RL进一步提升结构化解析。
显式而非更长:认知立场如何在记忆压缩中幸存
把立场写成显式标签字段而非括号附注,可显著提升记忆保留(约15个百分点,预注册复现+15.6);长度无关,模型决定最佳显式方式。
Simple-OPD:揭秘在线策略蒸馏的预热
揭秘OPD预热:需教师兼容思维链,LoRA近饱和训练更优,提出Simple-OPD初始化方法。
基于生物标本记录的非地名录地名地理定位
利用标本记录中的空间关系定位非地名录地名,概率推断精度最高(中位误差1.43km)。
针对各向异性校准WEAT:ZCA白化作为嵌入关联测试的几何预处理步骤
提出ZCA白化预处理WEAT,降低嵌入空间各向异性,超30%结果显著性改变,提示原偏差测量需谨慎解读。
未来桥:协作解码中超越局部偏好的令牌选择
提出未来桥,按令牌对SLM后续推理支持度排序,而非LLM局部偏好,数学推理平均提升35.1%。
Ask-E:校准问题生成环境
按技能水平出题,校准成功是恰有一个模型能解。前沿模型校准率低于一半,训练可提升数学性能,无需新数据或奖励。
LLMRouter:开发、评估与部署LLM路由器的统一基础设施
提出统一路由框架,学习路由较固定基线提升14.6%,轻量路由成本约束下更优,用户条件路由改善个性化。
PHASE-Tree:面向长时程角色扮演对话的角色状态演化建模
提出PHASE-Tree多尺度角色状态树及LongEvoRoleBench基准,显著提升长期角色扮演中的演化状态生成。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
研究发现大型语言模型会随提示框架调整回答,即使事实问题也易受引导,可能强化用户潜在偏见。
语言模型能否未见而想象?——Ekphrasis:衡量纯文本大语言模型的视觉创意构思
提出Ekphrasis基准,用400任务评估纯文本语言模型的视觉创意构思,区分有用性、表现力、新颖性,经跨模态验证。
GPTKB 2.0:浏览、查询与审计消歧后的LLM派生知识库
本演示探索消歧后的LLM知识库,含3840万三元组,支持浏览、查询、审计、SPARQL及实体链接。
更多检索证据是否有助于扩散语言模型的视觉检索增强生成?
提出基于熵的候选过滤器,选择性纳入证据,提升扩散语言模型视觉检索增强生成准确率约2.6个百分点。
一种基于智能体的自顶向下与自底向上混合知识图谱生成方法
提出混合知识图谱生成法,以大模型结合维基数据,用智能体反思从多语言噪声技能文本构建可扩展技能体系。
Skaling定律:融合Chinchilla指数与Kaplan耦合
提出Skaling定律,耦合模型与数据,误差降1.5-3倍,仅需约1/10计算量。
基于LLM激活测量文本概念内容:概念向量与线性探针的ESG证据
用冻结LLM激活的线性探针和RFM测概念内容,无需微调即近微调分类器精度,优于模型自身回答。
HNR-DAC:面向科学声明验证的难负样本重排与分布对齐分类
提出HNR-DAC两阶段框架,用难负样本重排与分布对齐分类提升科学声明验证,平均分95.13%居第三。
从测试时扩展到可复用记忆:衡量文本到SQL中的结晶化
提出结晶化:存储修正查询在BIRD上使新问题首答准确率提升4.34个百分点,关键在数据库特定内容。
CoinRAG:面向长上下文RAG的上下文信息片段KV缓存复用
CoinRAG复用细粒度信息片段KV缓存,兼顾低延迟与高精度,在长上下文问答中获平均5.3%相对F1提升,实现新的帕累托最优。
为何知晓两跳仍不足:理解语言模型的两跳泛化
模型泛化依赖第二跳分布;失配因上层只映射而非推理;循环训练可提升。
视觉世界实验中的注视行为可借助现成语言-视觉编码器建模
结合CLIP双编码器与双模态归因,无需微调即可预测视觉世界实验注视行为,复现人类预测加工。
大语言模型的地理空间概念探测:抽象性、组合性与基础性
通过空间概念基准测试,揭示LLM在抽象、组合和基础性方面的理解缺陷,为改进概念获取提供见解。
Stoicheia:用于古希腊语文本修复、句法解析和格律分析的字符级掩码扩散
405M字符级掩码扩散模型Stoicheia,统一处理古希腊语修复、解析与格律,性能超越SOTA。
自然语言处理心理测量学
用LLM人格模拟问卷,结合情感与网络特征,可解释心理健康预测,但需人工验证。
语法工程与LLM结合:粤语和爱尔兰语ParGram树库构建
开发粤语和爱尔兰语ParGram树库,测试LLM辅助语法工程:翻译不佳,句法生成部分有效但跨语言抽象弱,仍需专家验证。
LitTraceQA:科学问答中多阶段证据定位与验证的基准
提出LitTraceQA基准,用于科学问答的多阶段证据定位与验证,评估论文检索、证据定位和答案准确性。
零差距并非恢复:分层逐题概率评估与基准污染的逐步缓解
提出分层逐题概率差距评估,揭示先前缓解策略恢复被高估,新方法RailCap最优。
面向DisCoCat情感分析的LLM辅助改写中等复杂度金融句子的探索性评估
LLM辅助改写使中等复杂度金融句子适配DisCoCat,电路压缩逾七成,最优准确率0.550,训练集增大反降。
CreativeInstruct:规模化教会大语言模型平衡质量、创造性与多样性
提出CreativeInstruct,用特殊标记平衡创造性与质量,提升多样性且不损质量,并有益强化学习。
答案保持攻击下的模型置信度:信息性—可操纵性边界
研究表明,在保持答案不变的攻击下,模型置信度可被操纵,且现有防御无效,置信度并非内在稳健的监督信号。
检索约束策略优化:从网络威胁情报中提取攻击技术
提出TTP-R1框架,结合检索增强微调与强化学习,从CTI文本提取ATT&CK技术,F1提升7.4%,速度提升28倍。
编程代理的在线监控与纠偏引导
LivePlan实时监控纠偏编程代理,解耦判断与建议,解决率提升15.2%,成本仅增0.08美元。
我该如何为我的机器人挑选基础模型?倡导社会机器人的社区评估框架
提出社交机器人基础模型五大评估维度,设计三级评估漏斗,呼吁社区共建评估框架。
多码率离散扩散模型用于文本引导的语音修复与编辑
提出SIEDD离散扩散框架,分层编解码器令牌实现语音修复编辑,性能优于基线,验证分层建模提升上下文保持。
LoRAScan:通过下投影激活尖峰检测大型语言模型低秩适配器中的后门提示
LoRAScan通过监测稳定下投影尖峰,不修改参数即可检测并拒绝后门提示,恶意输入拒绝率约98.49%。
基因型触发:通过生成式抗菌肽模型中的宿主特异性后门暴露药物基因组学盲点
提出基因型触发后门攻击,使特定HLA携带者的免疫原性风险平均增加743%,且不损害抗菌活性等常规指标。
StepJack:针对多步间接提示注入的计算机使用代理安全基准测试
提出多步间接提示注入,构建StepJack基准480例,评测6个CUA,攻击成功率最高提升31.2个百分点。
大语言模型何时承认错误?理解模型信念在撤回中的作用
模型撤回错误由内部信念驱动,线性探针可预测,操纵信念可因果影响,监督微调通过改善信念提升撤回。
SABRE:压力下视觉语言模型的可扩展自动化基准测试
提出SABRE自动化流程,构造压力测试检验VLM是否遵循视觉证据而非世界先验,六模型平均准确率仅22.6%。