面向GNN知识图谱问答的查询侧攻击:从实体链接到答案生成的失败追踪
针对GNN-KGQA四阶段流程,提出分阶段隔离测试。发现子图构建是主要脆弱点,占CR攻击下99%以上性能崩溃,即使答案在子图中也难达。
超越局部意外:指称不确定条件下作为选择性信念修正的接地对话
对话中听者面对指称不确定时,局部失配应保留原理解,累积不确定性才触发修正,此策略兼顾稳定与检索性能。
前缀滑动:实现高效测试时扩展
提出前缀滑动,丢弃非前缀和最近窗口的推理标记,限制内存,三倍加速,配合强化学习可扩展至超十万标记。
微调Whisper用于巴尼瓦语自动语音识别的初步研究
初步研究表明微调Whisper可适应极低资源土著语巴尼瓦语,词错率37.5%,字符错率7.45%。
失而未抹:在神经语音模型中寻找遗忘语言的痕迹
模拟被收养者语言切换,首语痕迹留存底层,早期接触加快14%再学习,关键期源于表征固化而非可塑性丧失。
当人格遇见量化:量化大语言模型的逐层MBTI分析
人格涌现于上层,量化影响人格:4比特保留粗结构,2比特破坏一致性,解码可致漂移。
PA-CoT:面向个性化营养咨询的画像自适应思维链
提出画像自适应思维链,将画像解析作为独立推理步骤;新基准QPA上,相比11种方法,在个性化和安全性上均领先,平均分4.21。
检索、匹配、升级:基于VLM蒸馏交叉编码器与智能体VLM的精准可扩展商品链接
商品链接任务中,级联检索匹配,用轻量编码器处理高置信度样本,智能体VLM通过图像和网页证据解决疑难,将覆盖率从68%提升至77%。
学习什么共享什么个性化:代理记忆的层级策略协同进化
提出HiPS框架,将记忆管理分为全局共享与用户个性化,通过跨层级规则流协同进化,提升记忆增强代理性能。
罕见病,共同困境:大语言模型在决策中更重资源平均分配而非患者利益
评估11个LLM处理208个罕见病伦理困境,发现模型普遍优先公正原则,倾向平均分配资源,忽视病情差异,且受权威框架影响。
我们能否读懂音频大模型的“心思”?一个可言语化、多语言的中间层工作空间
研究发现音频大模型在输出前,其中间层已用文字浮现答案,且跨语言、含副语言信息,因果可证。
检索但不可靠:检索增强生成中的攻击与防御综述
综述RAG全流程攻击与防御,按准确性、隐私、公平分类,覆盖检索、重排、生成、追溯各阶段,并介绍基准与可解释性。
前沿挑战:评估科学工作流完成度
发布97个科学工作流任务,最优完成率仅20.6%,高部分得分与自信声明不可靠,需端到端评估交付完整性。
FinRiskAtlas:面向金融风险审查的大语言模型决策对齐评估
金融风险图谱基准从操作与证据双维评估金融大模型,显示通用能力分数无法全面反映专业可靠性。
TurnBench:多领域口语对话轮转动态基准
提出TurnBench,含30小时人工标注对话;评估14种系统,人类平稳接话时提前151毫秒,现有系统均误报过高。
LLM查询模拟中的“知识诅咒”:追踪答案侧侵入的概念溯源
概念溯源区分查询概念来源;答案侧侵入占7.4%,为诊断非预测,后选择可消除99%。
条件总相关与自适应并行采样的串行深度
证明策略散度等于条件总相关累积,揭示并行采样信息代价,并刻画多种随机结构的深度界。
GGSS:生成式视觉-语言模型推理时去偏的测地门控球面转向
提出GGSS,在超球面发现反事实偏置子空间,沿测地线转向视觉词元,自适应门控降偏,保持模型能力。
CaSKG:面向可扩展智能体技能检索的反事实-因果技能图
提出反事实因果技能图CaSKG,校准技能关系,提升LLM智能体跨模型和基准的任务成功率与效率。
针对LLM越狱攻击的自进化多智能体框架防御
提出自进化防御:跨交互规则记忆将失败抽象为方法级规则,泛化至攻击族,无需参数更新,降低越狱成功率且不增加拒绝。
PonsRAG:受脑桥启发的RAG,桥接认知孤岛以协调长叙事推理
提出受脑桥启发的检索增强框架,采用三层索引与协调推理桥接认知孤岛,多选任务平均准确率提升11.56%。
形式化、可执行且可解释的陆空通话运行程序运行时监控
提出运行时验证框架,解析陆空通话并与监视数据融合,用时态公式评估程序履行,违规自动报告,经真实与合成数据验证,F1达0.85。
一种症状,三个杠杆:同策略自蒸馏的批判性综述
同策略自蒸馏综述:教师用特权信息指导自身,致生成路径崩溃,受信号加权、特权信息、教师动态三个杠杆影响。
当陈旧约束无人复核:继承性智能体记忆中的预算化验证失败
继承记忆含过期约束时,默认验证致约75%陈旧一致决策;将一槽改配关键路径,正确率提升61–74个百分点。
AsymSpec:面向智能体大模型的上下文非对称推测解码
草稿读全量、验证看压缩,对比融合与分歧门控,90%精度,1.3-1.7倍速,成本降7成。
IDEAlign:比较大型语言模型与领域专家的想法对齐
提出IDEAlign协议,用“挑出异类”任务评估LLM注释与专家观点相似度;评测显示多数指标失效,LLM裁判最优但仍难替代人工。
语言学理论中的循环神经网络:重访Pinker与Prince(1988)及过去时之争
现代编码器-解码器网络克服了Pinker和Prince对早期模型的批评,表明NLP进展可推动认知建模。
LoRA需要多少秩?——Transformer注意力的秩-误差界
针对LoRA秩选择,提出注意力近似误差理论界,给出显式上下界及谱界,揭示softmax饱和对所需秩的影响。
$R^3$:通过强化学习训练机器人用自然语言推理
用强化学习让视觉语言模型生成自然语言推理,引导机器人长时程操作,提升探索与泛化,优于模仿学习基线。
追踪完整性:LLM数据代理的可审计结构化推理愿景
提出追踪完整性标准,评估LLM数据代理计算痕迹的可审计性,弥补仅凭答案正确性判断可靠性的不足。
SwarmWorld:语言模型代理社会中的痕迹式技术演化
群体世界中,无预设角色的语言模型代理经环境痕迹自组织协作,技术组合比独立搜索更广韧,但最强技术优势不显著。
论现代汉语量词系统的特异性
通过互信息度量量词特异性,发现形状名词最能降低量词选择不确定性,整体并非完全特异。
中文标题:KESA:一种基于知识增强的情感分析方法
中文摘要:通过两个情感感知辅助任务轻量注入情感知识,提升句子级情感分析性能,优于预训练模型且可叠加现有方法。
大型语言模型中用于早期退出的SimLens:用额外一个Token引出精确的潜在预测
SimLens以额外token轻量续写提升LLM中间层预测,结合线性近似实现早退,提精度并提速1.15-1.40倍。
PlanSightRAG:视觉优先多模态RAG,实现土木标准图纸问答与合规检查自动化
提出视觉优先多模态RAG框架,直接索引图纸图像,零样本检索召回率达91.47%,并能自主提取规范数值完成合规检查。
Mind2Report:基于认知深度研究代理的专家级商业报告合成
提出Mind2Report认知深度研究代理,模拟分析师意图探查与递归检索,迭代合成报告,性能超越现有模型。
LLMTrace:AI生成文本分类与细粒度定位的语料库
构建大型英俄双语人工智能语料库,提供字符级标注,支持全文分类与生成片段定位,助力检测研究。
ReFIne:一个兼具可靠性、忠实性和可解释性的可信大型推理模型框架
提出ReFIne框架,结合SFT与GRPO训练,提升推理模型可解释性、忠实性与可靠性,实验验证增益显著。
可扩展补丁推理监督,助力软件智能体扩展。
R4P用推理奖励监督智能体,免测试,SWE-bench验证72.2%,Mini-SE达26.2%Pass@1,稳定扩展。
阶梯上升,内存下降:基于侧网络的低成本微调
侧网微调LST内存减半,精度媲美QLoRA,单卡12GB可微调7B模型。
iFlip:迭代反馈驱动的反事实示例精炼
iFlip迭代精炼法融合三类反馈,反事实有效性提升57.8%,并增强数据增强。
Gavel:当智能体遇上检查清单——评估长上下文法律摘要中的LLM
评估12个前沿LLM进行长法律摘要,发现其易遗漏关键信息而非幻觉,Gavel-Agent省时省力且通用。
层序反转:重新审视大语言模型中的潜在多跳推理
挑战跳对齐假设,发现层序反转:后跳答案可早于桥实体解码。提出概率召回-提取框架,解释多跳推理机制与失败原因。
E2Rank:统一文本嵌入与列表式重排序,实现有效且高效的搜索
E2Rank统一嵌入与列表重排,以列表提示为伪相关反馈,余弦重排免自回归解码,高效高质。
从国家课程到文化意识:构建开放式特定文化问答数据集
基于国家课程,以多智能体框架自动构建开放式特定文化问答数据集,含三万四千对韩国问答,促进文化对齐。
检索增强的智能体化评分标准生成,用于可靠医疗回答评估
提出检索增强多智能体框架,基于医学证据自动生成个性化评分标准,显著提升医疗大模型评估准确性与响应质量。
卖得更多,玩得更少:评估LLM真实销售技能
提出SalesLLM双语基准,含自动评估管道与用户模型,降低角色反转,评分与人类高度相关,多数LLM相当于初级或中级销售人员。
只需传递两次:利用LLMs进行零样本NER的高效Token分类
提出JPT方法,输入自拼接让因果LLM获双向上下文,零样本NER最优,F1提升7.9,速度快20倍。
TTSR:测试时反思式自我进化
提出TTSR,采用反思-合成范式,通过学生-教师交替、弱点记忆与策略提示,实现测试时自我进化,显著提升推理性能。
AEL:开放环境中进化智能体框架的演化方法
AEL双时间尺度框架,用汤普森采样选检索策略,反思诊断后注入新策略,绩效提升27%,准确率提升18%和51%。