突破短片段限制:用向量档案扩展说话人嵌入
提出VAM-ECAPA,用向量档案映射增强短语音说话人嵌入,1秒EER 8.334%,相对降54.8%。
WatchPoint:面向真实世界智能体 Web 开发的可执行用户反馈
模拟用户执行诊断脚本,为编码智能体提供可执行反馈,任务恢复率 57.6%,接近人类。
行为并不足够:LLM社会中社会规范涌现的基于机制的评估
提出同时测量行为趋同与期望的评估框架,区分社会学习与社会选择机制,相同合作结果源于不同底层社会过程。
通过文本实现不相交表格的发现驱动集成
LOKI用双向交叉注意力与全局对比学习,发现文本中介的行-句连接路径,实现不相交表格的发现驱动集成。
论大型语言模型在代码理解中的词汇迷信:对低词汇质量代码的再评估
大模型代码理解存在词汇迷信:过度依赖标识符,误导性名称会左右输出,提示与微调干预难消除。
ABAI在COLIEE 2026任务1:结合GraphRAG增强元学习的多阶段检索,及交叉验证到测试差距的事后研究
ABAI在COLIEE 2026判例检索中F1=0.177,远低于交叉验证0.311;事后分析推翻归因并改进。
学术出版网络的语义方法:基于 OpenAlex 数据的文档向量表示与结构-语义混合融合
用SPECTER2向量接入OpenAlex图,可调权重融合语义与结构;分类优于TF-IDF,推荐信号互补。
DA-Cramming:融合依存一致性,提升高性价比语言模型预训练
提出DA-Cramming,将依存一致性融入预训练,单GPU一天可训BERT,多项任务显著优于现有方法。
用于检测和纠正LLM幻觉的几何不确定性
提出基于答案嵌入语义分布的几何框架,量化提示与答案两级不确定性,检测并纠正幻觉,医疗数据集表现优异。
MultiViewDx:证据关联的多视图临床诊断
提出以临床病例为单位、证据链关联的多视图诊断数据集MultiViewDx,覆盖多种影像模态;其微调模型在MedVQA及真实病例推理中表现领先。
SafetyFlow:面向自动化大语言模型安全基准测试的智能体流系统
提出SafetyFlow,首个智能体流系统,四天自动构建2.3万查询、低冗余强区分的大模型安全基准。
BigO(Bench):大语言模型能否生成时空复杂度可控的代码?
提出新基准,评估大模型按指定时空复杂度生成并理解代码,含大规模标注数据;显示其复杂度理解较弱。
CausalEmbed:潜在空间中自回归多向量生成用于视觉文档嵌入
提出CausalEmbed,以自回归生成多向量嵌入,仅需数十个视觉token,实现30-155倍压缩并保持竞争力。
面向语言模型不确定性的语义自蒸馏
提出语义自蒸馏,将采样语义分布蒸馏为轻量学生模型,生成前估计不确定性,用于幻觉预测与域外检测。
面向合理性感知的生物医学人工智能的定量证据挖掘:叙述性综述与概念框架
提出定量证据挖掘框架,将生物医学发现转为结构化、可审计证据单元,并设八阶段架构与多维合理性评估。
面向放射学报告生成的校准置信度表达
提出ConRad强化学习框架,微调医学LVLM生成校准置信度,提升放射报告生成可靠性与临床审查安全性。
为毒理学决策支持学习诊断推理
DeToxR以强化学习融合院前叙述与生命体征,多标签预测14类毒物,减少漏诊幻觉,临床F1优于基线。
通过往返验证与修复实现忠实的自动形式化
往返验证:形式化→回译→再形式化校验等价;分歧时定位错步定向修复。该法最优,未过检规则语义漂移更大。
S$^4$R:面向压缩长上下文 KV 缓存的选择性采样、子空间与稀疏重建
S⁴R 以选择性采样构建低秩子空间并稀疏重建 KV,最高 5 倍压缩且近乎全缓存精度。
Co-FactChecker:基于大型推理模型的人机协同声明验证框架
提出Co-FactChecker,以专家反馈编辑思维轨迹,实现人机协同声明验证,优于多轮对话。
面向特应性皮炎的稳定性与边界感知解释引导医学命名实体识别
提出稳定性与边界感知解释引导框架,提升特应性皮炎医学NER识别与解释可靠性。
POPI:通过优化自然语言偏好推断实现大语言模型个性化
POPI框架将个性化拆分为偏好摘要推断与生成两模块,以自然语言为接口,偏好摘要可跨生成器复用,上下文开销降低一个数量级。
FMMD:来自F1000Research的多模态多学科开放同行评审数据集
推出FMMD多模态多学科开放同行评审数据集,对齐稿件版本与评审意见,涵盖多学科,支持多模态自动评审研究。
EndoCogniAgent:面向内镜诊断的闭环智能体推理与自洽性验证
提出闭环智能体框架,以自洽性验证整合视觉文本证据,减少幻觉与错误累积,并构建内镜评测基准。
Re:CAP——生产环境 RAG 流水线中的检索覆盖度审计
Re:CAP以迭代探询审计生产RAG的检索覆盖度,可找回9-29%遗漏金标文档,结果稳定可复现。
VeriSoftBench:面向Lean的仓库级形式化验证基准
提出VeriSoftBench基准,含500个Lean 4证明义务,源自开源形式化方法项目。评估发现数学风格证明器迁移效果差,成功与仓库依赖闭包强相关。
LLM智能体长期记忆安全综述:记忆全生命周期中的攻击、防御与治理
本文提出记忆生命周期框架,从六个阶段与四类安全目标梳理LLM智能体长期记忆的攻击、防御与治理。
大模型捉鬼敢死队:通过自适应遗忘实现外科手术式软件包幻觉抑制
自适应遗忘框架AU无需人工标注,可将代码生成中的软件包幻觉率降低88%,且不损通用编码能力。
基于大语言模型的ASR中通过文本去噪实现纯文本自适应
将纯文本自适应视为文本去噪,训练LLM从噪声文本恢复干净转写,保持跨模态对齐,轻量且相对提升最高22.1%。
DolphinBench:绘制智能体记忆的帕累托前沿
提出DolphinBench:用任务完成度直接评估智能体记忆,同时要求报告成本与延迟。
CONCAT:共识与置信度驱动的临时组队,用于高效的大语言模型多智能体系统
提出免训练框架CONCAT以共识聚类、置信度选领导、心智预测收益剪枝通信,高效组织LLM多智能体协作
将治疗作为自然语言处理任务:比较CBT会话中LLM与人类同伴的行为
比较CBT中LLM与人类同伴咨询师:人类善共情但结构弱,LLM守方法却互动差、易说教和虚假共情。
重新拟合探针:单方向消融并非必要性检验
单方向消融未移除目标,重拟合探针仍恢复精度,故不能判断必要性;迭代零空间投影可反转结论。
DeepInstructor:面向经验驱动型想法评估的智能体AI导师
提出DeepInstructor,以5.8万条评审构建经验图,用ReAct智能体检索证据,实现可溯源的想法评估,命中率显著提升。
识别、模拟与拒绝:LLM智能体中经典心理学效应的污染感知研究
提出污染感知基准,在LLM智能体上重跑经典心理学实验,发现类人效应路径各异,主张报告复制概况而非单一偏差分数。
会前瞻的记忆:面向个人记忆检索的零推理前瞻项
提出零推理前瞻项,以承诺台账为到期/触发条目加权,合成任务困难层召回@5由0升至0.955,无误提升。
TreeSpark:面向半自回归投机解码的校准化、负载自适应草稿树
以父条件校准边接受率、路径存活驱动负载自适应建树,每轮多接收15-25%草稿词,提速8-14%且无损。
总结、评判、精炼:面向多模态内容审核的解耦式内容理解与策略学习
SJR双模型解耦多模态理解与政策分类,小样本冷启动,零真实违规数据可上线新政策,F1提升23.6%。
AI推断的表达性福祉与X平台气候变化运动中的集体行动话语
分析36.4万条X气候活动帖发现,活动期幸福感升而行动话语降,更快乐的源头帖转发更少。
代码的令牌签名:比较大型语言模型的编码行为
提出CLIC可视化分析,以令牌频率区分LLM编码行为,定义鲁棒性与集中度指标,助模型选择与提示工程。
食谱数据结构框架及其在烹饪与营养洞察中的应用
提出食谱数据结构化框架,构建含12.9万食谱的数据库,实现食材解析、营养映射与饮食风格标注。
AdaMem:检索增强生成中软压缩的自适应记忆令牌分配
AdaMem按相关性自适应分配记忆令牌,优化RAG软压缩,高压缩比下增益显著。
上下文投毒:长上下文语言模型中的极值注意力干扰
上下文投毒即注意力极值干扰:证据优势须随干扰项数按√logN增长,同格式硬负样本致检索精度降幅最大。
评估微调与基础语言模型在非洲母婴及疫苗接种医疗保健中的应用
尼日利亚研究显示,领域微调可提升模型医疗表现,但数据质量不足反致性能下降,部署前须严格验证。
评估意识随模型规模从格式转向上下文
小模型凭格式、大模型凭推理识别评估;双路径干预翻转率70.58%。
大型语言模型与人工标注的观察等价性
LLM与专家标注一致率堪比专家间,差异源于文本和编码规则歧义;标注核心转为减少歧义并处理残余歧义。
超越文本:验证智能体撰写的论文是否由其工件支撑
ReAgent自动审计智能体论文与代码库一致性,结合静态与动态证据,识别硬编码指标、方法未实现等偏差。
多轮编程智能体中上下文压缩网关的实证成本归因
压缩网关:工具过滤线性省词元,内容压缩节省随轮次二次增长,召回成本有界;单次压缩基准与多轮成本无关。
大语言模型中的隐私与个性化权衡:文体计量信号削弱对用户特定文本生成的影响
LLM个性化中匿名化文体计量信号使偏好降至13%,语义保留94.8%,揭示隐私-个性化权衡。
面向婆罗米系文字的类型驱动分词
标准分词器处理婆罗米系文字会生成畸形文本;本文形式化正字法约束,推导修正函数并实现补丁,消除错误。