PunGraph:面向双关语理解的检索增强语音-语义图推理
提出PunGraph检索增强语音语义图框架,发布WebPun数据集,有效提升双关推理性能。
基于网络数据与大语言模型的组织环境行动量化
研究用大语言模型从网页量化组织环保行动,以美国犹太教会为例,比较三种检测方法,直接分类覆盖最广。
审计的挑战:健康领域大型语言模型输出的变异性
健康大模型输出因访问方式而异;API评估与消费者聊天体验脱节,削弱审计有效性,需支持复现真实设置。
RoleBreak:口语对话中长时程角色扮演鲁棒性基准测试
提出长时程口语角色扮演基准RoleBreak,发现长对话鲁棒性脆弱、语音情感弱,LLM扩展仅改善语义。
奖励推理而非答案:修复并限定医学问答中的测试时强化学习
医学选择题中测试时强化学习因答案空间结构失效;PROSE以过程奖励评估推理步骤,取最低分,无需标签,提升泛化。
Lit3R:面向科学文献的循证问答的“检索—关联—阅读”框架
Lit3R无需训练,融合检索、重排序与大模型,先在单篇定位证据再跨文献综合,官方评测排名第四。
TIAO:面向文本摘要的词元重要性感知策略优化
TIAO依据词元依赖识别核心词元并重加权轨迹优势,实现重要性感知强化学习,7B模型摘要效果媲美GPT-4。
句法结构上的无数据通用先验
无需语言数据,句法结构通用先验可从增量产生模型涌现,在138种语言中优于随机并与语料概率正相关。
日本卒中大语言模型评估:面向安全卒中诊疗的日语对话式基准
日语卒中多轮对话基准:18个LLM中最优87.4%且零致命错误,仅两模型达安全阈值。
适时而智:面向大语言模型持续改进的环境驱动动态策略
DRPG框架融合记忆检索与动态策略生成,借环境反馈产出任务策略,在六项基准七种模型上多数优于基线。
Cascade:面向大语言模型遗忘的层级化可恢复性控制
Cascade通过路径路由、表示压缩与解码三层控制,降低知识内部可识别性,减少遗忘后残留可恢复性且不损效用。
普通话重叠构式:基于分布语义的社会情感画像
用词嵌入验证普通话重叠构式的语义语法特征,揭示其多维语义与语用分化及构式透明性。
解构刻板印象:面向有效多语言反仇恨言论的范畴条件生成
提出范畴条件生成框架,把结构化刻板印象特征融入提示,显著提升三语反仇恨言论的针对性与有效性。
RiskChainBench:面向混淆平台消息还原与基于证据的网页调查基准
提出RiskChainBench,分评混淆消息还原与正确路由后的网页调查,执行失败为主要瓶颈。
基于多轮对话说服的大语言模型事实鲁棒性基准评测
SAST-IR无记忆多轮说服攻击成功率96%,简单策略真实说服率84.7%,揭示拒绝惯性与复杂度悖论。
PaperDoctor:面向在研科学论文的循证式可操作反馈
PaperDoctor 提出诊断式论文评审框架,分层核查写作、引用、代码与实验,重跑关键实验,输出有据可查、可操作的修改建议。
显性与隐性人口统计信号在基于大语言模型的学生评估中的作用
大语言模型学生评估受显性与隐性人口统计信号影响,改变评分、反馈与作答,既可能优化可读性也带来偏见。
《大语言模型中反事实自解释的实证研究》
研究十款指令微调模型:规模最影响反事实自解释质量,理性引导提升最小性与人类一致性,但未必提升忠实性。
HUMAID-NER:面向灾难推文联合命名实体识别与事件分类的数据集——基于不确定性加权多任务学习
首个基于HumAID的灾难推文命名实体数据集(6万条),提出不确定性加权多任务学习框架,同步实现实体识别与事件分类。
多语言模型中的目标语言生成:激活引导与最优控制
提出目标语言生成的最优控制法及评估框架,性能不逊于均值差激活引导,且超参数调优更少。
诊断多跳问答中的事实锚定鸿沟
多跳问答失败分为检索失败与事实锚定抽取失败两类,后者占近半、检索指标难察觉,需不同方案。
无名分词:面向开放权重大模型控制令牌伪造的无损分词器级防御
提出无名分词:去除控制令牌表面字符串,攻击下无损复现标准词流,准确率从8.5%升至59.9%。
EviScope:面向忠实且高效的有据语言模型的成对反事实证据诊断
EviScope成对反事实证据诊断揭示答案准确率掩盖的无据作答、冲突盲视等有据性缺陷。
论证性实质推理的自动形式化
论证实质推理自动形式化可建模为守卫补全:LLM造守卫、定理证明器验证,不成弃权,验证忠实度升、泄漏降。
大语言模型能否把握危机脉搏?评估孟加拉国七月起义中的危机情绪
提出20万条孟加拉语危机情绪数据集,评测LLM在孟加拉国七月起义的表现,发现语境有益但跨阶段性能骤降
迈向信息物理系统设计中的幻象意识
提出"设计幻象"概念,指对失效假设的持续依赖,并给出识别、分类、刻画与利用幻象的设计知识化流程。
AraMIP:将MIPVU扩展至阿拉伯语隐喻识别
提出AraMIP阿拉伯语隐喻标注指南,基于MIPVU改编,区分隐喻、转喻与明喻,标注300句试点语料并揭示阿语特有挑战。
ECHO:推测解码中基于附加Logits的早层协同分层编排
ECHO提出分层双循环推测解码,利用早层与末层附加Logits加速草稿和验证,实现2.4–2.9倍加速。
ECHO:面向全双工对话中上下文敏感话轮转换的匹配对比基准
ECHO中文全双工配对基准:同文本配对比上下文,要求让出或保持;配对准确率揭示偏让出、打断评测虚高。
Transformer 层间的持久循环记忆——提升语言模型泛化能力
层间持久循环记忆仅增3.7%参数,评估损失降28.5%,泛化间隙由0.26降至0.12。
面向在线调查中AI辅助回答的检测
提出ASURRE基准涵盖多种AI作答策略;朴素AI易检测,人格化智能体近随机,聚合行为线索可提升检测。
百余年数百万首歌词中的文化剧变心理效应
百年百万歌词显示:越战、9·11和疫情后自我指涉减少、认知加工词增加、关注生命自由,文化剧变影响心理
社交媒体消息中的零样本叙事检测
LLM零样本可检测社交消息中的隐性叙事;人类描述加多数投票集成显著提升准确率,无需训练数据。
SHROOM-Visions 上的轰鸣:检测视觉语言输出中幻觉片段的多评委委员会
用多个微调视觉语言模型作独立标注者,字符级多数投票融合预测,四语中三语第一,模型分歧与人工分歧一致。
文档应存于何处:上下文、表征还是参数?
比较KV与微调注入知识:Cartridges最准,多文档媲美ICL,但有灾难性遗忘。
通过大语言模型驱动的简明语言改编提升医学文本可及性
借助GPT等大模型与多智能体混合技术自动简化医学文本,提升患者可读性并保留关键信息。
CLEAR:医学大语言模型的跨源证据裁决
CLEAR智能体跨源裁决医学LLM证据:三路生成候选,联合验证并解决冲突。
合适的工具做合适的事:母语评估、分词器敏感性,以及来自纯法语 BabyLM 的方法学发现
纯法语BabyLM在QFrBLiMP得85.97%,跨语言任务现梯度差异,分词器与模板偏差须常规排查。
智能家居剪枝中什么会失效,何时失效?——跨架构与任务复杂度的LLM退化评估
LLM智能家居工具调用剪枝退化:稠密模型安全区间窄、退化陡,MoE更耐受;剪枝先损具体性后损意图,激进致过度拒答。
后训练量化在何处破坏文本嵌入器:跨四类嵌入器家族的实测图谱
四类检索嵌入器量化实测:既有经验均失效,嵌入表非首要保护项,模块敏感度不可迁移,蒸馏小模型可反超教师
BLINDSPOT:长周期工具使用智能体的安全与拒绝校准基准
长周期工具智能体的轨迹级安全校准基准,含22类攻击、35个场景,评测13个模型,揭示失败常滞后显现。
超越文化知识:评估大语言模型的阿拉伯文化适宜性
AraBehave基准:文化适宜性分规范立场与事实准确两维度,通用模型立场欠妥,阿拉伯模型多杜撰经典。
大语言模型何时应当弃答?面向选择性风险控制的自我提问链
提出CoSQ提示框架,以自我提问评估信息是否充分,支撑不足时选择弃答,降低错误承诺率并提升准确率。
面向工具集成LLM智能体的对抗攻击通用防御
提出工具过滤与工具召回两种通用防御,结合思维链提示,四类攻击下攻击成功率大幅下降,多处达0%。
面向语言模型的安全纠错:冻结基座调整与能力保持
提出轻量logit纠错模块CRN v2,冻结基座仅训0.73%参数,纠错53.3%且不损能力,KL约束关键。
面向零样本跨语言音频深度伪造检测的语言正交化
提出语言正交化,消除自监督语音模型中与语言相关的干扰,在未见语言上稳定降低等错误率。
CLASH:口语讽刺检测中词汇与韵律依赖的反事实审计
提出双语反事实框架CLASH,审计口语讽刺检测对词汇和韵律的依赖:词汇线索具显著优势,声学敏感非鉴别力。
LoopSpec:面向循环Transformer的流水线自推测解码
LoopSpec为循环模型提出免训练自推测解码,流水线重叠草稿生成与验证,无损提速最高6.83倍。
ThinkFlow:面向终身对话智能体的自演化概率潜在记忆
提出ThinkFlow自演化概率潜在记忆框架,绕过文本瓶颈,实现无标签终身对话个性化。
LSREP:一种用于评估对话记忆的纵向状态回放协议,并以 ICE v2 作为经审计的本地优先架构
LSREP以纵向状态回放协议评估对话记忆;ICE v2本地优先近追平向量RAG,公开诊断却大幅落后。