超越准确率与表面流畅:面向法律条款生成的LLM风险敏感评估
提出法律条款生成评估框架,覆盖4模型、22类条款与34种失效模式,采用最大严重性准则,主张风险敏感评估。
面向大语言模型的相关性感知结构化剪枝
提出相关性感知结构化剪枝,建模单元间依赖,结合贪婪选择与自适应层稀疏分配,提升大模型精度效率权衡。
面向乌克兰语多领域文档理解的RAG流水线:平衡推理与硬件约束
OCR占5-7h;混合RAG(BM25+BGE-M3+重排)与4位量化12B,私榜0.8095。
MechaTerp-TRACE:语言模型组件消融分析的新方法
逐组件消融模型,发现最具影响的总是固定位置少数组件,与查询实体无关;实体知识定位多源于通用生成机制。
DiFA:面向词元级文本异常检测的双证据融合与聚合
提出DiFA,融合结构与语义双证据,自适应校准聚合,实现词元级文本异常检测,性能领先。
真实性信号能在语码混合中存续吗?基于隐状态探测的Hinglish幻觉检测
构建Hinglish基准探测隐状态,幻觉信号在语码混合下迁移良好,且印地语/混合语幻觉多于英语。
利用复合算子线性化大语言模型语义变换
提出用复合算子将LLM语义变换线性化,揭示其等距性与谱污染,并可构建有限维近似以比较任务和模型。
探测最优并非引导最优:全模态大语言模型中的探测—引导层分离
全模态大模型中,首次因果验证探测最优层≠引导最优层,引导层多在中后段,探测准确率不宜用于选干预层。
多语言安全信号是多层的:过滤安全退化数据以构建更安全的LLM
安全信号跨语言仅部分共享、分布于多层,据此提出多层框架MMSAFE过滤安全退化数据,有害响应率降60%。
语言模型知道自身的约束吗?
微调可让模型遵守禁用食材,却降低其主动报告和第三人称知识;强化学习损害更甚,自述仍优于探针。
超越拼接假设:基于语义量化的多模态合成数据统一评估框架
提出语义量化统一框架评估表格—文本合成数据,以投影诊断和置换基线检测跨模态配对破坏,弥补分模态指标盲区。
想象力源自幻觉吗?大语言模型中想象力与幻觉的跨分类评估
提出首个LLM想象力基准Whiteboard,跨分类联合评测想象与幻觉,发现二者多数子类型负相关。
超越原始上下文传输:基于表征的联邦检索增强生成
提出FedRepRAG:原文留存客户端,仅交换检索潜表示,经协作投影供冻结模型生成,降低开销与泄露。
超越匿名化的公平性?德语LLM生成简历中的人口统计学泄漏
德语LLM生成简历经匿名化后仍可靠泄露性别:中性词的细微用法差异可被分类器识别,族裔泄漏较弱。
基于纵向结构化电子健康记录的多智能体溯源合成病历生成流水线
多智能体流水线MedNotes将结构化EHR转为溯源临床笔记,闭环质控通过率91.4%,提升下游预测。
剖析多模态大语言模型中的免训练不确定性估计
系统评估多模态大模型免训练不确定性估计,分词元级、语言化、语义三类;基准显示无单一方法全面占优。
SCoR:一种预测科学概念间关系的层次化框架
提出层级SCoR框架与HiSCoR模型,预测科学概念间关系类型,AUROC达0.9515。
为精准医疗量化隐藏盐:基于联合因子检索与思维链推理的钠评估
提出SALT框架,用联合因子检索与思维链推理评估食谱隐藏钠,构建SALT54k并达最优。
单一文化偏见:大型语言模型的相关偏见导致招聘中系统性排斥率不平等
大模型后训练会强化并同质化招聘偏见,系统性排斥率由5.6%升至17.3%,加剧年龄等群体不平等。
PII-TRACE:多轮LLM对话中上下文感知PII检测基准
首个多轮对话PII检测基准PII-TRACE,含13种语言13148段对话,并推出0.6B参数检测器PII-Tracer。
AI在在线评论中的作用
LLM供给冲击后,未验证评论更负面:1星增、5星减,并现短时评论潮,或重塑平台竞争。
情境化身份测试:区分持久认知身份与人格模仿
提出情境化身份测试与基准,评估行为能否归因于特定发展历程,揭示仅凭共享档案无法分辨碰撞身份。
评估生成式AI系统对话交互中的个人信息输出
试点:生成式AI对话中个人信息输出受模型设计影响有限;事实类保守,行为/语言类较准,画像等易被推断。
Schematize:面向法律研究的信息抽取模式生成与优化智能体系统
开源多智能体系统通过澄清对话、迭代生成与数据验证,将研究问题转化为可用抽取模式,法律评测表现最佳。
EAVer:将长文本事实性验证作为端到端智能体策略
将长文本事实核查统一为端到端智能体策略,分组复用证据、按需搜索,经轨迹与DPO训练,性能提升且搜索量大幅下降。
在基础开放权重模型中复现情绪表征的几何结构
在gemma-2-27b上复现Claude情绪向量几何:效价对齐,唤醒未完全复现,L22-26固化,开源代码数据。
SALSA:半自主文献摘要助手
开源人在回路平台,融合大模型、OCR与图表数字化,从多模态文献提取结构化科学数据,支持人工校验导出。
SCoP:面向时序知识图谱问答中证据空间控制的结构化约束解析
SCoP将时序知识图谱问答视为证据空间控制,显式外化时序约束,过滤无效事实,无需微调即取得领先性能。
MLC-SLM 2026 百融系统:面向多语言对话语音理解的动态问题感知证据路由
提出动态问题感知证据路由,按问题与选项选取转写、音文融合或说话人声学证据,提升多语言对话语音问答效果。
面向文档敏感性分类的通道增强型迭代协商多智能体系统
提出IC-MAS,用通道评论家与迭代协商解决长文档截断,准确率90.72%、F1 91.23%,计算更省。
DArgk团队参与2026年ELOQUENT生成语言模型质量评估实验室:人性残余——通过GRPO微调规避AI检测
提出SHADE框架,以GRPO微调LLaMA规避AI文本检测,替代检测器规避率达98.5%,但跨检测器迁移有限。
知道,但只在被问时才说:LLM 内知诊断与 Minerva-7B 的认知分裂
提出大模型内知诊断,揭示行为评估与内部知识系统性背离,线性可解码不等于因果控制言语化。
论大型语言模型中阈下学习的缓解
研究大模型阈下学习动态,提出退火KL正则微调,抑制特质迁移且保留任务增益。
EvalMem:面向长期记忆系统的操作级诊断框架
提出操作级诊断框架EvalMem,用编码、检索、生成三检查器定位记忆缺陷,发现检索层失败最多。
从特征向量到电路:追踪语言模型中的拒绝与谄媚行为
以特征向量拆分重构与传递电路,检验拒绝和谄媚:拒绝回路紧凑忠实,谄媚重构更广且仅部分忠实。
BizSage:面向商业研究的自进化多智能体框架与高效知识检索
BizSage结合段落级知识图谱检索与元评审自进化多智能体,实现高质量商业研究并杜绝虚假引用。
回放门控神经执行:在冻结语言模型中解耦持久行为规范与神经实现
提出回放门控神经执行,在冻结语言模型中解耦持久行为规范与神经实现,以重放认证和运行审计授权执行。
看穿冲突:提升视觉语言模型的指令层级对齐
通过强化学习比较文本、图像与混合模态监督,混合训练最优,可泛化至真实图像与网页智能体安全任务。
知识图谱增强的环境AI用于临床病历生成
提出CDR框架,用知识图谱识别并补全环境AI病历中遗漏的临床信息,在四类大模型上均提升内容召回率。
H2LooP 电信模型 v1:从电信理解到自主问题与 PR 解决
推出两款电信专用大模型:理解版在 OT-Lite 榜单居前,智能体版可自主生成代码并解决 PR,无灾难性遗忘。
瑞士军刀:一种解码时可重构的外化多目标对齐框架
将解码时对齐规格外化为可热插拔运行对象,证明聚合算子表示定理,取得最佳均衡前沿,0.05 毫秒无梯度重构。
评估潜在推理模型的对抗鲁棒性
潜在推理模型对抗鲁棒性弱于显式CoT,白盒攻击下尤甚;文本与多模态失效模式不同。
大语言模型会像人类一样做选择吗?用认知理论评估LLM的决策
14万次测试:LLM情境敏感与分类类人,却不似人类重配注意力,规模与思维链无改善,机制异于人类。
Deep Persona:面向角色扮演智能体与模拟的心理学基础架构与评估框架
提出三层心理学人格架构与无参考评估框架;发现大模型语用流畅,但情感表达与共同注意存在系统性局限。
大语言模型中的上下文因果性:综述
综述提出上下文因果性的语义、干预与反事实分类,分析现有研究局限,并展望未来方向。
国际象棋解释能反映模型决策吗?LLM推理忠实性的行为与词元级测试
200个残局谜题的行为与词元级测试表明,解释的语言流畅性、动作一致性与正确性彼此独立,仅有限反映真实推理。
佐证错觉:更多新闻反而让大模型预测更失真
攻击者仅靠发新闻即可毒化语料、操纵LLM概率预测,单篇翻转56%预测,五篇达69%,常见防御可绕过。
提示工程教程:从混乱想法到AI工作流
提示工程:把模糊意图转为结构化AI规范,精简上下文、设定角色与正向目标,辅以批判验证,重在清晰。
DIPLOMAT:面向礼貌且具说服力的职场谈判对话的对话跨度感知直接偏好优化
DIPLOMAT采用对话跨度感知偏好优化,生成连贯、礼貌且有说服力的职场谈判回应。
无品格的功能性情绪:大语言模型、亚里士多德式性情与行为对齐的局限
大模型有因果活跃的情感概念表征,但缺乏品格与主观感受;对齐应视为持久性情而非输出符合。