SchemaGUI:面向可控GUI生成评估的模式驱动基准
提出SchemaGUI,一种无需人工标注的模式驱动GUI生成基准。评估显示模型几何控制弱、复杂布局易错乱,思考模式反而降低打分。
GTA-RAG:图轨迹增强的多轮检索增强推理强化学习
提出图轨迹增强强化学习GTA-RAG用图路径生成QA轨迹训练检索策略提升多跳证据链覆盖与答案准确率
大语言模型中用于可靠决策的声明级置信度校准
将回答分解为原子声明并校准置信度,无需内部信息,降低事实问题校准误差,但暴露对抗性错误前提问题的失效模式。
GeoRisk-RAG:基于层级感知的风险框架,通过选择性回答提升RAG可靠性
针对地理有效性与语义相似性混淆问题,提出层级感知框架,用DAG距离检索实现选择性回答,将误信率从0.090降至0.009。
混合面板:面向调查研究中的人机协作
大型调查面临回复率低、成本高、延迟大等问题,混合面板结合人类与AI模型,迭代优化调查设计,提升数据质量。
从诊断到重构:用定量民族志改进多智能体大模型推理
通过定量民族志分析智能体对话,诊断推理缺陷并改进提示词,使评分准确率从27.78%提升至40.28%。
核令牌矛盾:一种快速且有原则的LLM声明不确定性量化方法
提出核令牌矛盾法,用核与冯诺依曼熵量化LLM声明不确定性,CPU运行比GPU方法快8.2倍,性能相当。
DiaRelay:以恒定大小记忆传递对话上下文用于对话情感识别
提出DiaRelay轻量适配器,用恒定大小记忆中继对话历史,避免重复编码,提升对话情感识别精度,仅增7.1M参数。
富集-检索-排序:超越上下文路由的能力发现扩展
将能力发现转为离线富集与在线检索重排,相比上下文路由在大规模下更稳健,准确率更高、成本更低。
通过OMOP对齐的检索向大语言模型传授ICU医生的临床推理方法,可提升跨临床领域的推理能力
用临床专家构建的重症推理数据集微调模型在五个临床基准上超越基线证明重症推理可泛化至更广领域需前瞻评估
WnW:面向长语音大语言模型的潮汐式KV缓存
提出WnW潮汐式KV缓存,分锚定/潮汐/固定三类头,仅20%音频token留GPU即近全缓存精度,解决长语音预填充压缩失效。
基于临床病例报告构建与评估渐进式多模态诊断对话的源基框架
提出源基框架,病例报告构建渐进式多模态诊断对话评估模型,参考对话质优,前沿模型推理弱,流畅不等于循证。
迭代而不繁复:简单ReAct架构足以胜任文本到SQL生成
简单迭代加DSL,零样本SQL在两项基准达84.5%和73.9%,匹敌复杂系统且快8倍。
XTC:排除首选的头感知采样
提出XTC解码方法,排除高概率首选,显著提升文本多样性与重复率,被多模型采用,不损流畅度。
不要重复自己:在采样时阻止逐字循环
DRY方法在采样时仅惩罚延续上下文精确片段的token,使循环率降低47%并提升多样性,已被llama.cpp等主流框架采用。
超越事实知识:大语言模型中步骤级程序性规则推理的基准评测与学习
提出规则世界基准与动态规则框架,以步骤级注意力训练实现规则动态检索与更新,在万条规则下准确率提升19点。
SAVER:面向VLM变化推理错误恢复的言语证据选择性审计
视觉语言模型变化推理失败,该方法解析言语证据,缺失时重提示,准确率提升最高25.8%,证据门控是关键。
SPOC-SQL:面向可控文本到SQL的分阶段偏好优化
将文本到SQL分解为四个阶段,分阶段偏好优化,在关键决策点干预,实现可控可靠生成,实验验证有效。
TRACE:为一致且知限的LLM智能体打造的自进化技能库
TRACE用轨迹对比进化迭代优化技能库,不改权重即大幅提升一致性,Pass^3达94.5%,稳居官方隐藏集第一。
SDoH感知的医学大模型叙述锚定偏差:面向可信临床决策支持
医学大模型即使答对也可能因患者叙述方式改变而改答案。评估3个模型,7B准确率最高56.33%,但叙述敏感性误差仍达31.67%,提示需兼顾正确性与稳定性。
DelistBench:评估搜索增强型大语言模型用于可审计公司事件数据库补全
提出“搜索到记录”任务与退市基准,评估联网大模型补全公司事件,联网显著提升准确率,低成本系统接近最优。
工业指令:一种从工业技术报告构建指令微调与基准数据集的端到端框架
首个从工业技术报告构建的端到端QA数据集与流程,微调小模型显著提升性能,开源与商用模型对比揭示了成本与效果权衡。
DIAG:面向数据高效数学偏好蒸馏的诊断式迭代对齐与生成
DIAG通过诊断和生成将练习分布移至能力边界,以较少数据获得更多有效偏好对,提升数学推理。
AraDetox:多方言阿拉伯语去毒数据集
首个多方言阿拉伯语去毒数据集,含1.05万有害帖及8.4万改写,经人工与自动评估,证实可保留语义并去除有害内容。
SelFusion:扩散语言模型的自蒸馏
提出自蒸馏框架,双向蒸馏两种掩码模式,无需外部教师,显著提升扩散语言模型生成质量,超越传统蒸馏方法。
检索越强,鲁棒性越差:多跳RAG如何放大上游ASR错误
实体图链接与迭代改写放大ASR错误,F1差距增大36-67%,主因查询实体损坏。
口语语言模型听语音如同读文本吗?弥合语音与文本的结构鸿沟
现有口语语言模型语音与文本表征弱对齐,指令遵循和泛化差;提出解耦长度错配与语义对齐的框架,取得竞争性表现。
TSWAP:多语言检索增强的泰国健康顾问
八语言检索增强泰国健康顾问,基于泰医知识库与安全层,发布基准,发现量化损伤泰语声调。
知道并不总是说出:视觉语言模型中空间编码何时到达答案?
VLM空间编码对答案的因果影响仅在中深层出现;文本思维链抑制传递,视觉提示保持,形成条件传递模式。
控制的幻觉:为什么裸分类器反演在概念瓶颈文本生成中悄然失败
概念瓶颈文本生成中,测试多种推理时编码获取法,发现裸分类器反演会悄然失败,且各类反演均不如简单后验先验。
HelaBERT:使用双池化分类头提升僧伽罗语语言理解
提出HelaBERT,基于10亿僧伽罗语词预训练;双池化分类头提升情感分析和新闻分类效果。
探索道克同调在句子相似性中的应用
将句对词元嵌入视作点云,道克同调可捕捉相似性,用于预测、可视化;但单值摘要未超越标准池化。
什么会证明你错了:针对可证伪研究构思的语言模型基准测评
构建可证伪研究构思基准,经两百篇论文、一千二百次盲比,四个模型排名成立,差异源于测试与指标质量。
激活引导控制什么?答案编码与输出敏感子空间的归因
引入跨编码引导评估,发现引导效果可能追踪提取索引而非语义标签,且评测方式影响结论。
超越表面线索:厘清多语言大语言模型中的社会文化信号
多语言模型输出中的文化信号常被表面线索误导;去除身份线索和掩码后,语言识别能力下降,偏见因语言和任务而异。
信号还是噪声?Web开发中智能体技能的基准研究
基准研究显示,注入Web开发技能多数情况降低成功率并大幅增加成本,仅少数有效,应视为部署时的路由决策。
超越判定:基于图的人类与LLM推理在科学事实核查中的分析
提出图框架比较人类与LLM推理路径,发现不同模型在判定准确性、人类对齐度和推理有效性上各有优劣。
多语言FrameNet语料库
介绍多语言FrameNet语料库,整合九种语言数据,训练模型在多语言和跨语言场景中超越现有最优框架语义解析器。
元主持人:以元认知赋能多智能体辩论
提出可学习的元主持人,以元认知动态调控多智能体辩论并决定最终答案,超越现有方法且可迁移。
大语言模型在AI辅导互动中的教学行为
研究发现LLM在辅导中多直接给予解释或解答(超95%),虽影响后续对话,但对考试成绩预测作用有限。
LLM路由差距大部分源于任务类型
路由差距多来自任务类型:重复实验中仅29题可优化,任务类型预设解决21题,剩6题小于波动。
基于语义大语言模型代理的闭环贝叶斯分子逆向设计
以冻结语言模型为代理,闭环分子逆向设计中依据文本反馈选参考分子,优于一次性提示,与GP-BO相当。
遗忘不仅是擦除:基于生成不等性的时间解耦
ADU框架通过注意力路径解耦实现精细遗忘,保持92.9%效用并取得最强综合性能。
媒体偏见检测中的定义敏感性:多定义数据集与基准
定义的概念框架显著影响人与大模型的偏见标注,模型更敏感;发布多定义数据集MUDD。
对齐中的语言链:跨语言排序偏好优化
提出CRPO,用英语偏好知识,层级联合优化语言内与跨语言偏好,提升多语言对齐。
对齐生物医学文本与知识图谱:轻量级对齐策略的系统比较
轻量对比对齐可有效桥接生物医学文本与知识图谱,其中三元组构成和训练方向影响最大。
分子LLM智能体:从架构设计到科学自主性
从架构与自主性两视角提出分子LLM智能体框架,划分四级,助力分子发现。
以证据反驳!面向仇恨类别感知的反言论生成的多智能体记忆高效推理框架
FIRE多智能体框架将仇恨言论分为五类并生成针对性反驳,提升事实与类别准确性,降低毒性。
CaRGo-T:因果推理思维图提升多模态幽默理解
提出因果推理思维图框架,以图结构建模多模态幽默,提升幽默理解与检测性能。
英语-普纳尔语统计机器翻译系统:实证研究的一些洞见
首个英-普纳尔语机器翻译研究,构建10,234句平行语料,用Moses训练短语统计机器翻译,最优BLEU达14.97(普译英)和11.16(英译普)。