子词分段BabyLMs:面向样本高效预训练的分词学习
提出两种可学习分词的子词分段语言模型,在训练中优化分词,提升BabyLM预训练样本效率。
PersuaRL:强化学习驱动的多专家选择用于保险领域说服性对话生成
提出PersuaRL框架,用强化学习让对话代理动态选择协调专家策略,在保险对话中提升说服力,优于基线。
中文标题:迈向AI辅助临床试验匹配:实践考量、多中心评估与真实世界部署
中文摘要:多中心评估显示,AI辅助试验匹配系统可减少55%筛查时间,并增加90.9%试验机会。
LLMPEDIA:浏览、验证与比较大语言模型的参数化百科知识
LLMPEDIA审计参数记忆 真实准确率68.4% 较MMLU低21个百分点 30.5%断言不可判定
CaRL-EM:面向大语言模型实体匹配的成本感知强化学习
提出成本感知强化学习控制器,动态选择大模型算子与容量,兼顾质量成本,跨域零样本迁移。
开口就绪:让大模型生成适合语音合成的文本
让大模型直接生成适合语音合成的文本,提出数据集与评估法,FaST效果最佳。
用训练数据干预探测事实知识迁移
多语言模型跨语言事实迁移有限:严格移除事实后,绝大多数知识无法迁移;简单负例虚高迁移表现,困难负例下表现更低。
先探索后承诺:面向深度研究智能体的假设引导搜索
先探索后承诺:针对智能体过早单一搜索问题,提出假设引导分支探索并比较证据,性能显著超越单轨迹并行方法。
探索稀疏自编码器在文本因果混杂调整中的应用
用稀疏自编码器迭代筛选最小特征集调整文本混杂,偏差更低、覆盖率更高、可解释,并引入更真实的多标签半合成评估。
有些情感藏得更深:大语言模型的逐层探测与因果干预
最佳探针层随语料从浅到深;干预所选层使准确率降5-6点,表征可跨集迁移,早退提升6.9点。
CHARM:面向多元文化角色扮演的角色幻觉基准
提出CHARM多元文化角色扮演基准,区分边界意识与服从;评测显示幻觉主因是模型明知越界仍作答。
验证器失败之处:RLVR中奖励信号的类别级审计
对四类验证器做类别级审计:自验证率差异极大,失败主要源自空白/标点;数值容差会误收差一错误答案。
将句法与语言分离:多语言大语言模型翻译的机制解析
多语言模型翻译时先确定目标语词序,再生成表层形式;句法结构独立于语言身份,由特定注意力头处理。
探究医学问答中线性探针对语域、医学专科及语料库偏移的稳健性
线性探针在医学问答中跨语域和专科稳健,但跨语料库性能下降,揭示其信号部分依赖数据集结构而非纯医学知识。
VerTox:针对神经排序模型的可验证奖励引导式语料投毒
提出VerTox,将语料投毒建模为可验证奖励强化学习,生成文档排名更高且难检测,并降低RAG性能。
你的答案有多正确?——面向开放问答评估的语义正确性框架
提出语义正确性八级分类法、两个CAP数据集及CAP指标,经单调性测试优于基线。
从困惑到清晰:面向文本分类的困惑感知检索与知识注入
提出识别易混淆标签、扩展候选集并生成区分规则的框架,无需微调,跨模型迁移,Macro F1最高提升10个百分点。
行为有效的LoRA写入是稀疏且结构化的
行为有效的LoRA写入稀疏且结构化,比原始参数化更集中;少数方向主导行为影响,top-2/4即达最优。
InSight:交互式可视化中智能体声明验证基准
提出InSight基准,含2.1万条交互式可视化声明,智能体须导航验证证据,现模型挑战大。
当分词悄悄成为输出监督
分词粒度决定自回归模型的单步输出监督,影响任务难度与内部表示;实验显示输出分词主导,输入分词影响甚微。
波兰ModernBERT:波兰语理解的长与短
提出四个波兰语编码器,30项任务总体最优;8K版本长文本任务大幅超越基线,且参数更少、延迟更低。
中期训练中的知识蒸馏偏向推理而非事实回忆
中期训练中前向KD利于推理但迟滞事实回忆;切换蒸馏按教师置信度分流,补事实短板且保推理增益。
GlossoGen:复杂多智能体LLM交互中的涌现语言
多智能体交互中会涌现语言:具组合性、脱离英语且人类难懂;新语言需强模型涌现,弱模型可习得,显累积文化演化迹象。
SDARE-Bench:评估大语言模型在双人与群体对话中的污名检测与回应
构建首个对话污名检测与回应基准:八个大模型识别能力弱,群体对话中污名表达更高,成显著安全漏洞。
从采样到配方:大语言模型的自足式后训练
提出自我路由,按自采样正确性与置信度将样本路由至不同训练策略或跳过,无需外部教师与额外采样,提升数学推理。
构建半导体供应链机会与风险矩阵的系统方法
大模型提取企业披露的风险机遇建知识图谱三重排序五公司七万余条有效逾九成排序近专家主风险为贸易限制
NLP驱动的古印度医学译本知识提取与主题分类
利用NLP技术(实体识别、主题建模、知识图谱)提取分类古印度医学译本,促进传统医学智慧数字化与可访问性。
再审视:压力下多模态模型推理链中的谄媚行为测量
提出评估多模态模型在压力下谄媚的基准,发现推理链中谄媚普遍且独立于最终答案,仅评估答案不足。
基于领域大语言模型的BIM设计缺陷智能识别与修复
领域LLM框架实现BIM缺陷识别修复,用文本转换、提示学习与幻觉控制,准确率85%,修复建议94%。
参数化多模态用户记忆:存储字幕无法承载的内容
多模态参数化用户记忆:用视觉语言模型定位指代,专用编码器提取身份键,补字幕所缺,达零点九六召回。
从GenAI虚拟患者对话日志到教师可解释的过程证据:一项高等教育中的学习分析研究
通过三层分析1030个GenAI虚拟患者对话,揭示高质量病史采集的过程模式,为医学教育提供过程反馈证据。
Gurukul AI:面向印度教育体系的交互式AI驱动教育平台
基于印度教材构建问答数据集,微调大模型并部署检索增强生成,推出双语人工智能教育平台,适配本土教学。
STAGEET:以阿拉伯语为案例的分阶段类型化编辑标注语法纠错
提出STAGEET分阶段类型化编辑标注框架,将纠错分解为有序阶段,在阿拉伯语QALB-2014取得最优性能。
面向科学文档表示的文档内非对称预测学习
提出无引文预测框架,以标题摘要预测方法部分,再预测结论,加入正则化可显著提升性能。
大型语言模型会审视其所评审的内容吗?评分校准、错误检测与作者身份效应的多模态审计
多模态LLM评分高于人类,错误检测率仅12%-22%,图表反降检测,作者身份无影响。
MA-RAG:用于查询驱动的纵向帕金森病评估摘要的多智能体检索增强生成
提出MA-RAG多智能体检索增强生成框架,用于帕金森病纵向评估摘要,提升事实准确性,降低幻觉率
通用风格感知全双工框架实现主动语音轮次
提出LPS-TC控制器与WildTurn数据集,实现主动打断与反馈,提升时序与响应质量。
Terminal-Bench-LILT:基于语言、地域与文化的多语言智能体编码基准
提出多语言编程基准,含10种语言300任务,最强模型通过率仅63.1%,显示多语言编码能力是独立维度。
MLLM真的理解低资源高棉语文档吗?高棉语文档VQA初步研究
初步评估:直接Qwen3-VL准确率51.9%,外部OCR最高61.9%,高棉语理解仍具挑战。
PAUSE:用于长篇文化故事改编的可编辑策略制品
PAUSE提出可编辑策略制品,人工编辑可传导至章节,九例全获选,标记命中八例,使文化改编更可检视、可争议。
图卢语法律理解中的跨语言迁移:脚本依赖的改进与RAG引发的知识冲突
跨脚本转写改善图卢语理解,但依赖脚本;检索增强导致事实替换与虚构,失败源于模型非语料。
GreenBench:苹果芯片上开源大语言模型推理的能效与碳足迹基准评测
苹果M4 Pro推理开源大模型,封装功耗仅0.47瓦,每令牌能效超数据中心GPU30-40倍,碳排估算
大语言模型能否识别转化归因中的有意义触点?
评估LLMs识别转化触点,发现其能揭示隐含语义触点,但仍有提升空间;用于CVR训练获显著提升。
面向科学方程发现的测试时缩放
测试时缩放利于科学方程发现,搜索宽度主导分配,择优宽度提效并平衡探索利用。
面向忠实报告的深度研究写作重设计与审计
提出审计工具与写作框架,幻觉降低2.6-4.5倍,必要事实召回提升1.2-1.7倍
PromptKWS:一种新颖的提示引导的开放词汇关键词识别框架
提出PromptKWS,用PPN提取提示嵌入,交叉注意力融合,唤醒率提升超一成,复杂环境准确率提升一成五。
无检测到的侧级词错误率变化来自提示级上下文:对生产口述历史语料库的预注册消融实验
在提示层提供上下文未显著改变侧级词错误率,四项预注册假设均未获支持;效应小于管道运行变异,需结合序列级指标评估。
ReVA:面向视觉定位问答的区域感知视觉助手
提出区域感知VQA模型ReVA,融合图像与区域特征,减少幻觉,提升事实准确性。
幻觉信号是均值移位:为何简单探针足矣
幻觉隐藏状态信号由单一均值偏移主导;简单L2正则逻辑回归即可媲美复杂探针,LayerMix无需外部标签即可聚合最优层。
严谨匹配的周期性步长跳层高效LLM推理审计:ConfLayers对比SWIFT,及训练路由备选方案的补充分析
审计显示SWIFT在精度和真实推理速度上优于ConfLayers,后者全面落后;补充训练路由方法速度提升有限且精度大跌。