长工作流基准:评估可验证长任务的可演化图谱基因
引入LongWoF-Bench验证长工作流,EvoMap基因将经验外化复用,在778个任务中优于技能方法8.7-15.5个百分点,节省9.9%推理代价。
通过结构化后缀建模加速扩散语言模型
提出结构化后缀建模,按结构分区域保留后缀令牌并传递解码信息,免训练加速推理,最高提速72.81倍。
文学大五人格:统一可解释空间中的作者个性化文本生成
提出文学大五框架,将作者风格映射为五维可解释坐标,并引导个性化生成,兼顾表现力与语义保真。
超越原始文本:面向LLM数字人的结构化人格提取
关键限制不在信息量而在结构;固定模式提升有限,自动发现任务专属结构可使准确率提升1.91个百分点。
ExpertIVS:大语言模型中社会学专家驱动的个体价值观模拟
提出ExpertIVS框架,用14个社会学专家代理解析WVS问卷以生成个体画像,并引入多智能体辩论评估动态一致性,价值还原达90.78%,优于基线5.3%。
当词汇理解失效于临床推理:评估面向Alpha世代治疗机器人的安全风险
AI治疗机器人能理解Alpha世代词汇但误判临床风险,差距达10-14个百分点,需强制人工介入与监管。
Who Do Language Models Think Is Competent? A Mechanistic Analysis of Occupational Bias
构建与评估用于电信客户服务的合成孟加拉语音资源
构建10k对电信客服合成孟加拉语音数据集,约26.82小时,WER 2.54%,CER 0.59%,已公开于Hugging Face。
超越提示工程:提示词词汇敏感性及其对质量影响的系统分析
研究发现提示性能稳定性缩放定律:高性能对应低方差;领域术语与显式指令约束解释空间;自动精炼代理降方差40.7%并保持性能。
如何训练现实世界的硅基管家?将复杂业务流程内化至单一模型
提出OneModel,将复杂业务逻辑内化为模型参数,延迟降超50%,解决率升至83.3%。
临床长上下文推理中的抑制性注意力:表征与缓解电子健康记录处理中的‘中间丢失’效应
提出QCCS法缓解电子病历长文本中的临床中间丢失效应,优于BM25等检索法。
分歧假说:揭示心理健康自然语言处理中的词汇干扰与标签偏差
提出三流压力探针框架,揭示词汇干扰与标签偏差,以分歧度统计量审计标注来源,表明风格通道不依赖表层词汇。
合成英语RAG探针中文化标记谓词触发PII放大的探索性事后分析未检出:一项谓词-资源混杂审计
四文化RAG审计:刻板查询未显著放大邮箱/电话/SSN/地址泄露(校正后);仅未检出,非无效应。
大型语言模型在临床注册数据提取中的歧义分类评估:一项多中心前瞻性研究
LLM处理原始EMR数据的注册提取准确率远低于人工,且随歧义和临床推理需求增加而显著下降。
自我投机:加速推理模型
提出SSR,用部分思维链作草稿、完整思维链验证,免训练加速推理生成,延迟最高降24.1%。
TriPLU:微型语言模型中用直接三线性乘积前馈网络绕过门控
TriPLU以直接三线性乘积FFN替代门控机制,在低算力小模型上损失更低,但优化敏感,无普遍优势。
迈向自动科研:基于范畴结构从论文知识图谱中挖掘可证伪的研究想法
用范畴结构建模论文,函子保留关系链,过滤跨域假设,17:1筛选,可证伪率83%以上。
RLVR中的多语言验证器偏差:基准、展开诊断与跨语言选择瓶颈
RLVR中精确匹配验证器产生语言相关假阴性,跨语言选择瓶颈显著,建议按语言与答案接口审计奖励。
大语言模型时代的圣训计算科学:批判性叙事综述
批判性评述大语言模型时代圣训计算研究:数据与任务有进展,但语料窄、基准弱、再现性差,应视为证据基础设施问题。
基于文本特征分析的科研论文质量识别
标题摘要文本特征可区分高被引与撤稿论文,FastText+SVM最优,准确率91.12%。
ASTAR:从大规模临床自由文本语料库中自动归纳标准化放射学报告模板
利用大型语言模型自动从临床自由文本归纳放射报告模板优于专家模板开发时间从数周减至数小时
斯里兰卡议会辩论的三语主题建模
三语主题建模:LLM提取+多语言聚类,从近两万篇演讲恢复30主题,纯度0.673,轨迹对齐重大事件。
LLM何时取代微调NLU?生产对话系统中意图检测的决策框架
大模型能否取代微调NLU取决于意图空间,有标注微调更优廉,大模型擅越界检测抗噪动态场景,决策框架据此
解耦视觉-语言系统用于多模态理解与生成
提出解耦架构Libra,分离模态建模与交互,实现多模态理解与生成互促,性能优异。
ImmigrationReason:美国移民上诉结构化数据集,面向法律推理研究
提出ImmigrationReason数据集,含12,375份美国移民上诉裁决,支持法律推理研究。
利用人类-LLM分歧改进基于检查表的质量评价
人类与LLM的分歧可识别模糊检查表条目,修订后提高一致性,提示检查表设计影响LLM辅助评价可靠性。
Intent Engine:计算连续体中意图驱动编排的自然语言意图转换架构
本文提出Intent Engine,将自然语言意图转为验证的SLO工件,用于计算连续体服务放置。在多个LLM上优于基线,F1达0.941,幻觉降85.1%,放置失败从30.8%降至2.1%。
VA-DPO:面向语言模型可控情感生成的效价-唤醒直接偏好优化
VA-DPO用效价-唤醒回归器构建偏好对,显著降低目标距离,提升情感可控性,并保持通用能力。
Ansari:基于检索的伊斯兰AI助手——架构、部署与14万次对话的经验教训
介绍检索增强的伊斯兰AI助手Ansari,经14万次对话验证,能避免虚构与价值偏差,并总结通用经验。
TH-GNN:用于LLM代理刷单攻击检测的异构时序图神经网络
提出TH-GNN异构时序图神经网络,融合时序、结构与语义信号,检测LLM代理刷单攻击,F1达0.870。
Poly-InstructTTS:从开放式指令中学习自然场景下的表现力语音合成
提出新模型:野外数据构建千小时指令语料,以无提示GPT和流匹配实现精细情感控制与音色注入,性能强。
EditPPT:基于结构化工具多智能体与双模态验证器的忠实长幻灯片编辑
提出EditPPT多智能体框架,将幻灯片编辑转为工具选择,双模态验证提升忠实度,执行率达99.5%。
GRAFT:基于扩散语言模型的自适应草稿树构建与目标蒸馏边评分
针对DLM投机解码,GRAFT用目标蒸馏边评分和状态感知预算,实现2.13-6.36倍加速。
面向智能体对话AI的知识图谱门控去事实化:实现风格可控且事实保持的生成
提出知识图谱门控去事实化框架,结合激活引导,在风格可控下提升事实恢复,无需微调即增强可信生成。
ARGUS:心智理论引导的论证生成,融合策略感知规划与知识锚定
提出Argus框架基于心智理论建模读者信念规划论证策略并知识检索迭代优化超越基线并有效改变顽固态度
LingShu:大规模症状中心情境化知识图谱,桥接中医与现代生物医学
中医与现代医学共享症状表型,LingShu知识图谱含千万级实体与关系,通过混合模型编码条件医学知识,助力精准诊疗。
评估即搜索:会议助手中接地失败的自适应发现
提出评估即搜索,自适应搜寻提问,失败发现率升至7.1%;构建含三千余问答对的会议探针基准,识别八类复现失败。
AgentMercury:让智能体规模化合成可验证的商业场景环境
提出AgentMercury框架,从商业场景合成可执行环境,训练强化学习,显著提升企业流程及跨域基准,构建过程本身也可学习,成功率从3.3%升至83.3%。
JuryProbe:参考无关事实性评审团共识风险的经验诊断与路由验证
JuryProbe诊断参考无关评审团的共识风险,相关假阴性高时路由至带引用验证,降低错误接受。
LiLiCorr:推测解码中并行草稿的轻量级似然相关性
提出轻量级似然相关模型LiLiCorr,关联草稿各位置分布,接受长度提升9%-19%,吞吐领先。
自监督语音表征追踪听障婴幼儿及儿童口语向成人模式的趋同
用自监督嵌入分析日常录音,显示听障婴幼儿语音随听龄向成人趋同,并关联标准语言测试。
高效Transformer中的稀疏Token路由
高效变换器中的稀疏令牌路由:路由几乎不影响精度,门控重要性取决于学习方式,上下文门控显著优于静态先验。
当失败传播时:智能体检索增强生成中的因果失败归因
提出智能体RAG故障归因基准:事后诊断在深层失效,首跳覆盖率零点九一,后续零;深度二反事实探针零点六七优于覆盖率零。
AsmEvo:基于功能等价性验证的AMD GPU内核智能汇编级优化
针对无源码的AMD GPU二进制内核,AsmEvo通过汇编级智能优化与等价验证,实现最高3.88倍加速,并保持功能一致。
MIL-BERT:任意大规模文本分类及其性能与可解释性保证
基于多实例学习选取文本片段分类,可处理近百万token,在3个数据集上达到最优,且弱标注训练可泛化至小实例。
PSK参加WMT 2026 MIST:面向多语言摘要和问答的任务专用QLoRA适配器
用3.35B模型加三个QLoRA适配器分别处理摘要、段落问答和开放问答,上下文与摘要适配器优于多任务,提交三个系统。
依存关系的方向性上下文表示:为何跨方向配对会失败
BiLSTM同向配对优于跨方向配对,惩罚随距离增大;冻结实验证明非共适应,源于位置编码弱且前瞻有限。
KREL:利用大语言模型对临床证据进行知识引导推理的自动医疗编码
提出KREL框架,融合ICD指南知识与LLM推理,提升医疗编码性能,减少幻觉。
去噪未来:面向时序知识图谱外推的上下文感知光谱扩散
提出频率感知扩散框架,以上下文感知光谱校准增强时序知识图谱外推,性能最优。
关注树:分层多智能体辩论用于科学评审中的未言明局限提取
提出关注树框架:多智能体辩论与小组复审提取论文未言明局限,精确率升79%,覆盖率升11%。