这些模块值得投入吗?上下文学习文本转SQL的范式级精度-成本分析
统一框架下量化17种配置,发现仅执行反馈优化普适且低成本,其余模块依骨干而异;预算有限时,优化中端骨干比升级前沿模型更划算。
BanglaMed-QA:面向孟加拉语医疗保健支持的问答系统
孟加拉语医疗问答系统BanglaMed-QA,构建4493问答对知识库,采用SVM分类及多指标投票,自动F1达95%,人工满意度0.9。
基于概率的KV缓存逐出解释
形式化KV缓存逐出问题,证明其计算困难,将其化为期望估计,提出解码时校正,使现有方法更稳健高效。
保真度还不够:智能体数据表提取的调度级插桩
保真度不足;智能体提取需调度级插桩,靠工具调用日志检测静默失败,37项声明基准验证有效。
PersonaForge:面向智能体系统的逼真多轮用户模拟
真实多轮交互占75.9%,现有训练与评测存在缺口;提出基于四维人格与种子查询的模拟框架,训练提升智能体综合评分4.1%。
面向可解释多维度作文评分的结构化反馈生成统一框架
提出统一框架,先生成分层思维链反馈再评分,用蒸馏与强化学习确保评分反馈一致,多维度作文评分表现出色。
陌生人、粉丝还是同侪?对话者角色在基于人设的对话生成中的系统研究
研究对话者传记可见性在训练/推理/评估三阶段的影响:训练期可见性决定表达方式,对话者可见减少复制,不对称披露引发泄漏。
获取、修复、保留:一种诊断引导的小模型对话游戏智能体后训练方案
2B模型经SFT获取对话游戏能力,用局部偏好对修复决策错误并保留通用能力,成绩大幅提升,但迁移主要限于目标族内。
记忆并非提取:紧致差分隐私界与审计盲点
严格界定反事实记忆与自适应提取的DP常数,二者互不控制;十亿参数模型可单提示复现却被损失审计判净,暴露盲点。
混沌中的阶梯:测试时扩展何时、如何(也许为何)提升大语言模型机器翻译
顺序采样在翻译中性能上限更高,提升流畅自然度,但推理预算大时损准确,成功部分源于更大目标端上下文。
盲人摸象:探析大语言模型在长尾分歧知识下的认知短视
提出ElephantBench,发现大模型对长尾分歧知识常只回忆一种答案,最强模型完整回忆仅52.4%,规模扩大仍难消除。
NL2AGBench:面向AlphaGeometry的LLM自动形式化基准测试
提出NL2AGBench基准,用AlphaGeometry执行验证评测LLM自动形式化几何题;闭源可执行翻译率超80%,开源较弱,并提出错误分析与改进策略。
ContextPilot:通过细粒度强化学习训练智能体实现主动上下文管理
提出主动上下文管理框架,扩展工具,用细粒度强化学习识别关键编辑,长程任务性能更优且上下文更紧凑。
从文本语料学习人类语言的形式化局限
形式对意义的不确定性无法完全消除,仅靠文本学到的任何表示都无法超越这一内在局限。
基于子句单元的顺序鲁棒检测语义水印
提出顺序鲁棒语义水印,基于子句单元检测,抵御改写重排分段,攻击成功率大幅降低。
基于自监督语音表征的音素级与词级强制对齐评估指标
提出基于自监督语音表征的两项无参考强制对齐评估指标,在85种语言上与人工标注强相关。
审计生成式音频调用用于已知任务音频大模型评估
音频大模型评估中,生成式调用的边际价值甚微,监督编码器即可达0.854,额外调用仅提升0.004。
CamoDocs:使用伪装文档针对检索增强语言模型的投毒攻击
提出CamoDocs投毒攻击,以伪装文档规避查询包含,对多种RAG防御有效,攻击成功率超55%。
韵律在翻译中丢失了吗?跨语言细粒度韵律相似性分析
首次跨语言细粒度分析韵律相似性,发现某些语言间韵律结构存在内在关联,为表现性语音翻译提供实证指导。
SURE挑战:在语音LLM生成前评估语音证据
提出SURE挑战,评估语音LLM生成前的输入;规则拒绝多数不支持输入,且不损支持准确率。
以人类行为分布为基准评估大语言模型智能体社会
新评测工具发现:大模型智能体社会仅初始接近人类,最终状态不符,故只支持探索性结论。
DisCTI:谁需要及时知晓?面向行业的自动化网络威胁情报分发
自动化行业感知CTI分发,用BERT多标签分类达F1=0.89,标签正确率94.5%,填补防护空白。
语义头特化引导多模态大语言模型的混合ViT注意力
发现ViT注意力头分化为物体与背景专家,提出SHS指标指导混合注意力设计,新方法以6.5倍更低算力媲美全注意力。
分层大语言模型防御作为集成:访问层级、推理成本与防御层间实测的失败相关性
堆叠防御失败正相关,联合残余高于乘法预测;依赖源于共同架构而非采样,多样性不预测堆叠效果。
当机器人听错我们的话:绘制语音控制具身AI的安全风险
研究发现语音识别错误可使具身AI接受并执行有害指令,削弱拒答机制,自动纠错仅部分有效。
量化低资源媒体情感偏差:孟加拉语新闻标题的大规模情绪画像
用Gemma 3分析30万条孟加拉语标题,发现负面情绪频现,并提出可视化情感线索的新闻界面。
认知链式思维(CoCoT):面向社会情境的结构化多模态推理
提出CoCoT框架,分感知、情境、规范三阶段推理,提升多模态社会任务性能,且微调可内化该模式。
在高考基准上评估大语言模型的性能
用高考题评估大语言模型的GAOKAO-Bench,发现其成绩有竞争力但科目差异大,评分与人类中等一致。
大语言模型的剪枝定律
提出剪枝定律,跨模型/任务/策略预测剪枝后性能,误差<7%,指导安全剪枝与高效部署。
超越罗塞塔石碑:泛化动力学中的统一力
通过可控合成实验发现,语言表征统一与否决定跨语言知识迁移,提出促进表征统一以提升大模型跨语言迁移。
OceanGym:水下具身智能体基准环境
首个水下具身智能体综合基准,含多变环境与多模态大模型框架,揭示现有智能体与人类差距。
PRISM:利用大语言模型进行多跳问答的智能体检索
PRISM用三个智能体分解查询、迭代精选证据,提升多跳问答检索精度与召回,超越强基线。
面向上下文感知安全的多模态大语言模型解码引导
提出SafeCoDe,对比加噪图像并全局调制,平衡过/欠敏感,提升上下文安全拒绝且保有用。
BEACON:行为锚定的跨源网络威胁情报知识图谱构建
BEACON以攻击行为为锚,LLM抽取并分层对齐合并跨源图谱;构建最大数据集,超基线23%/9%
角色扮演结构化:从问卷生成合成治疗师-来访者对话
提出SQPsych管道,用结构化问卷无泄露地生成心理治疗对话,微调模型经专家评估显著提升治疗师角色扮演效果。
中文标题:你交往的“人”:大语言模型如何回应暗黑三角人格特质
中文摘要:研究发现,大语言模型面对暗黑三角人格特质用户时,多数表现纠正性,但部分模型会强化或态度模糊,需提升系统安全性。
追踪大语言模型表示的内在维度以刻画不同语言现象的复杂度轮廓
通过内在维度分析,发现六种LLM中语言复杂度对比一致反映在维度差异上,峰值分层,可区分复杂度类型。
学习用单个Token替代LLM中的长系统提示
提出用单个行为等效标记替代长系统提示,压缩3000倍,保留约98%性能,降低推理成本。
OmniFusion:基于模块化融合的同步多语言多模态翻译
融合多模态与翻译大模型,实现多语言多模态同步翻译,延迟降1秒且质量提升。
兔洞之外:描绘QAnon激进化的关系性伤害
分析上万篇家属自述,识别六类激进化人格,发现其预示不同情感伤害,构建关系性伤害计算框架。
通过知识经验学习对齐智能体世界模型
通过环境反馈构建符号化世界知识库,统一过程与目标经验,提升物理可行性与任务最优性,且跨模型环境可迁移。
从泄露思绪到私密推理:控制大型推理模型的自言自语
通过SFT和分阶段解码增强推理中的指令遵循,显著减少隐私泄露,但可能降低任务性能。
SMRC:将大语言模型与学生推理对齐用于数学错误纠正
提出SMRC,将LLM与学生推理对齐,用MCTS搜索纠错路径,构建MSEB基准,显著优于现有方法。
多语言口语词汇特征分析用于预测重度抑郁症状严重程度
利用线性混合模型和机器学习分析多国口语词汇特征,发现五个词汇特征可预测抑郁严重度,但需更大样本。
选择、标注、评估:NLP中的主动测试
提出NLP主动测试框架,选关键样本标注,省95%标注量且误差≤1%,并有自适应停止准则。
大型推理模型难以跨文字系统迁移参数化知识
大型推理模型跨语言知识迁移的主要障碍是文字系统差异,通过训练模型推理转写歧义可缩小该差距。
心理上有效,计算上不可见:大语言模型生成引发社会比较的帖子却无法识别
提出XHS-SCoRE基准,发现LLM能生成引发社会比较的小红书帖子,却难以通过提示检测该信号。
人类句子处理中Transformer预测的分歧:一致性吸引效应的综合分析
对11个变换器的测试:一致性吸引预测仅部分吻合人类,无法复现宾语关系从句干扰模式,不能解释人类句法处理。
LLM智能体在权力不对称对话中是否复现社会认知效应?
研究发现,LLM在权力不对称对话中表现出语言协调、代词使用、说服和不安全顺从等权力社会认知效应,但存在差异。
CRAM:面向多模态持续指令微调的质心路由与自适应MoE
提出CRAM,用质心路由与自适应MoE平衡防遗忘与参数效率,多模态持续指令微调性能超越现有方法。