开源大模型中的约束代价:结构化输出约束下工具调用抑制的实证研究
工具调用与结构化输出约束共存时,多个开源模型抑制工具调用,归因于语法掩码阻塞工具token,两阶段执行策略可恢复调用。
SFL-MTSC:利用语义框架级多任务自一致性实现鲁棒的多意图口语理解
提出SFL-MTSC框架,通过语义框架级分解与聚类提升多意图口语理解鲁棒性,零样本实验显示槽位F1和准确率提升。
MedGuards:可靠医疗错误检测与纠正的多智能体系统
MedGuards提出多智能体上下文学习框架,无需额外训练即可检测并纠正医疗错误,结合KPCS指标提升LLM安全部署。
Riazi-8B:用于数学推理的乌尔都语大语言模型
Riazi-8B通过乌尔都语预训练和GSM8K链式思维微调,显著提升低资源语言数学推理能力。
BiPACE:基于双模拟引导和动作反事实估计的LLM智能体策略优化
BiPACE用双模拟聚类和动作反事实估计修正信用分配,无需额外模型,大幅提升LLM智能体训练性能(成功率97.1%)。
保持角色:基于书籍的角色扮演代理的视角限定记忆
提出REVERIEMEM三层记忆架构,解决事实越界与风格单调,知识边界保真度提升34.6%,胜率约79%。
GraphRAG 是否必要?从基础 RAG 到图/代理方案与上下文优化
比较9种RAG场景,提出上下文优化节省19-53% token,揭示检索增强未等比提升生成质量。
OPERA:基于客观困惑度的强化学习对齐开放式推理
OPERA用困惑度动态作为内在奖励,替代外部评判,实现开放式推理对齐,在Qwen3-8B上达到新SOTA。
编码器足够吗?面向LLM对抗性评估的编码器与解码器安全评判器系统比较
比较编码器与LLM评判器在对抗评估中的性能,发现编码器可低成本低延迟替代,性能损失可控。
多步工具使用强化学习为何崩溃及监督信号如何修复
强化学习在多步工具任务中因控制token概率尖峰而崩溃,交错监督微调可提升稳定性但泛化受限。
SARA: 通过语义锚定路由对齐解锁混合专家模型中的多语言知识
SARA用语义锚定对齐路由分布,让低资源语言共享高资源专家,在MoE多语言任务中提升性能(Global-MMLU+0.8%~1.2%)。
超越函数调用:在工具环境不可靠条件下对使用工具的智能体进行基准测试
ToolBench-X评估代理在可恢复可靠性危害下的表现,揭示失败主因是危害诊断与恢复不足,建议评估聚焦任务完成。
HIPE-2026概览:多语言历史文本中的人物-地点关系抽取
HIPE-2026评估多语言历史文本中人物-地点时序关系抽取,涉及三语种、三方面评估,揭示准确率与效率权衡。
SpeechEQ:社交感知语音对话模型的情商基准
SpeechEQ框架评估语音语言模型情商,揭示现有模型存在模态捷径、安全陷阱和上下文遗忘等局限。
Dziri语音机器人:面向阿尔及利亚方言的端到端低资源语音对话系统
本文提出模块化流水线,集成ASR、NLU、RAG与TTS,构建阿尔及利亚方言端到端语音对话系统,实验性能优异。
形式思维编织
提出WoFT范式,融合语法验证与结构学习,通过GLR解码和RWS微调,使交叉熵降低14.3%。
低资源语言文本去毒化的Tatoxa系统:以鞑靼语为例
Tatoxa系统专攻鞑靼语文本去毒化,性能超现有模型,新数据集助力低资源微调,跨语言迁移效果不佳。
检测、遗忘、恢复:防御文本摘要模型的数据投毒攻击
提出后门防御框架,通过影响分析和行为审计检测投毒,遗忘学习恢复96%模型性能,精度达85-92%。
文学文本的AI翻译“还行”,但读者仍更偏爱人工翻译
读者比较AI与人工文学翻译,认为AI“还行”但更偏爱人工,因其更流畅沉浸;读者难区分两者,却偏好自认为人工的版本。
ASAP:面向以挂钟时间为中心的自动超参数优化研究的智能体-系统协同设计
ASAP通过智能体集成多种优化器与系统级推测并行,显著降低HPO端到端挂钟时间,持续优于基线。
人不可见,机器可见:四项生物医学文献API的Unicode保真度预注册审计
审计四个生物医学API的Unicode保真度,发现排版标点和特殊空白严重丢失,数学符号完好,保真度因API而异且未记录。
相同证据,不同答案:审计多模态大语言模型中的顺序敏感性
审计18个多模态大模型,发现均对顺序敏感,翻转率24-50%,最佳模型仍13.4%翻转,提示缓解效果有限。
When Certainty Is an Artifact: Keyword Lexicon Blindness and the (Mis)Measurement of Rhetorical Stance
实时语音AI能听见但不会倾听
四大实时语音系统仅按文字内容回应,忽略声音中的情感,即便能识别也不行动,存情感智能鸿沟。
RAVEN:基于视觉-空间-时间记忆的长期推理与导航系统
RAVEN利用视觉嵌入与空间地图实现高效检索,在长期机器人问答与导航任务中超越基于描述的方法,并以低成本部署于真实机器人。
评估LLM在真实世界软件性能优化中的表现
SWE-Pro基准测试表明,当前LLM在性能优化中效果微弱,远不及专家,差距巨大。
数据驱动下的图书馆与信息科学研究方法演化(1990-2022):基于细粒度方法实体的视角
基于1990-2022年LIS论文的细粒度分析,发现数据资源是方法演化关键驱动力,呈现“涌现-稳定/应用”循环模式。
学术论文研究难度测量:以自然语言处理为例
提出论文研究难度评估系统,发现中难度论文学术影响力最高。
翻译增强的语音编码器预训练是否影响语音大语言模型?
翻译增强预训练通过弥合语言差异,改善编码器与LLM的跨模态集成,从而提升下游语音大语言模型性能。
Sarashina2.2-TTS: 通过数据扩展和针对性数据合成应对日语语音生成中的汉字多音问题
Sarashina2.2-TTS通过数据扩展和针对性增强,准确解决日语汉字多音问题,实现最先进阅读准确率和跨语言鲁棒性。
面向扩散式TTS中尖锐韵律动态建模的自适应振荡归纳偏置
OscillaTTS采用自适应振荡非线性及线性旁路,更好建模扩散TTS中突变的韵律动态,主客观指标提升。
评估日语方言在基于语音和文本的大型语言模型中的鲁棒性
本研究以日语方言为例,发现语音与文本大模型方言鲁棒性相关,训练方言数据并微调语音编码器可提升鲁棒性。
泛化频谱:评估学习算法的色谱方法
提出泛化频谱框架,通过分层测试变体揭示算法泛化深度,发现RL更高效转化记忆为近迁移,ICL依赖对应关系。
基于软动态规划的全可微神经强制对齐
提出端到端全可微神经强制对齐架构,通过双分支编码器和可微软动态规划解码器,超越现有音素对齐最优结果。
LLM Agent中框架设计与后训练的相互作用
将框架作为可控维度进行后训练,可提升LLM agent分布内及OOD性能,避免环境变化下性能骤降。
通过令牌影响归因追踪被投毒检索语料库中的目标答案
TRACE框架通过令牌影响归因发现高影响关键词并二次验证,有效检测检索语料投毒攻击。
检索增强生成中的安全与隐私:架构、威胁、防御和构建可信系统的未来方向
全面综述RAG系统安全与隐私挑战,包括威胁分类、攻击分析及防御,指引构建可信系统。
混合线性注意力机制的系统分析
系统评估72个混合线性注意力模型,推荐HGRN-2/GatedDeltaNet及3:1~6:1比例实现Transformer级召回性能。
RAS:通过拒绝对齐评估大语言模型安全性
提出SafeVec白盒方法,用内部表示测量拒绝对齐,得到RAS分数,高效评估LLM安全性。
面向计算机使用智能体的不确定性量化基准:跨视觉语言模型与GUI定位数据集
Argus基准评估GUI定位不确定性量化方法,发现排名跨模型不稳定,封闭源需目标重排序,校准缩小区域但覆盖率下降。
大型语言模型如何跨语言与市场获取品牌声誉
LLM品牌信息85.7%来自第三方,维基百科主导,但市场差异明显,如波兰依赖YouTube。
极限空间高效语言生成
提出空间高效极限语言生成框架,证明多项式空间可近似生成,指数空间可精确辨识,并给出近匹配下界。
学习从多文档中擦除私有知识用于检索增强大语言模型
提出Eraser4RAG,通过知识图分割与PPO优化擦除多文档私有知识,保留公共知识,效果优于GPT-4o。
OCR推理有多鲁棒?视觉扰动下视觉语言模型OCR推理鲁棒性评估
提出OCR-Robust基准评估VLM视觉扰动鲁棒性:高准确率不意味强鲁棒,图表比文档更脆弱。
自然反同化:对预训练规则存留的非对称控制
模型自然遗忘已习得规则,存亡由支持频率决定,可破坏但不可恢复。
跨模态鲁棒性迁移(CMRT): 利用对抗文本训练鲁棒语音翻译模型
提出CMRT跨模态鲁棒性迁移,将文本对抗训练迁移至语音,无需生成对抗语音,平均提升3 BLEU,建立新基线。
规模还是推理?推理蒸馏的计算等价分析
推理蒸馏与指令微调在相同计算预算下对比:IFT多占优,混合25-50%推理数据可获高性价比。
Membox:将主题连续性融入LLM智能体的长程记忆
Membox通过主题织机和痕迹编织器实现主题连续性记忆,在LoCoMo上F1达59.71,优于碎片化语义检索。
韩语树库中基于语节的成分结构
主张韩语树库以语节为成分单位,形态信息单独分层,支持跨树库比较与依存对齐。
强化学习改进大语言模型中参数化知识的遍历
强化学习通过改善知识层次遍历提升事实回忆,而非新增知识,推理模型优于指令微调模型。