GraMRAG:基于图记忆与强化学习的多智能体多步推理编排
图记忆引导的多智能体RAG框架,融合动态多模态记忆图与拓扑感知策略优化,实现长程跨模态推理SOTA。
一刀切并不适用:根据部署实际提出的问题设定推理深度
早退出读出层:按部署流量定制阈值可显著提高提前退出率,但token级保真度指标在可校验任务失效。
面向风格感知放射学报告的语料库特征刻画与逆向宪法微调
分析2000份报告归纳五种写作风格,逆向构建风格宪法微调MedGemma,文本对齐显著提升。
面向有效反叙事生成与精炼的多阶段智能体框架
提出多阶段智能体框架,生成、精炼并评估反叙事;实验显示其优于基线,可规模化对抗仇恨与虚假信息。
从估计的听者注视中学习指称
用估计听者注视作奖励微调视觉语言模型,指称长度从15.4降至4.0词,成功率升至80.0%。
SpectralShift:通过谱重参数化有效扩展门控 DeltaNet 的上下文窗口
提出 SpectralShift 谱重参数化方法,重塑 GDN 衰减谱并缩放学习率,高效扩展线性注意力模型上下文窗口。
涅伊谢卡尔:面向自动语音识别的开放波斯语朗读语音语料库
开源波斯语朗读语音语料库,含99小时、6.2万条录音、190位贡献者,覆盖正式与非正式语言,ASR词错率较Common Voice显著降低。
用于评估社交媒体短文本公共卫生传播主题模型的文档-主题对齐指标
提出DoTA文档-主题对齐指标,衡量帖子与所赋主题的语义一致性,实验表明其与人工评估相符,可补充传统指标。
NeuroActiSep:单次前向传播中基于前馈神经元检测事实性幻觉
提出按末位提示词对前馈神经元排序并迁移其标识训练幻觉分类器,检测性能媲美内部状态探针。
智能体评估中的策略漏洞:当策略歧义伪装成智能体错误
智能体评估假设策略唯一正确动作,但自然语言策略的歧义、沉默与矛盾造成漏洞,评分不可靠,需先审计策略。
DenMark:面向扩散语言模型的鲁棒语义水印
DenMark将密钥信号注入扩散模型去噪过程,借临时展开估计语义、累积水印证据,检测时校准扫描,语义攻击下均最优。
语言的形式性质作为神经动力学的约束
提出NAP,用语言代数不变量约束神经机制,并给出最接近句法合并的神经绑定操作Meld。
图上的忒修斯:迈向可追踪的多跳图导航
将多跳KGQA重构为可追踪图导航,提出THESEUS,显式建模推理路径,并构建数据、评测与路径智能体。
E2A-Bench:金融图表推理中证据到行动可靠性的基准评测
提出E2A-Bench,评测金融图表推理证据到行动可靠性,揭示单一幻觉分掩盖多重失败。
编辑路径塑造 AI 辅助科学写作中计算结果的限定方式
AI辅助科学写作中,比较若分配到组仓库,模型常省略数值限定;针对性放置可恢复,通用准确性提醒无效。
领域特定预训练画像与Transformer性能:来自阿拉伯语-英语语码转换中数字语用建模的证据
领域预训练比多语言覆盖更关键:MARBERT在阿英语码转换数字语用分类中显著优于XLM-R。
TATK:面向LLM序列推荐的三重感知Top-K学习与知识接地验证
TATK融合Top-K学习与知识接地验证,用知识图谱增强LLM序列推荐,36项指标全面超越基线。
解耦多智能体大语言模型中的拓扑与多样性:面向多语言低资源情感检测。
在多语言低资源情感检测中,智能体差异化比拓扑影响更大,并行学习特化最佳。
CompCQR:面向免训练对话搜索的组合式查询生成
提出免训练组合式查询生成法,以极少 LLM 调用生成海量查询,四个对话检索基准上 MRR 相对提升最高达 22.5%。
通过价值引导偏好蒸馏,利用稠密行为信号优化稀疏结果。
多目标强化学习优化长程对话,以稠密行为信号优化稀疏结果,蒸馏价值偏好,提升留存与正向行为。
该论断有多宽泛?NLP研究中泛化表述的映射
构建NLP泛化分类体系与LLM自动标注框架,分5类建数据集,并分析论文泛化与引用等关联。
数据到文本驾驶教练系统的本地化:英国与尼日利亚的反馈系统差异
数据到文本驾驶教练需本地化,因实用性取决于驾驶员知识、风险、法规及数据。对比英尼两国系统,提出本地化设计流程。
量化语音-文本语言模型中的生成模态差距
语音-文本联合建模显著提升语义连贯,但音素与音质等指标改善不均,文本是高效语义训练信号。
提示词分岔的花园:用户如何在故事生成中探索叙事空间
研究用户迭代修改故事提示以探索叙事空间,构建两个大规模数据集与编辑类型框架,并用于故事生成评测。
构建用于证据依据与弃答的法律奖励模型
提出法律奖励模型框架与基准,用上下文偏好数据提升依据与弃答评估,最高增益25.6个百分点并具跨法域迁移。
注意你偏爱哪只鸟:机器翻译元评估中充分性-流畅性平衡的参数化
将机器翻译元评估中充分性与流畅性的平衡变为可调参数,通过重加权系统实现精确优化,并验证内部一致性。
Dream-RSI:通过不断演化的世界实现递归自我改进
Dream-RSI以历史发现树构建回放模拟器,离线低成本优化探索策略,在线部署形成递归自我改进闭环。
医疗领域大语言模型评估方法入门
综述涵盖研究设计、统计方法、能力评估与临床情境评估四方面,强调评估方法须与研究问题对齐。
低成本声调评估:面向大规模多语言语音合成的无参考词汇声调度量
提出免参考的词汇声调度量DunDun,以文本变音符号对比音高轨迹,弥补CER对声调的忽视,并开源完整验证协议。
MedTRACE:面向循证决策的工具增强多模态临床推理智能体
提出工具增强的多模态临床推理智能体,迭代形成假设、调用工具取证并验证,提升诊断准确率与可信度。
Func-R1:激发多模态大语言模型的数学函数推理能力
提出Func-R1,用分层后训练与PATO协同视觉感知和逻辑推理,缓解模态干扰,超越GPT-5。
Enemray:面向哈桑尼亚语的能力型语言模型
Enemray:以稳定性—可塑性目标训练哈桑尼亚语模型,英译哈最优,并保留基础模型通用能力。
路由而非修正:面向可靠临床大语言模型答案选择的状态依赖解码校正与轨迹门控路由器
ALTAS无需训练,依据终态熵与末层线性度逐题路由贪婪解码或轨迹校正,提升真实性且不损临床基准。
Pull:面向有状态大模型对话的工作记忆惰性物化
Pull 以确定性净化器构建可寻址元数据目录,查询时惰性物化所需对话轮次,上下文 token 减少约75%且质量无损。
ModularRSI:模块化、可泛化的递归执行框架自我改进
对比成败轨迹、跨任务聚合缺陷,将执行框架拆为五模块独立演化再整合;用与评测不重叠的2000任务演化,多基准稳定提升且可跨模型迁移。
在线语言自适应采样:实现更佳分布式跨语言收益
提出在线语言自适应采样,依语言对对齐损失贡献动态调整采样概率,实现更均衡的跨语言收益。
ABSOL:由大语言模型编排的聚合贝叶斯子采样
ABSOL以大语言模型为受限语义引导,改进贝叶斯网络结构学习,在多个基准上Edge F1最优。
一个示例就足以通过公平性基准:重新思考对齐大语言模型的公平性评估
单个示例即可将BBQ准确率从79.9%提至99.0%,暗示该类基准过易,难以衡量公平对齐。
台风 ASR 流式识别:可引导的低延迟泰语语音识别与实时浅层融合
可部署泰语流式ASR以缓存感知编码器恢复流式,实时浅层融合在解码期引导词表,字符错误率降约4.5倍。
跨26个大语言模型,生物医学参考文献生成仍不可靠
测试26个模型,55.4%回答为伪造文献,全字段正确率最高仅54.6%,模型生成引用须核验。
MTAC-IFBench:多轮智能体编程中的指令遵循基准评测
提出MTAC-IFBench多轮编程指令遵循基准,含6大类18子类约束,平均7轮91项,揭示长交互下遵循力骤降。
四十度蓝:通过模式条件强化学习实现质量—多样性对齐
MoDA:模式条件强化学习对齐质量与多样性,配合质量门控,兼顾通用能力与开放探索。
能否在没有人工参考译文的情况下对古典文本中的大语言模型翻译错误进行分诊?——以巴利语到英语翻译为例的源文新颖性、GEMBA评分与预算化审校
研究以巴利语英译测试无参考错误分诊;更强模型GEMBA评分最优,审前10%捕获81.6%主要错误,并提出预算化审校流程。
语料库对齐的奥斯曼体—标准体《古兰经》词语映射与确定性诵读校验器
发布2290对奥斯曼体—标准体词映射与归一化流程,构建无大模型的确定性诵读校验器,准确率98.4%
超越深度与宽度:流式测试时计算中的信息-松弛困境
证据顺序改变策略:早算余量多但证据不全,等待信息全却压缩余量,即信息松弛困境;资源约束下可信按时响应
SALUTE:面向国防领域的大语言模型基准评测与适配
提出SALUTE框架,构建国防语料、指令与偏好数据集及基准,经多阶段后训练提升国防领域LLM能力。
魔镜,魔镜:小型指令语言模型中的提示复读现象
研究多个家族小模型发现,提示复读主要源于模型归纳头机制,而非训练数据泄漏。
Salesforce Koa:面向智能体工具使用的企业级语言模型
以GRPO强化学习后训练开源模型,借模拟到奖励流程提升多轮工具调用与企业智能体能力,无需客户数据。
CITECHOICE:文档呈现方式如何在智能体搜索中重新分配引用信用的因果审计
因果审计显示,结构化呈现使目标每答案引用增0.5次,集中引用信用,但不增加总引用或可靠来源准入。
DA-DLM:在扩散语言模型中显式建模词元依赖
提出DA-DLM,用位置导向DAG为扩散语言模型显式建模词元依赖,提升连贯性,少步去噪更优并保持并行。