Eyes-on-Me:通过可迁移的注意力引导吸引子实现可扩展的RAG投毒
提出模块化攻击,利用可迁移注意力吸引子实现RAG投毒,成功率提升35.9%,近零成本适应新目标。
HauntAttack:当攻击如影随形般跟随推理
将有害指令嵌入推理问题,诱导模型逐步输出不安全内容,平均攻击成功率超70%,揭示推理模型的安全漏洞。
一种声音,多种语言:面向科学语音的跨语言语音克隆
评估多种模型,基于OmniVoice构建系统,通过ACL 60/60数据增强微调,提升跨语言语音克隆的可懂度和相似度。
语言学与人类大脑:计算神经科学的视角
计算神经科学通过建模和深度学习桥接语言学与神经科学,借助LLMs和模型-大脑对齐探索语言神经基础。
虚假奖励悖论:从机理上理解RLVR如何激活大语言模型中的记忆捷径
虚假RLVR触发记忆捷径,通过中间层功能锚点激活检索、后续层适配器转换信号实现。
利用线性RNN从代码中学习状态追踪
将置换组合转为代码,线性RNN优于Transformer,但部分可观测时不如非线性RNN。
经验压缩谱:统一LLM智能体中的记忆、技能与规则
提出经验压缩谱框架,将记忆、技能、规则视为不同压缩级别,揭示缺乏自适应跨级压缩的“缺失对角线”问题。
Small edits, large models: How Wikipedia advocacy shapes LLM values
药物使用者在线上物质使用社区中自我污名的认知、情感与行为表达
分析了Reddit帖子,发现药物使用者自我污名普遍,行为指标常先于核心认知情感,但悲观情绪随时间加深。
基于图的噪声ASR语音错误纠正
提出G-SPIN框架,利用图神经网络构建候选集,结合MLM和LLM进行上下文重排序,轻量高效地纠正噪声ASR语音错误。
错误感知的TF-IDF检索增强生成用于ASR纠错
提出词法级错误感知框架,通过对称文本归一化和错误感知TF-IDF算法,将命中率从53.7%提升至90.9%,词错误率从23.06%降至18.83%。
AgentOdyssey:面向测试时持续学习智能体的开放式长周期文本游戏生成
通过生成开放式长周期文本游戏,评估智能体在测试时的持续学习能力,发现其探索与知识获取受限,短期记忆为关键,人类仍远优于最优模型。
完美检测,控制失败:语言模型中认知与操控的几何学
语言模型中检测与操控行为的方向夹角极大(余弦仅0.12),完美检测无法实现有效控制,且该分离源于预训练。
Dustin:用于高效长上下文自发式解码的草稿增强稀疏验证
Dustin框架利用草稿与目标模型注意力实现稀疏验证,长上下文解码加速27.85倍,精度无损。
大语言模型在真实双评GCSE基准上的表现
LLM在双评GCSE基准上表现优异,与评分者高度一致甚至更优,提供经济高效的自动评分方案。
基于LLM的科学同行评审:方法、基准与可靠性挑战
综述LLM在同行评审中的批评生成与分数预测,分析数据集偏见、鲁棒性风险及开放挑战。
中文标题:SemEval-2026任务13中的Dream:面向单次机器生成代码检测的SALSA方法
中文摘要:提出SALSA单次自回归分类法,用单token输出检测代码是否机生,跨语言OOD鲁棒,F1达0.789远超基线。
基于局部分支路由的高效可训练语言模型测试时扩展
提出局部分支路由(LBR),通过轻量路由选择前瞻子树,实现高效可训练测试时扩展,提升推理Pass@1和Pass@32。
改进的大型语言扩散模型
提出8B全双向掩码扩散模型iLLaDA,预训练12T tokens,在多项基准上显著提升,性能媲美自回归模型。
三个佛教词汇集:英语巴利三藏经藏、律藏、论藏的计量文体学分析
英译巴利三藏文体分析:经律藏词汇多样性相近,论藏数字密度高,派别律藏词汇重叠,新旧译本差异显著。
混合IR:面向复杂医学问答的双路径混合检索与迭代推理
提出双路径(图检索+稠密检索)与迭代推理机制,提升复杂医学问答准确性,实验验证有效。
记忆带来不同:评估不同记忆角色如何塑造对话代理
研究发现,不同功能角色的记忆对对话代理响应有差异化影响,澄清记忆提升准确性与个性化,无关记忆降低相关性。
低资源唐库尔语-英语神经机器翻译
针对唐库尔语-英语低资源翻译,微调ByT5-large模型(3.8万句对),BLEU达39.97,并分析正字法和领域偏差问题。
Towards Structuring an Arabic-English Machine-Readable Dictionary Using Parsing Expression Grammars
击中移动目标:持续分布漂移下AI文本检测的测试时自适应
提出利用推理时同质性的测试时自适应方法,鲁棒应对持续分布漂移,AI文本检测性能显著提升。
中间层知道什么:从熵动态检测越狱攻击
利用熵动态特征在模型中间层可有效检测越狱攻击,效果优于输出层,无需额外训练。
基于提示学习的学术论文要点自动生成
提出提示学习生成论文亮点,无需大量标注数据,ChatGPT结合模板性能优异但提示设计敏感。
你的越狱判定器可靠性如何?自动ASR评分的校准与对抗鲁棒性
比较专用分类器与LLM评判者,发现两者均有缺陷且易受攻击,建议报告精度、召回率并校正ASR。
PolicyAlign:面向大型语言模型的直接基于策略的安全对齐
PolicyAlign通过合成违规指令和自蒸馏直接对齐安全策略,提升安全性且不损害通用能力。
故事算子:在嵌入空间分解原著到续集的变换
通过嵌入空间分解原著到续集的几何变换,揭示续集分类并用经典案例验证与作者意图一致。
Beyond Next-Observation Prediction: Agent-Authored World Modeling for Sequential Decision Making
多语言语言模型毒性检测与缓解策略综述
综述多语言LLM毒性检测与缓解策略,揭示语言覆盖不均、文化危害定义差异等挑战。
Introducing corpora Hlava Cor and Hlava AD: Human Label Variation in Coreference and Discourse Relations
基于微调PEGASUS的抽象摘要优化
微调PEGASUS在XL-Sum上实现最优摘要,ROUGE指标较mT5显著提升。
中文标题:野外探测:基于无监督发音分析的普通话次方言自监督语音表征案例研究
中文摘要:通过无标签探测管道分析自监督模型在普通话次方言上的发音特征,发现声学显著特征稳定,精细频谱特征随方言变化。
大语言模型的红队测试框架:关于忠实性评估的案例研究
提出多角色红队框架,通过对抗提示暴露模型不忠实性,攻击成功率提升7.9%,发现架构设计比参数规模更影响安全性。
回收评估:有损记忆比空记忆更糟
有损记忆使模型自信输出错误结论,源头优先策略可恢复可纠正性。
使用MARBERT模型进行阿拉伯语推文垃圾信息与情感检测
采用MARBERT模型分析阿拉伯语推文情感,在STC客户服务数据集上取得优于现有技术的准确率。
BitNet文本嵌入
BITEMBED极端低比特框架,将LLM转为BitNet编码器,量化与蒸馏训练,性能近全精度,大幅降存储成本。
星级评分的缺陷:评分与情感不一致的行为驱动因素
星级与文本情感不一致达18.6%,主因保守评分和强制5星行为,受场所、经验等影响,两者不能互替。
开源大模型中的约束代价:结构化输出约束下工具调用抑制的实证研究
工具调用与结构化输出约束共存时,多个开源模型抑制工具调用,归因于语法掩码阻塞工具token,两阶段执行策略可恢复调用。
SFL-MTSC:利用语义框架级多任务自一致性实现鲁棒的多意图口语理解
提出SFL-MTSC框架,通过语义框架级分解与聚类提升多意图口语理解鲁棒性,零样本实验显示槽位F1和准确率提升。
MedGuards:可靠医疗错误检测与纠正的多智能体系统
MedGuards提出多智能体上下文学习框架,无需额外训练即可检测并纠正医疗错误,结合KPCS指标提升LLM安全部署。
Riazi-8B:用于数学推理的乌尔都语大语言模型
Riazi-8B通过乌尔都语预训练和GSM8K链式思维微调,显著提升低资源语言数学推理能力。
BiPACE:基于双模拟引导和动作反事实估计的LLM智能体策略优化
BiPACE用双模拟聚类和动作反事实估计修正信用分配,无需额外模型,大幅提升LLM智能体训练性能(成功率97.1%)。
保持角色:基于书籍的角色扮演代理的视角限定记忆
提出REVERIEMEM三层记忆架构,解决事实越界与风格单调,知识边界保真度提升34.6%,胜率约79%。
GraphRAG 是否必要?从基础 RAG 到图/代理方案与上下文优化
比较9种RAG场景,提出上下文优化节省19-53% token,揭示检索增强未等比提升生成质量。
OPERA:基于客观困惑度的强化学习对齐开放式推理
OPERA用困惑度动态作为内在奖励,替代外部评判,实现开放式推理对齐,在Qwen3-8B上达到新SOTA。
编码器足够吗?面向LLM对抗性评估的编码器与解码器安全评判器系统比较
比较编码器与LLM评判器在对抗评估中的性能,发现编码器可低成本低延迟替代,性能损失可控。
多步工具使用强化学习为何崩溃及监督信号如何修复
强化学习在多步工具任务中因控制token概率尖峰而崩溃,交错监督微调可提升稳定性但泛化受限。