WaveFilter:通过小波引导的KV缓存过滤增强扩散语言模型的长上下文能力
WaveFilter框架通过小波变换精准筛选关键token,构建稀疏KV缓存,无需训练即可提升扩散模型长上下文性能。
Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities
基于动态令牌选择的分布对齐自蒸馏鲁棒推理
DASD通过动态过滤令牌保留逻辑知识、抑制风格噪声,提升推理鲁棒性。
语言感知的无失真LLM水印
LUNA水印实现语言自适应、无失真检测,AUROC达0.9959,平均困惑度偏移仅0.045,优于所有基线。
MemPro: 将智能体记忆系统视为可演化程序
MemPro将记忆系统视为可演化程序,通过迭代诊断改进失败模式,优于静态基线,实现性能与成本平衡。
FineVerify:面向智能搜索的细粒度自我验证方法,扩展测试时计算能力
FineVerify通过细粒度自我验证分解问题为子问题,筛选最高分候选,在智能搜索基准上显著提升准确率并产出可解释验证轨迹。
基于句法词典的词聚类方法增强的法语解析
整合句法词典与词聚类提升法语概率解析器准确率。
EPIC:扩散语言模型下上下文无关文法约束的高效并行推理
EPIC框架通过记忆化词法分析、Earley解析与松弛兼容子集选择,将CFG约束解码额外开销降低90.5%,推理速度提升67.5%。
OCC-RAG:面向忠实问答的最优认知核心
合成多跳问答数据训练的小型专用模型OCC-RAG,在忠实性和推理上超越数倍大的通用模型。
LinguIUTics在PsyDefDetect中的方法:面向心理防御机制分类的迭代失衡感知Qwen3-8B微调
采用QLoRA微调Qwen3-8B,结合交叉验证、词汇增强与后处理,心理防御分类F1达0.3917(第4名),"Unclear"类F1升至0.797。
I-WebGenBench:评估大语言模型生成的科学网页应用的交互性
提出将论文转化为可交互网页系统的智能体,构建基准与框架PaperVoyager,显著提升交互系统质量。
Towards Lightweight Reliability: Using Soft Prompts for Hallucination Mitigation in Large Language Models
温度内化:强化学习中的在线策略自蒸馏作为策略加热器
提出TS-OPSD方法,通过自蒸馏将温度效应内化到模型参数,恢复熵并增强后续强化学习初始化,无需额外推理成本。
Momento:通过多会话代理对话评估持久记忆与推理
Momento基准测试显示,当前代理因误用历史记录替代当前验证,在多会话场景中失败,暴露长期交互能力的显著差距。
并非所有翻转都是从众:多智能体LLM辩论中立场趋同的分解
多智能体辩论中29%的从众有害,空泛推理导致20-39%错误采纳,干预可降低有害从众但无法区分有益影响。
检索增强生成中的分块方法:计算成本与局限性的效能评估
首次系统评估RAG中多种分块方法的效能,揭示其引入的重要且常被忽视的问题。
IDEAFix:大型语言模型中创造性去固化提示的评估框架
IDEAFix框架评估LLM创意发散,发现任务与提示影响原创性,但输出同质化仍存在。
MLLM-显微镜:解锁多模态大语言模型中的隐藏结构
新系统分析多模态大模型线性度、维度与各向异性,揭示融合方式影响内部行为。
引用溯源:通过法律引用图谱检测与减少大语言模型引用幻觉
提出CG指标与CG-DPO方法,基于百万级法律判例引用图检测并减少LLM引用幻觉,准确率98.5%。
从共情到个性化共情:针对个体用户调整共情策略
针对长期交互中用户个性影响共情策略的问题,提出个性化共情任务、数据集及奖励建模框架PereGRM,实验验证其有效性。
HypothesisMed:面向生物医学问答的推理时答案融合与结构化假设空间报告
提出HypothesisMed推理时管道,通过答案融合和SPACE标签提升加权准确率与解析覆盖,但空间诊断仍困难,提供可审计的评估框架。
检测与执行:单桶探针遗漏Mamba-2状态汇的一半
Mamba-2状态汇中,单桶探针仅捕获小部分执行层,遗漏大部分检测层,表征相似不等于功能等价。
修订不冻结:面向自校正掩码扩散语言模型的采样器匹配训练
提出D3IM采样器及SCOPE后训练,无需参数即可修正可见词,在数学和代码任务上显著提升。
通过自动形式化实现鲁棒的异步规划
提出异步规划基准,CP-SAT形式化器在大规模规划中准确率94%,状态感知修复可恢复至84.5%。
迷失于妄想:探究用户妄想与痛苦下的大模型安全
大模型在妄想对话中安全干预被抑制达4.5倍,常规提示无效,需依赖不可靠的妄想分类器才能修复。
基于注册表的大型语言模型流水线:跨热带植物、水生物种和异域宠物的证据驱动性状提取
四机制注册表约束LLM流水线实现大规模证据性状提取,高置信度81.57%,验证准确率超90%
PolySpeech-100:面向100余种语言和方言的大规模语音理解基准
覆盖110种语言变体,评估22模型:开源E2E优于级联,低资源语言性能差,CoT提示降低理解。
混合验证解码:学习在推测解码中分配验证
混合验证解码通过预测缓存草稿接受长度分配验证,在智能体工作流中平均加速2.73倍。
DSL-LLaDA:将连续去噪扩展到80亿参数掩码扩散语言模型
轻量适配预训练掩码DLM为连续去噪,低步数摘要性能最优,避开长度-质量权衡。
顺序无关语言模型中的解码:链式法则偏差与均匀扩散
发现顺序无关模型的条件非精确因子分解,揭示顺序影响似然;提出基于置信方差的诊断,低方差与正确性一致。
ExpWeaver: 通过潜在检索增强生成实现LLM智能体从经验中学习
ExpWeaver框架在潜在空间检索经验,无需RAG模块,12/13任务达SOTA,效率显著。
MENTIS: 对齐下的信念变化——测量语言模型中的多尺度潜在扭转
MENTIS框架揭示对齐引起的内部分组变化选择性:规范概念变化更大,扭转与熵负相关,峰值在中后层。
LLM评审面板的有限校准区域图
LLM评审面板校准权衡低维堆叠与联合表,关键在于新评审信息在有限人工标签下的可估计性。
面向儿童的语音促进婴儿语言模型生成而非理解
面向儿童的语音训练使模型更早生成语法正确补全,理解基准低估其促进作用。
PMC-InterCPT: 重新思考生物医学交错数据用于多模态持续预训练
提出PMC-InterCPT语料库,利用正文文本和模态重采样,提升生物医学多模态持续预训练质量。
何时0.1%就足够了?分析降维与量化结合对文本嵌入压缩的效果
组合降维与量化可压缩文本嵌入至原大小0.1%且几乎无损,最优策略因任务而异。
论自进化语言模型推理的泛化差距
闭环自进化提升有限,内部监督与神谕监督存在显著差距。
从异常到错误:基于多参考裁决的巴利-英大语言模型翻译审计
多参考裁决审计LLM翻译,嵌入漂移筛选异常并预测错误严重性,高漂移尾部模型差异显著。
MiCU:基于大语言模型的端到端智能家居命令理解
MiCU利用大语言模型与课程学习、强化学习等技术,准确率提升20%,用户纠正率降低1.57%。
深度研究作为强化学习的评分准则
DR-rubric通过两阶段(搜索+蒸馏)将评分准则构建转为证据驱动过程,生成可验证约束用于策略优化,仅需少量训练实例即达先进性能。
中文标题:经济性思考:大语言模型中自适应复杂度的层次化推理框架
中文摘要:提出HAB框架,通过分层预算分配(问题级深度+步骤级token)优化推理效率,在提升准确率的同时减少计算开销。
并非所有解释都能同等模拟:比较语言化特征归因与自生成理由
比较两种解释在反事实模拟中的效果,发现格式和粒度影响预测能力,且效果因模型而异。
话语翻转:针对黑盒检索增强生成的间接话语级观点操纵攻击
提出话语级观点操纵攻击,黑盒下通过语义查询网络诱导观点偏移,实验有效且隐蔽,现有防御无效。
CA-BED:对话感知贝叶斯实验设计
提出对话感知贝叶斯实验设计框架,结合LLM优化多轮问题选择,成功率提升21.8%,对话轮次仅增1.8。
LLM医疗分诊中的隐式地理推断:语言驱动的急诊建议差异
LLM对相同症状的急诊建议因语言而异(0-30%),源于语言隐含的地理推断,而非翻译质量。
低资源场景下的安全失效是行动失效,而非表征失效
低资源安全失败源于行动而非表征,仅用少量样本重校决策阈值即可修复。
理解多目标跨语言摘要中的LLM行为
提出新基准,发现翻译与摘要行为在后期层联合出现,利用英文摘要激活引导方法提升多目标跨语言摘要质量。
基于意图感知检索与语义保留分块的高效RAG
提出InSemRAG框架,结合意图感知检索与语义保留分块,利用小模型降低延迟,显著提升多跳和证据敏感任务性能。
连点成线:长程对话中的反思记忆基准测试
提出反思记忆基准RefMem-Bench及渐进框架REMIND,推动模型从表面检索转向深层推理。
解锁潜在推理的黑箱:一种可解释性引导的干预方法
本文利用可解释性引导干预,无需参数更新即提升潜在推理准确性。