10213 条条目 · 106 个活跃源
2026年6月2日
04:00
arXiv cs.CL

WaveFilter:通过小波引导的KV缓存过滤增强扩散语言模型的长上下文能力

WaveFilter框架通过小波变换精准筛选关键token,构建稀疏KV缓存,无需训练即可提升扩散模型长上下文性能。

04:00
arXiv cs.CL

Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities

04:00
arXiv cs.CL

基于动态令牌选择的分布对齐自蒸馏鲁棒推理

DASD通过动态过滤令牌保留逻辑知识、抑制风格噪声,提升推理鲁棒性。

04:00
arXiv cs.CL

语言感知的无失真LLM水印

LUNA水印实现语言自适应、无失真检测,AUROC达0.9959,平均困惑度偏移仅0.045,优于所有基线。

04:00
arXiv cs.CL

MemPro: 将智能体记忆系统视为可演化程序

MemPro将记忆系统视为可演化程序,通过迭代诊断改进失败模式,优于静态基线,实现性能与成本平衡。

04:00
arXiv cs.CL

FineVerify:面向智能搜索的细粒度自我验证方法,扩展测试时计算能力

FineVerify通过细粒度自我验证分解问题为子问题,筛选最高分候选,在智能搜索基准上显著提升准确率并产出可解释验证轨迹。

04:00
arXiv cs.CL

基于句法词典的词聚类方法增强的法语解析

整合句法词典与词聚类提升法语概率解析器准确率。

04:00
arXiv cs.CL

EPIC:扩散语言模型下上下文无关文法约束的高效并行推理

EPIC框架通过记忆化词法分析、Earley解析与松弛兼容子集选择,将CFG约束解码额外开销降低90.5%,推理速度提升67.5%。

04:00
arXiv cs.CL

OCC-RAG:面向忠实问答的最优认知核心

合成多跳问答数据训练的小型专用模型OCC-RAG,在忠实性和推理上超越数倍大的通用模型。

04:00
arXiv cs.CL

LinguIUTics在PsyDefDetect中的方法:面向心理防御机制分类的迭代失衡感知Qwen3-8B微调

采用QLoRA微调Qwen3-8B,结合交叉验证、词汇增强与后处理,心理防御分类F1达0.3917(第4名),"Unclear"类F1升至0.797。

04:00
arXiv cs.CL

I-WebGenBench:评估大语言模型生成的科学网页应用的交互性

提出将论文转化为可交互网页系统的智能体,构建基准与框架PaperVoyager,显著提升交互系统质量。

04:00
arXiv cs.CL

Towards Lightweight Reliability: Using Soft Prompts for Hallucination Mitigation in Large Language Models

04:00
arXiv cs.CL

温度内化:强化学习中的在线策略自蒸馏作为策略加热器

提出TS-OPSD方法,通过自蒸馏将温度效应内化到模型参数,恢复熵并增强后续强化学习初始化,无需额外推理成本。

04:00
arXiv cs.CL

Momento:通过多会话代理对话评估持久记忆与推理

Momento基准测试显示,当前代理因误用历史记录替代当前验证,在多会话场景中失败,暴露长期交互能力的显著差距。

04:00
arXiv cs.CL

并非所有翻转都是从众:多智能体LLM辩论中立场趋同的分解

多智能体辩论中29%的从众有害,空泛推理导致20-39%错误采纳,干预可降低有害从众但无法区分有益影响。

04:00
arXiv cs.CL

检索增强生成中的分块方法:计算成本与局限性的效能评估

首次系统评估RAG中多种分块方法的效能,揭示其引入的重要且常被忽视的问题。

04:00
arXiv cs.CL

IDEAFix:大型语言模型中创造性去固化提示的评估框架

IDEAFix框架评估LLM创意发散,发现任务与提示影响原创性,但输出同质化仍存在。

04:00
arXiv cs.CL

MLLM-显微镜:解锁多模态大语言模型中的隐藏结构

新系统分析多模态大模型线性度、维度与各向异性,揭示融合方式影响内部行为。

04:00
arXiv cs.CL

引用溯源:通过法律引用图谱检测与减少大语言模型引用幻觉

提出CG指标与CG-DPO方法,基于百万级法律判例引用图检测并减少LLM引用幻觉,准确率98.5%。

04:00
arXiv cs.CL

从共情到个性化共情:针对个体用户调整共情策略

针对长期交互中用户个性影响共情策略的问题,提出个性化共情任务、数据集及奖励建模框架PereGRM,实验验证其有效性。

04:00
arXiv cs.CL

HypothesisMed:面向生物医学问答的推理时答案融合与结构化假设空间报告

提出HypothesisMed推理时管道,通过答案融合和SPACE标签提升加权准确率与解析覆盖,但空间诊断仍困难,提供可审计的评估框架。

04:00
arXiv cs.CL

检测与执行:单桶探针遗漏Mamba-2状态汇的一半

Mamba-2状态汇中,单桶探针仅捕获小部分执行层,遗漏大部分检测层,表征相似不等于功能等价。

04:00
arXiv cs.CL

修订不冻结:面向自校正掩码扩散语言模型的采样器匹配训练

提出D3IM采样器及SCOPE后训练,无需参数即可修正可见词,在数学和代码任务上显著提升。

04:00
arXiv cs.CL

通过自动形式化实现鲁棒的异步规划

提出异步规划基准,CP-SAT形式化器在大规模规划中准确率94%,状态感知修复可恢复至84.5%。

04:00
arXiv cs.CL

迷失于妄想:探究用户妄想与痛苦下的大模型安全

大模型在妄想对话中安全干预被抑制达4.5倍,常规提示无效,需依赖不可靠的妄想分类器才能修复。

04:00
arXiv cs.CL

基于注册表的大型语言模型流水线:跨热带植物、水生物种和异域宠物的证据驱动性状提取

四机制注册表约束LLM流水线实现大规模证据性状提取,高置信度81.57%,验证准确率超90%

04:00
arXiv cs.CL

PolySpeech-100:面向100余种语言和方言的大规模语音理解基准

覆盖110种语言变体,评估22模型:开源E2E优于级联,低资源语言性能差,CoT提示降低理解。

04:00
arXiv cs.CL

混合验证解码:学习在推测解码中分配验证

混合验证解码通过预测缓存草稿接受长度分配验证,在智能体工作流中平均加速2.73倍。

04:00
arXiv cs.CL

DSL-LLaDA:将连续去噪扩展到80亿参数掩码扩散语言模型

轻量适配预训练掩码DLM为连续去噪,低步数摘要性能最优,避开长度-质量权衡。

04:00
arXiv cs.CL

顺序无关语言模型中的解码:链式法则偏差与均匀扩散

发现顺序无关模型的条件非精确因子分解,揭示顺序影响似然;提出基于置信方差的诊断,低方差与正确性一致。

04:00
arXiv cs.CL

ExpWeaver: 通过潜在检索增强生成实现LLM智能体从经验中学习

ExpWeaver框架在潜在空间检索经验,无需RAG模块,12/13任务达SOTA,效率显著。

04:00
arXiv cs.CL

MENTIS: 对齐下的信念变化——测量语言模型中的多尺度潜在扭转

MENTIS框架揭示对齐引起的内部分组变化选择性:规范概念变化更大,扭转与熵负相关,峰值在中后层。

04:00
arXiv cs.CL

LLM评审面板的有限校准区域图

LLM评审面板校准权衡低维堆叠与联合表,关键在于新评审信息在有限人工标签下的可估计性。

04:00
arXiv cs.CL

面向儿童的语音促进婴儿语言模型生成而非理解

面向儿童的语音训练使模型更早生成语法正确补全,理解基准低估其促进作用。

04:00
arXiv cs.CL

PMC-InterCPT: 重新思考生物医学交错数据用于多模态持续预训练

提出PMC-InterCPT语料库,利用正文文本和模态重采样,提升生物医学多模态持续预训练质量。

04:00
arXiv cs.CL

何时0.1%就足够了?分析降维与量化结合对文本嵌入压缩的效果

组合降维与量化可压缩文本嵌入至原大小0.1%且几乎无损,最优策略因任务而异。

04:00
arXiv cs.CL

论自进化语言模型推理的泛化差距

闭环自进化提升有限,内部监督与神谕监督存在显著差距。

04:00
arXiv cs.CL

从异常到错误:基于多参考裁决的巴利-英大语言模型翻译审计

多参考裁决审计LLM翻译,嵌入漂移筛选异常并预测错误严重性,高漂移尾部模型差异显著。

04:00
arXiv cs.CL

MiCU:基于大语言模型的端到端智能家居命令理解

MiCU利用大语言模型与课程学习、强化学习等技术,准确率提升20%,用户纠正率降低1.57%。

04:00
arXiv cs.CL

深度研究作为强化学习的评分准则

DR-rubric通过两阶段(搜索+蒸馏)将评分准则构建转为证据驱动过程,生成可验证约束用于策略优化,仅需少量训练实例即达先进性能。

04:00
arXiv cs.CL

中文标题:经济性思考:大语言模型中自适应复杂度的层次化推理框架

中文摘要:提出HAB框架,通过分层预算分配(问题级深度+步骤级token)优化推理效率,在提升准确率的同时减少计算开销。

04:00
arXiv cs.CL

并非所有解释都能同等模拟:比较语言化特征归因与自生成理由

比较两种解释在反事实模拟中的效果,发现格式和粒度影响预测能力,且效果因模型而异。

04:00
arXiv cs.CL

话语翻转:针对黑盒检索增强生成的间接话语级观点操纵攻击

提出话语级观点操纵攻击,黑盒下通过语义查询网络诱导观点偏移,实验有效且隐蔽,现有防御无效。

04:00
arXiv cs.CL

CA-BED:对话感知贝叶斯实验设计

提出对话感知贝叶斯实验设计框架,结合LLM优化多轮问题选择,成功率提升21.8%,对话轮次仅增1.8。

04:00
arXiv cs.CL

LLM医疗分诊中的隐式地理推断:语言驱动的急诊建议差异

LLM对相同症状的急诊建议因语言而异(0-30%),源于语言隐含的地理推断,而非翻译质量。

04:00
arXiv cs.CL

低资源场景下的安全失效是行动失效,而非表征失效

低资源安全失败源于行动而非表征,仅用少量样本重校决策阈值即可修复。

04:00
arXiv cs.CL

理解多目标跨语言摘要中的LLM行为

提出新基准,发现翻译与摘要行为在后期层联合出现,利用英文摘要激活引导方法提升多目标跨语言摘要质量。

04:00
arXiv cs.CL

基于意图感知检索与语义保留分块的高效RAG

提出InSemRAG框架,结合意图感知检索与语义保留分块,利用小模型降低延迟,显著提升多跳和证据敏感任务性能。

04:00
arXiv cs.CL

连点成线:长程对话中的反思记忆基准测试

提出反思记忆基准RefMem-Bench及渐进框架REMIND,推动模型从表面检索转向深层推理。

04:00
arXiv cs.CL

解锁潜在推理的黑箱:一种可解释性引导的干预方法

本文利用可解释性引导干预,无需参数更新即提升潜在推理准确性。