10213 条条目 · 106 个活跃源
2026年5月22日
04:00
arXiv cs.CL

EntmaxKV: 支撑感知的Entmax注意力解码

EntmaxKV利用entmax精确零点实现支撑感知稀疏解码,大幅减少KV缓存并加速,误差可控。

04:00
arXiv cs.CL

放大而非学习:微调AI文本检测器放大了预训练方向

AI文本检测器放大预训练典型性轴,而非学习新边界;该轴在非母语写作中反转,校准偏移主导微调差异。

04:00
arXiv cs.CL

Value-Gradient Hypothesis of RL for LLMs

04:00
arXiv cs.CL

X-Token:投影引导的跨分词器知识蒸馏

提出X-Token方法,通过稀疏投影矩阵消除分词不匹配,解决未常见词失效和过度保守匹配问题,在多教师蒸馏中性能提升显著。

04:00
arXiv cs.CL

分布偏移下基于词典的可解释性保真度的几何自适应解释器

提出GAE方法,无需梯度更新,通过几何对齐减少分布偏移造成的词典解释器保真度下降。

04:00
arXiv cs.CL

能量门控注意力:谱显著性作为Transformer注意力的归纳偏置

提出能量门控注意力(EGA),用学习到的谱能量门控注意力,使信息密集token获得更多关注,少量参数即提升语言模型性能。

04:00
arXiv cs.CL

LLM时代的规划:构建可靠性与高效性

LLM规划从单次生成转向可验证的符号求解器,实现推理时的高可靠与高效率。

04:00
arXiv cs.CL

Echo:通过用户驱动的精炼从经验数据中学习

Echo框架利用用户对智能体输出的精炼,将原始交互转化为训练信号,持续对齐真实需求,性能接受率从25.7%提升至35.7%。

04:00
arXiv cs.CL

Maestro:层次化模型-技能集成的强化学习编排

提出强化学习编排框架,动态组合专家模型与技能库,以4B参数量超越GPT-5等,泛化至未见模型。

04:00
arXiv cs.CL

Reflecti-Mate:一种通过系统1和系统2思维实现自适应决策支持的对话代理

提出适应个体思维模式的对话代理,促进快慢思考整合,优于基线代理,提供更个性化反思支持。

04:00
arXiv cs.CL

中文标题

5行代码SVD分解LLM权重,揭示训练数据、语义子空间及不当内容,无需模型推理。

04:00
arXiv cs.CL

通过自我调节的模拟规划实现高效智能体推理

提出三系统推理架构(SR²AM),实现高效规划,减少25-95%推理令牌,RL提升规划深度而非频率。

04:00
arXiv cs.CL

From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning

04:00
arXiv cs.CL

生存还是崩溃:数据门控与奖励锚定在自对弈强化学习中的非对称作用

数据门控而非奖励校准是自对弈稳定性的关键约束,严格门控可确保稳定,移除门控后奖励无法挽救。

04:00
arXiv cs.CL

棘轮:一种用于自进化LLM智能体的最小化卫生配方

Ratchet通过四机制管理技能库,使冻结LLM性能提升32.8%,远超无技能基线(+0.2%)。

04:00
arXiv cs.CL

面向边界的安全分类器成员推断攻击

提出边界目标策略,利用低置信度例子放大成员信号,恢复率提升3.5倍,内容过滤无效,噪声可缓解。

04:00
arXiv cs.CL

用于实体跟踪的结构化稀疏注意力,具有次二次序列复杂度

提出块状评估方法,利用注意力稀疏性实现次二次复杂度,在实体跟踪中速度提升达2.4倍且精度不变。

04:00
arXiv cs.CL

Epicure:探索食材嵌入中涌现的几何结构

提出Epicure家族多语言食材嵌入,通过混合共现与化合物图游走,在化学与食谱上下文间取得平衡。

04:00
arXiv cs.CL

通过灵活术语定义表示语境变化

认知语言学应用于术语定义,提出灵活定义反映语境变化,实证分析三种现象并给出构建指南。

04:00
arXiv cs.CL

AnyMo:几何感知、不受设备设置影响的野外人体运动建模

AnyMo通过物理模拟和图形编码,实现与设备设置无关的人体运动建模,显著提升零样本识别、跨模态检索和运动字幕任务性能。

04:00
arXiv cs.CL

双奖励胜于单奖励:一种无崩溃的多奖励RLIF训练框架

提出双互补内部奖励与正则化的多奖励RLIF框架,避免熵崩溃,性能接近监督RLVR。

04:00
arXiv cs.CL

Search-E1:自蒸馏驱动搜索增强推理中的自我进化

Search-E1仅用GRPO和离线自蒸馏实现自我进化,无需外部监督,在7个QA基准上超越开源基线。

04:00
arXiv cs.CL

多任务放射学报告生成中的双重困境:梯度动力学分析与解决方案

提出CAME-Grad优化器,解决线性标量化导致的梯度漂移与衰减困境,在多种方法上平均提升临床性能约2%。

04:00
arXiv cs.CL

扩散理论教程:从微分方程到扩散模型

从微分方程视角讲解扩散模型,涵盖前向/逆向过程、分数匹配训练、采样方法及DDPM/DDIM与SDE/ODE关系。

04:00
arXiv cs.CL

AMEL:累积消息对大语言模型评判的影响

AMEL发现LLM评判受历史偏向,负向偏误更重,建议每项独立上下文。

04:00
arXiv cs.CL

超越声学情感识别:基于LLM和声学情感模型的政治演讲多模态悲情分析

LLM多模态分析比纯声学模型更有效捕获政治演讲情感;Gemini效价与悲情评分强相关(ρ=0.664),声学模型不相关。

04:00
arXiv cs.CL

SpaceDG:在视觉退化下评测空间智能

首个退化感知空间理解基准,揭示多模态大模型视觉退化下空间推理鲁棒性差,微调可提升至超人水平。

04:00
arXiv cs.CL

向量策略优化:训练多样性以改进测试时搜索

VPO算法通过训练多样化解并利用向量奖励,显著提升测试时搜索性能,尤其随搜索预算增加优势扩大。

04:00
arXiv cs.CL

MAP4TS:面向大型语言模型时间序列预测的多视角提示框架

提出MAP4TS框架,融合经典时间序列分析于提示设计,通过多视角提示和跨模态对齐模块,显著提升预测性能。

04:00
arXiv cs.CL

用全科医学基准评估大型语言模型的临床能力

提出GPBench基准评估LLM,发现现有模型不适合自主全科医疗,需人类监督与优化。

04:00
arXiv cs.CL

内部叙事参数化情感状态

内部叙事的结构和动态可量化情感状态,预测抑郁评分,叙事变化驱动情感改变,基线严重度预测后续波动。

04:00
arXiv cs.CL

框架入,框架出:衡量LLM生成新闻摘要中的框架偏差

首个大规模基准FIFO揭示:LLM摘要框架率高于人类,科学和健康类尤甚,框架偏差成摘要质量新维度。

04:00
arXiv cs.CL

基于无模型推测采样的加速测试时扩展

提出STAND无模型推测解码法,利用推理轨迹冗余加速测试时扩展,降低延迟60-65%且不损精度。

04:00
arXiv cs.CL

MTR-Bench:多轮推理评估的综合基准

提出MTR-Bench基准,含4类40任务3600实例,全自动评估,揭示大模型在多轮交互推理上表现不足。

04:00
arXiv cs.CL

面向问答的实体链接代理

提出基于大语言模型的实体链接代理,模拟人类认知流程,解决短问题实体链接难题,实验验证有效。

04:00
arXiv cs.CL

LightReasoner:小语言模型能教会大语言模型推理吗?

利用强弱模型差异,LightReasoner通过关键推理时刻采样与微调,大幅提升大模型推理性能,资源消耗降低90%以上。

04:00
arXiv cs.CL

StructSense: 任务无关的智能体框架,用于结构化信息提取,集成人在回路评估与基准测试

StructSense框架通过本体引导、智能体自评估和人在回路验证,实现高精度结构化信息提取,跨任务通用。

04:00
arXiv cs.CL

RAGCap-Bench:基于智能体的检索增强生成系统中大语言模型能力基准测试

RAGCap-Bench评估智能体RAG中LLM的中间推理能力,实验表明增强该能力可提升端到端效果。

04:00
arXiv cs.CL

训练轨迹感知的令牌选择

提出T3S方法,解决蒸馏中模仿锚令牌与待学令牌不共存问题,仅用少量示例即显著提升推理性能。

04:00
arXiv cs.CL

MemEvoBench:评估LLM智能体记忆误进化的安全风险基准

首个评估LLM智能体长期记忆安全基准,发现记忆误进化导致安全退化,静态防御不足。

04:00
arXiv cs.CL

SimCT: 恢复跨分词器策略蒸馏中丢失的监督

SimCT用共享token加短多token延续恢复跨分词器蒸馏丢失的监督,提升数学推理与代码生成性能。

04:00
arXiv cs.CL

修复结构瓶颈:通过显式信息传输进行上下文压缩

ComprExIT通过自适应跨层特征选择和全局协调传输解决压缩的结构瓶颈,性能提升18.5%,参数仅增1%。

04:00
arXiv cs.CL

超越基准孤岛:面向自主AI的代表性可信度评估

定义自主AI可信度五属性,提出HAAF评估框架,通过分布感知采样与跨模型迁移实现代表性评估。

04:00
arXiv cs.CL

中文标题:迈向真实世界人类行为模拟:在长期、跨场景、异质行为轨迹上基准测试大型语言模型

中文摘要:提出首个真实数据用户模拟基准OmniBehavior,揭示LLM存在结构性偏差,丢失个体差异及长尾行为。

04:00
arXiv cs.CL

当大语言模型不再遵循步骤:语言模型中程序执行的诊断研究

LLM执行程序时随步骤增多准确率骤降,存在缺失、过早、自我修正、未执行和幻觉,忠实执行薄弱。

04:00
arXiv cs.CL

TingIS:企业级规模下从嘈杂客户事件中实时发现风险事件

TingIS多阶段事件链接引擎结合LLM,从噪声客户事件中实时发现风险,延迟3.5分钟,发现率95%。

04:00
arXiv cs.CL

UniSD:面向大型语言模型的统一自蒸馏框架

提出UniSD统一自蒸馏框架,集成多教师一致性、EMA稳定、对比学习等机制,在多个LLM上性能显著提升,比基线高5.4分。

04:00
arXiv cs.CL

SpecBlock: 块迭代式推测解码与动态树草稿

SpecBlock通过块迭代与动态树草稿,兼顾路径依赖与低开销,比EAGLE-3加速8-13%,草稿成本降低一半以上。

04:00
arXiv cs.CL

DocAtlas:跨越80多种语言的多语言文档理解

DocAtlas构建覆盖82种语言的高保真OCR数据集,通过双流水线产生精确结构注释,无需学习模型,DPO适配多语言,最佳变体提升1.7%。

04:00
arXiv cs.CL

使用语义级奖励校准大语言模型

CSR框架在语义空间直接校准模型,无需置信度接口,ECE降低40%、AUROC提升31%。