10073 条条目 · 106 个活跃源
2026年7月20日
04:00
arXiv cs.CL

SkillCorpus:整合与评估面向真实世界LLM智能体的开放技能生态系统

SkillCorpus框架整合筛选96k技能,提升LLM智能体任务性能,最大提升7.5个百分点。

04:00
arXiv cs.CL

行动之前:面向前瞻假设发现的LLM基准测试

提出PHD与HypoArena基准,评估LLM自主构建可检验假设的能力,实验显示模型能力分层。

04:00
arXiv cs.CL

EpiNarrate:从流行病学情景预测中生成基于事实的叙事

通过分离数值推理与文本生成,实现事实准确、覆盖全面的流行病报告自动撰写。

04:00
arXiv cs.CL

可言语表征形成语言模型中的全局工作空间

语言模型存在类似意识访问的全局工作空间,可揭示未言明思维与不对齐,后训练安装助手视角。

04:00
arXiv cs.CL

VarRate:面向长上下文大语言模型的无训练可变速率KV缓存压缩

VarRate通过无训练分配可变低秩预算保留所有token,在20%压缩下精度近无损。

04:00
arXiv cs.CL

多方对话中的指向结构:从离散标签到连续层级

本文提出话语指向是连续现象,连续层级模型比离散标签更优预测听众行为。

04:00
arXiv cs.CL

扩散语言模型的自适应多步前瞻解码

提出AdaLook自适应前瞻框架,动态评估候选分数方差,避免无效深度展开,提升扩散语言模型解码效率与精度平衡。

04:00
arXiv cs.CL

过程奖励引导的树形展开策略实现高效多轮强化学习

PATR利用过程反馈指导树形展开,减少无效采样,在SWE-Bench和FrozenLake上分别提升5.0和9.3点。

04:00
arXiv cs.CL

善始善终:面向压缩推理的自举迭代自推理蒸馏方法

BIRD通过两阶段自推理蒸馏,先采样简洁解SFT,再on-policy蒸馏,提升准确率并大幅压缩推理长度。

04:00
arXiv cs.CL

CAMMAR:面向隐喻阿拉伯语表示的文化感知套娃框架

提出CAMMAR框架,通过嵌套词法、文化、隐喻子空间表示,几何度量检测隐喻,监督下AUC达0.84。

04:00
arXiv cs.CL

自然语言理解中上下文语义相关性追踪fMRI BOLD反应

研究揭示,自然语言理解时上下文语义相关性比词概率预测误差更显著预测fMRI反应,支持语义整合模型。

04:00
arXiv cs.CL

BayesPO:基于并行退火梯度引导的离散MCMC的贝叶斯提示优化

BayesPO将提示优化视为贝叶斯后验采样,用梯度引导离散MCMC和并行退火提升准确率,但有过拟合和计算昂贵问题。

04:00
arXiv cs.CL

基于MLIR的大型语言模型编译方法

提出基于MLIR的LLM编译方法,通过TopOp和TpuOp两层方言及三阶段编译,高效部署多种生成式模型与量化格式。

04:00
arXiv cs.CL

Conditional Reliability of Toxicity Signals for Multilingual and Code-Mixed Abuse Detection

04:00
arXiv cs.CL

形式语义结构能解释多少人类标注变异?:NLI中的群体级效应与项目级上限

形式语义结构仅解释少量标注熵差异,群体效应显著但项目层面解释弱,且未改变分歧类型。

04:00
arXiv cs.CL

双向归纳:掩码扩散语言模型中上下文学习的机制分析

扩散语言模型通过双向归纳电路实现上下文学习,左右可见时性能更强,并隐式利用掩码比例作为时间步。

04:00
arXiv cs.CL

DECODEM:通过增强方法从公司组织文档中提取数据

提出DECODEM基准,评估LLM自动提取公司治理变量,高精度可行但性能因变量而异,先进模型可提取复杂法律信息。

04:00
arXiv cs.CL

从貌似合理到切实可行:LLM自我解释的立场

主张LLM自解释虽合理性与忠实性存疑,但具高度可操作性,评估应扩展至可操作性。

04:00
arXiv cs.CL

成本高效的生成式AI摘要用于教育评估中可扩展的自动作文评分

提出生成式AI摘要框架改进长作文评分,GPT-5 mini一致性最佳,但复杂作文摘要质量下降。

04:00
arXiv cs.CL

前沿语言模型难以完成复制任务:文本在二维空间中更利于观察

提出2D-RoPE,将文本组织成二维网格,通过固定列偏移实现完美复制,解决前沿语言模型复制困难问题。

04:00
arXiv cs.CL

CoWeaver:面向混合人机科学协作的双向、可学习、可解释匹配引擎

CoWeaver通过双向可学习匹配及探索-利用机制,高效匹配科学家,多数任务优于基线。

04:00
arXiv cs.CL

前沿AI在商业学科中的表现:基于案例的知识工作与分析推理基准

构建商业案例基准BusinessCaseBench,测试AI分析性知识工作,前沿模型表现高且提升快。

04:00
arXiv cs.CL

控制L2英语口语自动评分器中的隐式捷径依赖

提出新训练准则,减少评分器对隐式捷径的依赖,使评分更接近人类参考。

04:00
arXiv cs.CL

ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证

ToolSciVer通过三种类型视觉工具和GRPO训练,实现多模态科学声明验证,性能优于基线方法。

04:00
arXiv cs.CL

语言编码的速率-效用前沿:在受控语言内容下比较词元、字节和像素

控制内容与容量,比较词元、字节、像素编码,发现无编码全面占优,选择取决于任务和容量。

04:00
arXiv cs.CL

隐藏于思维:可迁移的思维链痕迹引发有害行为

研究揭示有害思维链痕迹可在模型间转移,蒸馏为通用越狱攻击,对强对齐模型提升10倍效果。

04:00
arXiv cs.CL

循环Loopie!

Loopie是迄今最强循环Transformer,MoE架构突破性能瓶颈,无工具获IMO/IPhO金牌。

04:00
arXiv cs.CL

基于BERT的候选注意力对话状态跟踪

提出基于BERT的零样本多域对话状态跟踪框架,无需额外训练即可适应新领域,性能大幅领先基线。

04:00
arXiv cs.CL

学会记忆:基于混合邻居归纳记忆的半参数模型中的可扩展持续学习

用可学习混合邻居归纳记忆替代静态存储,整合注意力与FFN,实现半参数模型的可扩展持续学习。

04:00
arXiv cs.CL

基于推测词汇表的推测解码

SpecVocab动态选择词汇子集,提升推测解码效率,吞吐量较EAGLE-3提升8.1%。

04:00
arXiv cs.CL

AI水印证据未能满足取证准备要求:一项实证评估

三种LLM水印方法经同义改写后几乎全部失效,假阴性率高,不满足法庭证据标准。

04:00
arXiv cs.CL

HCIG:面向多模态讽刺与网络霸凌检测的层次化跨模态不一致性图网络

提出HCIG和GCCN模型,通过层次化跨模态不一致图网络实现多模态讽刺与霸凌检测,在基准数据集上取得最优性能。

04:00
arXiv cs.CL

理解从预训练到后训练中的推理

预训练损失可预测强化学习后性能,强化学习在难题上挖掘监督微调未现的正确动作,规律跨域适用。

04:00
arXiv cs.CL

通过机制可解释性分析微调大语言模型中的道德偏见

微调LLM学会道德偏见(Knobe效应),可定位至特定层,仅修正少数层即可消除该偏见,无需重训。

04:00
arXiv cs.CL

主动观察者测试

ActiveVision测试表明,当前多模态大模型主动视觉观察能力薄弱,顶尖模型仅解决10.6%任务,远逊于人类96.1%。

04:00
arXiv cs.CL

潜在融合越狱:混合有害与无害表征诱导LLM不安全输出

提出LFJ方法,混合有害与无害表征实现94.13%白盒攻击成功率,针对性对抗训练可降至12.37%。

04:00
arXiv cs.CL

双焦注意力:协调几何与频谱位置嵌入以实现算法泛化

针对RoPE无法捕捉长程递归结构,提出双焦注意力解耦几何和频谱编码,通过频谱演化训练提升算法泛化。

04:00
arXiv cs.CL

基于Docker化环境的大规模终端智能体轨迹生成

提出TerminalTraj管道,生成5万+已验证终端轨迹,训练模型性能提升高达20%。

04:00
arXiv cs.CL

AI小说悖论

AI依赖小说数据却难生成好小说,因叙事因果、信息重估、多尺度情感三大挑战。

04:00
arXiv cs.CL

从文章到前提:构建PrimeFacts——一种事实核查证据的提取方法与资源

提出PrimeFacts方法,从事实核查文章提取前提证据,大幅提升检索与验证性能。

04:00
arXiv cs.CL

VCG-Bench:迈向统一视觉中心的结构化生成与编辑基准

提出基于mxGraph XML的代码范式与VCG-Bench基准,实现精确图表生成编辑,揭示SOTA视觉语言模型在结构保真度上的挑战。

04:00
arXiv cs.CL

技能应该记住什么?语言模型代理中成本感知技能重写的质量-成本权衡

技能重写需权衡质量与成本,学习策略降总成本7%、代币成本6%,跨模型降14.7%和13.7%,质量不变,视为成本感知知识工程。

04:00
arXiv cs.CL

越狱工坊:从论文到可运行攻击的可复现基准测试

JBF系统将越狱论文自动转为可执行攻击模块,实现高保真复现与标准化基准测试,代码复用率82.5%。

04:00
arXiv cs.CL

KDFlow:面向大语言模型的用户友好且高效的知识蒸馏框架

提出KDFlow,解耦架构融合FSDP2与SGLang,零拷贝传输隐藏状态,支持跨tokenizer蒸馏,实现1.44-6.36倍加速。

04:00
arXiv cs.CL

基于布鲁姆分类法的线性探测:大语言模型认知复杂性的机制可解释性

通过布鲁姆分类法线性探测,发现LLMs认知层次(从记忆到创造)在残差流中线性可分,准确率95%,且前向传播早期即解决认知难度。

04:00
arXiv cs.CL

RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性

提出混合DPO方法,融合NLI信号与验证器分数,提升逻辑性最多6倍,减少对齐税。

04:00
arXiv cs.CL

当困惑度说谎时:面向生成的混合序列模型蒸馏

困惑度评估掩盖生成质量差距,GenDistill证明其误导;最佳方案保留86-90%精度,减75%缓存,提升2-4倍速度。

04:00
arXiv cs.CL

Brain-CLIPLM:面向脑电图到文本解码的语义压缩

提出语义压缩假设,Brain-CLIPLM两阶段框架先恢复语义锚点再重建句子,在ZuCo上达67.6% Top-5准确率。

04:00
arXiv cs.CL

前摄的最小架构是什么?小型Transformer中跨任务的早期不可撤销承诺

小型Transformer中前摄现象:早期不可撤销承诺由任务特定注意力头维持,模板共享但路由不同。

04:00
arXiv cs.CL

排除以纳入:面向医学问答的对比假设检索

提出对比假设检索(CHR),通过生成正负假设抑制硬负样本,医学问答检索性能提升达10.4个百分点。