10213 条条目 · 106 个活跃源
2026年6月15日
04:00
arXiv cs.CL

SciDef:用于从科学文献中利用大语言模型自动提取定义的数据集和工具

SciDef套件含定义基准与LLM管道,最强0.397分,覆盖86.4%但过度生成,NLI匹配与人工一致,相关性过滤是关键瓶颈。

04:00
arXiv cs.CL

基于枢轴驱动重采样的LLM强化学习深度密集探索

提出深度密集探索法,通过识别可恢复错误状态进行重采样,双流优化提升数学推理性能。

04:00
arXiv cs.CL

Protean编译器:一种驱动细粒度阶段排序的敏捷框架

提出Protean编译器,内置LLVM细粒度阶段排序,含140+静态特征,平均加速4.1%,支持ML/LLM集成。

04:00
arXiv cs.CL

知进退:大语言模型推理中动态弃权的原则性框架

提出动态弃权形式化分析,基于正则化强化学习,弃权当价值函数低于奖励参数,提升选择性准确率。

04:00
arXiv cs.CL

X-OPD: 用于语音大语言模型能力对齐的跨模态在线策略蒸馏

X-OPD通过跨模态在线策略蒸馏,用文本教师反馈对齐语音LLM能力,显著缩小性能差距。

04:00
arXiv cs.CL

OmniOPD:通过推测验证实现的无对数概率的在线策略蒸馏

OmniOPD用块级语义验证替代token级logit,克服标准OPD局限,数学任务提升28.64%,黑盒教师额外提升9.54%。

04:00
arXiv cs.CL

子令牌路由用于KV缓存压缩

提出子令牌路由,细粒度压缩值向量分组,与令牌级减少互补,降低KV缓存成本。

04:00
arXiv cs.CL

大规模既视感:基于句子变换器嵌入与110万步开放基准的行为驱动软件测试中重复Gherkin步骤的释义鲁棒检测

发布最大跨组织BDD步骤语料库及标注基准,四策略检测器F1可达0.906,估计可消除89万重复步骤。

04:00
arXiv cs.CL

EmoMind:从人脑fMRI解码情感描述

EmoMind直接从fMRI解码情感描述,用34维连续情感向量控制生成,性能优于离散标签GPT-4。

04:00
arXiv cs.CL

高效理由基检索:基于JEPA的生成式重排序器在线策略蒸馏

提出Rabetriever,用JEPA在线蒸馏重排序器,独立编码实现跨文档理解,复杂度从二次降至线性,性能优于基线。

2026年6月12日
04:00
arXiv cs.CL

EDEN:意大利语临床笔记大规模语料库

EDEN语料库含400万份意大利急诊临床笔记,6000份经专家标注132项内容,助力大语言模型医疗应用。

04:00
arXiv cs.CL

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

04:00
arXiv cs.CL

基于智能体的形态交替模式演化模型

用多智能体模拟形态交替,AI历史语言学家评估发现无标度网络和随机伯努利采纳利于逼真形态。

04:00
arXiv cs.CL

MARD:面向机制级药物-药物相互作用预测的镜像增强推理蒸馏

MARD-7B通过镜像增强推理蒸馏实现机制级DDI预测,准确率超越GPT-4o 6.7%,成本仅1%。

04:00
arXiv cs.CL

购物推理基准:专家编写的多轮对话购物助手基准

专家编写525个任务评估多轮购物对话推理,模型通过率57-77%,多轮任务表现差,揭示专家级能力的不足。

04:00
arXiv cs.CL

基于波斯谚语条件的故事生成:大语言模型中的约束语义解压缩

研究发现LLMs在波斯谚语故事生成中存在解压缩差距:表面流畅但未能忠实体现深层道德因果结构,显式推理可部分缓解。

04:00
arXiv cs.CL

AfriSUD:面向非洲语言模型评估的依存树库集合

首个覆盖9种非洲语言的大规模句法树库,评估模型发现显著语法鸿沟。

04:00
arXiv cs.CL

MentalMARBERT:领域自适应预训练与两阶段微调用于阿拉伯语心理健康障碍检测

MentalMARBERT经领域自适应预训练和两阶段层级微调,在阿拉伯语心理健康检测中达宏F1 0.861、准确率0.877,效果显著。

04:00
arXiv cs.CL

Observable Patterns Are Not Explanations: A Causal-Geometric Analysis of Latent Reasoning Models

04:00
arXiv cs.CL

AI审稿人是否看到了全貌?攻击与防御多模态同行评审

提出PaperGuard基准,首次系统评估多模态AI审稿安全性,发现其普遍易受攻击。

04:00
arXiv cs.CL

RAG基准测试应多细致?一个用于合成问题生成的分层框架

提出HieraRAG框架,通过多维度合成QA对评估RAG基准测试粒度,发现不同维度最优粒度不同,并引入一致性比率指标。

04:00
arXiv cs.CL

LLMs Can Better Capture Human Judgments--With the Right Prompts

04:00
arXiv cs.CL

Rigel:逆向工程Apple M4 Max GPU上的Metal 4.1张量计算路径

Rigel揭示Metal 4.1 fp8 matmul2d为模拟非加速,执行于GPU着色核,累加精度≥fp32,并重构了隐藏的8x8张量片段布局。

04:00
arXiv cs.CL

GENIE:一种细粒度新颖性度量方法

提出细粒度新颖性指标GENIE,在任务特征上量化模型输出新颖性,优于整体指标,可评估缓解方法效果。

04:00
arXiv cs.CL

检测、重掩码、修复:面向演化上下文忠实摘要的扩散编辑

提出DETECT-REMASK-REPAIR扩散框架,检测并修复过时摘要区域,实现高效可控的忠实摘要更新。

04:00
arXiv cs.CL

SafeLLM:在安全关键场景中,抽取作为抗幻觉的改写替代方案

评估抽取式抗幻觉RAG,行号选择策略最优,召回达95%且对齐源文本,安全策略精度高但存在遗漏。

04:00
arXiv cs.CL

LoHoSearch:超越人类难度上限的长程搜索智能体基准测试

LoHoSearch基准通过知识图谱自动生成544个高难度问题,突破人类难度上限,最强模型仅34.7%准确率。

04:00
arXiv cs.CL

小型LLM用于生物医学声明验证:经济微调、数据集结构捷径与跨领域泛化

通过QLoRA微调小型LLM,Mistral-7B以极低成本超越GPT-4o,并揭示数据集结构伪影影响性能。

04:00
arXiv cs.CL

定位语言模型中的锚定通路

本研究通过电路定位发现,锚定效应由边缘级通路更忠实地携带,通路在模型内共享但跨微调变体迁移不稳定。

04:00
arXiv cs.CL

面向聊天机器人微调的直接偏好优化:一项实证研究

DPO微调LLM简化训练、提升效率,性能具竞争力,但存在训练不稳定需进一步研究。

04:00
arXiv cs.CL

PiDA:基于语音信息的数据增强以实现鲁棒的越南语语音翻译

PiDA通过生成语音相似词替换增强数据,提升越南语语音翻译鲁棒性,BLEU最高提升2.04。

04:00
arXiv cs.CL

SkillChain:为基于图像的电商AI助手实现技能演化闭环

SkillChain通过自动化技能创建、路由优化与迭代精炼,显著提升电商图像助手的响应质量及用户参与和留存。

04:00
arXiv cs.CL

Polar:评估大语言模型政治偏见的基准

提出Polar基准,通过多项选择题测量大语言模型政治偏见,发现偏见随政治语境和语言变化。

04:00
arXiv cs.CL

LEDGER:面向金融检索与抽取的企业年报长上下文基准

提出LEDGER基准,包含4999份年报的财务KPI检索与提取任务,提供完整工具链及市场影响分析。

04:00
arXiv cs.CL

无需隐藏提示!仅通过呈现方式的修改即可欺骗AI同行评审

仅修改论文呈现方式即可让AI审稿人给出更高评分,成功率75.1%,揭示AI评审易被呈现优化误导。

04:00
arXiv cs.CL

X-MADAM-RAG:诊断和处理检索增强生成中的中英文证据冲突

提出中英文证据冲突基准与管道,受控测试准确率高,但抗模板和自然检索鲁棒性不足。

04:00
arXiv cs.CL

上下文碎片化场景下的多轮推理:可扩展分片与记忆增强强化学习

利用低成本分片数据训练记忆增强模型,通过紧凑滚动记忆缓解多轮推理信息碎片化导致的精度下降,并零样本泛化。

04:00
arXiv cs.CL

SENTINEL:基于失败驱动的强化学习训练工具使用语言模型代理

SENTINEL通过失败驱动强化学习,将模型失败转化为针对性训练任务,提升工具使用语言模型代理性能。

04:00
arXiv cs.CL

PRISM:韵律整合的多智能体共情口语对话推理框架

PRISM多智能体框架通过韵律-语言翻译与外部知识工具,提升共情口语对话的韵律适当性和响应质量。

04:00
arXiv cs.CL

sebis在2026年CRF填充任务:两阶段本地大语言模型流程用于医疗CRF填充

本地两阶段LLM流程实现医疗CRF填充,宏F1达0.55,在本地开源中排第二,兼顾隐私保护与性能。

04:00
arXiv cs.CL

M\"OVE:面向德国公共部门的全面大语言模型基准

德国公共部门LLM综合基准MÖVE,评估39模型性能与治理,结果显示无模型全优。

04:00
arXiv cs.CL

NaturalFlow:同时语音翻译中减少破坏性停顿以保持自然语音流

通过模型内部信号减少块间静默,在低延迟与自然流畅间取得平衡。

04:00
arXiv cs.CL

G-Long:面向高效长期对话代理的图增强记忆管理

提出G-Long框架,用小语言模型和注意力评分机制,实现高效长期对话记忆,性能提升且计算成本低。

04:00
arXiv cs.CL

SICI:一种语义-语用复杂度指数揭示大语言模型立场检测中的相变

SICI七维指标揭示LLM立场检测错误随复杂度递增呈三阶段相变:低复杂度过度归因,高复杂度集中无态度,强模型仅移动边界。

04:00
arXiv cs.CL

EvoBrowseComp:面向演化知识的搜索代理基准测试

提出动态基准EvoBrowseComp,通过实时网页合成无污染复杂问题,评估搜索代理真实检索能力。

04:00
arXiv cs.CL

NTS-CoT:利用思维链推理减轻基于大语言模型的新闻时间线摘要中的幻觉

提出NTS-CoT框架,通过元素提取、日期选择和因果推理,有效减轻新闻时间线摘要的幻觉。

04:00
arXiv cs.CL

HyPE:面向角色对话的类别感知超图编码与持久边嵌入

HyPE用超图建模角色属性,结合持久边嵌入,在多个模型上提升对话一致性。

04:00
arXiv cs.CL

MemRefine:基于LLM引导的长期智能体记忆压缩

提出MemRefine框架,用LLM引导在预算内压缩长期记忆,消除冗余,保持性能。

04:00
arXiv cs.CL

一个面向Reddit生物伦理争议中立场检测的上下文感知数据集

BioStance数据集含39600条Reddit生物伦理讨论标注对,三人标注三类立场,可靠性高,支持立场检测研究。

04:00
arXiv cs.CL

LAUKIN:一个跨司法管辖区的普通法合同数据集

LAUKIN数据集覆盖澳、英、印三地普通法合同条款对,标注法律等价性,基准测试最高F1为65.11%,揭示跨辖区分类挑战。