10213 条条目 · 106 个活跃源
2026年5月20日
04:00
arXiv cs.CL

DECOR:通过信息操纵理论审计大语言模型欺骗行为

DECOR框架分解信息单元并多维度评分,生成可解释操纵图谱,高效检测大模型欺骗。

04:00
arXiv cs.CL

FormalASR:端到端中文口语到正式文本转换

提出端到端模型FormalASR,直接转换中文口语为正式文本,CER降低37.4%,无需后处理LLM,轻量部署。

04:00
arXiv cs.CL

OpenCompass:大语言模型通用评估平台

提出OpenCompass一站式通用LLM评估平台,支持多领域基准,实现高效并发评估。

04:00
arXiv cs.CL

解释之困:跨语言解释中合理性与忠实性的权衡

跨语言解释中,英语解释合理但忠实性差(降5.7倍),建议用输入语言审计并报告多维度忠实性指标。

04:00
arXiv cs.CL

推理是必要且充分的吗?微调大语言模型实现可解释虚假信息检测

提出LONSREX管道,量化验证步骤贡献以精炼推理,解决理由不足或多余问题。

04:00
arXiv cs.CL

LambdaPO:面向推理语言模型的Lambda风格策略优化

LambdaPO通过成对偏好比较和语义密度奖励,从轨迹组中挖掘细粒度信号,提升推理模型性能。

04:00
arXiv cs.CL

检索增强的语言校准

提出语言置信度分布建模与忠实度散度指标,构建检索增强后处理管道RALC,提升校准与忠实度达66%和58%。

04:00
arXiv cs.CL

A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item Generation

04:00
arXiv cs.CL

HalluWorld:基于参考世界模型的幻觉可控基准

提出基于参考世界公式的可扩建基准,自动生成标签,发现前沿模型感知幻觉近解,但多步追踪和因果模拟仍难,失败模式多样。

04:00
arXiv cs.CL

文档解析器如何失效?文档智能中的结构脆弱性审计

提出结构脆弱性审计框架,发现B-SLR比足迹更能衡量扰动影响,小结构目标扰动同样导致下游任务降级。

04:00
arXiv cs.CL

IMLJD:印度婚姻诉讼分析计算数据集

涵盖3613份印度法院判决,发现最高法院撤销率57.6%高于高等法院39.7%。

04:00
arXiv cs.CL

SciCustom:面向大型语言模型科学能力自定义评估的框架

SciCustom通过本体知识单元与多模型投票共识,从大规模数据自定义构建基准,无需人工标注即可揭示LLM科学能力的细粒度差异。

04:00
arXiv cs.CL

驯服思考者:条件熵塑造实现自适应LLM推理

提出条件熵塑造框架,动态控制响应熵,在简单问题生成简洁解,难问题鼓励深度探索,提升准确率并缩短响应长度。

04:00
arXiv cs.CL

EmbGen: 使用重组语料进行教学

EmbGen分解重组语料生成QA对,在异构数据集上准确率提升最高88.9%。

04:00
arXiv cs.CL

K-量化及其对输出性能的影响

研究8个LLM在2-6比特量化下的性能,发现高精度收益递减,激进量化损失有限,但影响因模型和任务而异。

04:00
arXiv cs.CL

偏离即回溯:缓解大语言模型推理蒸馏中的双重暴露偏差

MOTAB动态监测学生推理,偏离时回溯纠正,缓解双重暴露偏差,提升推理性能约3%。

04:00
arXiv cs.CL

m3BERT: 一个现代、多语言、嵌套式双向编码器

m3BERT通过联合优化层与嵌入维度的预训练策略,实现单模型适配多种资源与精度需求,在工业检索中显著超越现有模型。

04:00
arXiv cs.CL

GoLongRL:面向能力的长上下文强化学习与多任务对齐

开源23K样本覆盖9种长上下文能力,TMN-Reweight优化异构奖励,性能超越闭源数据集。

04:00
arXiv cs.CL

基于理论语言学专家标准的习语性数据驱动方法

分析286个多词表达,基于16项专家标准,发现无绝对习语,词汇标准最关键。

04:00
arXiv cs.CL

优化一切:用于优化任意文本参数的通用API

首个LLM优化系统实现跨六类任务最优,证明文本优化是通用问题解决新范式。

04:00
arXiv cs.CL

LLMEval-Logic:一个求解器验证的、具有对抗性加固的中文大语言模型逻辑推理基准

LLMEval-Logic中文逻辑推理基准含246基础与190困难题,经求解器验证和专家审计,评测14模型最佳准确率仅37.5%。

04:00
arXiv cs.CL

基础模型在AI检测器眼中被视为人类

基础模型文本常被检测器判为人类,HIP迭代释义法有效提升人性化。

04:00
arXiv cs.CL

用于精炼离散扩散语言模型的漂移目标

TokenDrift漂移目标可提升离散扩散模型生成质量,在MDLM和DUO上分别降低Gen.-PPL达89%和86%。

04:00
arXiv cs.CL

探究跨模态技能注入:场景、方法与超参数

研究跨模态技能注入的场景、方法与超参数:指令遵循和跨语言场景表现优,数学推理差,TA和DARE方法最佳,定量分析超参数调优。

04:00
arXiv cs.CL

LP-Eval:衡量法律命题生成质量的评估标准与数据集

LP-Eval评估标准与数据集显示:LLM生成法律命题质量高,但专家评估发现案例时效性影响,且LLM评估缺乏细粒度。

04:00
arXiv cs.CL

基于大语言模型的阿拉伯语金融情感分析:来自沙特市场的证据

针对阿拉伯语金融情感分析挑战,构建多源数据NLP框架,在沙特市场实现可靠可扩展的情感分析。

04:00
arXiv cs.CL

大型语言模型能否可靠纠正低资源ASR中的错误?一项关于西弗里斯兰语的污染感知案例研究

研究用污染感知实验证明LLM生成式纠错可提升低资源弗里斯兰语ASR,最佳结果超越oracle WER。

04:00
arXiv cs.CL

TERGAD:面向图异常检测的结构感知文本增强表示

利用大语言模型将节点拓扑属性转为语义嵌入,与原始特征融合重构,有效检测图异常。

04:00
arXiv cs.CL

CAIT:面向儿童-成人互动的句法分析工具包

基于CHILDES语料库,训练专用依赖解析器,并发布词性标注和结构标注工具,助力大规模语言习得研究。

04:00
arXiv cs.CL

大型语言模型中的数学推理:基准、架构、评估与开放挑战

综述LLM数学推理,涵盖基准、架构与评估,指出推理忠实性等挑战及改进方向。

04:00
arXiv cs.CL

长期病史感知型医疗对话的合成与评估

提出合成长期医疗对话框架,创建数据集MediLongChat,设立三项记忆基准任务,实验显示顶尖LLM仍难应对。

04:00
arXiv cs.CL

社交互动代理中的信任校准:基于LLMs的性别化多模态行为生成研究

LLMs可生成体现能力与善意的多模态行为以校准信任,但存在性别刻板印象,用户研究验证有效性。

04:00
arXiv cs.CL

ContextRAG:免提取层次图构建方法用于检索增强生成

ContextRAG免提取构建图结构,索引仅需30次LLM调用,性能达33.6%F1,成本远低于基线。

04:00
arXiv cs.CL

德语法典的分块策略

研究德国法律文本分块,发现基于结构(章节/分段)的简单方法召回率最高,复杂方法效果不佳,凸显保留领域结构的重要性。

04:00
arXiv cs.CL

重新思考记忆方式:超越原子事实的终身LLM智能体记忆

提出TriMem,维护三种粒度记忆表示,结合提示优化,实现终身记忆进化。

04:00
arXiv cs.CL

奖励信念,而非行动:一致性引导的长期智能体信用分配

ReBel算法通过信念一致性监督和信念感知分组,在部分可观测长期任务中提升成功率20.4%、样本效率2.1倍。

04:00
arXiv cs.CL

CLIF:面向透明瓶颈模型的概念级影响函数

提出概念级影响函数,无需重训即可识别关键样本与概念,恢复模型性能,提升可解释性。

04:00
arXiv cs.CL

工具总是有益的吗?自适应调用工具的双模式多模态大模型推理

提出AutoTool模型,自适应决定是否调用工具,提升准确率21.8%,效率提升44.9%。

04:00
arXiv cs.CL

What Are LLMs Doing to Scientific Communication? Measuring Changes in Writing Practices and Reading Experience

04:00
arXiv cs.CL

基于编码器的语言模型中,作者身份信号出现在哪里?

评分机制决定作者身份信号位置:平均池化集中在前中期层,后期交互则在后期层,造成四倍性能差异。

04:00
arXiv cs.CL

关注音拍:基于正字法意识的日语神经形态生成错误分析

对日语过去式形态生成的错误分析发现,送气音变相关错误占75-80%,且模式高度一致,凸显正字法意识评估的必要性。

04:00
arXiv cs.CL

语言突变维持社交媒体上阴谋论的持续传播

研究表明,语言突变(语义与心理语言学特征)显著延长阴谋论传播寿命,存在简化和同化两种模式。

04:00
arXiv cs.CL

FlexDraft:通过注意力调优与奖励引导校准的灵活投机解码

FlexDraft通过注意力调优和奖励引导校准,实现灵活投机解码,在批量大小变化时避免质量下降与吞吐量崩溃。

04:00
arXiv cs.CL

PromptRad:面向低资源放射学报告标注的知识增强多标签提示微调

提出PromptRad,用提示微调和UMLS知识增强,仅需32例标注即可高效进行放射学报告多标签标注,性能优于传统方法,媲美GPT-4。

04:00
arXiv cs.CL

TIDE:基于I/O感知专家卸载的高效无损MoE扩散大模型推理

TIDE利用专家激活时间稳定性,以I/O感知策略实现无损加速,吞吐量提升1.4-1.5倍。

04:00
arXiv cs.CL

基于强化学习的文本到SPARQL生成:DBLP上的GRPO方法

使用GRPO强化学习训练小模型零样本文本转SPARQL,优于零样本基线,但监督微调更准确。

04:00
arXiv cs.CL

MixRea:评估大语言模型显式与隐式推理能力的基准

受人类“不注意盲视”启发,发现最佳大模型在显隐推理中仅42.8%一致性,提出PRCP方法改善。

04:00
arXiv cs.CL

中文标题

ThoughtTrace首个大规模用户思维数据集,揭示人机对话中隐藏的认知动态,提升行为预测与个性化。

04:00
arXiv cs.CL

BalanceRAG:级联检索增强生成中的联合风险校准

BalanceRAG联合风险校准优化级联RAG阈值,在控制错误率的同时提高覆盖率并减少不必要检索。

04:00
arXiv cs.CL

CopT:面向通用与智能体推理的连续空间对比策略内思考

CopT反转思考与回答顺序,通过连续嵌入对比验证答案可靠性,无需训练,准确率提升23%,token节省57%。