9916 条条目 · 106 个活跃源
2026年8月20日
04:00
arXiv cs.CL

ConspirED:阴谋论认知特征数据集与大型语言模型安全性

CONSPIRED数据集捕获阴谋论认知特征,用于建模识别及评估大模型安全隐患。

04:00
arXiv cs.CL

LLM推理中离线强化学习的未来策略近似

提出未来策略近似方法,用未来策略估计重加权梯度,解决推理中梯度纠缠,超过离线基线,逼近在线强化方法且算力低。

04:00
arXiv cs.CL

MedStruct-S:面向OCR临床报告的键发现、键条件问答与半结构化抽取基准

提出含3582页标注的基准,评测未知键与噪声下三类任务,发现编码器在非空键问答最优,调优解码器整体最强。

04:00
arXiv cs.CL

倾听还是阅读?评估思维链语音到文本翻译中的语音感知

研究发现思维链在语音翻译中主要依赖转录而忽视语音,简单训练干预可增强鲁棒性,需明确整合声学信息。

04:00
arXiv cs.CL

可重复性不等于恢复:量化潜在狄利克雷分配中的算法稳定性与主题恢复

主题模型重复运行稳定不代表正确恢复真实主题,应区分评估稳定性与准确性,并用多重标准验证。

04:00
arXiv cs.CL

何时称苹果为红:人类遵循内省规则,VLM却不遵守

研究显示,视觉语言模型常违背自述规则,而人类保持一致,挑战其可靠性。

04:00
arXiv cs.CL

KA2L:面向大语言模型的知识感知主动学习框架

KA2L通过潜在空间分析评估模型知识掌握,生成未知问题聚焦未掌握知识,减少50%标注与计算成本并提升性能

04:00
arXiv cs.CL

大型语言模型的自我改进:技术综述与未来展望

综述大模型自我改进,提出数据获取、选择、模型优化、推理优化与自主评估的闭环框架,并展望未来。

04:00
arXiv cs.CL

信息论驱动的传播去噪与融合框架用于假新闻检测

针对合成传播数据不可靠问题,提出信息论框架InfoPDF,通过互信息目标去噪、融合真实与合成传播,提升假新闻检测性能。

04:00
arXiv cs.CL

预测开放域问答中检索增强的收益

预测检索增益,用检索信号、答案特征及LLM内部状态构建预测器,动态选择是否检索,提升答案质量。

04:00
arXiv cs.CL

干草堆中的越狱

提出NINJA越狱法:将良性内容附加于有害目标,利用位置效应提升攻击成功率,低资源、可迁移、计算最优。

04:00
arXiv cs.CL

鞑靼斯坦地名:面向地理空间问答的双语数据集与混合RAG系统

构建俄鞑双语地名数据集及混合检索问答系统;混合检索与抽取式阅读器显著优于基线,性能优异。

04:00
arXiv cs.CL

SkillNet:创建、评估与连接AI技能

提出SkillNet基础设施,统一技能创建与评估,含60万技能,提升奖励40%,减少30%执行步骤。

04:00
arXiv cs.CL

LACONIC:通过两阶段训练课程实现可扩展稀疏检索的稠密级效果

提出基于Llama3的LACONIC稀疏检索模型,两阶段训练后8B版在MTEB达60.2 nDCG@10,比稠密模型省74%内存,CPU上高效。

04:00
arXiv cs.CL

智能体如何在自动科研中失败:对100项真实前沿科研任务的端到端诊断评估

新基准评估百项前沿任务,总结45种失败模式,核心缺陷为智能体缺乏元认知循环。

04:00
arXiv cs.CL

Key Coverage Matters: Semi-Structured Extraction of OCR Clinical Reports

04:00
arXiv cs.CL

重建:从发表前参考文献中恢复研究想法的盲基准

重建基准仅用发表前参考文献恢复想法防泄漏前沿模型匹配率3-15%多智能体提升至23-42%约2.4倍

04:00
arXiv cs.CL

从序列到结构:面向LLM智能体的关系不确定性传播

用轨迹图传播不确定性,建模步骤间依赖,提升大语言模型智能体轨迹级不确定性量化与早期失败检测。

04:00
arXiv cs.CL

音频语言模型为何难以利用多模态上下文进行构音障碍语音识别

基准测试显示现有模型无法利用临床提示;带提示微调使词错率降至零点零六六,相对降五成二,唐氏及轻症者获益。

04:00
arXiv cs.CL

神经符号具身智能体

提出神经符号智能体,分解长程家务任务,结合视觉探索与约束规划,计划可执行,成功率超90%。

2026年8月19日
04:00
arXiv cs.CL

不确定感知的多模态大语言模型决策

多模态大模型的不确定性与决策紧密相关,需校准风险并指导系统行为,而非仅看置信度数值。

04:00
arXiv cs.CL

迈向更安全的RAG:仅具备系统2思维能力的智能体方可访问不可信文档

提出改进安全原则:仅具备系统2深思推理的智能体可访问不可信文档,避免严格隔离开销,实证显示推理模型更稳健。

04:00
arXiv cs.CL

多语言嵌入空间结构没有理论上的多语言诅咒

证明完美多语言所需维度随语言数仅对数增长,即嵌入空间无理论诅咒,实证诅咒源于数据与训练。

04:00
arXiv cs.CL

字形非字母,词元非单词,空白非空格:伏尼契文的单位不是什么

伏尼契文的字形、词元、空白均非所假设的字母、单词、词间空格;规律在词元边缘而非词序。

04:00
arXiv cs.CL

跨模型记忆迁移:目标侧读取器适配

跨模型记忆迁移中,目标侧读取器适配是关键;兼容读取器下冻结记忆可复用,适配可进一步提升性能。

04:00
arXiv cs.CL

面向脑-语言对应的边际正则化结构化语义对齐

提出MD-SigLIP,边际正则化结构化语义对齐脑与语言,建模多正例排序,实现检索解码最优。

04:00
arXiv cs.CL

语音与面部情感:多模态基础模型中的共享情感机制

研究发现多模态模型中的语音和面部情感识别共享部分稀疏神经元,且跨模态干预可双向迁移。

04:00
arXiv cs.CL

机构特定的大语言模型提示可恢复去标识化系统及其金标准均遗漏的受保护健康信息

机构特定的大模型提示可恢复去标识化系统及金标准遗漏的健康信息,平衡精确率与召回率,并审计参考标准。

04:00
arXiv cs.CL

儿童在词汇学习中呈现加速回报,语言模型则不然

儿童词汇学习加速累积:每单位语言经验收益递增;语言模型无此加速,只有恒定回报,数据需求高多个数量级。

04:00
arXiv cs.CL

基础智能体与智能体式深度研究:基于证据的临床代码预测

新系统融合基础模型与深度研究预测ICD,两数据集精确率/召回率提升,医生评其检索证据更有用。

04:00
arXiv cs.CL

Q-干涉:内存高效的相位感知量子启发注意力

提出相位感知Q-Interference注意力,用三角分解避免大张量,内存高效且适配GPT。

04:00
arXiv cs.CL

哪个来源胜出?视觉语言模型中随任务变化的信源依赖

视觉语言模型对图文依赖随任务而变:算术任务更依赖文本,图表冲突更依赖图像。

04:00
arXiv cs.CL

ArguLens:用于自动作文评分和标签感知反馈生成的开源系统

提出开源本地可部署的作文评分系统,分解为三组件,评分QWK达0.813,并生成标签感知反馈。

04:00
arXiv cs.CL

金融新闻NLP中的时间泄漏:多架构审计与特定时期并购信号

随机划分使金融新闻NLP性能虚高至6.5倍,时间顺序下仅并购信号有效,建议将泄漏审计设为基准强制要求。

04:00
arXiv cs.CL

Polaris:从检索反馈中学习生成表格描述

利用检索反馈构造偏好对,用直接偏好优化微调大语言模型生成表格描述,显著提升检索效果,超越现有最优。

04:00
arXiv cs.CL

《情节变薄:文学摘要中的均匀性与线性》

构建150部小说摘要-章节映射数据集,发现归因困难;衡量线性和均匀性,揭示文学与摘要情节表达差异。

04:00
arXiv cs.CL

分词与语言建模联合优化时会学到怎样的词元?

联合优化分词可改变词元结构;免分词方法兼顾上下文与计算效率,降低困惑度,性能媲美传统方法。

04:00
arXiv cs.CL

AI安全助手框架:持续改进公路施工安全

提出基于大语言模型的公路施工安全分析框架,分类事故叙述并检索历史事故,提升作业安全分析效率。

04:00
arXiv cs.CL

多智能体AI工作流中的Token优化与上下文窗口管理

提出多智能体工作流令牌优化与上下文管理框架,含六种模式,削减延迟与令牌成本,并发现相关性对比上下文提升效果。

04:00
arXiv cs.CL

大语言模型能否进行具有法律意义的推理?——基于欧洲人权法院案例的小规模研究

大模型法律推理结构完整但实质浅薄;AI评委可靠但替代不了人工;专家提示更全面但预测未更准,准确率不能衡量推理。

04:00
arXiv cs.CL

多语言大语言模型生成文本中的翻译腔研究

探究多语言大模型生成文本是否带有翻译腔,并分析其与直接翻译产生的翻译腔的差异。

04:00
arXiv cs.CL

从实体提及到语气:基于LLM的媒体偏见分析流程

提出LLM媒体偏见分析流程:话题聚类、实体情感标注、来源比较,在阿尔巴尼亚新闻验证,适合资源有限场景。

04:00
arXiv cs.CL

答案格式变化对大型语言模型性别偏见的影响

研究不同答案格式对LLM性别偏见测量及人类分布对齐的影响,发现格式显著改变结果,建议多格式评估。

04:00
arXiv cs.CL

低资源语言中的思考:SFT之所建,RL之所修,准确率之所不见

SFT使低资源语言推理涌现,RL修复格式违抗,准确率基准因噪声失效。

04:00
arXiv cs.CL

使用多模态语言模型审计TikTok有害内容暴露:跨国、年龄分层研究

用多模态语言模型审计TikTok,关键词搜索使有害内容增1.5-7.5倍,意大利各年龄风险最高。

04:00
arXiv cs.CL

CoAL-RAG:一种复杂度感知的法律检索增强生成方法

提出复杂度感知法律RAG,基于问题本质与检索一致性自适应路由策略,显著提升中英文基准的生成质量与效率。

04:00
arXiv cs.CL

写、执行、精炼:从技能跟随者到技能优化者,通过执行反馈强化学习

WER框架用执行反馈训练技能优化器,超越无技能基线7.8分,优于同骨干9.35分。

04:00
arXiv cs.CL

PTXBench:面向GPU内核优化、利用架构特定PTX的LLM基准与适配

提出PTXBench基准,评估LLM生成架构特定PTX优化GPU内核;现有模型表现不均,适配训练部分有效但泛化不足。

04:00
arXiv cs.CL

ArborMem:以记忆森林导航交互状态

提出一种在线记忆框架用记忆森林导航交互状态保持多任务连续性在多个基准上超越强基线查询延迟低于半秒

04:00
arXiv cs.CL

从文本到多模态交互的多轮对话AI:数据、模型、评估与开放挑战

多轮对话AI从文本转向多模态,面临记忆、跨轮锚定、全双工、评估与文化对齐等挑战,亟待研究。