10193 条条目 · 106 个活跃源
2026年6月25日
04:00
arXiv cs.CL

ConPress:从多问题上下文压力中学习高效推理

提出ConPress方法,利用多问题上下文压力诱导自压缩,仅用8k样本微调即减少59%推理token,保持精度。

04:00
arXiv cs.CL

付费声音 vs. 公共信息流:可解释的跨平台气候话语主题分析

对比Meta付费广告与Bluesky公共帖子的气候话语,开发可解释主题发现流程,揭示策略推广与系统批评的系统性差异。

04:00
arXiv cs.CL

大型音频语言模型在多项选择评估中的鲁棒性评估

研究发现大型音频模型对选项顺序及题目措辞敏感,并提出更稳健的评估协议与指标。

04:00
arXiv cs.CL

How Pragmatics Shape Articulation: A Computational Case Study in STEM ASL Discourse

04:00
arXiv cs.CL

我更偏向逐点还是逐对?揭示基于评分量规的LLM评判中的位置偏差

基于量规的LLM评估存在模型特定位置偏差和排序偏差,随机排列选项可有效减轻。

04:00
arXiv cs.CL

低资源语言机器翻译中的多示例上下文学习实证研究

研究表明多示例上下文学习有效提升低资源语言翻译,BM25检索可大幅提高数据效率。

04:00
arXiv cs.CL

适应自监督语音表示用于帕金森病跨语言构音障碍检测

提出表示级语言偏移,对齐自监督语音表示,有效提升跨语言帕金森病构音障碍检测灵敏度和F1。

04:00
arXiv cs.CL

叙事特征还是结构化特征?大语言模型识别癌症患者心衰风险的研究

LLM用叙事特征识别癌症患者心衰风险,F1优于传统模型39%,显著提升性能。

04:00
arXiv cs.CL

MedLayBench-V: 面向医学视觉语言模型中专家-普通人语义对齐的大规模基准

首个大规模多模态基准,通过结构化概念精炼管道实现医学图像专家-普通人语义对齐。

04:00
arXiv cs.CL

Unintended Negative Impacts of Promotional Language in Patent Evaluation

04:00
arXiv cs.CL

通过有效反馈计算实现代理框架的缩放定律

引入有效反馈计算(EFC)作为缩放坐标,优于原始计算,提升通过率并降低成本。

04:00
arXiv cs.CL

心理健康支持中的人机交互信任对齐:多利益相关方的综述与观点

提出人、AI、交互三层信任框架,综述心理健康AI研究,揭示NLP评估与临床需求的关键差距,规划对齐研究路线。

04:00
arXiv cs.CL

山崩地裂如何登上新闻头条:全球滑坡事件在德国媒体报道中的覆盖与空间偏差数据分析

分析25年德国报纸对全球滑坡的报道,发现过度偏向南欧和西欧,揭示媒体注意力偏差。

04:00
arXiv cs.CL

通过干预性后训练学习语音基础模型的任务特定子空间

提出干预性对比后训练,将语音模型表示分解为内容和说话人子空间,提升域外说话人验证。

04:00
arXiv cs.CL

PhoneBuddy:训练开放模型实现代理式手机操作

结合真实与模拟环境训练手机代理模型,混合强化学习将任务成功率提升至45.33%,较监督微调提升近9个百分点。

04:00
arXiv cs.CL

CoLA:跨模态低秩适应用于多模态下游任务

CoLA在LoRA基础上增加跨模态路径,实现双流多模态高效适配,在视觉-语言与音频-视觉任务上相对提升约2-3%。

04:00
arXiv cs.CL

开放权重大语言模型中的同质性偏差对解码超参数具有鲁棒性

开放权重LLM中西班牙裔和亚裔同质性偏差对超参数鲁棒,非裔和性别偏差不稳健,且命名范式可反转偏差方向。

04:00
arXiv cs.CL

隐私感知的视觉语言模型

提出隐私基准和指令数据集,微调少量样本即可显著提升模型隐私感知能力,并超越GPT-4。

04:00
arXiv cs.CL

SyncLoop:一个用于自我改进数学推理的多模态双循环框架

提出C2-Evo框架,通过跨模态数据与数据-模型双进化循环,自动提升多模态数学推理性能。

04:00
arXiv cs.CL

广义医学短语定位

提出广义医学短语定位,允许每句映射到零或多个区域,MedGrounder模型两阶段训练,实现零样本迁移并减少标注。

04:00
arXiv cs.CL

Streaming-dLLM:通过后缀剪枝与动态解码加速扩散大语言模型

提出训练无关框架,剪枝冗余后缀并动态跳过收敛迭代,实现最高68.2倍加速且保持质量。

04:00
arXiv cs.CL

观点:感知后推理即无视觉推理

多模态研究误以为语言推理可补偿视觉缺陷,实则感知后推理退化为文本空间推理,丢失视觉信号,应转向感知内推理。

04:00
arXiv cs.CL

SPARC:分离视觉语言模型的感知与推理回路以实现测试时缩放

SPARC框架将感知与推理解耦,实现推理时计算资源灵活分配,显著提升视觉语言模型在复杂推理任务中的性能。

04:00
arXiv cs.CL

从语义和音位视角探究语音编解码器

本文分析语音分词器,发现其主要捕获音位而非词汇语义,为下一代设计提供启示。

04:00
arXiv cs.CL

CLEF HIPE-2026:评估从多语言历史文本中准确高效的人物-地点关系提取

HIPE-2026评估多语言历史文本中人物-地点关系提取,综合考核准确性、效率与泛化性,支撑数字人文应用。

04:00
arXiv cs.CL

记忆传染:通过智能体记忆的评估者偏见的跨时间传播

发现记忆传染:评估者偏见通过智能体记忆跨时间传播,长度偏见在旧模型中传播而新模型免疫,权威偏见未传播,且无安全阈值。

04:00
arXiv cs.CL

SingGuard:一种具有动态推理能力的策略自适应多模态大语言模型护栏

SingGuard是一种策略自适应多模态护栏,支持动态规则输入和快慢推理,在多个基准上取得SOTA,显著提升策略遵循准确率。

04:00
arXiv cs.CL

LLM系统中的持续知识更新:通过多时间尺度记忆动力学学习

提出外部记忆应模仿生物多时间尺度耦合动力学,使LLM通过Memini实现知识的持续自适应更新。

2026年6月24日
04:00
arXiv cs.CL

EXPO-SQL:基于执行的子句级策略优化用于文本到SQL

提出EXPO-SQL,通过子句级奖励细粒度监督,利用执行反馈识别错误子句,显著提升文本到SQL性能。

04:00
arXiv cs.CL

QuechuaTok:形态边界准确度——黏着型低资源语言分词器评估的必要指标

比较四种分词器在克丘亚语上的表现:PRPE形态准确率最高(83.33%),BPE仅6.67%,证明仅用生育率评估黏着语分词器不足。

04:00
arXiv cs.CL

评估LLM在高效且可解释的产品吸引力数值与分类隐式情感分析中的应用

提出LLM量化产品吸引力框架,零样本情感评分与专家高度一致(r=0.97,准确率94%),GPT-4o-mini成本降94%性能相当,兼具可解释性。

04:00
arXiv cs.CL

ModTGCN:面向文本分类的模块化感知图神经网络

提出ModTGCN,通过模块化辅助目标优化文本分类,在复杂低同质性数据集上效果显著。

04:00
arXiv cs.CL

量化RAG系统中的先验主导性

提出NCU指标量化上下文利用,发现小模型在严格事实提取中优于大模型,商业API存在先验主导问题。

04:00
arXiv cs.CL

自我识别微调可以预防和逆转涌现性失配

自我识别微调通过强化模型性格,有效预防和逆转涌现性失配,且不恶化其他指标。

04:00
arXiv cs.CL

一年之后:伤害仍在,但我们绝不后退!

通用大模型心理健康对话安全防护不足,除自杀外其他疾病失败率高达100%,需分类防护。

04:00
arXiv cs.CL

先定位再排序:重新审视基于无训练实体识别的知识型VQA

提出无训练IBA框架,解耦实体识别与证据排序,在KB-VQA上优于微调基线且降低复杂度。

04:00
arXiv cs.CL

LLM归因指标可迁移吗?跨数据集和构造的检索增强生成评估审计

审计8种自动归因评分器:跨数据集指标颠倒,无通用最优,需在目标数据集验证。

04:00
arXiv cs.CL

When Retrieval Metrics Mislead: Measuring Policy Signal in Long-Horizon Tool-Use Agents

04:00
arXiv cs.CL

我的嵌入是否反映 $A = B$?评估嵌入模型中的数学等价性

引入MELD数据集,发现现有模型按术语而非数学实质分组,提出对比学习对齐方法以改进。

04:00
arXiv cs.CL

CAVEWOMAN:大语言模型在语言输入与输出压缩下的行为表现

输出压缩降成本,输入压缩反增成本,模型响应偏离无约束基线。

04:00
arXiv cs.CL

非裔美国人英语辅音丛缩减的wav2vec 2.0和Whisper逐层探测

非裔美国人英语辅音丛缩减在模型中编码为结构化渐变音系变异,而非简单删除,保留底层塞音线索。

04:00
arXiv cs.CL

RASC+:面向临床值集编写的检索约束大语言模型裁决

通过检索增强候选池召回率至0.73,再以受限LLM裁决选择,F1从0.287提升至0.549。

04:00
arXiv cs.CL

迈向规范学习:基于偏好对的推理时对齐

提出Spec Learning框架,用偏好对编译自然语言规范,推理时对齐LLM,无需参数更新,性能优于DPO且可解释。

04:00
arXiv cs.CL

构建即忠实:基于声明锚定的多文档摘要归因

CAMS框架以原子声明为锚定单元,通过提取、聚类与约束重写,实现多文档摘要的细粒度归因与忠实性,提升归因准确率约三分之二。

04:00
arXiv cs.CL

面向多层MeMo的版本感知操作与事务记忆

MeMo通过版本感知操作和事务记忆编辑显式关联矩阵,实现知识更新而不需重训练,支持回滚与追溯。

04:00
arXiv cs.CL

情感分析的最佳预处理技术

研究发现,情感分析预处理最佳顺序为分词、清理、词干提取、去停用词;拼写校正影响最小,分词影响最大。

04:00
arXiv cs.CL

端到端语音语言理解中的选择性能力遗忘

针对SLU系统移除功能后意图-槽映射残留问题,提出BSU框架降低强制前缀重构风险,同时保持性能。

04:00
arXiv cs.CL

大型语言模型中的句子级上下文同化

发现句子级上下文同化:提示句子自增概率,模型越大效应越小,2%-4%注意力头控制,关闭可缓解。

04:00
arXiv cs.CL

PORTER:语言驱动的事件表示,构建可移植的结构化电子健康记录基础模型

PORTER采用语言描述解耦固定词汇,数值单独处理,实现无重训跨机构迁移,恢复97.1%AUROC,优于固定词汇模型。

04:00
arXiv cs.CL

Decoherence as Defence and the Magnitude of Noise Regularisation: A Rigorous N -Qubit Theory of Stochastic Quantum Neural Networks for Adversarially Robust Network Intrusion Detection