10143 条条目 · 106 个活跃源
2026年7月2日
04:00
arXiv cs.CL

可读但不可控:医学大模型幻觉的神经元级证据

医学大模型幻觉可检测(AUROC达0.86),但分布冗余,无法通过操纵相关神经元实现有效控制,检测与控制存在分离。

04:00
arXiv cs.CL

前沿大语言模型在阿拉伯文化与社会语言学知识上的基准测试:一个基于人类专家真值的交叉评估框架

提出阿拉伯语文化与语言学知识的交叉评估框架,发现GPT-5.4最可靠,文化任务评分更难,模型在埃及方言上表现更优。

04:00
arXiv cs.CL

基于奖励门控的CLIP选择性测试时去偏

RG-TTA根据偏置敏感性选择性测试时去偏,在降低偏置的同时提升零样本性能,解决了统一去偏的公平-效用权衡。

04:00
arXiv cs.CL

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

04:00
arXiv cs.CL

LV-ROVER-MLT:基于多流投票的低资源马耳他语OCR

通过合成训练与五流Tesseract集成,将马耳他语OCR字符错误率降低70%至0.00700。

04:00
arXiv cs.CL

ALEE:通过以英语为中心的极小对比对实现任意语言嵌入评估

ALEE用AMR生成英语极小对比对并翻译,评估275+语言嵌入,揭示跨语言语义表示差距。

04:00
arXiv cs.CL

印加奇普的结构模式挖掘:无监督聚类、来源分类及圣塔谷匹配的计算验证

机器学习分析619件印加奇普,无监督聚类得三组(轮廓0.769),监督分类F1=0.86,识别绳捻方向为关键,发现殖民收藏结构并验证圣塔谷奇普。

04:00
arXiv cs.CL

TRACE: 面向对话数据的时序证据图上的状态感知查询处理

TRACE框架利用时序证据图和有效性标注,实现对话数据状态感知查询,提升时序与多跳推理。

04:00
arXiv cs.CL

超越困惑度:面向LLM测试时训练中部署记忆主张的行为评估框架

提出行为评估框架,校准测试时训练的记忆主张,揭示代理指标与部署行为间的差距。

04:00
arXiv cs.CL

语音游乐场:一个用于语音分析与对比的交互工具

结合Python后端与Web前端的交互式语音可视化对比工具,支持多种特征,用于语音研究、表示验证及CAPT实验。

2026年7月1日
04:00
arXiv cs.CL

桥梁科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与大语言模型基准

发布含2.7万句对的阿俄科学翻译基准,微调QLoRA模型BLEU达23.15,促进跨语言知识共享。

04:00
arXiv cs.CL

Indi-RomCoM:基于罗马化印地-英语混合指令评估大型语言模型的基准

该基准评估LLM在罗马化印地-英语混合指令上的表现,发现性能随混合密度下降,推理优于检测。

04:00
arXiv cs.CL

一次重写足矣:来自生产环境技能描述优化的经验教训

自动优化中单次LLM重写即可匹配手动调优F1(79.2%),工程时间从120分钟减至3.8分钟。

04:00
arXiv cs.CL

当Transformer学习“不可能”语言时,它们学到了什么?

Transformer学习“不可能”语言时,语法敏感性仅逐步下降,但生成能力显著缺陷,导致无法生成高质量长句。

04:00
arXiv cs.CL

当校准排名反转时:面向大语言模型公平比较的精度可控评估

提出ACE框架控制精度差异,发现全局校准指标因混淆精度致排名反转,公平比较需精度感知评估。

04:00
arXiv cs.CL

使用AI代理大规模自动化黑盒审计个性化算法

提出基于GenAI代理的黑盒审计框架,实现反事实分析;X平台案例显示算法放大极化右倾内容,用户意识形态影响显著。

04:00
arXiv cs.CL

基于结果奖励模型的Text-to-SQL测试时验证

提出GradeSQL框架,用结果奖励模型验证Text-to-SQL,在BIRD和Spider上分别提升4.33%和2.10%。

04:00
arXiv cs.CL

使用基于Transformer的模型结合类别权重和阈值调优的多语言极化检测

采用类别加权损失和阈值调优的Transformer模型,处理不平衡多标签极化检测,在英语和斯瓦希里语上表现优异。

04:00
arXiv cs.CL

Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support

04:00
arXiv cs.CL

超越干净文本:评估编码器与解码器在噪声文本中对孟加拉语事件检测的鲁棒性

孟加拉语噪声文本事件检测中,编码器干净文本优但噪声衰减,解码器更鲁棒,联合训练有效缩小差距。

04:00
arXiv cs.CL

Building a Multimodal Dataset of Academic Paper for Keyword Extraction

04:00
arXiv cs.CL

Linguistic Distancing on Social Media: Indicators of Emotion Regulation Across Age Groups

04:00
arXiv cs.CL

CORTEX:通过比较内部表示实现RAG中令牌级幻觉检测

CORTEX通过比较有无检索文档时的LLM内部表示,实现令牌级幻觉细粒度检测,结合前文传播与平滑提升性能。

04:00
arXiv cs.CL

A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases

04:00
arXiv cs.CL

基于参考的语音对话系统韵律与节奏评估

提出基于匹配参考的百分位评估协议,用于对话系统韵律节奏评估,提升可解释性与准确性。

04:00
arXiv cs.CL

真相还是诡辩?LoFa:LLM逻辑谬误鲁棒性基准

LoFa基准通过多轮辩论框架评估LLM对逻辑谬误的鲁棒性,提出LFR@k指标,揭示不同模型脆弱性差异。

04:00
arXiv cs.CL

基于细粒度知识实体的学术论文团队机构组成与新颖性关系研究

产学研混合团队比纯工业团队更易产生新颖论文,并关注方法-指标组合,而工业团队更关注方法-工具组合。

04:00
arXiv cs.CL

自然语言解释中判断质量的衡量:来自预测锦标赛的证据

引入解释质量标记(EQMs),用LLM评分推理模式,预测准确性优于传统方法,并能有效识别表现不佳者。

04:00
arXiv cs.CL

等等,我公平吗?——演绎刻板印象的表征与Fair-GCG的缓解方法

识别演绎刻板印象,提出Fair-GCG推理注入框架,有效提升LLM公平性、减少偏见。

04:00
arXiv cs.CL

从命题不对称到感知不对称:将摩擦策略优化扩展到非对称部分信息对话

将FPO从命题扩展至感知不对称,发现摩擦函数仅在各自信息视野有效,正确视角优于全知视角,提出两种标注改进。

04:00
arXiv cs.CL

当重排序有害时:基于不确定性的门控机制用于少样本重排序

重排序并非总是提升性能,基于不确定性的门控可降本15%-80%,并提升平均性能2%。

04:00
arXiv cs.CL

Triospect:一种针对多种攻击的鲁棒性统计AI生成文本检测的三维框架

提出Triospect三维框架,利用内容与表达视角,显著提升检测对多种攻击的鲁棒性。

04:00
arXiv cs.CL

LOPA:通过潜在序数原型对齐增强口语评估

提出LOPA正则项与SALR路由,无需大模型微调,RMSE达0.361,媲美十亿参数系统的口语评估方法。

04:00
arXiv cs.CL

SeKV:面向长上下文LLM推理的分层语义记忆分辨率自适应KV缓存

SeKV提出分辨率自适应KV缓存,通过熵引导语义跨度在GPU-CPU间存储,不丢弃信息,性能提升5.9%,GPU内存减少53.3%。

04:00
arXiv cs.CL

何为错误?非典型语音识别的双参考基准测试

非典型ASR评估存在逐字与意图两种参考,混淆导致模型排名偏差,选择合适参考至关重要。

04:00
arXiv cs.CL

TAG-DLM:面向文本属性图学习的扩散语言模型

提出统一文本推理与图消息传递的掩码扩散语言模型,线性化邻域并引入拓扑注意力掩码,无需微调即可适配多种图任务。

04:00
arXiv cs.CL

大语言模型能否想象超越二元困境的道德替代方案?

LLMs能生成道德替代方案并获偏好,但需平衡结构质量与可行性。

04:00
arXiv cs.CL

基于图注意网络的门控多图融合用于阿尔茨海默病检测

多视图门控图注意网络结合PMI共现图与自适应门控融合,AD检测准确率90%。

04:00
arXiv cs.CL

使用大型语言模型探究风格挪用:欧盟法律下版权侵权评估框架

PSALM框架揭示微调导致系统性风格挪用,仅防范逐字记忆不足以规避版权风险。

04:00
arXiv cs.CL

当数据库出现故障:提示LLM对话代理在任务导向对话中安全恢复

轻量提示恢复法降低LLM数据库故障时幻觉率50%以上,但残留问题仍存。

04:00
arXiv cs.CL

BlockPilot:面向基于扩散的投机解码的实例自适应策略学习

BlockPilot基于预填充表征预测最优块大小,适应样本差异,实现扩散式投机解码高效加速。

04:00
arXiv cs.CL

通过梯度反转和变分信息瓶颈缓解语音欺骗检测中的语言偏差

本文提出语言不变欺骗检测框架,利用梯度反转和变分信息瓶颈缓解语言偏差,EER相对降低36.2%。

04:00
arXiv cs.CL

CLExEval:一种人机协作的LLM临床推理定性评估框架

CLExEval框架揭示LLM临床推理存在冗长偏差、隐藏知识悖论等失败模式,且LLM自评不可靠,需专家验证。

04:00
arXiv cs.CL

面向跨基准医学问答的临床结构化等级门控LoRA

BiRG-LoRA在医学问答四个基准上平均准确率69.31%,超越MoELoRA,参数减少28.1%。

04:00
arXiv cs.CL

Team MKC在CLPsych 2026:通过社交媒体时间线动态捕捉与刻画心理健康变化

提出基于LLM的流水线,对社交媒体帖子序列进行心理健康分析,实现帖子级与用户级时间建模。

04:00
arXiv cs.CL

修正RVL-CDIP:量化错误与训练-测试重叠

发现12%标签错误和35%训练-测试重叠;错误修复提升准确率,错误校正数据改善分布外泛化(最高提升14%)。

04:00
arXiv cs.CL

构建用于训练和评估儿童阅读的ASR系统

针对班巴拉语儿童阅读,开源ASR系统最佳模型将词错误率降至0.22,字符错误率降至0.08,10岁以下儿童为主要误差来源。