9886 条条目 · 106 个活跃源
2026年8月26日
04:00
arXiv cs.CL

数据集稀缺制约多语言嵌入模型的稳健评估:斯拉夫语言案例研究

提出二维评估框架分析斯拉夫语MTEB,发现数据稀缺制约稳健结论,少数模型跨任务表现优异。

04:00
arXiv cs.CL

离散难度是否足够?利用连续难度提升LLM自一致性效率

提出柔性自一致性方法,用连续难度动态调整推理路径数,保精度且节省最多76%的令牌。

04:00
arXiv cs.CL

词语、空间与生成式AI:当代建筑中的语言层次

语言是建筑设计材料,生成式AI中交织话语、编程语言与注释,需研究隐喻、语料库及语言差异。

04:00
arXiv cs.CL

大语言模型中量化对孟加拉语理解的影响:一项系统性评估

孟加拉语量化影响因模型而异:GPT-OSS损失大,Qwen/LLaMA稳定,架构与方法比位宽更重要。

04:00
arXiv cs.CL

FARCA:事实监督强化学习中事实对齐的可靠性感知信用分配

提出FARCA,将事实监督转为可靠性加权的令牌级训练信号,解决信用分配歧义,提升事实性并保持推理。

04:00
arXiv cs.CL

迷失于语音:跨音频与文本的三语口语幻觉检测

首个三语口语幻觉基准(英俄哈,1.2万样本):文本检测优于音频,合成训练可迁移至真实虚假新闻。

04:00
arXiv cs.CL

线性探测为机器生成文本检测提供稳健高效的方法

线性探针以极少样本超越多种检测器,跨域提升AUC,因共享潜在“机器性”方向,可细粒度估计AI编辑文本。

04:00
arXiv cs.CL

期待、反弹、复苏与兴奋:模型发布如何塑造Reddit对对话式AI系统的看法

分析Reddit长期讨论,发现对话式AI用户看法随模型发布动态变化:Anthropic获好评,OpenAI现反弹复苏,Grok-3受政治影响,DeepSeek-R1毁誉参半。

04:00
arXiv cs.CL

从局部核到全局形式:建模音乐内容的涌现

用滑动窗口从单序列估计局部转移核,在德彪西《Syrinx》中边界处达峰值,但宽平台表明难作自动分段器。

04:00
arXiv cs.CL

SkillForge:为强化学习智能体演化可验证技能

提出SkillForge框架,通过环境交互验证技能并持续演化,使技能库保持有效,显著提升强化学习智能体性能。

04:00
arXiv cs.CL

波斯语文本NLP中的标注瓶颈:作为标注稀缺语言的波斯语

波斯语并非全面低资源,而是标注稀缺,任务与领域覆盖不均,部分任务密集,NLI等低于基线。

04:00
arXiv cs.CL

RAT:一种用于RAG评估的统一贝叶斯模型

提出统一贝叶斯框架,联合建模检索、弃答与答案正确性,揭示系统行为差异,优化标注分配,整合LLM评判。

04:00
arXiv cs.CL

单一时间线,多端渲染:一个用于异构音乐输出的Wolfram语言程序包

用单一时间线存储,经后端契约同步生成Csound、乐谱、实时控制与节拍声效。

04:00
arXiv cs.CL

任意多边形振荡器:将多边形合成推广至任意形状、形变与三维多面体

提出统一弧长引擎的多边形合成,支持任意顶点、不等顶点数渐变及三维多面体截面,实现通用波形生成。

04:00
arXiv cs.CL

ExpConCAD:经验引导的文本到CAD生成——面向含隐式空间约束的形状描述

针对描述缺失空间约束,提出ExpConCAD,恢复构造结构并用经验补全隐式约束,生成可执行CAD程序。

04:00
arXiv cs.CL

诈骗电话解剖:1万通真实诈骗与垃圾电话揭示电话骗子运作方式

分析10211通诈骗电话发现:骗局按办公时间运作,使用模板化脚本,索要身份信息多于支付凭据;目标年龄增加,诈骗者投入更多话术,但诉求不变。

04:00
arXiv cs.CL

基于结构约束的智能体图探索用于证据支撑的学术深度检索

提出Crase方法,用受限图探索替代开放检索,剪枝引用边并排序,召回率提升3倍,成本仅三分之一。

04:00
arXiv cs.CL

Wontopos Tablet 2:不依赖词汇匹配的多语言与多模态记忆检索评测

无词汇匹配的记忆检索:文本达95.7%/67.5%,跨语言无文本照片检索超BM25与稠密基线,低资源语言仍弱。

04:00
arXiv cs.CL

压缩缓存,保持真实:Geodesia-KV的单调等势分配

Geodesia-KV以单调块级精度分配和查询稀疏读取,大幅压缩KV缓存并降低比特率,在16GB GPU上支持百万token上下文。

04:00
arXiv cs.CL

BrowserForge:通过并行浏览器沙箱规模化网页操作轨迹

提出BrowserForge,用并行沙箱在开放网络生成20万余条网页操作轨迹,显著提升多模态网页代理性能。

04:00
arXiv cs.CL

语言模型跨语言代码功能等价性评估

大语言模型难以可靠判断跨语言代码功能等价性,难题易误判,且运行不稳定。

04:00
arXiv cs.CL

阅读并非使用:检索、判断与AI金融研究工作流的设计

检索准确未必用于判断:长语境下风险披露影响消失,工作流架构决定信息能否进入判断。

04:00
arXiv cs.CL

Transformer加速器(TFA):面向Transformer推理与机器翻译的宏操作INT8硬件芯片

TFA是INT8内存到内存引擎,位精确执行Transformer推理,在25项测试中零失配,吞吐比22线程CPU快20倍。

04:00
arXiv cs.CL

市场,而非规划者:私有信息下的大语言模型代理去中心化编排

提出代理劳动力市场,以私有成本竞价和激励支付实现去中心化编排,超越集中式基线。

04:00
arXiv cs.CL

SQLite 就够了:使用 scrydb 实现词法、语义与混合搜索

scrydb 基于 SQLite 的 FTS5 与向量扩展,实现词法、语义及混合搜索,支持重排融合,轻量高效。

04:00
arXiv cs.CL

Meta^n:经由涌现深度的递归自我改进

固定元操作并递归作用自身产物,层间条件传递带来主要增益,超越此前方法,在抗记忆基准上唯一得分非零。

04:00
arXiv cs.CL

UTS在CheckThat! 2026:生成式事实核查文章的引用框架工程

UTS获第二(M4=0.484),确定性模板+引用验证框架提升0.027;与冠军差距在引用精确率/召回率。

04:00
arXiv cs.CL

RePolicy:面向智能体防护中安全策略调用的强化学习方法

提出RePolicy,用强化学习学习安全策略调用,适配动态策略,生成依据与判断,多基准下稳健。

04:00
arXiv cs.CL

DeepRepoQA:基于深度智能体探索的代码仓库问答

提出DeepRepoQA框架,以蒙特卡洛树搜索引导智能体深度探索仓库代码,实现多跳推理,性能显著提升。

04:00
arXiv cs.CL

并非所有 Token 都平等:MLLM 后门的区域感知一致性修复

提出RACER,利用层间不一致异常修复MLLM后门,仅需100干净样本,平均ASR降至1.1%

04:00
arXiv cs.CL

行动时刻的自信:隐藏信息下大语言模型游戏中的信念校准偏差

高置信时对隐藏棋子位置的判断62例仅1例正确,校准偏差几乎全集中于此;常规评估指标与信念质量可完全脱节。

04:00
arXiv cs.CL

看不见的编辑层:形式化部署语言模型中未披露的推理时引导、概率放置与归因问题

模型不等于部署系统,推理时干预可系统改变输出。本文提出归因问题、概率放置、透明度原则,呼吁部署层审计。

04:00
arXiv cs.CL

Ockhamareto:面向强化学习简洁单元测试生成的帕累托门控段级信用分配

Ockhamareto通过帕累托门控奖励与段级信用分配,用更少测试捕获更多缺陷,全面超越最强基线。

04:00
arXiv cs.CL

EduDial:构建大规模多轮师生对话语料库

提出EduDial多轮师生对话数据集,含34K会话,基于Bloom分类学,构建EduDial-LLM并显著优于主流模型。

04:00
arXiv cs.CL

低资源命名实体识别:基于跨语言的字符级神经条件随机场

提出跨语言字符级神经条件随机场迁移学习,联合训练高/低资源语言,F1提升达9.8点。

04:00
arXiv cs.CL

设计并实证表征一种带自动卡片编程的硬件图灵机

提出硬件图灵机,实现自主多步执行与可重编程光输入,机械与光学性能量化,计算输出与软件模拟完全一致。

04:00
arXiv cs.CL

大语言模型时代语言多样性景观的萎缩

大语言模型辅助写作会导致语言多样性下降风格同质化并削弱语言承载的社会心理信息

04:00
arXiv cs.CL

方法、心智与道德:人们如何理解人工智能

通过混合方法研究AI意义建构,识别社会框架,围绕方法、心智、道德三大争论。

04:00
arXiv cs.CL

面向长时程智能体框架的递归经验-工作记忆演化

递归经验-工作记忆演化将执行转为证据,定位并更新技能,显著提升长时程任务成功率。

04:00
arXiv cs.CL

比较大型语言模型的不确定性测量与缓解方法:系统综述

系统综述LLM不确定性量化与校准方法,基于三个数据集评估七种方法,揭示关键发现并展望未来方向。

04:00
arXiv cs.CL

优势参数扩展训练使大语言模型更优

提出APEX,优势参数扩入劣势空间,总参数不变,52%参数超越全参调优,30%数据达同等性能。

04:00
arXiv cs.CL

面向双语词典归纳的判别式潜变量模型

提出判别式潜变量模型,结合匹配先验与表示方法,经维特比EM训练,提升双语词典归纳效果。

04:00
arXiv cs.CL

融合时空模型与大语言模型的模块化多任务推理框架

提出融合时空模型与大语言模型的模块化多任务推理框架,无需微调,分解查询执行,生成数值与解释,抑制幻觉,优于基线。

04:00
arXiv cs.CL

GR-SAP:微调期间保持安全对齐的生成式回放

提出GR-SAP,用LLM生成领域对齐数据并在微调中集成,保持安全对齐,缓解退化且性能不减。

04:00
arXiv cs.CL

MPIB:大语言模型医疗提示注入攻击与临床安全基准

提出医疗提示注入基准MPIB,评估LLM直接与间接注入下临床风险,发现ASR2与CHER3差异显著。

04:00
arXiv cs.CL

MauBERT:用于少样本声学单元发现的通用语音归纳偏置

MauBERT基于HuBERT,利用发音特征做跨语言语音表征,超越SOTA,仅需10小时微调即可适应新语言。

04:00
arXiv cs.CL

大型语言模型还能自我解释吗?探究量化对自我解释的影响

量化适度降低大语言模型自我解释的质量与忠实度(最多4.4%/3.9%),用户感知连贯性与可信度降8.5%,建议按用例验证。

04:00
arXiv cs.CL

CASTLE:评估大语言模型学生个性化安全的综合基准

提出学生定制个性化安全概念,构建含15种风险、14种属性的9万场景基准,18个模型均得分低于2.3/5,揭示个性化安全缺陷。

04:00
arXiv cs.CL

EstLLM:通过持续预训练和后训练增强多语言大模型的爱沙尼亚语能力

持续预训练与后训练可增强多语言大模型的爱沙尼亚语能力,虽略有英语回退,但聊天向量合并可恢复。

04:00
arXiv cs.CL

大语言模型对顺序有多敏感?面向确定性结构重建的OrderProbe

提出顺序探针基准,用中日韩四字词评估结构重建,前沿模型零样本恢复率低于35%,结构鲁棒性非语义能力必然结果。