9816 条条目 · 106 个活跃源
2026年9月9日
04:00
arXiv cs.CL

区分语言模型中的流式稳定性与长期记忆

提出稳定、访问、效用三视界评估:注意力汇可无限稳定流式生成,但无法利用缓存外内容;递归/检索可扩展记忆视界。

04:00
arXiv cs.CL

路由中继:面向高效动态稀疏注意力的事件触发跨层路由复用

路由中继跨层复用路由元数据,仅当哨兵块挑战最弱选择时重路由,保持近满召回,显著降低评分计算量。

04:00
arXiv cs.CL

LANTERN:面向噪声与变换任务的语言模型评估——理解错误与鲁棒性细微差别

系统评估大语言模型在多种扰动下的鲁棒性,构建合成增强数据集,分析模型响应波动,助力开发更稳健的模型与评估方法。

04:00
arXiv cs.CL

BlueprintAgent:面向扫描结构蓝图仿真就绪生成的约束触发式定向复核

提出多模态蓝图智能体,以工程约束触发局部定向复核,从扫描蓝图生成仿真就绪框架,梁F1达0.994。

04:00
arXiv cs.CL

超越流畅生成:面向边缘部署的Sub-2B小语言模型MCP式工具调用CPU可靠性基准测试

5个<2B小模型的MCP式工具调用CPU测试:经恢复解析,Qwen2.5-1.5B最佳(75-79%);但原始输出直接可解析仅0.5%,需安全约束与人工复核。

04:00
arXiv cs.CL

叙事散文中的句法模式与文体功能:一种规则与机器学习结合的方法

通过规则标注3300句的文体类别,结合句法特征与机器学习分类,宏F1达0.948,提供可复现的分析流程。

04:00
arXiv cs.CL

验证面向自然语言生成的DBpedia三元组集合

提出并评估DBpedia三元组筛选方法,验证规则下精确率达98%,改进属性定义可提升召回率40%且不损精度。

04:00
arXiv cs.CL

Qwen-Audio-3.0-ASR技术报告

采用混合专家模型的语音识别系统,支持多语言与多方言,具备热词定制等工业级能力,性能领先。

04:00
arXiv cs.CL

层级竞争模式的艺术:连字符断词的高斯过程优化

用高斯过程贝叶斯优化连字符模式生成参数,在17个数据集中16个提升F1/7,并全部缩小字典规模。

04:00
arXiv cs.CL

我们完了!——通过冲突框架的食谱翻译探究大语言模型的政治立场

单一政治性框架词即触发大模型翻译的隐性政治立场:西方模型回避,中国模型沉默,警示冲突语境慎用。

04:00
arXiv cs.CL

ObGynLongBench:揭示纵向电子病历决策中的证据-病历差距

提出用于产科妇科纵向电子病历决策基准,发现证据-病历差距:直接提供证据时佳,需自行提取时差,主动检索智能体最优。

04:00
arXiv cs.CL

FramingQA:问题是否塑造答案?衡量组合式框架效应

提出FramingQA基准,测法律、医学等场景下模型受问题框架影响的程度,准确率高不等于跨表述稳健。

04:00
arXiv cs.CL

MEMO:面向长周期LLM智能体的多模态证据记忆组织

提出MEMO,用证据提取器和记忆管理器组织多模态证据,减少记忆词元并提升下游任务性能。

04:00
arXiv cs.CL

韩国期刊摘要中与LLM相关的语域转变:一项2018—2026年形态感知超额词汇研究

韩国期刊摘要自2024年末起现LLM语域转变,此前无;2026年超16%疑经LLM处理。

04:00
arXiv cs.CL

语言在多模态模型中应置于何处?——从语言对人类感知与认知的影响中获得的启示

语言是基于共享代码本的压缩器,不应成为多模态模型的内部表示,而应置于边界与代码本中,否则丧失可审计性。

04:00
arXiv cs.CL

有符号救援路由:面向高效LLM推理的损害感知级联

提出有符号救援路由SRR,分别预测大模型纠正与致错,按增益差排序请求,仅需小模型输出统计。

04:00
arXiv cs.CL

AI模型如何管理认知权威:用户异议回应的分类与比较分析

提出六类质疑与四层框架,分析14个模型回应:常表面认同却坚持原答案,权威转移和放弃因任务、模型而异。

04:00
arXiv cs.CL

从回声室到认知单一文化:大型语言模型将随时代而变的党派立场呈现为知识

大模型把随训练截止时点变化的党派立场当作知识,不辨事实与观点,将信息环境推向认知单一文化。

04:00
arXiv cs.CL

翻译的不确定性与分布谬误

本文反对语义源于分布,认为分布反映意义实践;跨语言分布可支撑翻译;意义基于主体-环境交互,LLM缺乏。

04:00
arXiv cs.CL

在不同微观单元概念下复现并查集实验以评估翻译工作量

复现实验考察不同停顿阈值划分微观与宏观单元,评估文本产出压力,认为基于过程的单元或更适用。

04:00
arXiv cs.CL

LLM取证:后门藏在哪里?用稀疏自编码器定位与控制触发机制

稀疏自编码器揭示触发后门分角色:检测触发的特征未必控制行为,残差流干预可抑制或诱导语言切换。

04:00
arXiv cs.CL

优质PT-PT Web:欧洲葡萄牙语网络的高质量410亿词元数据集

发布410亿词元欧葡网络语料库,源自411TB数据,前置去杂使产出增19.04%,服务大模型预训练

04:00
arXiv cs.CL

DeepTable:面向层次化表格理解的结构注意力偏置与树路径编码

提出DeepTable,以结构注意力偏置和树路径编码显式建模表格行列层次结构,在三个问答基准上持续提升性能。

04:00
arXiv cs.CL

是技巧锦囊还是迷思锦囊?在可解释自杀风险评估中用任务知识降低建模复杂度

审计31种技术仅5种可靠有效;按任务知识重构自杀风险评估系统,综合分0.7781,53队中第三。

04:00
arXiv cs.CL

医学问题中LLM跨语言一致性的多视角探讨

多语言LLM医学问答应跨语言一致还是文化适配?调研显示各方分歧,模型角色难复现,优劣尚无定论。

04:00
arXiv cs.CL

大语言模型智能体作为计算类型学家

LLM智能体可检索参考语法、解析IGT并检验类型学假设,支持可扩展的类型学分析,但仍需专家验证。

04:00
arXiv cs.CL

句法重要吗?面向计算社会科学的图增强变分主题模型

提出SCPTM图增强变分主题模型;句法仅在论证性文本中提升主题多样性,信息性语域反增噪声。

04:00
arXiv cs.CL

你无法偏好未曾采样到的情绪:DPO 微调大语言模型中的情绪强度欠调

DPO候选池缺乏极端情绪样本,导致情绪强度欠调;扩大采样可提升效价增益。

04:00
arXiv cs.CL

Climate-ModernBERT:重新审视领域自适应持续预训练的语料构成

提出Climate-ModernBERT,以三类气候语料持续预训练,九项基准平均F1达76.3,较基线提升2.8;学术语料适应信号最强,参数合并优于联合训练。

04:00
arXiv cs.CL

MeRoTune:带可调旋钮的RoPE安全合并

MeRoTune:推导RoPE安全校正矩阵类,冻结基座,学习可调混合比例的模型合并。

04:00
arXiv cs.CL

大语言模型各层会即时相互纠正

揭示Transformer层纠正机制:相邻层相互抵消贡献,后层选择性剔除前层不当特征,残余流含瞬态提议。

04:00
arXiv cs.CL

重新审视手语翻译:手语者依赖性对模型评估的影响

手语翻译评估多依赖同一手语者,跨手语者评估性能骤降,数据集还存在句子重叠,高估了真实泛化能力。

04:00
arXiv cs.CL

面向高效大语言模型服务的截止时间感知自适应预填充分块

SLOWeave按最早解码截止时刻选最大预填充块,免调参,兼顾延迟与效率,上下文吞吐提升至3.3倍。

04:00
arXiv cs.CL

超越转录的推理:音频语言模型在儿童口吃语音上的表现

混合说话人场景下,音频语言模型能提取儿童口吃语音的高层语义,但推理随口吃加重显著退化。

04:00
arXiv cs.CL

A*-Thought-V2:基于大语言模型几何动力学的高效潜在推理

提出A*-Thought-V2,以LLM隐状态几何动态压缩偏离步骤为潜向量,提升准确率并减少计算与长度。

2026年9月7日
04:00
arXiv cs.CL

从低谷中适应:预测心理健康危机咨询师长期对话技能的发展

提出早期预测咨询师能否提升引导对话效果的任务,基于其面对困境时刻的适应方式,效果优于基线。

04:00
arXiv cs.CL

多语言语言模型中跨语言一致性增强方法的系统评估

后训练方法更可靠,直接分布对齐持续提升一致性;跨域迁移有限,对文化问题无系统退化,开放生成偶有下降。

04:00
arXiv cs.CL

语料库选择对依存距离估计的影响有多大?

单语料库的依存距离估计不可靠:替换语料库反转四成语言排序,解释近三成组间方差;但长度最小化普遍成立。

04:00
arXiv cs.CL

大型语言模型中的证据整合

提出证据整合分布理论:证据改变模型答案分布,模型更易整合自身错误;相同证据可提升弱模型、损害强模型。

04:00
arXiv cs.CL

记忆即转化:LETHE,一种自指式生成对抗网络启发的架构

自指声音系统LETHE无需外部数据,判别器与随机扰动优化共驱延迟矩阵演化,实验证实活跃生成器为演化必需。

04:00
arXiv cs.CL

MedProb:探测视觉语言模型内部表示用于医学问答

轻量探针用冻结视觉语言模型表示预测医学多选答案,优于提示与医学专用模型,可扩展至开放生成。

04:00
arXiv cs.CL

你真没看懂吗?——中文在线评论间接戏谑语用社会推理基准

针对中文在线评论的间接戏谑语用,构建4,735个人类验证题;LLM平均68.7%,最优81.4%,人类90.8%。

04:00
arXiv cs.CL

转写数据集上的语音编码算法评估

提出基于广义Rand指数的新方案,用归一化编辑距离衡量不一致度并随机校准,在多语种转写集上测评语音编码算法。

04:00
arXiv cs.CL

ASR幻觉剖析

ASR幻觉源于最终编码器阶段接地失败:绕过该阶段导致输出发散为乱码而非流畅编造,揭示终端阶段对可靠识别的关键依赖。

04:00
arXiv cs.CL

VERGE:面向临床笔记中早发性结直肠癌症状可溯源抽取的验证增强精炼方法

VERGE通过有界验证-精炼循环,将早发结直肠癌症状抽取精确率由0.764提至0.849,MCC达0.730,且不损召回,仅1.5%需人工审查。

04:00
arXiv cs.CL

Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal

提出边界感知自蒸馏框架,用数据组合控制安全与可用性权衡;靶向拒答率大幅提升,但需在意图边界两侧共同评估以避免过度拒答。

04:00
arXiv cs.CL

混合语言模型中注意力回忆与循环控制的作用

注意力负责精确检索,循环状态决定输出语言和人格;两者分工明确。

04:00
arXiv cs.CL

TRILOGUE:三语口语对话事实核查基准,含证据与配对音频

首个英俄哈三语口语对话事实核查基准,含1.2万对话、390小时音频,支持可核查性检测、证据检索与验证,ASR降级和跨语言迁移仍是挑战。

04:00
arXiv cs.CL

GRACE:图基座反思式智能体副驾引擎,支持专家在环知识扩展

提出图基反思引擎,将声明与知识图对齐分类,按注意力回报优选专家验证,迭代扩展知识库以抑制幻觉。

04:00
arXiv cs.CL

大型语言模型中的文化错位:检测、测量与定向微调缓解

评估三国三模型,发现无本土偏好,中国模型对本国人群偏差最大;LoRA微调降偏16.8%,但偏差仅转移未消除。