9651 条条目 · 106 个活跃源
2026年9月30日
04:00
arXiv cs.CL

E-CONAN(蕴含、矛盾与中立)诊断数据集:探究阿拉伯语自然语言理解中的语言现象

提出阿拉伯语NLU错误分析层级及E-CONAN诊断数据集,评测14个模型,发现大模型常识强、句法弱。

04:00
arXiv cs.CL

学会从上下文学习:基于扰动公共文档的合成训练

用扰动公共文档合成训练数据,免人工标注,显著提升大模型从上下文学习能力。

04:00
arXiv cs.CL

考问翻译:一种基于证明器的自然语言→一阶逻辑评估指标

提出SIV,用定理证明器生成正反探针评估NL→FOL翻译,检测漏译与多译,评分贴合错误严重度并定位错误。

04:00
arXiv cs.CL

ManiEdit:从流形视角出发的语言模型序列化非结构化知识编辑

从流形视角重构编辑,提出ManiEdit,通过枢轴定位与流形感知保持,显著提升序列化非结构化编辑效果。

04:00
arXiv cs.CL

Tsubame:基于扩散的推测解码中的树重放

Tsubame采用两遍树推测解码:先冻结上下文感知拓扑,再重放采样节点,结合扩散草稿,无损提升接受长度与吞吐。

04:00
arXiv cs.CL

Jev 在语音神经假体重评分中媲美 7B 语言模型

Jev将重评分转为单次类型化决策,无需GPU,在ALS语音神经假体上词错率7.5%,媲美7B模型。

04:00
arXiv cs.CL

安全重构:通过掩码扩散生成式建模构建强大安全护栏

LLaDA-Guard用掩码扩散按标签重建文本,安全基准领先、校准更优,可定位并改写不安全提示。

04:00
arXiv cs.CL

重置不等于恢复:通过谄媚迟滞评估虚假对话上下文中的可恢复性

受用户错误压力后,普通重置难以消除谄媚偏差;仅删除/截断压力历史或引入可信证据可有效恢复。

04:00
arXiv cs.CL

一个模型不成众:多LLM与方面条件化的多样化评论生成

多模型与方面条件生成能更贴近人类评论多样性分布,在预训练与下游任务中均有效,但人类多样性仍难企及。

04:00
arXiv cs.CL

弥合跨方言鸿沟:以查询计划作为Text-to-SQL的可移植接口

让模型生成方言无关的关系代数查询计划而非SQL,可近乎一致地恢复跨方言可移植性,微调后效果优于SQL监督。

04:00
arXiv cs.CL

手握地图仍迷路:语言模型中的对话状态与行为可靠性

模型能读出对话结构却难解析值,旧值更新后仍影响行动;据此设计的控制器修正动作,显著提升查询与任务成功率。

04:00
arXiv cs.CL

智能体何时才有用?古典文本及其译本的嵌入、大语言模型与智能体对齐

七系统对比:生成式恢复率93-94%远超嵌入77%;智能体缺陷更少,但长文本优势经分块后消失。

04:00
arXiv cs.CL

从细粒度修改操作到有意义的修改单元:评估大语言模型在修改边界检测中的表现

微调Qwen3-32B识别学生修改单元边界效果最佳,优于提示式大模型与启发式基线。

04:00
arXiv cs.CL

理解激活解释中的虚构并重新思考重建

点重建解释易致虚构与写作缺陷;提出Flow-NLA建模激活分布,保留效用并抑制缺陷。

04:00
arXiv cs.CL

共享经验、分离学习:面向大语言模型的伴随式置信度校准

CoCal以共享轨迹、分离学习训练轻量伴随模型校准LLM置信度,不损任务性能,优于RL与事后校准,并可跨域泛化。

04:00
arXiv cs.CL

位置并非事实:KV 缓存与记忆之间的错配

更新KV缓存需保留单位、对象依赖与未变文本;重建旧位置会损历史准确率,识别需学习读出或查询访问。

04:00
arXiv cs.CL

渐进式指令交付对语言模型创意写作的影响

分多轮渐进交付写作要求会降低模型约束遵守度,结构连贯性受损最重,创意完整性仅存71.2%。

04:00
arXiv cs.CL

Unicode 中的约鲁巴文:一个问题概述

约鲁巴文 Unicode 缺预组合字符,跨平台显示、搜索和字体替换出错;呼吁联盟介入申请编码四个核心字符

04:00
arXiv cs.CL

语音识别中编码器-解码器模型的上下文自适应

编码器-解码器模型均能直接上下文自适应,最高相对提升30%,词法与说话人信息均起作用,拼接式演示最稳定。

04:00
arXiv cs.CL

LA-CPD:用于人类-LLM作者身份分段的局部证据感知变点检测

LA-CPD将句级噪声分数转为连贯作者分段,动态规划与AIC选变点,准确率升至0.796,边界定位更优。

04:00
arXiv cs.CL

大型语言模型在被训练预测自身准确率时学会不同形式的元认知

模型置信度分双信号:近训练分布追踪准确率,其他领域追踪输出一致性;后者早现可泛化,前者晚现且局限。

04:00
arXiv cs.CL

简单扩散语言模型作为少步生成器比报道的更有效

少步生成潜力被次优采样器掩盖:适度锐化无需重训,旧模型16步超越1024步,且需联合评估质量与多样性。

04:00
arXiv cs.CL

具无分布风险保证的更快块扩散推理服务

Redline用校准数据选配置,在风险预算内控制相对参考的失败概率,并部署最快通过者以加速块扩散推理。

04:00
arXiv cs.CL

论高效推理中的词元价值不平等

CoT推理词元价值高度不均,对数概率可区分核心与冗余词元;TokenProbe压缩冗余词元,省76%用量并保持质量。

04:00
arXiv cs.CL

量化误差是谱平坦的:单次随机探针即可作为校准、无数据的敏感度估计器,并应用于面向预算目标的混合精度量化

量化误差谱平坦,单随机高斯探针可无校准无偏估计敏感度,RAM按字节预算分配混合精度位宽。

04:00
arXiv cs.CL

NSV-Shift:面向语音到语音模型中非言语发声理解与响应适应的对比基准

NSV-Shift对比基准:评估语音到语音模型的非言语发声理解与响应适应,发现模型检测强于情绪解读与差异化回应。

04:00
arXiv cs.CL

SlopBench:我们能在多大程度上按“AI 废话”给语言模型排名?一项重复性 AI 写作的多领域基准

SlopBench用112项任务评测18个模型近2万输出,按四项表层特征评分;重加权后排名不稳,仅一项排名无歧义。

04:00
arXiv cs.CL

面向论述性文本语义相似度分析的高层文本预处理:框架与实证演示

提出高层文本预处理,用规则分离论述结构与核心主张;实验显示可降低语义相似度虚高,并提出语义扩散指数。

04:00
arXiv cs.CL

超越单智能体与一致性:通过条件渐进剪枝为多智能体辩论正名

提出条件渐进剪枝(CPP),轻量利用多轮辩论,在严格成本下超越单智能体、一致性及现有MAD框架。

04:00
arXiv cs.CL

系统1决策能自洽吗?一项概率一致性研究

Jev与Laya分类概率不一致:粗细预测分歧大,准确率反向变动,提升或伴随校准恶化。

04:00
arXiv cs.CL

RewardExplainer:从反事实偏好反馈中学习奖励模型解释

提出RewardExplainer,借反事实反馈训练可复用解释器,生成可干预评分机制,提升忠实度并助力去偏。

04:00
arXiv cs.CL

迈向大语言模型中信念稳定性的分级度量

提出分级信念稳定性指标,基于内部表征估计条件信念,发现低稳定性信念更易在对话挑战下动摇。

04:00
arXiv cs.CL

Opera:面向长周期编程智能体的语言评论家框架

Opera将每次纠正作为持久批注并跟踪至问题解决,择机审查、诊断并核验反馈,显著提升编程智能体解决率。

04:00
arXiv cs.CL

使用大语言模型理解临床认知对话

构建8250句认知评估对话语料,标注56类对话行为,并基准评测大模型的细粒度分类与生成能力。

04:00
arXiv cs.CL

评估自动语音识别中的机器遗忘

研究ASR机器遗忘:梯度上升法隐私-效用均衡好,复杂法过度遗忘,常规评估不足,序列与同时遗忘更差。

04:00
arXiv cs.CL

未知并非正常:将语言模型抽取与规则决策逻辑分离以计算临床风险评分

分离三态抽取与确定性决策逻辑,仅追问关键问题:提问减半、准确率99.4%,避免漏诊,小模型亦适用。

04:00
arXiv cs.CL

面向印度语言的词相似度数据集:标注与基线系统

发布六种印度语言人工标注词相似度数据集,并用最新模型给出三种语言基线。

04:00
arXiv cs.CL

基于预训练语言模型的近缘印欧语言间语言距离量化测量:以北日耳曼语支为例

用预训练模型从语义、正字、可预测性量化北日耳曼语距离,丹麦语-挪威语最近,与历史结论吻合。

04:00
arXiv cs.CL

忠实激活言语化:减少大语言模型表征解释中的幻觉

AVPO两阶段框架:从激活重构文本并评估,再以DPO优化,提升语义与字词保真,减少幻觉。

04:00
arXiv cs.CL

谁获得一个词元,它又承载着什么?大语言模型中不平等的姓名支持与概念可及性

匹配姓名并非等价词元输入;姓名支持不均会系统影响大模型概念可及性,并在招聘、贷款等任务中造成偏差。

04:00
arXiv cs.CL

大语言模型并非随机鹦鹉:来自类人造语言任务的意义中介抽象证据

类人造语言任务表明,大模型无示例仍能依约束做意义中介抽象,反驳强随机鹦鹉假说。

04:00
arXiv cs.CL

MAS-OPD:面向多智能体系统的同策略蒸馏

MAS-OPD以角色优势特化与特权归因协调,将协作信息转为同策略蒸馏监督,实现清晰分工与高效协作。

04:00
arXiv cs.CL

SALMONN-duo:面向全双工语音智能体的自适应双系统协同

提出自适应双系统全双工语音智能体:快系统实时交互并按需委派慢系统,提升推理与多轮任务表现,优化成本。

04:00
arXiv cs.CL

USA:面向语言智能体跨域在线策略蒸馏的更新感知SAM

USA将预热更新幅度转为逐坐标扰动半径,缓解跨域在线策略蒸馏更新耦合与负迁移,六方向均超单域基线逾4分。

04:00
arXiv cs.CL

面向开放式文本生成的连贯性感知分布评估

CHORD用冻结大模型隐状态与RBF-MMD比较文本分布,灵敏检测全局连贯缺陷,排名更贴合人类判断。

04:00
arXiv cs.CL

过度个性化是一种决策失败:大语言模型中的生成诱发应用偏差

LLM过度个性化是决策失败:生成目标诱发应用偏差,按logit减去偏差标量可减少泄漏并保持满足。

04:00
arXiv cs.CL

ReScraper:面向高效LLM预训练的统一网页数据抓取与清洗

0.6B模型ReScraper统一抓取与清洗网页,替代启发式规则,显著提升LLM预训练语料质量。

04:00
arXiv cs.CL

Dr.Credit:面向深度研究智能体的基于评分标准的过程信用分配

以评分标准为共享参照,对工具反馈给予过程信用,并结合GRPO结果优势,提升深度研究智能体表现。

04:00
arXiv cs.CL

LLM智能体评估的可认证选择性自动化

提出任务级自助认证,量化可安全自动化的智能体评估比例,并兼作自训练过滤,实现零标注跨域迁移。

04:00
arXiv cs.CL

生物医学问答中的递归式大语言模型退化:一项跨代研究

PubMedQA中递归合成数据训练使生物医学问答指标逐代下降,3B更明显,主为答案变长,未证模型崩溃