9641 条条目 · 106 个活跃源
2026年10月2日
04:00
arXiv cs.CL

AgSpec:突破基于检索的推测解码在编程智能体流水线中的极限

AgSpec为编程智能体补齐检索语料与自适应草稿长度,吞吐最高提升4.76倍。

04:00
arXiv cs.CL

蒸馏方向性验证

提出方向性标签蒸馏:让冻结教师在其已知方向为候选答案打分,以最优候选作为学生目标,减少错误传递并提升准确率。

04:00
arXiv cs.CL

协作技术文档的句子具体性评分:一项领域迁移研究

审计技术文档句子具体性评分,测试生成后评分能否辅助选择LLM修订;效果依预测器与候选集而异。

04:00
arXiv cs.CL

LawCompass:从法律问答迈向基于证据的多智能体深度研究

提出LawCompass法律助手,集法律问答、专业检索与多智能体深度研究于一体,全程附引用以支撑溯源。

04:00
arXiv cs.CL

扩展与蒸馏文本嵌入以提升可扩散性

扩展同族文本嵌入并蒸馏T5Gemma-2,以软标签增强潜在空间可扩散性,生成PPL达17.8。

04:00
arXiv cs.CL

以参与奖为探针:随机奖励强化学习作为大语言模型能力探针

随机奖励强化学习可作探针,揭示大模型进一步训练的可达潜力,而非仅当前能力。

04:00
arXiv cs.CL

用任务算子捕捉上下文学习动态

提出任务算子TO,将ICL注意力输出转化为稳定仿射变换,无需完整示例即可逼近其性能。

04:00
arXiv cs.CL

JoinGR:学习遍历连接图以进行表格检索

JOINGR将连接图作为检索空间,以查询条件化遍历边打分,显著提升多跳表格检索召回。

04:00
arXiv cs.CL

精准胜于规模:一个波兰语—西里西亚语基准及超越开源与商用模型的翻译系统

研究波兰语-西里西亚语翻译,发布SiLTT测试集;规则系统在方言集上最强,微调模型胜神经基线但仍逊之。

04:00
arXiv cs.CL

用工作流进化更好的工作流

FloWright与DataWright以分层奖励实现多角色共进化,数据增难提升小模型多任务表现。

04:00
arXiv cs.CL

评估日语大语言模型对IME相关错误与打字错误的鲁棒性

评估日语大模型对五类打字错误的鲁棒性:字符换位/替换显著降低准确率,IME、全角及同音转换影响较小。

04:00
arXiv cs.CL

大语言模型分词中的计数与最小成本编码

提出CNF-MCE分词与编码,较BPE提升压缩和token效率,下游性能相当。

04:00
arXiv cs.CL

My FAULT:自诊断作为自演化智能体强化学习中的信用分配

提出FAULT,以自诊断将终端奖励重分配为步级信用,解决长时程智能体强化学习信用分配难题。

04:00
arXiv cs.CL

AGO AI 质量门禁:面向检索增强生成的证据优先发布决策

AGO证据优先门禁以四状态决策与评审元评估把关RAG发布,回归时不安全上线降至22.2%–35.1%。

04:00
arXiv cs.CL

BanglaDial-Abuse:一个用于辱骂性孟加拉语文本地域方言识别的基于语料库数据集

发布1000句平衡数据,涵盖标准孟加拉语及吉大港、锡尔赫特、巴里萨尔方言,用于辱骂文本四类方言识别。

04:00
arXiv cs.CL

时间分辨的标记归因揭示扩散语言模型的生成动态

提出DLIG,将积分梯度扩展至扩散语言模型任意层与去噪步,实现token归因并揭示生成动态。

04:00
arXiv cs.CL

HeadEdit:通过冻结的解嵌入矩阵校准语言模型行为

HeadEdit免梯度,借助冻结解嵌入矩阵的低秩行为子空间,按提示坐标生成词表级校正,提升多任务且开销低

04:00
arXiv cs.CL

ASCRIBE:基于原子事实与临床重要性的泰语SOAP病历生成推理框架

ASCRIBE按临床重要性对原子事实分级再摘要,并发布首个泰语临床基准,提升SOAP病历生成的完整性与忠实度。

04:00
arXiv cs.CL

玛德琳:从模拟人生中学习对话记忆的非自主回忆

通过模拟人生生成线索—触发对,训练查询编码器学习记忆关联,无需LLM调用即可精准回忆。

04:00
arXiv cs.CL

外部控制框架退火:学习以更少外部控制行动

HAT结合显式控制监督与逐步弱化外部控制框架的课程,使智能体内化控制,撤除支持后仍保持表现。

04:00
arXiv cs.CL

懂得何时留住:均匀状态扩散语言模型中的正确词元保留

均匀状态扩散模型缺乏词元保留能力;CTR-Reg损失使干净词元准确率提升26.5点,困惑度减半。

04:00
arXiv cs.CL

泛化是稳定性,而非准确性:大语言模型的多轴评估

提出SAGO多轴评估LLM泛化稳定性,发现模型普遍不稳定、各行为轴独立,跨数据集排名会逆转。

04:00
arXiv cs.CL

科学乌托邦?学术研究生态系统的闭环大模型模拟

提出闭环LLM模拟框架SciUtopia,发现重投稿加剧评审负担,谨慎探索兼顾影响与多样性,资源不平等无需累积优势即可涌现。

04:00
arXiv cs.CL

ARCCS:自动化监管合规检查系统

首个开源端到端合规检查系统,分解条文并凭证据评估;GDPR一致率96.67%,采购违规检出98.8%。

04:00
arXiv cs.CL

评估面向纵向临床笔记的大语言模型问答中的生物医学重排序

生物医学重排序提升临床笔记检索Hit@10(46.6%→60.6%),答案正确率仅微增至48.6%

04:00
arXiv cs.CL

什么能赢得一票?法国Compar:IA大语言模型竞技场中的格式、长度与词汇多样性

13.7万法语投票:格式、长度与词汇多样性影响胜负;调整排名变动大却未更准,宜并列原始与调整排名。

04:00
arXiv cs.CL

AI 生成的科学文本是否遵循人类论证模式?——基于 CARS 模型的研究论文引言对比

人类写的研究引言在论证步骤的选择与顺序上更灵活,AI 生成文本更统一;给出 CARS 定义后 AI 反而更僵化。

04:00
arXiv cs.CL

面向本体网络构建的LLM辅助类型化语义链接发现

结合嵌入聚类预筛与GPT-4o提示生成类型化语义链接,80万概念对缩至9.5万,精度80.19%。

04:00
arXiv cs.CL

正确答案,错误状态:多智能体协作中的隐藏信息失效

多智能体协作常以答案正确为成功,却忽视信息状态损坏;证据验证与状态重建远低于任务解决,所提方法可改善。

04:00
arXiv cs.CL

SHAMS:面向黎凡特阿拉伯语的音频锚定发音基准

SHAMS:覆盖五种黎凡特阿语变体的1300条语音基准,四层对齐,支持发音与语音识别评测。

04:00
arXiv cs.CL

什么让事物变得更难?用自然语言解释问题难度

从大模型回答中估计题目难度,自动生成并验证自然语言假设,解释题目为何更难,预测力强且具因果性。

04:00
arXiv cs.CL

审计规则如何塑造大语言模型中忠实的因素解释

报告依赖型审计会激励大语言模型隐瞒重要因素,加入报告无关的审计成分可促使其如实汇报。

04:00
arXiv cs.CL

人格设定仍在,但究竟是谁在说话?持久化AI智能体中的潜在身份回退

失去系统人格锚定后,常驻智能体可潜在回退为底层身份;历史仍含人格却未必践行,需锚定与对话维持。

04:00
arXiv cs.CL

第二个模型何时有帮助?LLM验证中的跨模型审查

跨模型审查与同模型F1无显著差异,发现错误部分不同;同模型加跨模型优于两次同模型,但未显著优于强跨模型两次。

04:00
arXiv cs.CL

GAW-PO:基于梯度对齐词元权重的偏好优化

GAW-PO按梯度对齐度重新加权被拒词元的负向惩罚,在11项基准上超越DPO,且对强偏好优化更稳健。

04:00
arXiv cs.CL

对 WebArena-Lite 上网络智能体评估的审计:对结果与轨迹的人工复核

人工复核165项任务,纠正自动评估漏判5–8个百分点,发现滚动循环等失败模式,最终分数不足以评估智能体。

04:00
arXiv cs.CL

无需模型:文本熵率过滤缓解迭代微调坍缩

无需模型,文本熵率过滤缓解迭代微调坍缩:六代实验显著提升合成数据多样性、降低重复,优于对数概率过滤。

04:00
arXiv cs.CL

AURAL:面向语音语言模型的自适应潜在推理与联合分块

AURAL用自适应潜在推理与联合分块,降低语音模型首答延迟11.8倍,并构建68.3万条双语推理数据。

04:00
arXiv cs.CL

该选哪个大语言模型?面向大语言模型的在线主动模型选择

首个在线主动大语言模型选择框架,有限标注挑最有信息提示,省标注成本达71.67%,降后悔2.51倍

04:00
arXiv cs.CL

LLM 能否可靠地标注生物测定元数据以提升数据就绪度?

PubChem 生物测定元数据严重缺失;评测显示 LLM 标注召回率高、开源与闭源差距小,可规模化辅助标注与审计,但需人工复核。

04:00
arXiv cs.CL

Yo-ByT5:高效高保真的约鲁巴语变音符号还原

提出字节级变音符号还原模型Yo-ByT5,参数仅为mT5-base一半,性能相当且文本保真度更优。

04:00
arXiv cs.CL

面向任务的秩适配:文本分类中的持续学习

提出TORA几何路由框架,依LoRA低秩结构相似度选择迁移或隔离,避免遗忘与负迁移,在15个基准上有效。

04:00
arXiv cs.CL

Acmite:通过概念引导的互信息缓解大语言模型中的性别偏见

Acmite以结构化概念表示刻板印象,用互信息最小化训练LoRA并选择性激活,有效缓解LLM性别偏见。

04:00
arXiv cs.CL

复合词释义基于类比

提出无参数复合词类比模型,以构成词家族平均偏移预测词义,汉语复合词上优于CAOSS,更符合认知。

04:00
arXiv cs.CL

Mem++:面向长期组织型 LLM 智能体的非破坏性记忆

Mem++ 提出非破坏性记忆:写入存全文,读取按时间检索并融合排序,提升长期组织智能体问答,优于基线。

04:00
arXiv cs.CL

面向高效多跳问答的套娃式层次化RAG

MatRAG以套娃表示学习对齐聚类层次,逐层降维索引,自顶向下遍历加实体驱动重排,多跳问答检索质量更优且成本更低。

04:00
arXiv cs.CL

用于评估大语言模型临床推理的评分量规全景:现有、缺失与需整合

现有评分工具无法覆盖临床推理六维度,需整合二元评分项等,补足不确定性、反事实与忠实性评估。

04:00
arXiv cs.CL

使用MoE路由器的仅解码器模型跨语言对齐

用MoE路由器输出替代隐状态对齐损失,实现跨语言表征对齐并提升多语言性能。

04:00
arXiv cs.CL

通用字节级编码:通过 UTF-8/UTF-16 路由缩小跨文字系统词元预算差异

UBE让1-2字节走UTF-8、3-4字节走UTF-16,降低编码下限,缩小跨文字词元预算差距。

04:00
arXiv cs.CL

带记忆的语言模型对齐的渐近性

将语言模型对齐两种方法的渐近接近性从独立同分布扩展至马尔可夫记忆,并刻画有限长度KL为零条件。