9926 条条目 · 106 个活跃源
2026年8月19日
04:00
arXiv cs.CL

Dripper:轻量级语言模型实现令牌高效的主HTML提取

提出轻量框架,以小型语言模型将网页主内容提取转为约束序列标注,高效媲美超大模型,开源。

04:00
arXiv cs.CL

语境中说话:基于对比学习的语音上下文对齐多语言ASR

提出多语言上下文感知ASR,用对比学习对齐语音与上下文,在11种语言及方言上提升识别超5%。

04:00
arXiv cs.CL

Eval4Sim:角色模拟评估框架

Eval4Sim从可还原性、一致性、自然性三维度,以人类语料为基准评估角色模拟,揭示单分数法忽视的权衡。

04:00
arXiv cs.CL

PrivAct:通过多智能体偏好训练内化情境隐私保护

PrivAct多智能体框架内化情境隐私,泄漏率降低12.32%且保持有用性,具零样本泛化。

04:00
arXiv cs.CL

实验室驱动的对齐特征的涌现:审计生成式AI潜在偏见与复合风险的心理测量学框架

审计6机构18模型:组织在缺陷维度上排序一致,无意识形态倾向;机构内差异≈机构间,新版本缺陷更少。

04:00
arXiv cs.CL

大型语言模型如何在持续预训练中学习概念?

LLM概念电路揭示学习/遗忘:先升后降再稳定;相似概念干扰大;知识可迁移;提出电路感知经验回放优先重放易忘概念。

04:00
arXiv cs.CL

语系至关重要:评估跨语言边界的基于大模型的语音识别

提出基于语系的连接器共享策略,每语系一个连接器,减少参数并提升跨域泛化,为多语言语音识别提供可扩展方案。

04:00
arXiv cs.CL

SCOPE:选择性共形优化的成对大语言模型评判

提出选择性共形优化框架校准阈值控制评判错误率,用双向偏好熵信号,同风险下多接受2.4倍评判。

04:00
arXiv cs.CL

SCRIBES:基于强化学习的网络规模脚本化半结构化数据抽取

提出SCRIBES框架,强化学习以网页布局相似性为奖励,生成可复用提取脚本,质量提升13%,问答提升4%

04:00
arXiv cs.CL

趋同演化:不同语言模型如何学到相似数字表示

模型以周期特征表示数字,但仅部分可线性分类;傅里叶稀疏性非充分条件,数据、架构等决定特征,呈趋同演化。

04:00
arXiv cs.CL

面向领域特定文档生成的RAG-SFT参数化知识

针对领域文档生成,提出C-FEX/PKP评估参数化知识,发现微调不强化反而抑制幻觉,7B媲美72B。

04:00
arXiv cs.CL

RecurrentGPT:通过循环调制实现Transformer的表达深度

该模型通过循环调制共享核心实现深层表达,等算力下三层媲美十二层模型,等参数下损失更低,并大幅减少参数和内存。

04:00
arXiv cs.CL

SOD:面向小型语言模型智能体的逐步在线策略蒸馏

提出SOD逐步在线策略蒸馏,按步骤差异调整蒸馏强度,缓解工具错误级联,基准提升20.86%,0.6B模型AIME达26.13%

04:00
arXiv cs.CL

LLMs能否可靠自我报告对抗性前缀注入?

模型难以识别自身输出遭对抗性前缀攻击;训练可改善内省,却反升攻击成功率。

04:00
arXiv cs.CL

ContextClaim:一种上下文驱动的可验证声明检测范式

将检索引入声明检测阶段,用维基百科上下文摘要增强可验证性判断,并提升下游验证效果。

04:00
arXiv cs.CL

TCMIIES:基于浏览器的LLM驱动的学术文献智能信息抽取系统

TCMIIES:浏览器端LLM学术文献信息抽取系统,零安装、纯前端、多模型支持,抽取合规率超94%。

04:00
arXiv cs.CL

注意力流:通过故事摘要追踪LLM的概念参与

对比人类与LLM的小说摘要,发现模型叙事关注偏向结尾,揭示其长文理解局限。

04:00
arXiv cs.CL

SAEVerbalizer:通过表征言语化为稀疏自编码器特征生成解释

将SAE解码方向注入LLM表征,直接生成特征的自然语言解释,可泛化到未见特征并跨字典和模型迁移。

04:00
arXiv cs.CL

DataSTORM:基于探索性数据分析与数据叙事的大规模数据库深度研究

提出LLM代理系统DataSTORM,融合探索性数据分析与数据叙事,自主研究大型数据库与网络,在基准测试上超越现有方法。

04:00
arXiv cs.CL

LENS:在动态原始文档上通过潜在证据探索进行上下文搜索

LENS提出免索引的上下文搜索,动态探索潜在证据,预算受限下定位证据,提升证据召回与答案溯源性。

04:00
arXiv cs.CL

衡量在线话语中的叙事极化

研究提出叙事极化概念,分析以巴冲突视频与评论,发现视频高度极化,评论趋同,但复杂叙事仍存差异。

04:00
arXiv cs.CL

自蒸馏作为大语言模型的性能恢复机制:对抗压缩与灾难性遗忘

提出自蒸馏微调框架恢复大模型性能,理论证明其通过对齐高维流形实现恢复,实验验证流形对齐与性能恢复强相关。

04:00
arXiv cs.CL

在人机协作中支持校准信赖:不同任务需要不同策略

AI辅助策略无通用最优:视觉推理中概率支持最佳,语言推理中LLM解释最佳,应针对任务匹配支持形式。

04:00
arXiv cs.CL

TSQueryBench:大语言模型作为时间序列解释的评判者

提出时间序列解释基准,生成与评估不对称:生成错误仍能正确打分,规则引导的大语言模型评估比生成更可靠。

04:00
arXiv cs.CL

手稿中的隐藏提示词利用AI辅助同行评审

手稿隐藏提示词可操纵AI同行评审,暴露系统漏洞,属可疑研究行为,需技术筛查与统一政策。

04:00
arXiv cs.CL

Palmyra x6 技术报告:一种经锚定监督微调后训练的智能体工具使用模型

锚定监督微调训练工具使用智能体,仅626条轨迹,企业任务表现优异,BFCL Core 0.785,六基准均值领先。

04:00
arXiv cs.CL

空标记知晓:减少ASR与NMT中的无消息幻觉

空标记可作弃权信号;提高其分数能抑制幻觉,但会误删有效内容,评估需兼顾抑制与删除代价。

04:00
arXiv cs.CL

大语言模型在规则应用中的概念掌握证据

五实验表明13个LLM规则应用超越记忆,对新刺激与人类判断一致,体现可泛化语义能力,不依赖扩展推理。

04:00
arXiv cs.CL

Chronos:AI协同历史学家

Chronos:AI协同历史学家,支持自然语言定制工作流,其扩展可自动提取历史扫描件信息,准确率高。

04:00
arXiv cs.CL

抖音多模态嵌入模型技术报告

抖音提出双阶段多模态嵌入模型DME兼顾效率与细粒度取得SOTA并已上线

04:00
arXiv cs.CL

FishBack:Transformer中最优激活引导的拉回Fisher几何

提出拉回费希尔几何修正欧氏空间假设,于变换器中间层推导最优引导方向,令非目标相对熵降1.4至6.5倍。

2026年8月18日
04:00
arXiv cs.CL

自动还是受控?重复启动揭示基础LLM、指令LLM与人类的处理差异

基础模型呈自动加工,指令模型呈受控加工,人类为混合模式;后训练改变大语言模型的重复信息处理机制。

04:00
arXiv cs.CL

辅助不确定性信号用于大语言模型辅助的系统评价筛选:八个Cohen药物类别评价的基准研究

辅助图神经网络不确定性信号可提升大模型筛选效率;仅处理存疑项最优,二次筛查不改判。

04:00
arXiv cs.CL

AutoMem:面向自动化记忆架构搜索的文本梯度递归自改进框架

提出AutoMem框架,用文本梯度递归自改进搜索任务自适应记忆架构,平均准确率提升2.8点,令牌成本降低14.3%。

04:00
arXiv cs.CL

Wiola 13M:面向参数高效小型语言模型的门控螺旋注意力架构

Wiola13M为参数高效小语言模型,引入螺旋旋转位置编码、门控螺旋注意力和蝴蝶前馈,推理无损。

04:00
arXiv cs.CL

HarmProfile:刻画前沿大语言模型的有害分布

提出HarmProfile,收集大模型有害输出,定义风险画像,发现危害性与多样性随能力增长。

04:00
arXiv cs.CL

推理时缓解大型语言模型中的对抗性政治偏见

提出用思维链和直接偏好优化策略,递归自校正将政治中立性从2.14提至4.56,有效缓解LLM摘要的政治偏见。

04:00
arXiv cs.CL

描述语言模型在决策中的修辞错位特征

研究发现语言模型即使事实准确,其修辞表达也可能诱导认知偏差,导致人类决策失误,带来安全风险。

04:00
arXiv cs.CL

低资源语言下的大语言模型安全对齐:系统文献综述

综述低资源语言大模型安全对齐:安全差距大,源于预训练不均与文化基准缺失,需文化基准与多语对齐。

04:00
arXiv cs.CL

DeMTS:将去噪轨迹作为多元时间序列用于扩散语言模型幻觉检测

将去噪轨迹建模为多元时间序列检测扩散语言模型幻觉,DeMTS性能超越现有方法。

04:00
arXiv cs.CL

多模态生成式模糊系统:模糊推理引导的大模型交互式问答框架

提出多模态生成模糊系统:协同反思缓解模态偏差,模糊规则+多跳推理增强跨域融合,多数据集上优于现有方法。

2026年8月17日
04:00
arXiv cs.CL

BCMT:分块因果记忆Transformer

BCMT用分块因果记忆替代全局注意力,实现长上下文建模,性能媲美密集Transformer,同时提升吞吐、降低内存。

04:00
arXiv cs.CL

并非所有Token都等价:面向智能体LLM系统的通胀感知路由

智能体系统重试导致Token膨胀,实际成本远超单价。InflationAgent通过四阶段路由,以语义汇率选模型,在GSM8K上比FrugalGPT节省31%Token且准确率更高。

04:00
arXiv cs.CL

潜空间思考,语言解释:自解释潜推理

提出SELR:通过答案损失和CoT损失联合训练,实现高效且自解释的潜推理,无需外部解码器。

04:00
arXiv cs.CL

语言服务器能为编码智能体节省Token吗?一种测量方法论与初步研究

经测量,LSP语义检索通常不省Token,仅特定任务和模型有利;建议按任务类自适应路由。

04:00
arXiv cs.CL

Jais 2:一个以阿拉伯语为中心的开源大语言模型家族

Jais 2是阿拉伯语中心开源大模型家族,含70B参数最大模型,性能领先,高效且开放。

04:00
arXiv cs.CL

基于语义感知偏差估计的大型音频语言模型公平性度量

提出语义感知混合效应回归框架,控制语义与说话人混淆,用模型自身语义嵌入,减少虚假公平发现,稳健估计亚组差异。

04:00
arXiv cs.CL

IterCOMP:面向多跳问答的推理感知自适应提示压缩

本文提出一种无需训练的迭代压缩方法,通过分解证据与生成追问,减少令牌并提升多跳问答的准确性。

04:00
arXiv cs.CL

GRPO超越英语:非英语与多语言环境下的大规模研究

研究发现非英语GRPO训练母语推理与英语差距小,跨语言迁移强,但特定语言可能引发其他语言退化,需广泛评估。

04:00
arXiv cs.CL

CLAIR-Fin:面向跨模态金融问答的对抗式多智能体声明级验证与自适应辩论框架

提出九智能体框架,按类型验证金融声明,对抗式辩论,先审查后终审,忠实度升至0.889,拒答5.4%问题。