9691 条条目 · 106 个活跃源
2026年9月25日
04:00
arXiv cs.CL

面向自动语音识别的词元级转写歧义容忍训练准则

提出词元级容错训练,将通配路径细化至词元并融合词级路径;多语言均优于CTC,WER降9.45%。

04:00
arXiv cs.CL

SemMSA:面向不完整数据的潜在语义辅助鲁棒多模态情感分析

提出SemMSA,用LLM构建情感语义,经跨模态语义精炼与谱对齐融合多模态,在不完整数据下达最优。

04:00
arXiv cs.CL

音频语言模型对听与读的区别性特征表征是否一致?

音频语言模型听读区别性特征表征多不一致;仅Qwen2.5-Omni浊音超随机基线,模型家族比规模更关键。

04:00
arXiv cs.CL

JevOut:自然语境即可颠覆决策模型

简短自然语境即可将决策模型的正确判断翻转为高置信度错误选择,翻转率达六至七成。

04:00
arXiv cs.CL

网络阴谋论的智能体检测

提出智能体框架,借助社交语境工具推断发言意图,在希伯来语推文上显著优于纯文本分类。

04:00
arXiv cs.CL

中文标题:查询同盟:学习检索动作

中文摘要:轨迹微调使小模型胜任检索问答的动作控制器,动作预测宏F1由0.17升至0.65,端到端精确匹配提升至0.79。

04:00
arXiv cs.CL

家庭不受保护区:算法治理与对话式AI中施害者话语的再生产

六款AI:四款拒答率<1%,亲密框架令漏答放大4–11倍,新会话96%以上复发,即“家庭不受保护区”。

04:00
arXiv cs.CL

Spooftral:Voxtral 音频-语言模型能否检测语音欺骗?

Voxtral检测语音欺骗,DoRA轻量适配提出Spooftral,ASVspoof5上EER 4.25%。

04:00
arXiv cs.CL

来自主动语音代理蜜罐的真实诈骗与骚扰电话对话语料库

主动语音蜜罐53天采集万通真实诈骗与骚扰通话,含895小时音频及逐轮转录,并验证真实性。

04:00
arXiv cs.CL

CodeGraph:基于维基数据锚定的源代码开放分类法知识图谱

用代码大模型抽取语义实体并链接维基数据,构建含1.58亿节点、10亿边的源码开放分类知识图谱。

04:00
arXiv cs.CL

口音类比引导:跨语言语音克隆中同等口音下更高的说话人相似度

提出免训练口音类比引导,减少参考口音泄漏,同等口音下提升说话人相似度,四个开源TTS模型有效。

04:00
arXiv cs.CL

将语言模型从视觉编码器中解放:语义序列化作为小语言模型的感知接口

冻结感知栈将场景序列化为文本供纯文本LLM作答,7B/3B超越同规模零样本VLM,监督下二者趋同。

04:00
arXiv cs.CL

在自动语音识别中从未标注测试数据学习新词

提出ASR测试时从未标注数据学新词,以KL散度优化CTC候选拼写,OOV字符错误率最多降14.97%。

04:00
arXiv cs.CL

奖励倾斜的在线策略蒸馏:面向音频语言模型的声学依据

提出RT-OPD:用教师有无音频的对数概率差为奖励重塑分布,做反向KL蒸馏强化声学依据。

04:00
arXiv cs.CL

面向通用服务机器人的基于大模型链式任务规划的设计与评估

提出LLM链式两阶段架构,提示长度减约45%,各模型规划提升最高37个百分点,实机10任务完成6项。

04:00
arXiv cs.CL

个性化韩语唇读作为视觉语音识别:OLKAVS 上的迁移、统计与自适应

提出个性化韩语VSR系统,在OLKAVS上量化个体误差;低秩适配器以少量视频降低高错说话人CER并跨摄像头迁移。

04:00
arXiv cs.CL

ExplorationBench:衡量AI系统在可验证异世界中的探索能力

发布ExplorationBench基准:以规则可执行、与常识相悖的可验证异世界沙盒,评测AI能否通过探索获取并应用全新知识。

04:00
arXiv cs.CL

用可渲染程序进行多模态思维

SVGLM用SVG基元连接文本与图像推理,构建SVG图像编辑数据集,使VLM能"边想边画"。

04:00
arXiv cs.CL

在扩散语言模型中实现近似联合采样

提出轻量采样器,使扩散语言模型单次全模型前向可近似联合采样多个词元,兼顾并行与精度,MAUVE达0.87。

04:00
arXiv cs.CL

PoEM:基于现有策略预测强化学习结果

提出PoEM,利用已有奖励后训练模型,免额外强化学习即可预测新奖励下的策略,并在文本图像任务验证。

04:00
arXiv cs.CL

OpenAI o1 评测:通用人工智能的机遇与挑战

对OpenAI o1的跨领域复杂推理评测显示其表现优异,部分超越人类,迈向AGI仍存局限。

04:00
arXiv cs.CL

信任还是不信任:语音中的检索增强事实核查

提出VeriSpeak语音事实核查基准,含3879条声明,揭示文本-语音模态差距,检索结合显式推理可使准确率达86.1%。

04:00
arXiv cs.CL

语言特定知识:模型在X语言中比英语懂得更多吗?

提出语言特定知识,发现换用非英语乃至低资源语言可提升问答表现,需为查询选择最优语言。

04:00
arXiv cs.CL

大语言模型基础

本书聚焦大语言模型基础,涵盖预训练、生成模型、提示、对齐、推断与推理,适合学生、从业者及感兴趣者。

04:00
arXiv cs.CL

基于人类反馈的会中交互式说话人纠错

提出LLM辅助会中说话人纠错,用户反馈修正归属;AMI上DER降31.99%、替换错误降52.68%

04:00
arXiv cs.CL

校准还不够:评估语言变化下的置信度估计

提出鲁棒性、稳定性与敏感性三维评估框架,揭示现有置信度估计难以区分语义不同答案的缺陷。

04:00
arXiv cs.CL

IDRBench:深度研究智能体交互能力基准测试

提出IDRBench评测深度研究智能体交互;交互平均提升对齐6.39分,但非总有效,取决于提问与反馈利用。

04:00
arXiv cs.CL

别贪心,三思而行:文档级信息抽取的采样与选择

提出ThinkTwice:LLM生成多候选模板并择优,优于贪心解码与监督SOTA。

04:00
arXiv cs.CL

通过能量驱动的潜在冲突检测对抗指令冲突

提出ELCD响应级潜在冲突检测器,用隐藏状态与排序目标识别响应漂移,多模型上显著优于基线。

04:00
arXiv cs.CL

LLM惊奇度是捕捉英语花园路径效应的必要而非充分条件:来自阅读范式联合潜变量建模的证据

潜过程MPT模型整合四种阅读范式,预测英语花园路径效应优于仅LLM惊奇度;融合惊奇度可再提升。

04:00
arXiv cs.CL

Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis

04:00
arXiv cs.CL

Continued Pretraining of FinBERT on Finnish Histopathological Reports: Train-Time Signals and Proxy Downstream Correlations

04:00
arXiv cs.CL

Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation

04:00
arXiv cs.CL

DiscoPhon:基于离散语音单元的无监督音素库发现基准

提出多语言基准DiscoPhon,用离散语音单元做无监督音素发现;覆盖6+6语言,用10小时新语言语音映射音素,评测识别与切分,提供HuBERT/SpidR基线。

04:00
arXiv cs.CL

LiveMathematicianBench:基于证明草图的研究级数学推理动态基准

动态基准源自最新arXiv论文,用证明草图干扰项评测LLM研究级数学推理,最佳仅43.5%,远未饱和

2026年9月24日
04:00
arXiv cs.CL

COMED:多LLM推理中路由与协作之间缺失的中间地带

揭示跨模型协作的非单调性,COMED以锚点自洽、路由边距与轻量探针选择性升级协作,在16项基准上最多提升10.7个百分点且更省算力。

04:00
arXiv cs.CL

当学习式上下文规划未能胜过强检索:面向长上下文问答的规划、路由与重排序对照研究

受控实验表明,学习式上下文规划经强检索、路由与重排序控制后仍不及混合检索,只是弱相关信号。

04:00
arXiv cs.CL

专家在LLM分歧处登场:利用跨模型分歧定位专家投入,改进大规模标注的LLM编码手册修订

以LLM跨模型分歧定位专家投入;理由标注法准确率64.9%,优于专家修订手册,将数月修订缩短至数天。

04:00
arXiv cs.CL

事实核查得分提升时究竟改变了什么?训练验证器与大语言模型中的证据与答案归因

联合分数提升主要来自证据改善而非答案准确率;扩大上下文可放大证据增益,聚合指标会掩盖声明级差异。

04:00
arXiv cs.CL

句子级解释准则分类:来自德国联邦宪法法院的基准

基于德国联邦宪法法院判决,构建句子级解释准则分类基准;四模型七项子任务平均F1为70.4–79.2。

04:00
arXiv cs.CL

LEGO:协同专家GraphRAG与专家思维链进行法律推理

LEGO融合法律专家GraphRAG与专家思维链,借规范关系检索和结构化推理提升大模型法律推理能力。

04:00
arXiv cs.CL

能识别却无法生成:面向文化特定亲属称谓的生成基准

多选高分但生成低分:五种开源LLM在印地、泰米尔、韩语亲属称谓生成中准确率骤降,需生成式评估。

04:00
arXiv cs.CL

伊利诺伊社会态度聚合语料库(ISAAC):用于大规模分析社会群体话语的开放工具与可复现流程

推出ISAAC:5.27亿条Reddit帖子,覆盖六类社会群体,支持标注、验证与可复现分析。

04:00
arXiv cs.CL

EduBehaviors:面向教育对话可审计编码的基于断言模式

提出EduBehaviors框架,用大模型测量可观察行为并训练分类器,实现可解释、可扩展、可审计的教育对话标注,在TalkMoves上具竞争力,并开源工具。

04:00
arXiv cs.CL

LexLattice:通过文档层级上的神经细胞自动机实现多语言抽取式摘要

将法律文档层级映射为二维语义晶格,用神经细胞自动机整合证据,实现多语言抽取式摘要,24语种SOTA。

04:00
arXiv cs.CL

NADI 2026:第二届多方言阿拉伯语语音处理共享任务

NADI 2026设五项八子任务,覆盖ASR、方言识别、TTS、翻译与理解;域外泛化仍是瓶颈。

04:00
arXiv cs.CL

数证据,而非数句子:面向长文本价值测量的LLM判断退火证据融合

提出免训练TEF,按信息增益加权句子证据、抑制不确定句,在MIND基准上平均提升4.5个准确率点。

04:00
arXiv cs.CL

UniDataAgent:面向企业问报到报告自动化的本体驱动智能体

本体驱动的企业问报到报告智能体,语义构建与执行分离,构建周期由一周缩至数小时,严格准确率95.0%,远超文档RAG的72.5%。

04:00
arXiv cs.CL

把信用归于应得之处:面向高效推理的冗余感知学习

提出RECAP,以结构责任和步骤效能做冗余感知信用分配,重塑GRPO优势,提升推理准确率并减少冗余。

04:00
arXiv cs.CL

洞悉关键:面向大规模推理的原则性上下文表示

基于关联实现原则提出R3Con,构建大规模上下文表示,显著超越基线,小模型亦可媲美大模型且成本更低。