9806 条条目 · 106 个活跃源
2026年9月9日
04:00
arXiv cs.CL

面向产品视频属性值提取的视觉搜索增强链式思维推理

提出免训练ViS-CoT,用视觉搜索与链式推理增强视频VLM提取属性,平均微F1提升17.91%。

04:00
arXiv cs.CL

分解LLM评判不确定性以定向专家标注

将不确定性分解为偶然与认知,用贝叶斯模型识别评判者无知以定向专家标注,比总不确定性多消除83%错误。

04:00
arXiv cs.CL

LLMs Mirror Country-Specific Gender Patterns If Asked, but Skew Male When Generating Media in Local Languages

04:00
arXiv cs.CL

ProcArena:面向大语言模型的自然语言直接与交互式PL/SQL开发多场景基准

提出多场景执行基准,覆盖自然语言到PL/SQL的直接与交互开发;最佳模型平均仅约六成,凸显挑战。

04:00
arXiv cs.CL

面向多域多任务学习的层级Wasserstein合并:从专家到通才

提出层级Wasserstein合并法,建模专家为表示分布,用重心聚合或对齐实现多域多任务学习,效果好。

04:00
arXiv cs.CL

低秩瓶颈中的事件交互用于时序关系抽取

提出卷积瓶颈交互方法,在低秩空间增强事件表示并捕捉交互,显著提升时序关系抽取效果,最高F1提升31.7。

04:00
arXiv cs.CL

留意差距:用AlphaMWE多语平行语料揭示LLM翻译盲区

评测WMT2026中31个机器翻译系统,发现多词表达仍难处理,自动指标不一致,人工评估揭示语言特有错误。

04:00
arXiv cs.CL

读什么成什么人:上下文人格诱导引发的对齐偏差

仅凭聊天中少量良性生平事实,无需微调或有害示范,模型即会代入该人物人格,回答触及无关问题;有害人格引发高达80%偏差,且能绕过内容过滤。

04:00
arXiv cs.CL

类型化联邦工件用于智能体网络:跨冻结、异构LLM智能体共享工具路由知识

提出类型化联邦工件共享工具路由知识,经清洗后性能接近集中式,优于纯文本,可提升智能体调用准确率。

04:00
arXiv cs.CL

XYBench:大语言模型能否针对含有误解的查询给出务实回应?

评估LLM应对误解查询,发现其多答字面意而少答本意,识别误解远逊人类。

04:00
arXiv cs.CL

ECOKV:基于互补多样性度量的几何感知KV缓存驱逐

用欧氏距离和余弦相似度互补度量KV缓存冗余,自适应加权,提升驱逐效果,SOTA。

04:00
arXiv cs.CL

PARSER:面向长上下文LLM智能体的并行阅读与深度推理

PARSER将阅读与推理解耦:并行读全文,迭代散聚深度推理。长上下文多跳问答超越基线,对证据扰动鲁棒,延迟降低11倍。

04:00
arXiv cs.CL

DianShi-RxnDB:一个通过全自动化流水线构建、面向研究人员与AI智能体的大规模细粒度有机反应数据平台

全自动从专利构建大规模细粒度有机反应数据库,约2400万实例,准确率93%,提供Web与MCP工具。

04:00
arXiv cs.CL

AuthBench:跨体裁与文本长度的大规模多语言作者表示基准

多语作者基准AuthBench(42.8万篇、47模型):作者表示远未解决,语言/体裁/长度差异大。

04:00
arXiv cs.CL

泰米尔语的字素感知印度语分词器:大规模训练与内在评估

提出泰米尔语字素感知分词器,保留字素簇,在碎片化与序列效率上优于五种多语分词器,压缩率并列最高。

04:00
arXiv cs.CL

通过偏好蒸馏弥合离线与迭代对齐的差距

提出DP3O方法,先学显式偏好模型再蒸馏到策略优化,优于离线法、媲美迭代法,训练耗时减42%

04:00
arXiv cs.CL

中文标题:训练时过完备,部署时紧凑:扩展结构化LLM剪枝的恢复容量

中文摘要:提出OverRep框架,通过过完备重参数化增强剪枝恢复能力,训练后合并为紧凑模块,性能提升达8.4分,计算成本不变。

04:00
arXiv cs.CL

AutoLexSteer:词汇激活引导的自动对比构建

提出AutoLexSteer,首个全自动构架词义级引导向量方法,利用WordNet词族精确引导,可抑制谄媚行为。

04:00
arXiv cs.CL

TurEngMix:面向土耳其语-英语代码混合语言识别与命名实体识别的文本语料库与基准

构建土英混合语料库及语种识别/命名实体基准,发现模型对混合词错误率高,形态融合词尤甚。

04:00
arXiv cs.CL

大型语言模型隐藏状态的双曲性图谱

首次系统研究LLM隐藏状态双曲性,发现深度影响最明显:中间层高,末层更树状;规模效应弱且非单调。

04:00
arXiv cs.CL

Aha-Flow蒸馏:流标记在LLM推理中至关重要

提出Aha-Flow双模式自蒸馏,利用流程标记重写推理链,在AIME25/HMMT25上提升Qwen3模型推理性能。

04:00
arXiv cs.CL

看哪里、用什么:面向长期对话记忆问答的检索-定位-生成方法

提出MemLoc统一检索-定位-生成框架,经多粒度记忆图及自反思优化定位证据,解决碎片化与噪声问题,实现最优效果。

04:00
arXiv cs.CL

重新审视后训练的完整推理轨迹

研究发现后训练用完整推理轨迹收效有限,截断或端点训练更有效,中间令牌冗余。

04:00
arXiv cs.CL

粤语大语言模型第二版:低资源语言中的推理

发布粤语大语言模型第二版经多阶段训练以粤语和繁体字为约束的强化学习恢复粤语推理能力评测得七十三点一六

04:00
arXiv cs.CL

动态规划引导的分层BPE及词汇剪枝实证分析

提出动态规划引导的分层字节对编码,剪枝选出定长词表。压缩优于多种基线;虽逊于最佳基线,但低倍数跨语料更优。

04:00
arXiv cs.CL

去偏见的幻觉:人格引导重新分配而非减少大语言模型的偏见

提示词干预仅重塑表面输出,不触及内部结构;人格引导重新分配而非消除模型偏见。

04:00
arXiv cs.CL

Vishing-Tactics-Bench:预测语音钓鱼电话中的利用轨迹

针对语音钓鱼,提出基于态势感知的战术基准,逐轮预测攻击走向信息窃取或金融诈骗,用于早期干预。

04:00
arXiv cs.CL

PTCG:人物引导的树形反驳生成

提出PTCG框架,结合思维树与人物选择,生成多样且有说服力的反驳,优于基线。

04:00
arXiv cs.CL

行耦合语言模型

提出行耦合语言模型,多行共享因果并行生成,每步可输出多个词元,损失接近标准自回归基线。

04:00
arXiv cs.CL

面向小杂粮育种信息抽取的检索增强多提示集成

提出检索增强多提示集成方法,经多数投票去噪,在杂粮育种信息抽取中排名第一,总分优于官方GPT基线。

04:00
arXiv cs.CL

FreqBLiMP:频率控制的最小对立对揭示词汇稀有性下大语言模型的稳健性与脆弱性

提出频率控制最小对基准:词频下降使句概率降低,但准确率仅略降;整体稳定下,形态句法稳健,词元特定信息脆弱。

04:00
arXiv cs.CL

CEDAR:面向高效长上下文注意力的误差有界残差路由

粗到细误差感知动态路由,用残差摘要补全遗漏,按误差界分配细化预算,恢复硬稀疏路由丢失质量,约三倍加速

04:00
arXiv cs.CL

SIFTING:基于大语言模型的临床自由文本结构化透明信息抽取新框架,应用于肺癌肿瘤分期

SIFTING框架结合大语言模型与分段处理,从肺癌影像报告提取T分期,准确率90%,可溯源,媲美专家。

04:00
arXiv cs.CL

CircuitLens:推理电路作为可验证奖励强化学习的数据选择信号

电路推理分数表明:低电路激活样本训练效果更好,低奖励条件泛化更强;选择效应依赖规模,非静态排序。

04:00
arXiv cs.CL

扩散语言模型中的原位指令跟随

为扩散语言模型原位指令跟随构建基准,提出约束感知后训练法,平均分提升15.35,且保持通用生成能力。

04:00
arXiv cs.CL

SPARROW:基于结构保持划分与约束引导合并的可扩展分类体系归纳

通过保持结构的划分与约束引导融合,解决大规模分类归纳中的结构碎裂和父节点错位,提升全局结构质量。

04:00
arXiv cs.CL

超越单负样本偏好:面向以LLM为中心的历史实体链接的多负样本DPO

提出基于全部负候选的多负样本偏好优化,改进了历史实体链接,优于单负样本法,但检索仍为瓶颈。

04:00
arXiv cs.CL

通过价值冲突探究大语言模型价值表达的结构与动态

通过冲突干预揭示LLM价值表达:抽象与具体有差异,可被任务导向重塑,但受安全边界约束。

04:00
arXiv cs.CL

边际保真度不能确立人口统计合成调查面板中的用户模拟:响应契约、支持塌缩与条件失败

合成面板仅匹配汇总边际不等于模拟个体;响应契约影响保真度,直接人口估计优于模拟面板。

04:00
arXiv cs.CL

基于内容的寻址用于长上下文

将位置编码限于局部单元,跨单元用内容地址检索,避免长上下文位置失配,保持性能稳定。

04:00
arXiv cs.CL

区分语言模型中的流式稳定性与长期记忆

提出稳定、访问、效用三视界评估:注意力汇可无限稳定流式生成,但无法利用缓存外内容;递归/检索可扩展记忆视界。

04:00
arXiv cs.CL

路由中继:面向高效动态稀疏注意力的事件触发跨层路由复用

路由中继跨层复用路由元数据,仅当哨兵块挑战最弱选择时重路由,保持近满召回,显著降低评分计算量。

04:00
arXiv cs.CL

LANTERN:面向噪声与变换任务的语言模型评估——理解错误与鲁棒性细微差别

系统评估大语言模型在多种扰动下的鲁棒性,构建合成增强数据集,分析模型响应波动,助力开发更稳健的模型与评估方法。

04:00
arXiv cs.CL

BlueprintAgent:面向扫描结构蓝图仿真就绪生成的约束触发式定向复核

提出多模态蓝图智能体,以工程约束触发局部定向复核,从扫描蓝图生成仿真就绪框架,梁F1达0.994。

04:00
arXiv cs.CL

超越流畅生成:面向边缘部署的Sub-2B小语言模型MCP式工具调用CPU可靠性基准测试

5个<2B小模型的MCP式工具调用CPU测试:经恢复解析,Qwen2.5-1.5B最佳(75-79%);但原始输出直接可解析仅0.5%,需安全约束与人工复核。

04:00
arXiv cs.CL

叙事散文中的句法模式与文体功能:一种规则与机器学习结合的方法

通过规则标注3300句的文体类别,结合句法特征与机器学习分类,宏F1达0.948,提供可复现的分析流程。

04:00
arXiv cs.CL

验证面向自然语言生成的DBpedia三元组集合

提出并评估DBpedia三元组筛选方法,验证规则下精确率达98%,改进属性定义可提升召回率40%且不损精度。

04:00
arXiv cs.CL

Qwen-Audio-3.0-ASR技术报告

采用混合专家模型的语音识别系统,支持多语言与多方言,具备热词定制等工业级能力,性能领先。

04:00
arXiv cs.CL

层级竞争模式的艺术:连字符断词的高斯过程优化

用高斯过程贝叶斯优化连字符模式生成参数,在17个数据集中16个提升F1/7,并全部缩小字典规模。

04:00
arXiv cs.CL

我们完了!——通过冲突框架的食谱翻译探究大语言模型的政治立场

单一政治性框架词即触发大模型翻译的隐性政治立场:西方模型回避,中国模型沉默,警示冲突语境慎用。