10025 条条目 · 106 个活跃源
2026年7月28日
04:00
arXiv cs.CL

Tokengeist:多轮对话中的归因追踪

提出Tokengeist框架,递归遍历对话轮次DAG,多跳归因召回率从不足20%提升至90%。

04:00
arXiv cs.CL

LLM任务适应如何重塑对齐:行为与表征漂移的多维研究

任务适应方法对LLM对齐影响各异:RLVR漂移小,SFT漂移大,KL正则化缓解,建议多维评估。

04:00
arXiv cs.CL

面向检索增强生成的源感知重排序:一种可靠性先验方法

引入来源可靠性先验权重,改进RAG排序,在健康语料上将精准度提升50%并抑制虚假信息。

04:00
arXiv cs.CL

CRAFT:习得模式,执行计划

CRAFT通过两阶段后训练(监督微调+强化学习)让编码代理习得模式与执行计划,代理分数提升9.6%,输入token减少9倍。

04:00
arXiv cs.CL

通过文化与政治记忆振兴城市公共空间:基于大语言模型与增强现实的技术方法

利用大语言模型和增强现实,通过数字孪生与视觉叙事,激活城市公共空间的文化政治记忆。

04:00
arXiv cs.CL

掩码蒸馏:将思维链内化到语言模型中

提出掩码蒸馏框架,训练学生模型内化中间推理步骤,直接输出答案,减少延迟和成本,在算术和搜索任务上验证。

04:00
arXiv cs.CL

STAIF:面向复杂指令跟随的分阶段优化框架

提出STAIF分阶段优化框架,先优化软约束再强化硬约束,构建双语数据集,性能领先。

04:00
arXiv cs.CL

结构胜于规模:面向RAG的受模式约束因果图

HCG-RAG用受模式约束因果图替代开放抽取,节点和成本大幅降低,性能匹配基线,因果过滤器提升检索6个百分点。

04:00
arXiv cs.CL

你是在跟我说话吗?:电影剧本中性别化的说话者-受话者模式的网络分析

论文通过网络分析电影对话,发现男性主导发言与受话,性别偏见体现在对话结构而非仅时长。

04:00
arXiv cs.CL

从同行评审的细微差别到最佳实践

研究同行评审数据中版本、评分、格式三种细微差别及其影响,提出最佳实践。

04:00
arXiv cs.CL

真实世界对话机器人中基于上下文感知前导生成的低延迟话轮转换

提出两阶段增量框架,通过上下文感知前导生成降低对话延迟,实验显示其在初始响应延迟与主响应间隙间存在权衡。

04:00
arXiv cs.CL

语言路由RAG与直接选项评分用于多语言金融问答:DS@GT在FinMMEval的提交

DS@GT提交多语言金融问答系统,采用语言路由RAG与直接选项评分,发现链式思维降低希腊语准确率,需语言感知策略。

04:00
arXiv cs.CL

Co-Harness: 协同演化LLM智能体的引导框架与模型权重

提出Co-Harness框架,联合优化智能体引导框架与模型参数,交替优化,可自动恢复崩溃、提升效率、发现集成策略。

04:00
arXiv cs.CL

Imprompt:一个面向提示编程的语言框架

Imprompt框架将提示程序与执行解耦,定义编译器和类型检查,实现任务描述与约束解码对应。

04:00
arXiv cs.CL

一致性门控:通过自一致性准入控制防止LLM代理中的记忆污染

提出写入时准入门控,多次查询LLM得到支持分数,平均超阈值才写入,减少记忆污染,代价是隐含事实的写入。

04:00
arXiv cs.CL

AssumptionMiner:提取、追踪和修订LLM代码生成中的隐式假设

提出AssumptionMiner,将隐式假设显式化,提升LLM代码生成的透明度和可控性。

04:00
arXiv cs.CL

Token消耗最大化最佳编程语言:跨编程语言编码智能体行为探究

编程语言显著影响编码智能体的token消耗,非编译与重复修改推高成本,最昂贵语言可指导token最大化。

04:00
arXiv cs.CL

AgentOmnia:面向全场景应用的智能体模型规模化

AgentOmnia框架通过领域×能力×难度分类,数据合成与后训练,将基准性能从9.16%提升至37.11%,并实现PRD引导的自进化。

04:00
arXiv cs.CL

SMART: 大语言模型增强的动态产品广告混合检索

提出SMART混合检索,门控仅路由10%用户至LLM,降本90%同时广告转化率提升27.6%。

04:00
arXiv cs.CL

语言生成中的幻觉率

引入无限幻觉使语言生成能力更强,幻觉率刻画了语言集合的严格层级结构。

04:00
arXiv cs.CL

基于政治轴的大语言模型对齐可控性审计

对LLM进行政治可控性压力测试,发现提示框架解释88-93%方差,模型身份影响小,需报告分散性、对称性等指标。

04:00
arXiv cs.CL

谁被点名:引用类型预测基础语言模型对个体的命名,名册工具仅捕获其0.5%

模型命名个体率约25.8%,引用类型比数量更能预测命名;名册工具仅捕获0.5%的命名提及且覆盖不具代表性。

04:00
arXiv cs.CL

Kalypso:关系型大语言模型服务

Kalypso通过流水线执行与KV-cache重用,实现语义查询加速,速度提升高达4.57倍。

04:00
arXiv cs.CL

TriShieldRAG:一种针对检索增强生成中知识污染的三环纵深防御框架

三层独立防线将攻击成功率从91%降至13%,同时保持良性查询准确度。

04:00
arXiv cs.CL

利用解耦时深扩散Transformer的高效内存音频合成

提出解耦时深扩散Transformer音频合成架构,内存恒定,16倍实时速度,峰值21MB,MOS提升0.28。

04:00
arXiv cs.CL

利用多模态挖掘电池文献中的X射线吸收光谱数据

多模态挖掘电池文献,提取13,740条XAS光谱,覆盖66种元素,构建AI可用数据集。

04:00
arXiv cs.CL

第三方API路由器在代理软件开发中的代价何在?

实证揭示第三方API路由器注入攻击使编码代理防御成功率降至0%,客户端防护难以检测,需提供方输出完整性保障。

04:00
arXiv cs.CL

Latent-LoRA: 面向持续学习的紧凑潜在空间适配器与无梯度路由

利用冻结嵌入层的无梯度路由与主子空间适配器,实现近零遗忘的持续学习。

04:00
arXiv cs.CL

HiTMS:一种高吞吐量多流语言隐写框架

HiTMS框架通过多轮交互分发秘密至多响应,实现高吞吐量隐写,速度提升4.3倍,降低检测率。

04:00
arXiv cs.CL

大型语言模型中的现实监控:随对话记忆转换的自我认知

LLM对信息来源的归因依赖对话记忆结构,存在归因反转与信心解离等失败模式。

04:00
arXiv cs.CL

让我看看你:对话语音合成中的高级面部表情建模

提出FacialTalker框架,利用AUTokenizer和DualDPO策略,结合大规模数据集VSDD-1K,提升面部表情感知与语音合成质量。

04:00
arXiv cs.CL

当前检索器是否覆盖所有证据?一项关于合取跨页检索的受控研究

合取跨页检索中,现有检索器即使找到文档,也常缺失部分条件证据,条件覆盖才是核心瓶颈。

04:00
arXiv cs.CL

Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families

04:00
arXiv cs.CL

超越聚合风险:面向LLM工具调用的角色分层共形风险控制

提出角色分层共形风险控制,为语义角色独立设限,提供逐角色风险保证,优于聚合方法。

04:00
arXiv cs.CL

从模式连通性视角理解机器遗忘

通过模式连通性研究遗忘,发现模型处于连通盆地,线性连接揭示方法机制差异,集成可提升泛化性和鲁棒性。

04:00
arXiv cs.CL

基于阈值化符号排序的LLM源代码压缩

提出T-边界符号排序的LLM压缩方法,30个模型评估显示压缩比提升37%,速度提升40%,相对通用压缩器增益82%。

04:00
arXiv cs.CL

MEMOIR:面向偏好漂移谱的时间行为记忆推荐方法

MEMOIR通过时间分段与LLM生成语义记忆,在偏好漂移极端用户上显著提升排序质量,整体与最强基线持平。

04:00
arXiv cs.CL

ACRL:训练-推理差异的自适应控制以实现稳定强化学习

ACRL自适应控制训练-推理差异,稳定RL训练,提升探索与精度,FP8量化下优于基线。

04:00
arXiv cs.CL

被遮蔽的巨眼:风格遮蔽的操作化

通过消融实验发现,注入零宽字符等手法最能有效对抗文体测量系统,保护文本匿名性。

2026年7月27日
04:00
arXiv cs.CL

论提升文档生成播客的忠实度

首次系统研究文档播客生成忠实度,提出turn-level评估框架和catch-n-repair方法,有效提升模型输出忠实度。

04:00
arXiv cs.CL

对抗性风格优化:基于GRPO的风格触发优化增强视觉语言模型越狱攻击

发现多模态大模型安全防御易被风格触发绕过,提出GRPO驱动的对抗风格优化(ASO),显著提升越狱攻击成功率。

04:00
arXiv cs.CL

利用自然语言自编码器探测Qwen2.5-7B中的潜在哥伦比亚身份推断

本研究表明Qwen2.5-7B在处理提示时可能内隐编码哥伦比亚身份和刻板印象,且早于输出表达。

04:00
arXiv cs.CL

基于共识的大语言模型相对偏好评估框架

提出共识框架,用多模型投票匿名排名衡量相对偏好,发现一致模式,提供可扩展比较方法。

04:00
arXiv cs.CL

评估设计条件影响专家与自动MeSH差距:Cohen基准上词袋与BiomedBERT的控制比较

专家与自动MeSH标签的分类差距随评估设计变化,从+0.096降至+0.02,结论依赖于评估方式。

04:00
arXiv cs.CL

版权法合规性的智能体评估

提出Copyright-Bench基准评估LLM智能体版权合规性,发现智能体常选侵权内容,违规率受偏好和时间压力影响。

04:00
arXiv cs.CL

Humanly: 一个可配置且可追溯的人机协作写作环境

Humanly平台记录写作过程与AI辅助,生成可追溯证书,支持配置化异常检测,区分手工与自动打字。

04:00
arXiv cs.CL

Khondo:孟加拉语表单文档包分割的多模态基准

首个孟加拉语表单文档包分割基准,发现页面顺序恢复是主要挑战,语言是次要因素。

04:00
arXiv cs.CL

数据质量胜于容量:将文档内化到LoRA适配器用于闭卷问答

通过LoRA将文档内化到模型权重,数据质量是关键,单次整理使闭卷问答准确率从57.7%升至85.7%,超越检索增强方法。

04:00
arXiv cs.CL

利用外部知识的检索增强大语言模型修复历史文档

本文提出ARI框架,结合大语言模型与检索增强生成,有效恢复历史文档中断裂的命名实体,显著提升修复效果。

04:00
arXiv cs.CL

分析语言模型中的自残表征:一项跨架构研究

发现自残信息集中于模型最后3-7%层,精确探针不总是线性可分,不同模型表征存在差异。