9671 条条目 · 106 个活跃源
2026年9月28日
04:00
arXiv cs.CL

并非所有记忆都同等重要:面向LLM智能体有效性感知检索的分层协作记忆

提出HiCoMER框架,分层协作管理记忆并按有效性检索,避免过时冲突信息,提升协作问答质量。

04:00
arXiv cs.CL

系统综述筛选自动化的基准评估框架

发布45064条标注的SR筛选基准数据集,提出应对类别不平衡的评估框架及PromptSR工具。

04:00
arXiv cs.CL

生产级Text-to-SQL流水线中LLM裁判失效的审计与修复

生产Text-to-SQL的LLM裁判与人工仅κ=0.04,源于评分幻觉;自托管Qwen3.6-27B达0.72且成本1/300,三强裁判一致达0.79。

04:00
arXiv cs.CL

SlideLab:以听众为中心的科研幻灯片生成与评估

提出免训练多智能体框架SlideLab,从论文生成连贯科研演示,并提出面向听众的ConfArena评估框架。

04:00
arXiv cs.CL

Cartograph:面向 AI 智能体的联邦工具发现与操作者认证检索

联邦 MCP 代理 Cartograph 以操作者签名能力卡与两阶段检索,将工具发现从 O(n) 降为 O(k),R@5 达 0.816。

04:00
arXiv cs.CL

Spotify 对话式推荐智能体的冷启动:合成数据生成与自我改进循环

提出多轮合成数据生成与自我改进循环,规划质量提升8%;上线后用户收听增14%、周活增5%、跳过率降5%。

04:00
arXiv cs.CL

虚假评论检测综述:从预训练语言模型到大语言模型

综述2018—2026年初211项研究,梳理虚假评论检测从传统模型到预训练与大语言模型的发展及挑战

04:00
arXiv cs.CL

冻结BERT中AI文本检测神经元的机制研究:RAID数据集上的稀疏探测与激活修补

通过稀疏探测与激活修补,在冻结BERT中定位不足1%的AI文本检测神经元,具因果性且可跨生成器迁移。

04:00
arXiv cs.CL

SignTrace:描述手势,找到对应词

SignTrace利用自然语言检索中国手语词典,由动作描述识别陌生手语,首条命中率达94.0%。

04:00
arXiv cs.CL

面向掩码语言建模的流形投影与迭代自编码器细化

提出低秩瓶颈自编码器替代注意力,结合迭代流形投影细化,以约1.9倍更少FLOPs接近BERT性能。

04:00
arXiv cs.CL

通过认知实验范式探究智能体记忆中的稳定性—可塑性权衡

提出MemProbe框架,用四种认知实验范式诊断智能体记忆的稳定性—可塑性权衡,揭示系统行为差异。

04:00
arXiv cs.CL

打破同质化:面向创造性大模型输出的多样化人设集合

提出人设集合多样化方法,对比选择/生成与覆盖/前沿策略,在创意任务中提升输出多样性、原创性与创造力。

04:00
arXiv cs.CL

概念与组块的统一解释

概念与组块研究分离;本文提出统一计算理论并实现系统,以上下文无关文法验证其解析、生成与学习能力。

04:00
arXiv cs.CL

基于大语言模型的自动语音识别中的推理时目标说话人遗忘

提出TSU-ASR任务及轻量级ECG模块,可在推理时动态让指定说话人退出转写并标注其活动,保护隐私。

04:00
arXiv cs.CL

基于检索的开放式评估在哪里失败?从长篇医学答案事实性验证中自动归纳分类体系

提出检索与验证两阶段失败分类,自动标注分析显示模型规模、推理与微调均无法解决,揭示该范式的根本局限。

04:00
arXiv cs.CL

CARGO:生产环境中智能体AI的上下文感知检索门控评估

CARGO将检索参考视为程序范例,以实例上下文判定事实,仅惩罚矛盾并按检索置信度门控,缓解参考实例分歧误判。

04:00
arXiv cs.CL

给 BabyLM 喂通心粉:语码转换课程导致跨语言趋同

用LLM在英荷中语料插入词/句级语码转换预训练小模型,可对齐跨语言表示,课程学习提升BabyLM评测。

04:00
arXiv cs.CL

恰逢其时:面向基于大语言模型的同声语音到语音翻译的因果感知框架

提出面向基于大语言模型同声语音到语音翻译的因果感知框架,以FAST-CAP和数据管线提升质量并降低延迟。

04:00
arXiv cs.CL

REALMS:面向高维嵌套用户画像的实时精确受众规模测算AI助手对话系统

生产级对话式受众测算系统,以向量检索与LLM生成NL2SQL,实现千万级高维画像的秒级精确统计。

04:00
arXiv cs.CL

Inquesto Score:面向语音智能体的可靠性协议

提出Inquesto Score协议,以固定评测集中无功能故障达成目标的通话占比衡量语音智能体可靠性,显式定义故障等级并直测音频延迟。

04:00
arXiv cs.CL

难点在搜索之后:基于知识综合、组织与展示的网络智能体基准评测

提出KNOWS基准,评测浏览器智能体综合、组织与展示知识的开放式复杂任务;最佳智能体完整成功率不足3%,视觉理解与长程推理成瓶颈。

04:00
arXiv cs.CL

利用扰动强度增强LLM解释中自洽性评估

提出LLM评判法统一量化扰动强度,受控比较各模型自洽性;输入扰动影响强于CoT,同类扰动方可公平比较。

04:00
arXiv cs.CL

TRACE:流式视频理解的时间审计与条件感知评估

提出TRACE基准,显式考量证据时序与触发条件,多维评估流式视频理解,揭示相同准确率下的行为差异。

04:00
arXiv cs.CL

通过同策略蒸馏实现推理的递归自我改进

提出DCE+SRCL框架,使教师与学生共同进化并学习简洁改写,在数学推理上显著超越OPSD。

04:00
arXiv cs.CL

措辞胜于顺序:Gemma 4 的行为评估

Gemma 4-e4b评估:来源框定强于阅读顺序;首因偏差随措辞波动,结构雷同放大位置偏好。

04:00
arXiv cs.CL

超越平均注意力:面向 KV 缓存淘汰的多样性感知逐层打分

KV缓存淘汰中,注意力打分加入离散度与冗余惩罚;全局多样性常数提升多数数据集,逐层搜索在检索任务中层现大幅增益。

04:00
arXiv cs.CL

理解提示模板在安全对齐知识蒸馏中的作用

知识蒸馏中提示模板影响安全对齐:聊天模板比非聊天模板更易顺从有害查询,非聊天模板更能保留学生表征。

04:00
arXiv cs.CL

在串联式语音到语音模型中利用随机化引导学习自然对话行为

提出随机化中间引导,免模拟后端LLM;3.8k小时真实对话训练提升轮次转换自然度,保持回复质量优势。

04:00
arXiv cs.CL

SEA-CLIP-Tiny:面向东南亚语言的高效多语言文本-视觉嵌入

提出不足50M参数的东南亚多语言文本-视觉嵌入模型SEA-CLIP-Tiny,在七种语言检索上领先同类学生模型,R@10较MobileCLIP2高12.1点且参数少38.4%。

04:00
arXiv cs.CL

I-Parakeet:移动端 NPU 上的纯整数 Conformer 语音识别

纯整数Conformer在手机NPU运行,无浮点/CPU回退,错误率4.97%,比CPU快7.5倍。

04:00
arXiv cs.CL

转写压缩对基于大语言模型的日语YouTube视频医疗虚假信息检测的影响

全文转写检测效果最佳;摘要、RAG等压缩均增加漏判,假视频更易被判为真。

04:00
arXiv cs.CL

持久负样本:面向对抗式黑箱同策略蒸馏

用历史提示匹配的师生对比替换部分判别器负样本,稳定奖励估计,同等算力下提升黑箱同策略蒸馏性能。

04:00
arXiv cs.CL

气候政策因果评估中识别假设的循证审计

ARGUS按十一维标准审计DID识别假设,无据即弃权,缺陷检出率73%,远超关键词法18%,并输出可溯源风险报告。

04:00
arXiv cs.CL

从标注到推理:语言模型中的文化

主张以文学阐释评估语言模型的文化引用与推理,结合证据基准、学者分歧与丹麦文学实验,提升文化稳健性。

04:00
arXiv cs.CL

ToolSearcher:通过强化学习优化大规模工具选择

提出ToolSearcher强化学习框架,借助类别约束、事件级搜索建模与轨迹对齐信用分配,优化大规模工具选择。

04:00
arXiv cs.CL

基于文本约束声学重打分的免训练发音转写

提出免训练语音-文本转发音流水线,用文本约束候选与预训练模型贪心重打分,大幅降低错误率且更快。

04:00
arXiv cs.CL

THA:面向高棉语的加权有限状态文本规范化与逆文本规范化

THA:高棉语加权有限状态文本/逆文本规范化开源工具,Google测试集准确率高。

04:00
arXiv cs.CL

面向大语言模型持续微调的未知预训练梯度估计与正交化

提出EoupCT框架,用可学习软提示生成易遗忘伪数据以估计预训练梯度,并通过帕累托优化强制正交,缓解灾难性遗忘。

04:00
arXiv cs.CL

FAVoR:度量与缓解联邦个性化生成中的作者风格同质化

联邦个性化生成中,标准聚合会抹平作者风格;FAVoR用共享-私有适配器保留作者残差,提升风格留存。

04:00
arXiv cs.CL

耦合用法—义项过程:时序性与可归因的词汇语义变化

提出CUSP,从单一时间过程同时揭示词义变化的幅度、时间、机制、成分移动与文本归因。

04:00
arXiv cs.CL

《CG-Probes:从患者查询嵌入中恢复护栏方向》

提出CG-Probes,在冻结嵌入空间以均值差法探测三条风险轴,可媲美开源LLM且延迟极低。

04:00
arXiv cs.CL

ZooWork-ShopRanker:一个开放的、偏好对齐的电商重排序器

提出0.6–8B偏好对齐电商重排序器,LLM评判标签加蒸馏,发布ShopRank-Bench。

04:00
arXiv cs.CL

LocUS:面向定向激活引导的注意力头选择与子空间投影

LocUS将激活引导限制于输出词表子空间,仅调<6%参数,能更好控制毒性、情感与谄媚且保住通用能力。

04:00
arXiv cs.CL

G$^2$PTQ:通过广义梯度补偿改进大语言模型训练后量化

G$^2$PTQ提出统一训练后量化框架,融合一阶与二阶梯度信息,动态刷新Hessian并稳定补偿,性能优于现有方法。

04:00
arXiv cs.CL

基于大语言模型与知识图谱引导推理的学生意义建构建模

中型LLM分析协作意义建构:推理提示与知识状态诊断可提升失败识别及专家一致性,但无单一最优配置。

04:00
arXiv cs.CL

我们需要回答那个问题吗?自然对话中潜在问题的显著性与可回答性

自然对话中,潜在问题显著性与可回答性稳健弱正相关但弱于独白,对话更难预测;结构化交流标注一致性更高。

04:00
arXiv cs.CL

评估中文大语言模型在源自在线搜索查询的事实性问题上的谄媚行为

三大中文模型36万条回答显示:谄媚因模型与推理而异,反谄媚提示减错误认同却增不确定,回避附和≠事实准确。

04:00
arXiv cs.CL

模型将自身重复词元送往何处

读取 argmax p(.|t,t) 得到整个词表上的映射;非不动点的去向可按模型家族区分,平衡准确率达 0.90。

04:00
arXiv cs.CL

基于度量损失加权的多模态机器翻译大语言模型视觉敏感性提升

提出度量式损失加权,定位受益于图像的词元并加大其损失,提升视觉敏感性,准确率超微调7个百分点。

04:00
arXiv cs.CL

RupeeBias:审计大型语言模型在印度经济指导中的人口统计偏见

RupeeBias含3.9万条提示,覆盖种姓、宗教、性别、城乡六轴;仅人口标识不同,经济建议差20.2%。