10103 条条目 · 106 个活跃源
2026年7月14日
04:00
arXiv cs.CL

语言识别中的全局一致性着色方案

每字符串一个终端比特即可识别所有可数无限语言集合,着色全局一致但构造非构造性。

04:00
arXiv cs.CL

用自然语言传达国际象棋策略

提出棋策略语言化流程与评估框架,实验证明自然语言可解释地传递策略信息,并揭示需评估主线外策略等关键见解。

04:00
arXiv cs.CL

UMoE:在领域特定训练中解锁每个专家

UMoE通过剪枝低贡献专家并扰动扩展,重新对齐专家池,将冗余转化为有用容量,持续提升领域微调性能。

04:00
arXiv cs.CL

LightMem-Ego:你的日常生活AI记忆

轻量级流式多模态记忆系统,持续感知日常生活,层次化记忆与动态检索,支持智能手机和AI眼镜。

04:00
arXiv cs.CL

宗卡语下一词预测系统

采用GRU模型预测宗卡语单词,准确率74.03%,有效减少打字按键次数。

04:00
arXiv cs.CL

GEIS:面向长篇文章生成的代理技能生成-评估-改进循环

GEIS通过可检查、模块化的技能循环,在长文生成中较默认方法提升8.0分,优于STORM,迭代改进使平均分从82.90升至86.95。

04:00
arXiv cs.CL

超越基准:揭露孟加拉语仇恨言论检测中的隐性危机

基准模型在孟加拉语隐晦仇恨言论检测中性能骤降,表情符号预处理可提升12%,亟需文化敏感框架。

04:00
arXiv cs.CL

PaperRouter-Agent:一种基于内容的LLM代理,用于个性化层次化论文路由

提出无训练LLM代理,基于文件夹成员内容路由论文,Recall@1从0.39升至0.61,LaMP-2准确率从44.5%提至51.5%。

04:00
arXiv cs.CL

关系定位:多轮人-AI对话中可测量的风险对象——历史锁定与自我虚构

定义并验证关系定位测量,发现历史锁定导致状态持续分离,自我虚构编造背景以深化关系。

04:00
arXiv cs.CL

高级数学基准测试集:面向高级数学证明生成与验证的基准

提出AdvancedMathBench,评估高级数学推理,前沿模型表现不佳,错误检测仍是瓶颈。

04:00
arXiv cs.CL

JobHop v2:基于非结构化简历的大规模职业轨迹数据集

从44万简历提取35.5万条职业轨迹,标注丰富,提取准确率接近人工标注。

04:00
arXiv cs.CL

RAGU:一种具有紧凑领域自适应LLM的多步GraphRAG引擎

RAGU开源引擎通过多步流程与7B紧凑模型,实现知识图谱构建性能超过32B模型。

04:00
arXiv cs.CL

失去组合性:预测组合性随时间的变化

提出组合性趋势预测任务,基于几十年语料标注,发现复合词组合性仅微弱下降;窄时窗模型优于宽时窗,静态与上下文表示性能相当。

04:00
arXiv cs.CL

LLM中的生成与感知:一种标记概率方法

通过直接测量token概率,发现LLM在生成与感知提示下概率分布差异显著,距离比约1.8,感知影响在序列开头最强。

04:00
arXiv cs.CL

MET:基于理论与文化感知的多语言道德推理

提出理论与文化感知的多语言道德推理方法MET及蒸馏版MET-D,在跨语言基准上提升达12.94点。

04:00
arXiv cs.CL

通过关联递归记忆扩展大语言模型上下文

ARMT方法以常量内存扩展LLM上下文,性能不降且省30%计算量。

04:00
arXiv cs.CL

STEP:基于时间与教育轨迹建模的职业路径推荐

利用大语言模型从简历提取信号,提出STEP系统结合时间衰减GRU与教育条件调制,实现职业路径下一步预测,性能超现有基线。

04:00
arXiv cs.CL

温度如何塑造检索增强生成中的意识形态话语?

RAG易传递意识形态话语,温度影响强度,适度温度下话语对齐最高。

04:00
arXiv cs.CL

AI辅助词典编纂中的人本化引入

本文提出人本AI框架,强调AI增强而非取代词典编纂者,结合自动化与人类控制,确保专业自主性。

04:00
arXiv cs.CL

一个Token就够了:从单Token输出分布对大型语言模型进行指纹识别与验证

提出用单Token输出分布作为LLM指纹,低成本验证模型身份,有效检测模型替换。

04:00
arXiv cs.CL

问题类型、认知负荷与CEFR对齐:评估LLM生成的EFL语法练习

LLM生成语法练习:多选题认知负荷最低,完形填空阻碍主动回忆,CEFR难度分级有效,需策略化问题模态顺序。

04:00
arXiv cs.CL

面向已验证教学反馈分类协议的耐久性与跨语言迁移基准

协议持久适用,模型选择为部署决策,非方法特性。

04:00
arXiv cs.CL

大语言模型中的元认知:基础、进展与机遇

综述LLM元认知领域,涵盖评估方法、改进技术及未来方向。

04:00
arXiv cs.CL

利用预训练词嵌入改进答案选择

预训练词嵌入显著提升答案选择,结合学习排序可媲美先进神经网络。

04:00
arXiv cs.CL

Narrix: 从范例中重组叙事策略以辅助故事写作

Narrix通过分析范例中的叙事策略,以彩色标注和互动故事弧辅助新手作者拖拽应用,提升策略保留与创意改编能力。

04:00
arXiv cs.CL

像人类一样倾听?语音语言模型中的声音象征与感知对齐

研究发现SLMs听觉判断与人类感知不符,缺失频谱倾斜等关键声学线索,问题在于语音表示而非视觉。

04:00
arXiv cs.CL

大语言模型水印技术综述:理论与部署

综述LLM水印的嵌入、检测、威胁模型及攻防评估,提供部署指导。

04:00
arXiv cs.CL

从专利到期到商业路径:激活创新档案的AI工作流程

提出AI框架发现过期专利并转化为商业路径,通过CIPO档案验证,强调处理法律不确定性与风险。

04:00
arXiv cs.CL

追求更强的代码水印:一种语法驱动的方法以优化质量与可检测性之间的权衡

提出GDW语法驱动水印,通过掩码和角色感知调制优化质量与可检测性权衡,实验优于现有方法。

04:00
arXiv cs.CL

PC-Mix: 混合语音与环境声音条件下的部分组件音频伪造检测

提出PC-Mix数据集,用于混合语音与环境声音的部分组件伪造检测,验证了匹配训练更有效。

04:00
arXiv cs.CL

基于人类反馈增强LLM:自我改进之路

通过辅助反馈RAG系统整合人类反馈,实现检索增强生成系统的自改进与优化。

04:00
arXiv cs.CL

GigaAM多语言模型:面向低资源语言的基础模型

提出GigaAM多语言模型,采用数据平衡策略,在低资源中亚语言上超越Whisper等模型,实现高效自适应。

04:00
arXiv cs.CL

GigaChat音频:时间感知的大规模音频语言模型

提出时间感知音频大模型,融合周期时间标记,支持120分钟输入,实现高精度时间定位与片段描述。

04:00
arXiv cs.CL

工具自适应大语言模型重排序器

TALRanker通过两阶段训练实现工具自适应,平衡重排序的准确性与效率,达到SOTA性能。

04:00
arXiv cs.CL

生成式中国法规检索

提出GCSR框架,将法规检索转为序列生成问题,通过多粒度docid和多任务训练实现高效检索。

04:00
arXiv cs.CL

领域感知的缩放定律揭示数据协同效应

量化语言模型预训练中数据协同效应,利用开源LLM估计领域交互,提升规模定律预测准确性。

04:00
arXiv cs.CL

AgentCheck:基于MCP的LLM代理可复现-干预-缓解工作台

AgentCheck开源工作台通过故障注入与重放,使开发者复现、干预并验证LLM代理在MCP上的工具故障,最佳代理通过105/120场景。

04:00
arXiv cs.CL

当奖励套件存在泄漏时:RLVR中自然验证器误报的预注册因果对比

RLVR奖励套件误报奖励真实错误(47.57%),静态审计可预测漏洞,加固消除虚高,误报源于预存错误模式。

04:00
arXiv cs.CL

视频中矛盾与犹豫识别的简单特征与诚实校准

提出结合情感文本、音频、视觉和语言线索的多模态系统,通过AP加权集成在固定阈值下达0.731AP,发现校准比架构更关键。

04:00
arXiv cs.CL

使用大语言模型复现路径选择中的人类偏见:迈向可扩展的行为建模

研究发现大语言模型可复现人类路径选择中的非理性偏见,无需参数校准,为可扩展行为建模提供新途径。

04:00
arXiv cs.CL

解构特征结构:Transformer中可数学证明的两阶段训练动态

理论证明Transformer中特征解耦导致两阶段训练动态,从语法到语义,与注意力谱性质相关。

04:00
arXiv cs.CL

HiQA:面向多文档问答的层次化上下文增强RAG

提出HiQA框架,通过级联元数据与多路检索提升多文档问答性能,发布MasQA基准,达最先进水平。

04:00
arXiv cs.CL

遗忘成就共享意义:非伙伴协调游戏中遗忘对概念对齐的影响

研究非伙伴协调游戏中遗忘对概念对齐的影响:适应性玩家实际收敛更快、最终概念更接近,非适应性玩家感知收敛更早,减轻新信息权重可提高协议稳定性。

04:00
arXiv cs.CL

深入不公裁判者:基于机制可解释性的LLM作为裁判的偏见研究

发现偏见在隐藏状态中有几何结构,通过控制激活方向可双向调节评分,线性投影可预测模型失败。

04:00
arXiv cs.CL

HyperSafe:微调语言模型的推理时安全恢复

HyperSafe为微调模型生成安全侧网络,推理时分类有害提示并拒绝回答,无需梯度更新,显著降低有害响应。

04:00
arXiv cs.CL

从表达性到样本复杂度:基于C-RASP的Transformer窄教师模型

本文首次提出Transformer学习C-RASP构造的样本复杂度界限,推进可学习性理论。

04:00
arXiv cs.CL

SCOPE-RL:在成功前后优化推理路径

提出两阶段框架SCOPE-RL,在成功前后密集化奖励信号,准确率提升11.2%,推理token减少27.1%。

04:00
arXiv cs.CL

家长式过滤:LLM中介的历史教育中对边缘化罗马尼亚学生的认知不公与差异化拒绝

LLM历史导师对边缘学生实施差异化拒绝与认知把关,构成认知不公和叙事隔离,亟需审计。

04:00
arXiv cs.CL

利用改写提升社交媒体短文本主题建模:以COVID-19相关推文为例

通过LLM将推文改写为规范语言,提升主题建模的连贯性、多样性和唯一性,口语转正式策略效果最佳。

04:00
arXiv cs.CL

PM-KVQ:面向长思维链大语言模型的渐进式混合精度KV缓存量化

提出渐进式混合精度量化与位置插值校准,解决长CoT的KV缓存误差,性能提升8%,吞吐量提升2.73-5.18倍。