10113 条条目 · 106 个活跃源
2026年7月10日
04:00
arXiv cs.CL

SQuaD-SQL:基于大语言模型指导的知识蒸馏实现小型语言模型高效文本到SQL

本文提出SQuaD-SQL方法,通过知识蒸馏让小模型接近大模型性能,在WikiSQL上达86.9%准确率,效率更高。

04:00
arXiv cs.CL

大规模隐式解码:大型语言模型的潜在计算扩展

提出隐藏解码方法,通过序列长度扩展增加计算,首次在百亿参数MoE模型上验证,实现固定骨干网络的性能提升。

04:00
arXiv cs.CL

SEC 8-K文件有依据事件提取与细粒度分类体系

两阶段系统从SEC 8-K文件提取119类有依据事件,质量评分精确度达96%,有效区分经济事件。

04:00
arXiv cs.CL

LLM拒答的两个维度:答案正确性与问题可回答性

LLM拒答需区分答案正确与问题可答,隐藏态探针可识别,但模型自报失效;校准策略分开控制,优于单阈值。

04:00
arXiv cs.CL

UltraX:通过自适应程序化编辑大规模优化预训练数据

UltraX提出函数调用框架,通过插入、删除、修改实现细粒度实例级编辑,提升大规模预训练数据优化效率与可靠性。

04:00
arXiv cs.CL

人格识别中基于大语言模型裁判的理论无关自适应度量对齐原型网络

提出JAM框架,利用LLM裁判与原型网络实现理论无关人格识别,提升跨框架泛化性能。

04:00
arXiv cs.CL

当只有合成语音可用时:请调用GRPO

GRPO强化学习在仅用合成语音时比监督微调降低词错误率40%,改善校准与对齐。

04:00
arXiv cs.CL

基于激活聚合的提示压缩

通过加权激活和将提示信息压缩为单向量注入模型,准确率下降<2%,揭示激活空间跨层兼容性与语义编码结构。

04:00
arXiv cs.CL

使用ESBMC-PLC+检测IEC 61131-3 PLC程序中的梯形逻辑炸弹:一种带有触发综合的形式化验证方法

提出ESBMC-LLB形式化验证检测PLC梯形逻辑炸弹,恢复触发条件,检测率99%且无假阳性。

04:00
arXiv cs.CL

当法官改变,测量也随之改变:审计LLM作为裁判的可靠性

审计LLM裁判可靠性:评估者变更引起评分偏移,升级型号效果不互通,强模型仅减小偏差而未消除,需含偏差探测等审计。

04:00
arXiv cs.CL

使用Procrustes条件联合端到端Top-K稀疏自编码器的跨种子可解释性

提出Procrustes条件联合端到端Top-K稀疏自编码器,从独立BERT提取跨种子通用特征,优于后处理对齐。

04:00
arXiv cs.CL

It Takes a MAESTRO To Prune Bad Experts

04:00
arXiv cs.CL

DominoTree:面向推测解码的基于Domino的条件树结构草稿方法

提出DominoTree,无需训练,利用Domino条件校正评分,达到6.6倍加速和10.7 token平均接收长度,吞吐量全面优于现有方法。

04:00
arXiv cs.CL

SPL:用声明式确定-概率组合编排工作流程

SPL声明式语言统一确定性与概率计算,跨平台运行,实验验证正确率达82-93%。

04:00
arXiv cs.CL

从提示到契约:面向可审计企业LLM代理的束绳工程

束绳工程通过代码契约将LLM原型转化为可审计代理,保障安全与效用。

04:00
arXiv cs.CL

WebSwarm:用于深度和广度网络搜索的递归多智能体编排

WebSwarm递归多智能体框架通过动态节点协作实现深度与广度联合搜索,性能优于基线。

04:00
arXiv cs.CL

大语言模型作为数据标注者的有效性:AMALIA对权威道德基础的标注

AMALIA标注权威高一致但低效,依赖表面特征,不可独立使用。

04:00
arXiv cs.CL

你需要前沿模型作为引文验证器吗?——深度研究来源归属中LLM评估标准的基准测试

研究发现,较便宜的LLM评判者即可有效验证引文质量,无需最前沿模型,但需校准偏差。

04:00
arXiv cs.CL

基于基础模型的集体智能

异构多智能体框架中,模型多样性显著提升推理准确率与步骤质量,优于同质框架及单个模型。

04:00
arXiv cs.CL

社会科学中LLM的验证:认知威胁与新兴规范

LLM在社科测量中作用核心但验证实践不一致,需建立更稳健的规范。

04:00
arXiv cs.CL

绿色软件的内存墙:备忘录设计模式的经验性能量评估

实证备忘录设计模式能耗,差分策略中等状态节能65.8%,但200MB时遭遇内存墙,GC抖动抵消算法优势。

04:00
arXiv cs.CL

fog:通过AI生成代码的函数组合表达运动与情感

框架fog通过函数组合表达运动与情感,识别准确率68%,助力用户快速迭代与操控。

04:00
arXiv cs.CL

UniClawBench:面向真实世界任务的主动型智能体通用基准

首个能力驱动基准,基于五种能力设计400项双语真实任务,在Docker中实时评估并模拟用户反馈。

04:00
arXiv cs.CL

机制理解大语言模型微调中记忆知识为何无法泛化

发现记忆-使用差距,自修补揭示知识回路错配,简单策略恢复58-75%泛化性能。

04:00
arXiv cs.CL

CausalDS:数据科学智能体因果推理基准测试

提出CausalDS基准,评估数据科学智能体在结构因果模型、观测数据与自然语言故事中的因果推理,涵盖Pearl三阶梯任务及工具使用与弃权。

04:00
arXiv cs.CL

以患者为中心的对话式人工智能的复杂性

真实对话显示沟通风格改变分流结果,AI需适应多样性,否则会放大健康差距。

04:00
arXiv cs.CL

慢思考与主动感知的第一性原理理论

基于概率分布提升与投影,形式化推导慢思考模型的设计、训练与推理,提出主动提升理论。

04:00
arXiv cs.CL

AutoPersonas:一个多时间尺度的循环引擎,用于开放式角色演化

针对角色代理自锁问题,提出多时间尺度循环引擎,通过分离可控发散与证据吸收,降低行为重复并保持身份连续性。

04:00
arXiv cs.CL

令牌流防火墙:面向持久性AI代理的语义运行时审计

TokenWall通过语义运行时审计拦截危险令牌流,将攻击成功率降至12.5%,同时保持97.4%良性通过率,延迟仅增0.69秒。

04:00
arXiv cs.CL

面向主观监督的集成多样性优化

EDO通过可微优化集成结构与多样性正则化,在主观文本分类中显著改善校准,降低交叉熵40-78%及Brier分数。

04:00
arXiv cs.CL

不同教师,不同能力:面向结构化文本增强的Sub-1B设备端蒸馏

蒸馏8B推理模型至0.6B学生,速度提升49倍,恢复58%质量差距;不同教师传递不同能力,需字段级路由。

04:00
arXiv cs.CL

通过模型合并提升对话式信息检索中的即席搜索效果

本文提出模型合并策略,无需额外训练即可提升对话检索器的即席搜索能力,零样本下NDCG@3提升15%。

04:00
arXiv cs.CL

人格要素:激活引导对短答案生成与评分的影响

激活引导降低短答案质量,加剧评分偏见,开放式任务和混合专家模型更敏感。

04:00
arXiv cs.CL

基于自适应特征与图神经网络的科学文献语义表示学习

提出自适应特征与图神经网络方法,通过全局局部特征和互信息比较提升无监督文献语义表示及分类效果。

04:00
arXiv cs.CL

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

04:00
arXiv cs.CL

ParamMute:抑制知识关键型前馈网络以实现忠实检索增强生成

通过抑制不忠实的FFN激活,增强RAG对检索知识的依赖,显著提升生成忠实性。

04:00
arXiv cs.CL

少即是多:在不影响性能的情况下减少标记数量

Thunder-Tok分词器通过修剪无效词汇,在保持性能的同时减少token数量,英韩生育率分别降低约25%和9%。

04:00
arXiv cs.CL

基于Shapley值的LLM摘要中文档公平估值

提出Cluster Shapley近似,分组计算Shapley值,实现LLM摘要中文档公平估值,提升效率与精度。

04:00
arXiv cs.CL

IMProofBench:科研级数学证明生成AI基准测试

IMProofBench包含77个专家评审的科研级问题,模拟真实研究环境评估AI数学证明能力。

04:00
arXiv cs.CL

DR-Arena:深度研究智能体的自动化评估框架

DR-Arena利用动态信息树和自适应进化循环评估智能体深度推理与广度覆盖,与人类偏好高度一致。

04:00
arXiv cs.CL

重新思考以大型语言模型作为评判者:通过语义容量不对称性,利用小型语言模型的表示作为评判者

提出表示即评判者范式,利用小模型内部表示高效评估,性能逼近大模型,更可靠可解释。

04:00
arXiv cs.CL

检索增强推理中基于过程奖励的截断步骤级采样

提出SLATE方法,通过截断步骤级采样和稠密过程奖励,解决信用分配问题,在7B和3B模型上分别提升7.0%和30.7%。

04:00
arXiv cs.CL

用于语言模型推理的同伴预测自训练

PST框架通过多模型协作和PMI加权实现无监督自我改进,提升数学推理准确率2.2-4.3%,缩小生成-验证差距26-40%。

04:00
arXiv cs.CL

代理推断:从语义嵌入到有效社会测量

NLP用嵌入度量社会概念存在效度问题,本文提出构造效度协议与反事实中和法以提升测量科学性。

04:00
arXiv cs.CL

UtterTune: 基于LoRA的多语言TTS目标语言发音编辑与控制

UtterTune利用LoRA实现多语言TTS中目标语言音素级发音与重音控制,保持其他语言性能及自然度。

04:00
arXiv cs.CL

因果抽象如何奠定计算解释的基础

因果抽象为计算实现提供新视角,结合深度学习说明表征与计算的关系,强调泛化与预测关键作用。

04:00
arXiv cs.CL

HeaPA:面向大语言模型强化学习的难度感知堆采样与在策略查询增强

HeaPA通过边界采样与在策略增强,高效提升LLM强化学习训练效率和准确性。

04:00
arXiv cs.CL

通过几乎正交特征实现语言模型中的隔离干预

提出正交正则化减少特征干扰,实现隔离干预,保持模型性能。

04:00
arXiv cs.CL

基于Wasserstein的分布鲁棒遗憾优化用于人类反馈强化学习

提出分布鲁棒遗憾优化,以Wasserstein模糊集抑制RLHF奖励过度优化,比标准方法更少悲观且效果更佳。

04:00
arXiv cs.CL

一种面向流程图图像到代码生成的在线无参考评估框架

提出无参考评估框架,用OCR和视觉蕴含指标实时监测代码生成质量,与真实指标高度相关。