10213 条条目 · 106 个活跃源
2026年6月17日
04:00
arXiv cs.CL

PreLort: 面向秩异质性联邦微调的前缀嵌套LoRA

PreLort通过前缀嵌套低秩和分段聚合,实现异构秩客户端高效共享任务信息,提升精度与ROUGE-L。

04:00
arXiv cs.CL

你的“专业”大模型订阅可能实际上是“免费”的:揭露LLM推理服务中的指纹欺骗风险

提出指纹欺骗攻击,证明用户资源限制使指纹易被绕过,设计GhostPrint框架低成本让弱模型模仿强模型,揭露LLM指纹验证漏洞。

04:00
arXiv cs.CL

基于LLM的虚拟人口需求模拟与定价

LLM驱动虚拟人口模型,利用非结构化信息生成需求分布,支持平均收益与风险意识定价决策。

04:00
arXiv cs.CL

快速毒化:针对快速响应框架的实用投毒攻击

仅1%毒化率即可实现近100%假阳性与96%假阴性,通过提示注入攻击快速响应训练管道。

04:00
arXiv cs.CL

SCAR:面向RAG高效上下文扩展的语义连续性感知检索

SCAR自适应策略权衡相关性与连续性,碎片查询召回92.8%,块数减少22.9%,跨模型通用且token减少27.1%。

04:00
arXiv cs.CL

面向数据受限语言模型预训练的数据增强方法

数据增强可缓解多轮训练过拟合,随机token替换及组合增强有效降低验证损失。

04:00
arXiv cs.CL

VisualClaw:面向物理世界的实时、个性化智能体

VisualClaw通过混合编码与技能进化,低成本高精度实现物理世界实时个性化智能体。

04:00
arXiv cs.CL

LiFT:基于线性规划局部搜索的过拟合可控Transformer模型

提出线性规划局部搜索框架,通过双层优化联合更新参数与超参数,有效控制Transformer微调过拟合。

04:00
arXiv cs.CL

Taylor-Calibrate:混合线性注意力蒸馏的原则性初始化

提出Taylor-Calibrate初始化方法,利用泰勒引导注意力统计设置学生参数,大幅减少蒸馏所需token并提升零样本性能。

04:00
arXiv cs.CL

QK归一化的MLA:无需完整键缓存的QK归一化

提出QK归一化与MLA兼容方法,无需缓存完整键,实现低延迟、高精度训练。

04:00
arXiv cs.CL

DoubtProbe:通过结构验证与语义审计的黑盒越狱防御

提出双分支防御框架,结合结构验证与语义审计,有效降低攻击成功率,保持低误报率,实现稳定防御。

04:00
arXiv cs.CL

daVinci-kernel:基于强化学习的技能选择、总结与利用协同进化,用于GPU内核优化

daVinci-kernel提出强化学习框架,三个共享LLM的智能体协同进化技能选择、生成与总结,在KernelBench超越先前最优模型。

04:00
arXiv cs.CL

生成式因果测试:连接语言神经科学中的数据驱动模型与科学理论

提出生成式因果测试(GCT)框架,利用LLM生成刺激解释大脑语言选择性,弥合数据驱动模型与科学理论差距。

04:00
arXiv cs.CL

关于时间:涌现通信中的时间引用

改变架构(批处理方法)可使95%以上智能体涌现时间引用,无需修改损失函数。

04:00
arXiv cs.CL

无信号选择,通过表达恢复:冻结小代码模型事后证伪算子的测量研究

事后验证算子对冻结小代码模型无提升,表达式恢复M1提升准确率,自适应共识早停ACE零损伤节省计算。

04:00
arXiv cs.CL

HK-LegiCoST:利用非逐字转录进行语音翻译

提出600+小时粤语-英语平行语料库,利用非逐字转录实现句子级对齐,在语音翻译上取得竞争性结果。

04:00
arXiv cs.CL

多模态评估者偏好崩溃:自进化智能体中的跨模态传染

多模态下评估偏好崩溃加剧,跨模态传染导致策略反转;交叉模型评估风险最高,自评估近乎免疫(97%零传染)。

04:00
arXiv cs.CL

良性多智能体系统中的错误信息传播

研究显示错误信息会降低单代理性能,但多智能体辩论可缓解,鲁棒性依赖群体组成与决策协议。

04:00
arXiv cs.CL

通过提示调优的大语言模型自动总结医患对话

本研究利用提示调优的大语言模型自动总结医患对话,GatorTronGPT-20B性能最优且计算成本低。

04:00
arXiv cs.CL

符号非形式化:流畅、高效、多语言

符号非形式化可靠转换形式数学为自然语言,使机器验证内容可读且精确,Informath项目基于Dedukti和GF实现多语言输出。

04:00
arXiv cs.CL

MyPCBench:面向个性化智能计算机操作助手的基准测试

MyPCBench测试个人助手在模拟真实桌面上的表现,最佳模型仅完成55.4%任务,个性化任务挑战大。

04:00
arXiv cs.CL

从最小标签扩展LLM推理:一种带有轻量验证器的半监督框架

用少量标注训练轻量推理验证器,结合熵阈值过滤生成高质量伪标签,微调后性能媲美10-15倍标注数据。

04:00
arXiv cs.CL

GePBench:评估多模态大语言模型的基础几何感知能力

GePBench基准测试揭示多模态大模型几何感知能力显著不足,训练数据能提升下游任务性能。

04:00
arXiv cs.CL

词元级熵揭示语言模型中的群体差异

零温度下,黑人名首个词元熵更高,女性名熵更低且输出更同质,种族性别效应独立,指令调优不减弱种族差距。

04:00
arXiv cs.CL

DRA-GRPO:你的GRPO需知多样推理路径以进行数学推理

提出DRA-GRPO,通过多样性奖励调整避免策略坍塌,仅用7000样本和$55成本,数学推理准确率达58.2%。

04:00
arXiv cs.CL

SimSiam命名游戏:一种用于涌现通信和表示学习的统一方法

SSNG以自监督表示对齐替代采样,实现无反馈的成对智体符号涌现,在视觉数据集上分类精度显著超越现有方法。

04:00
arXiv cs.CL

理解、检测与修复基于上下文学习的真实文本到SQL错误

首次系统研究基于上下文学习的Text-to-SQL错误,总结27种类型,提出MapleDoctor框架,修复率提升13.8%,延迟降低67.4%。

04:00
arXiv cs.CL

低资源多语言语音识别中面向层次Softmax的跨语言嵌入聚类

跨语言嵌入聚类构建层次Softmax解码器,共享相似token表示,提升低资源多语言ASR准确率

04:00
arXiv cs.CL

处理仇恨言论分类中的标注者分歧

研究标注者分歧的聚合方法,证明分歧是提升分类鲁棒性的宝贵资源,并在土耳其语推文中取得新最优结果。

04:00
arXiv cs.CL

基于理论极小极大博弈提升大语言模型安全性

提出极小极大强化学习框架生成多语言安全数据,理论收敛,小模型超越SOTA近10%,速度快4.5倍。

04:00
arXiv cs.CL

无所不可?语言模型中(不)可能语言学习的跨语言研究

探究语言模型能否区分自然语言与不可能语言:GPT-2小模型有部分人类归纳偏倚,但弱于人类。

04:00
arXiv cs.CL

映射11个大语言模型中的地缘政治偏见:对美中紧张局势的双语、双框架分析

使用平衡键控法消除同意偏差,测量11个LLM的地缘政治立场,发现语言和开发起源等三因素影响,中文语境下模型更亲中。

04:00
arXiv cs.CL

树状分支为何对GRPO的思路优势估计至关重要

树状分支通过增加每思路连续分支使方差以1/M趋零,而仅增加采样无法消除,故而是必要机制,实验验证其有效性。

04:00
arXiv cs.CL

隐藏的幽灵之手:揭示基于MLLM的移动GUI智能体中的后门漏洞

AgentGhost利用复合触发器对GUI智能体实施后门攻击,成功率99.7%,效用仅降1%,防御后降至22.1%。

04:00
arXiv cs.CL

LoLA:带有稀疏缓存的低秩线性注意力

LoLA通过三种记忆系统增强线性注意力,无需训练,长上下文检索准确率从0.6%提升至97.4%,缓存更小。

04:00
arXiv cs.CL

CentroidKV:通过KV缓存聚类实现高效长上下文LLM推理

CentroidKV分块交替聚类KV缓存,减少75%内存,加速解码1.92倍,吞吐量提升4倍。

04:00
arXiv cs.CL

LM-SPT:面向语音标记化的语言模型对齐语义蒸馏

LM-SPT通过语音再合成蒸馏,避免刚性对齐,提升语义与语言模型对齐,在ASR和TTS任务上表现更优。

04:00
arXiv cs.CL

ChildGuard:针对儿童仇恨言论的专用数据集

推出35万条儿童仇恨言论数据集,覆盖三个年龄段,最佳F1达82%。

04:00
arXiv cs.CL

MedSynth:逼真的合成医疗对话-笔记对

合成超万对医疗对话-笔记,覆盖2000余ICD-10码,提升双向生成性能。

04:00
arXiv cs.CL

语义保持的提示劫持:一种针对自动提示优化的黑盒对抗攻击

提出自适应贪婪局部搜索方法,在保持语义相似下最大化输出偏离,成功率更高。

04:00
arXiv cs.CL

生成式AI与科学计量学的未来:当前主题与未来问题

提出语义与语用维度框架,分析任务性质、粒度及目标类型等关键参数,强调需实证与理论反思以解读AI时代的科学文本变化。

04:00
arXiv cs.CL

ArFake:面向多方言阿拉伯语语音欺骗检测基准的鲁棒框架

提出首个多方言阿拉伯语欺骗语音数据集,评估发现FishSpeech生成最具挑战样本,但单一模型限制泛化性。

04:00
arXiv cs.CL

OBCache: 面向高效长上下文LLM推理的最优脑KV缓存剪枝

OBCache基于最优脑损伤理论,通过输出感知评分剪枝KV缓存,提升长上下文推理准确率。

04:00
arXiv cs.CL

RoSE:无需人工测试集的循环合成数据评估方法,用以选择LLM生成器

RoSE循环评估各LLM的合成数据,训练小模型取平均性能,无需人工测试集即可选出最优生成器,性能接近人工标注基线。

04:00
arXiv cs.CL

SPI:面向向量数据库中流式RAG的查询深度自适应索引

SPI通过语义金字塔自适应检索深度,实现低延迟流式RAG,延迟降低1.4-2.3倍。

04:00
arXiv cs.CL

答案自内求:自推导奖励赋能可解释关系抽取

提出 COGRE 推理框架与 HIT@DICT 奖励策略,自推导奖励解决无关 token 误导和抽象层次错位,F1 提升 23.46%,解释质量提升 54%。

04:00
arXiv cs.CL

智能体安全综述:应用、威胁与防御

首部智能体安全综述,涵盖应用、威胁与防御,揭示系统脆弱性需全生命周期防御。

04:00
arXiv cs.CL

建模讽刺性言语:语音合成框架中的语义和韵律线索

融合语义和韵律线索建模讽刺,实验证明二者互补增强感知,综合系统最佳。

04:00
arXiv cs.CL

少即是多:通过最小测试时干预提升大语言模型推理能力

发现推理不确定性集中在高熵token,提出无训练MTI框架,通过选择性CFG和轻量负提示指导,显著提升推理准确性和效率。

04:00
arXiv cs.CL

一个用于LLM辅助语料库标注的大规模流水线:英语consider构式的变异与变化

提出LLM辅助语料标注流水线,四阶段工作流,在英语consider构式上实现98%+准确率,发现新的变化轨迹。