10073 条条目 · 106 个活跃源
2026年7月17日
04:00
arXiv cs.CL

不断提示:评估视觉语言模型中的重复苏格拉底式提示

提出JKP框架评估VLM在重复追问下的稳定性,发现重复提示效果有限且模型表现差异大。

04:00
arXiv cs.CL

面向阿拉伯语的量子组合自然语言处理:电路拓扑中的语法、形态与词义

首次将预群语法量子NLP应用于形态丰富的阿拉伯语,电路拓扑反映语法结构,实验验证优于经典方法。

04:00
arXiv cs.CL

LBA:低查询预算下的文本硬标签对抗攻击

提出LBA采样方法,融合先验与后验知识,低预算下高效生成高质量对抗文本,显著超越基线。

04:00
arXiv cs.CL

UniSAGE:使用超结构统一静态与动态属性

UniSAGE框架通过超结构统一静态与动态属性,自动建模复杂交互,性能提升超10%。

04:00
arXiv cs.CL

语言模型智能体之间的潜在通信:通道、对齐与文本的局限

文本通信丢失88%特征,潜在通道未超越文本,揭示复杂概念表达局限。

04:00
arXiv cs.CL

UzWordnet与生成式AI:通过游戏学习乌兹别克语

结合词汇资源与生成式AI,通过四款教育游戏学习乌兹别克语,同时动态改进词汇网络。

04:00
arXiv cs.CL

自动进化任务特定优化的提示指南

AGOPS自动生成任务特定提示指南,修复查询模糊导致的性能大幅下降。

04:00
arXiv cs.CL

基于令牌时间连续扩散的语言建模

新型连续扩散语言模型,通过每个令牌独立时间步长,提升条件生成质量,高速率下优于离散模型。

04:00
arXiv cs.CL

Δ下的η:用边际工具效用定义LLM工具效率

提出工具效率和边际工具效用,直接量化工具调用有用性,提升效率并补充准确度指标。

04:00
arXiv cs.CL

Polestar:面向扩散LLM高效推理的漂移感知缓存校准与令牌提交

Polestar利用令牌漂移信号实现缓存校准与令牌提交,显著提升扩散LLM推理准确率与吞吐量。

04:00
arXiv cs.CL

简单性悖论:揭穿大语言模型评估中提示工程与数据集的神话

基线提示始终优于复杂推理,仅专家角色框架略有提升,复杂技术反而拉低性能。

04:00
arXiv cs.CL

MAPS:多智能体认知对话中建模共存主观视角与共享意义

MAPS框架通过个性化记忆与注意力,使多智能体在对话中保持主观多样性并逐步达成共识,平衡表达性与连贯性。

04:00
arXiv cs.CL

内省微调(IFT):训练小型大语言模型进行内省

提出内省微调(IFT),将1B模型句子定位准确率提升6倍(9.6%→60.6%),证明小模型内省能力可被训练获得。

04:00
arXiv cs.CL

CoEvoT:面向图-大语言模型推理的共进化思维链提示

CoEvoT通过文本-图标记重写与推理指导闭环,实现逐步状态感知证据细化,在8个数据集上超越基线。

04:00
arXiv cs.CL

多智能体大语言模型级联中的语义语域压缩

语义语域压缩在多智能体LLM级联中可测量且泛化,评估环节使标签可分性降低41.7%。

04:00
arXiv cs.CL

ReportMedSAM: 通过放射学报告指导分割

ReportMedSAM用可学习概念库替代离散提取,对比对齐临床语料,动态激活MoE,实现自由文本鲁棒分割及无干扰扩展。

04:00
arXiv cs.CL

语言模型可靠性与规模化的信息论极限

语言模型存在信息论可靠性上限,性能瓶颈取决于数据或容量中更稀缺资源,统一了检索增强、灾难性遗忘等现象。

04:00
arXiv cs.CL

T5-CSBoost:对抗性扰动鲁棒的LLM指纹识别

T5-CSBoost利用对比学习正则化风格嵌入,在多种对抗扰动下实现SOTA,显著提升LLM指纹鲁棒性。

04:00
arXiv cs.CL

预算子集优化用于执行感知的LLM研究构思

预算子集优化策略通过选择性优化提升LLM研究构思质量,多样性感知MMR-k方法在非重复性和成本效益上最优。

04:00
arXiv cs.CL

面向科学文档的异构元素感知跨版本差异检测:布局感知对齐与结构感知推理

提出布局感知异构元素感知框架,实现科学文档跨版本差异检测,统一处理文本、表格、公式、图形,F1达0.85-0.90。

04:00
arXiv cs.CL

HABIB_TAZ在SemEval-2026任务11中:通过合成训练和多目标优化分离形式逻辑与内容

使用合成数据和多目标损失函数,系统在英语子任务上达成零偏差和100%准确率,多语言子任务排名第六。

04:00
arXiv cs.CL

PReM:学习保留什么以及何时刷新以实现上下文压缩

PReM框架通过内部KV记忆学习保留和刷新上下文,采用相位分离训练,在32倍压缩下兼顾答案质量与效率。

04:00
arXiv cs.CL

多头潜变量控制:大语言模型智能体决策的统一接口

多头潜变量控制从冻结模型隐状态推断控制信号,优化智能体决策,显著降低大模型调用成本并保持性能。

04:00
arXiv cs.CL

更聪明且更便宜一举两得:字节精确的KV缓存嫁接将冻结的小模型变成验证知识飞轮

字节精确KV缓存嫁接使冻结小模型性能跃升、成本剧降,零额外内存扩展上下文,AIME得分从80.0%升至93.3%

04:00
arXiv cs.CL

通过概念链的隐式推理引导

大型语言模型推理脆弱,本文用自然文本隐式偏置答案,显示普通文本可系统性重构决策。

04:00
arXiv cs.CL

乌尔都语假新闻检测中的跨数据集泛化:基于XLM-RoBERTa和长度混淆分析的实证研究

跨数据集泛化研究发现长度混淆导致迁移崩塌,截断实验确证其影响。

04:00
arXiv cs.CL

MamaBench:通过反事实临床扰动评估LLM在妇幼健康诊断中的鲁棒性

MamaBench是首个妇幼健康反事实基准,BTR揭示LLM鲁棒性缺陷,EA-RAG降BTR 5.5%,但残差20%表明挑战犹存。

04:00
arXiv cs.CL

前半段突破拒绝:预填充越狱的机制研究

预填充通过被动自回归条件在响应前半段打破拒绝,而非抑制安全表示;监控提示侧可免疫此类攻击。

04:00
arXiv cs.CL

DS@GT ARC在LongEval:科学问答中的引用完整性与事实依据

通过纠正管道提升引用忠实度,主张评估需奖励严格答案依据。

04:00
arXiv cs.CL

断绝问题:大型语言模型无法感知提示之外的用户

LLM因缺乏对用户未知的表示导致奉承、幻觉;引入断绝模式列出未知维度可减少问题并促使用户主动提问。

04:00
arXiv cs.CL

MARS:面向KGQA的多跳自适应检索与SPARQL生成

MARS是一种无需微调的KGQA方法,通过结构化多跳检索自适应生成SPARQL查询,性能优异。

04:00
arXiv cs.CL

驾驭大语言模型实现可靠的学术督导:一项比较研究

脚手架工程可让小型语言模型在可靠性和一致性上超越大型模型,挑战“越大越好”的直觉。

04:00
arXiv cs.CL

LLM评估器存在跨语言偏差

大模型评估器对低资源语言评分偏高,配对准确性无法揭示此偏差,导致安全漏洞。

04:00
arXiv cs.CL

CityLLM:一个用于自然语言查询语义三维城市模型的框架

CityLLM框架实现自然语言查询语义3D城市模型,评估显示高正确率和100%查询成功率,轻量可扩展。

04:00
arXiv cs.CL

基于答案条件的思维链降低大语言模型中的可验证推理蒸馏质量

答案条件化生成的思维链会降低推理蒸馏质量,正确性筛选无法弥补,应避免使用。

04:00
arXiv cs.CL

大型语言模型逻辑一致性的受控改写测试

提出CRTBench基准发现LLM逻辑等价改写一致性差,准确率与一致性存在鸿沟,推理优化可提升但有限。

04:00
arXiv cs.CL

AI生成反馈效果如何?——基于两万余篇EFL论文草稿的内在与外在评估

研究通过两万篇论文评估AI反馈,发现专家评分与学习者反馈不一致,强调以学习者为中心的评估框架。

04:00
arXiv cs.CL

Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection

04:00
arXiv cs.CL

探究LLM自动作文评分中的第一语言偏见:一项针对托福作文的开放权重AI模型跨提示评估

研究首次发现LoRA微调LLM评分存在母语偏见:欧洲语言得分系统性高于东亚,跨提示泛化稳健。

04:00
arXiv cs.CL

D-Cut:面向批量推测解码的自适应验证深度剪枝

D-Cut自适应剪枝验证预算,高并发下加速比从1.26倍升至1.65倍,最高达3.0倍。

04:00
arXiv cs.CL

Latent Trajectory Discrimination for AI-Generated Text Detection

04:00
arXiv cs.CL

SEED:面向智能体强化学习的自进化在线策略蒸馏

提出自进化框架,将在线轨迹转化为事后技能并蒸馏回策略,提升智能体强化学习性能和样本效率。

04:00
arXiv cs.CL

数字万神殿:利用大语言模型智能体模拟与审计联盟形成

提出多智能体框架,用DPO和RAG塑造党派立场,溯源分析协议条款,预测现实联盟结果。

04:00
arXiv cs.CL

展示你的推理方式,我便能道出你是谁:用于鲁棒LLM作者归属的推理图

提出推理图神经网络方法,在改写攻击下准确率比基线高27%,对未知模型版本高19%,实现鲁棒作者归属。

04:00
arXiv cs.CL

自闭症作者的写作被误判为AI生成

AI检测模型对自闭症作者存偏见,其作品更易被误判为AI生成,呼吁伦理审查。

04:00
arXiv cs.CL

OmniaBench:跨多样场景评估通用AI智能体的基准测试

OmniaBench基准测试评估通用AI智能体,覆盖多领域任务,揭示规划与自适应修正能力局限。

04:00
arXiv cs.CL

黄金引导的程序化蒸馏用于混合表格与文本的金融推理

用执行验证的Python程序替代自然语言理由,从大模型蒸馏可靠数值推理到小模型,在金融推理中超越72B教师模型。