10213 条条目 · 106 个活跃源
2026年6月4日
04:00
arXiv cs.CL

多模态长对话中的细粒度片段检索

提出细粒度片段检索任务,通过强化学习训练和两阶段系统,从多模态长对话中精准定位相关图文片段。

04:00
arXiv cs.CL

GENEB:为何基因组模型难以比较

GENEB基准测试发现,基因组模型排行榜不稳定,规模收益有限,架构与预训练对齐更关键。

04:00
arXiv cs.CL

扩散大语言模型中格式约束生成的动态填充锚点

提出无训练动态填充锚点法,动态调整生成长度,保证结构正确与语义连贯,显著提升推理任务格式合规性和准确性。

04:00
arXiv cs.CL

面向自然语言理解任务的混合对抗防御

混合熵、不确定性和几何特征的防御框架,在多个NLU数据集上提升准确率最高43.34%,降低攻击成功率最高62.27%,优于单一特征方法。

04:00
arXiv cs.CL

SMADE-IE:基于证据驱动辩论的稀疏多智能体框架用于零样本信息抽取

提出SMADE-IE稀疏多智能体框架,通过自适应模式选择和证据驱动辩论,在零样本信息抽取中优于现有方法并提高效率。

04:00
arXiv cs.CL

基于查询的跨模态投影器增强Mamba多模态大语言模型

查询跨模态投影器用交叉注意力压缩视觉令牌,提升Mamba多模态LLM性能与吞吐量,免手动扫描排序。

04:00
arXiv cs.CL

DuDi:跨语言口语化器的双信号蒸馏

DuDi通过双信号蒸馏和跨语言口语化器提升小模型多语言能力,尤其对东南亚语言表现优异。

04:00
arXiv cs.CL

CRAFT:成本感知的精炼与前沿感知的提示调优

CRAFT是帕累托前沿提示优化器,将验证调用作为稀缺资源,实现高准确率与低成本权衡。

04:00
arXiv cs.CL

中文标题

重新思考自我进化LLM智能体的持续经验内化:发现多迭代学习导致能力崩溃,提出原则级经验、逐步注入与离策略蒸馏的稳定方案。

04:00
arXiv cs.CL

CYGNET:用于神经执行分流与成本控制的Cypher门控

在查询生成与数据库执行间设置门控,检测结构/语义错误,修正结构错误,保持精度,低延迟。

04:00
arXiv cs.CL

QO-Bench: 诊断类型化事件元组上的查询算子保持检索

QO-Bench基准诊断查询算子保持检索,发现系统检索相关文本但丢失类型值,算子执行是核心瓶颈。

04:00
arXiv cs.CL

LifeSide:将智能体评估为终身数字伴侣

LifeSide基准测试发现,即使顶尖模型在长期用户理解与情感陪伴上也表现不佳。

04:00
arXiv cs.CL

RAMPART:基于注册表的智能体记忆与优先级感知运行时变换

RAMPART是编译时记忆模型,通过可组合原语和优先级感知变换优化上下文组装,提升任务成功率并降低提示成本。

04:00
arXiv cs.CL

多语言长语音指令跟随:KIT提交至IWSLT 2026

KIT提出结合数据增强与似然-最小贝叶斯风险解码,解决长语音指令跟随中语义任务退化问题。

04:00
arXiv cs.CL

K-12教育中的大语言模型:与州立课程标准和学生角色的对齐

LLM调整历史呈现受政治倾向影响,未反映课程内容;对年级适应好,种族性别偏见低,需加强对齐。

04:00
arXiv cs.CL

Caliper:探究大语言模型中的词汇锚点与因果结构

Caliper测试表明,大语言模型因果推理依赖词汇模式,去除锚点后准确率下降达29.6个百分点,结构推理证据不足。

04:00
arXiv cs.CL

智能体规划基准:LLM智能体规划能力的诊断框架

APB基准通过多模态案例诊断LLM智能体规划能力,揭示规划弱点,作为执行基准的上游补充。

04:00
arXiv cs.CL

GRAIL:基于梯度重加权优势的可验证奖励强化学习方法

提出GRAIL,利用梯度激活显著性重加权令牌优势,无需过程监督提升推理对齐,准确率提升3.6%。

04:00
arXiv cs.CL

优化Lean中智能体定理证明器的成本-质量权衡

利用失败Lean轨迹信号动态路由,成本降低25.8%且性能不变。

04:00
arXiv cs.CL

PersonaTree:面向LLM智能体人物理解的结构化生命周期记忆

提出PersonaTree框架,通过三层人物树与路径检索提升LLM长期人物理解,在18项评测中12项第一。

04:00
arXiv cs.CL

TIDE:通过模板引导迭代的主动多问题发现

提出TIDE框架,通过模板引导迭代主动发现上下文中多个隐藏问题,提升任务覆盖与解决能力。

04:00
arXiv cs.CL

'你的AI文本并非我作':在现实假设下重新定义与评估AI生成文本检测

系统定义AI文本概念,构建AITDNA基准,发现现有检测器仅对特定概念有效。

04:00
arXiv cs.CL

A French Corpus Annotated for Multiword Expressions with Adverbial Function

04:00
arXiv cs.CL

SemBlock:面向扩散大语言模型的语义边界动态块

SemBlock提出语义边界驱动动态块解码,利用轻量预测器在冻结隐状态上预测边界,在多个任务上优于固定块解码。

04:00
arXiv cs.CL

DeliChess:一个用于国际象棋谜题协商讨论的多方对话数据集

DeliChess含107组国际象棋谜题讨论,小组讨论提升准确性,但探究性话语效果不稳定。

04:00
arXiv cs.CL

赋予大语言模型双向逻辑以稳健修复推理链

提出TRI框架,通过双向逻辑的填充中间任务修复推理链错误,两阶段训练达SOTA,token节省31.2%。

04:00
arXiv cs.CL

GARL:面向多智能体战略优先级的博弈论强化学习

GARL将博弈论与强化学习结合,通过两阶段博弈建模多智能体战略优先级排序,显著提升性能,使小模型媲美大模型。

04:00
arXiv cs.CL

SAID: 通过支架感知迭代解码加速基于扩散的语言模型

SAID框架利用支架感知迭代解码和置信度分层生成,加速扩散语言模型推理最高达9.1倍,同时保持性能。

04:00
arXiv cs.CL

探究大语言模型风险决策中的结果层面相似性与机制层面一致性:来自圣彼得堡博弈的证据

LLM风险决策结果表面似人类但机制不一致,评估需关注机制层面一致性。

04:00
arXiv cs.CL

众包能否在LLM时代生存?关于人类数据收集的社区调查

44%研究者发现众包数据含LLM内容,93%有预期但半数无对策,现有检测与防治措施不足。

04:00
arXiv cs.CL

DAR:基于代理框架的道义推理

DAR通过代理框架让模型按需交互法规,提升道义推理,但弱模型在数值任务上退化且消耗更多token。

04:00
arXiv cs.CL

深度注意力:语言模型的跨层值混合

提出Depth-Attention,在注意力内实现跨层值混合,无额外参数和推理状态,显著提升语言模型困惑度和准确率。

04:00
arXiv cs.CL

TaDA:面向任务-领域LoRA合并的校准探针门控

TaDA通过校准探针门控和子空间感知合并,无需训练融合任务与领域LoRA,在多个基准上取得最优。

04:00
arXiv cs.CL

用排序提升自一致性

RISC用排序模型结合五个特征评分替代多数投票,提升自一致性准确率与效率。

04:00
arXiv cs.CL

语言模型的算术教学法

基于人类教学法(GASING)训练小语言模型算术推理,通过CoT监督达到80%以上准确率,无需强化学习。

04:00
arXiv cs.CL

使用标准化病人案例评估大语言模型在动态临床决策中的表现

静态基准无法反映模型动态诊疗能力,最佳模型GPT-5.5仅完成60.4%专家指标,当前模型尚不可靠。

04:00
arXiv cs.CL

自我评估已然存在:用极少量数据激发基础大语言模型中的潜在评判校准

基础LLM可预测外部评判,SEE方法用少量数据激发潜在自我评估,实现跨评判者校准且保持答案质量。

04:00
arXiv cs.CL

语言模型间的隐蔽影响

研究三种接口下的隐蔽影响,利用归因分数放大载荷传递,发现自然语言载体风险面更广且不同于数字载体。

04:00
arXiv cs.CL

基于激活的主动学习在上下文学习中的应用:挑战与见解

MLP激活与任务性能弱相关(相关系数≤0.33),叠加效应是主因,未来方向为稀疏自编码器。

04:00
arXiv cs.CL

快速且可靠的功能向量

通过LRP梯度归因和分布式引导改进函数向量,提升LLM在上下文学习中的效率与准确性。

04:00
arXiv cs.CL

使用语言模型自动生成研究论文标题

本文用语言模型从摘要自动生成论文标题,微调PEGASUS-large表现最佳,AI标题可靠有创意。

04:00
arXiv cs.CL

中文标题:多智能体推理中的流式通信

中文摘要:流式传输推理步骤降低延迟,利用早期步骤可靠性提升效果,形式化分析优势并发现步骤级缩放定律。

04:00
arXiv cs.CL

轻动词还是实义动词?一个用于探测语言模型短语能力的最小配对数据集

新数据集探明语言模型能区分轻动词和实义动词用法,即使在最小上下文中。

04:00
arXiv cs.CL

BEATS:通过迭代人机协作引导电子商务属性分类体系以支持搜索

BEATS通过迭代人机协作从零构建电商属性分类,提升搜索过滤与语义表示,已部署于乐天台湾,覆盖2694个子类及540万产品。

04:00
arXiv cs.CL

超越检索:学习紧凑的用户表示以实现可扩展的LLM个性化

提出TAP-PER框架,用可学习用户状态前缀替代检索和适配器,实现高效个性化且大幅减少参数。

04:00
arXiv cs.CL

令牌排名是不可伪造的语言模型签名

令牌排名可作为不可伪造模型签名,通过限制top-k大小平衡安全与验证。

04:00
arXiv cs.CL

基于全局草图的扩散语言模型水印方法

提出全局草图水印,实现顺序无关检测,并分析了失真与鲁棒性。

04:00
arXiv cs.CL

SocialCoach:基于强化学习智能体辅导与练习的个性化社交技能学习

提出SocialCoach系统,利用LLM与强化学习实现个性化社交技能辅导,实验证明有效提升学习质量。

04:00
arXiv cs.CL

Exploring the Topology and Memory of Consensus: How LLM Agents Agree, Fragment, or Settle When Forming Conventions

04:00
arXiv cs.CL

CleanCodec:通过感知引导编码实现高效鲁棒的语音令牌化

CleanCodec以12.5令牌/秒仅编码感知重要特征,提升语音清晰度和推理速度17倍。