10064 条条目 · 106 个活跃源
2026年7月21日
04:00
arXiv cs.CL

表达方式至关重要:探究AI辅助信息评估中的修辞模式

研究八种修辞模式,发现支架解释提升准确率与反思最多,对抗性条件也有效,用户偏好替代框架。

04:00
arXiv cs.CL

莫比乌斯学习:Transformer中的循环深度折叠

Mobius学习通过循环深度折叠实现块组深度角色叠加,降低验证损失,尤其适合分布式训练。

04:00
arXiv cs.CL

基准测试资源高效LLM在生物医学领域研究主题本体生成

评估五款小参数开源LLM,微调使F1提升34.1个百分点,证明其可准确自动化构建生物医学本体。

04:00
arXiv cs.CL

自托管AI代理上的自状态攻击:操作系统防御能走多远?

自状态攻击通过合法OS调用破坏AI代理自身状态,OS分层防御有效但仍存结构不可区分的残余攻击面。

04:00
arXiv cs.CL

AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning

04:00
arXiv cs.CL

L1增强注意力:一种改进的向量相似性度量

L1增强注意力结合点积与L1距离,改进Transformer相似性度量,困惑度降14.5%,优于RBF L2核。

04:00
arXiv cs.CL

MADA-RL:面向紧凑模型参数高效推理的多智能体辩论感知强化学习

MADA-RL通过辩论感知强化学习和LoRA微调,让紧凑模型分工协作,用反事实优势提升推理精度,节省16倍参数量。

04:00
arXiv cs.CL

大语言模型作为教练:面向不可验证任务的体验式学习

将LLM从裁判转为教练,通过经验蒸馏提供高密度反馈,优于标量奖励的强化学习,泛化更强且避免奖励黑客。

04:00
arXiv cs.CL

WorldCupArena:针对足球预测的语言模型与深度研究代理的细粒度评估

提出WorldCupArena动态基准,细粒度评估语言模型和深度研究代理的足球预测能力,104场比赛揭示模型细节预测差异。

04:00
arXiv cs.CL

FinSAgent:面向证据支持的SEC文件问答的语料对齐多智能体RAG框架

FinSAgent提出语料对齐的多智能体RAG框架,通过角色代理、查询分解和特征门控重排序,提升SEC文件问答的证据准确性。

04:00
arXiv cs.CL

章鱼v3:面向设备端亚十亿参数多模态AI智能体技术报告

提出含功能令牌的亚十亿参数多模态AI代理模型,支持中英文,可在树莓派等边缘设备高效运行。

04:00
arXiv cs.CL

O-VAD:通过以对象为中心的跟踪与推理进行工业视频异常检测

提出无训练、无领域知识的智能体框架,通过对象时空轨迹推理识别异常,优于现有方法并提供可解释报告。

04:00
arXiv cs.CL

AI计数环:计算高效的等价形式及应用

提出CEEF结合AI与人类指导,高效计算高阶环计数统计量,并应用于尖峰矩阵检验等统计推断。

04:00
arXiv cs.CL

压力下的逻辑判断:用学习到的软前缀诊断三段论稳定性

通过软前缀测试,发现模型逻辑判断易被改变,主要效应是答案偏好,模型间稳定性差异显著。

04:00
arXiv cs.CL

语言模型会梦想结合分子吗?在空间约束下评估大语言模型

研究发现通用LLM在3D空间约束分子生成中虽落后扩散模型,但能同时处理多种约束,展现潜力。

04:00
arXiv cs.CL

Octo-planner:设备端规划-动作代理语言模型

提出设备端Planner-Action框架,将规划与执行分离,微调Phi-3 Mini模型,实现97%成功率。

04:00
arXiv cs.CL

Octopus v4:语言模型图

Octopus v4用功能令牌和图结构整合开源模型,<10B参数获MMLU 74.8分,达SOTA。

04:00
arXiv cs.CL

章鱼:用于软件API函数调用的设备端语言模型

通过微调小模型和条件掩码,Octopus在API调用上性能优于GPT-4,推动自动化软件开发。

04:00
arXiv cs.CL

面向知识的检索增强生成综述

综述检索增强生成(RAG)的机制、分类、评估与应用,强调动态外部知识整合及未来方向。

04:00
arXiv cs.CL

Squid:将长上下文视为新模态以实现高能效设备端语言模型

Dolphin以小解码器压缩长文本为记忆嵌入,提升主模型效率,能效增10倍、延迟降5倍。

04:00
arXiv cs.CL

从证据到轨迹:面向检索增强生成智能体开发的溯因推理路径合成

EviPath通过溯因推理从证据合成可执行轨迹,使8B模型在开放域问答中取得14.7%精确匹配提升。

04:00
arXiv cs.CL

LogicIF:迈向复杂逻辑指令跟随

LogicIFGen和LogicIFEval评估LLM逻辑指令跟随,实验显示当前LLM正确率不足60%。

04:00
arXiv cs.CL

Psyche-R1:通过统一共情、专业知识和推理迈向可靠的心理大语言模型

首个整合共情、专业知识和推理的中文心理大模型Psyche-R1,7B参数性能媲美671B DeepSeek-R1。

04:00
arXiv cs.CL

Lil:后训练稀疏注意力算法在长解码阶段中的“少即是少”现象

发现稀疏注意力在解码时因信息损失导致序列变长,提出早停算法,减少令牌消耗90%,准确率损失小于2%。

04:00
arXiv cs.CL

面向RLVR的监督学习框架下的隐式演员-评论员耦合

提出PACS框架,将RLVR转化为监督学习任务,隐式实现演员-评论员耦合,训练更稳定高效,性能显著提升。

04:00
arXiv cs.CL

打破阻塞:保持数据连续性以训练更优的指令模型SAE

针对指令模型提出FAST序列训练范式,解决注意力泄漏,显著提升SAE重构质量与特征可解释性。

04:00
arXiv cs.CL

GRIP: 参数内图推理通过微调大型语言模型

GRIP微调LLM将图知识内化到LoRA参数,推理免图上下文,大图高效,小图低成本。

04:00
arXiv cs.CL

探测大语言模型的难度感知机制

发现大语言模型内部表征可线性建模问题难度,特定注意力头难易激活相反,支持自动标注。

04:00
arXiv cs.CL

PapersPlease: A Benchmark for Evaluating Motivational Values of Large Language Models Based on ERG Theory

04:00
arXiv cs.CL

AutoNeural:为NPU推理协同设计的视觉语言模型

AutoNeural创新NPU原生VLM架构,以卷积骨干和混合SSM-Transformer实现稳定量化与线性复杂度,延迟降14倍、解码快3倍。

04:00
arXiv cs.CL

SyriSign:用于阿拉伯语文本到叙利亚阿拉伯手语翻译的平行语料库

首次发布叙利亚手语数据集SyriSign(1500视频、150词汇),生成方法有潜力但受数据规模限制。

04:00
arXiv cs.CL

开放大语言模型在多语言机器翻译中的模型与数据规模扩展

基于Gemma3的MiLMMT-46在46种语言翻译上超越现有SOTA及商业系统。

04:00
arXiv cs.CL

ReMIND:模块化大语言模型的可控意外发现编排——一种受REM启发的涌现式创意构思系统设计

ReMIND通过四阶段模块化LLM编排,分离探索与稳定,实现可控的意外创意涌现。

04:00
arXiv cs.CL

傀儡攻击:结合预填充与优化的LLM越狱方法

集成简单预填充变体提升越狱成功率,混合攻击优化后缀位置,显著提升通用对抗效果。

04:00
arXiv cs.CL

截断盲点:解码策略如何系统性地排除类人词元选择

解码截断排除低概率人类词元,形成盲区,机器文本因此易被检测(49字)

04:00
arXiv cs.CL

通过高效多样化响应采样暴露大语言模型中的长尾安全故障

PDPS通过多样响应采样高效暴露长尾安全故障,以低计算成本提升安全强化效果

04:00
arXiv cs.CL

基于道德理由的自我解释型仇恨言论检测

提出SMRA框架,利用道德理由监督注意力,提升仇恨检测性能与可解释性,解释更简洁且公平性稳定。

04:00
arXiv cs.CL

HiCI: 面向长上下文注意力的层次化构建-整合方法

提出HiCI层次注意力,以<5.5%参数将上下文扩展至100K,显著提升长程任务性能。

04:00
arXiv cs.CL

语言触发器劫持语言电路:大语言模型后门行为的机制分析

首次机制分析发现,后门触发器劫持模型现有的语言编码回路,而非新建电路。

04:00
arXiv cs.CL

面向RAG幻觉检测的层次化验证反向形态测试

RT4CHART分解答案为声明,层次化验证标记蕴含/矛盾/无依据,F1达0.776,较基线提升83%。

2026年7月20日
04:00
arXiv cs.CL

大语言模型作为统一多模态学习器用于临床预测

将患者多模态数据序列化为文本,微调大语言模型,无需专用融合架构,在临床预测中匹配或超越专用模型。

04:00
arXiv cs.CL

SkillCorpus:整合与评估面向真实世界LLM智能体的开放技能生态系统

SkillCorpus框架整合筛选96k技能,提升LLM智能体任务性能,最大提升7.5个百分点。

04:00
arXiv cs.CL

行动之前:面向前瞻假设发现的LLM基准测试

提出PHD与HypoArena基准,评估LLM自主构建可检验假设的能力,实验显示模型能力分层。

04:00
arXiv cs.CL

EpiNarrate:从流行病学情景预测中生成基于事实的叙事

通过分离数值推理与文本生成,实现事实准确、覆盖全面的流行病报告自动撰写。

04:00
arXiv cs.CL

可言语表征形成语言模型中的全局工作空间

语言模型存在类似意识访问的全局工作空间,可揭示未言明思维与不对齐,后训练安装助手视角。

04:00
arXiv cs.CL

VarRate:面向长上下文大语言模型的无训练可变速率KV缓存压缩

VarRate通过无训练分配可变低秩预算保留所有token,在20%压缩下精度近无损。

04:00
arXiv cs.CL

多方对话中的指向结构:从离散标签到连续层级

本文提出话语指向是连续现象,连续层级模型比离散标签更优预测听众行为。

04:00
arXiv cs.CL

扩散语言模型的自适应多步前瞻解码

提出AdaLook自适应前瞻框架,动态评估候选分数方差,避免无效深度展开,提升扩散语言模型解码效率与精度平衡。

04:00
arXiv cs.CL

过程奖励引导的树形展开策略实现高效多轮强化学习

PATR利用过程反馈指导树形展开,减少无效采样,在SWE-Bench和FrozenLake上分别提升5.0和9.3点。

04:00
arXiv cs.CL

善始善终:面向压缩推理的自举迭代自推理蒸馏方法

BIRD通过两阶段自推理蒸馏,先采样简洁解SFT,再on-policy蒸馏,提升准确率并大幅压缩推理长度。