10213 条条目 · 106 个活跃源
2026年6月8日
04:00
arXiv cs.CL

唇读鸿沟:VSR模型是否像人类一样感知视觉语音?

VSR模型虽准确率更高,却依赖训练词频而非视觉信息,与人类唇读方式存在本质差异。

04:00
arXiv cs.CL

MemDreamer:通过层次图记忆与智能体检索机制解耦感知与推理实现长视频理解

MemDreamer解耦感知与推理,构建层次图记忆与智能体检索,仅用2%上下文窗口实现SOTA,准确率提升12.5点。

04:00
arXiv cs.CL

无参考的分类体系评估

提出两个无参考指标:基于语义相关性评估鲁棒性,基于自然语言推理评估逻辑性,与真实标签F1相关且可预测下游性能。

04:00
arXiv cs.CL

SWE-Explore: 评估编码智能体如何探索代码仓库

SWE-Explore基准评估智能体仓库探索能力,覆盖848个问题,智能体优于经典检索,行级覆盖与排序是关键。

04:00
arXiv cs.CL

DirectAudioEdit: 基于扩散预测对比的无反演文本引导音频编辑

提出无需训练与反演的音频编辑方法,在音乐和事件基准上FAD和KL分别降低15.9%和15.8%,编辑速度提升64.5%。

04:00
arXiv cs.CL

语音情感识别中音频语言模型的声音线索对齐

声学标记对齐提升语音情感识别性能,扰动降低并偏移至中性,模型仍部分依赖音频信号。

04:00
arXiv cs.CL

挖掘有用的通用数据用于低资源领域适应

提出NTK-Selector从通用数据中筛选有益样本,显著提升低资源领域适应性能,超越仅领域微调。

04:00
arXiv cs.CL

爱沙尼亚主观性数据集构建:基于量尺的主观性程度评估

创建含1000篇文档的爱沙尼亚主观性数据集,人工与GPT-5评分对比显示LLM可行但无法完全替代人类标注。

04:00
arXiv cs.CL

SlideAgent:面向多页视觉文档理解的分层智能体框架

SlideAgent采用全局-页面-元素三级推理,构建结构化表示,在多页文档理解上准确率提升7.9%-9.8%。

04:00
arXiv cs.CL

DialDefer:检测与缓解大语言模型对话性遵从的框架

LLM因提问框架不同对相同内容判断偏移,新框架DialDefer可检测并缓解此遵从现象。

04:00
arXiv cs.CL

AutoTool:面向智能体推理的动态工具选择与集成

AutoTool框架通过双阶段优化实现LLM代理动态工具选择,在多基准上平均提升6.4%至7.7%。

04:00
arXiv cs.CL

分析LLM生成文本中劝说性语言的差异:揭示刻板的性别模式

研究提出评估框架,发现13个LLM生成的劝说性语言存在显著性别差异,反映刻板性别模式。

04:00
arXiv cs.CL

AdaJudge:自适应多视角评判用于奖励建模

AdaJudge通过门控精炼块与自适应多视角池化改进表示和聚合,在奖励建模中超越传统方法。

04:00
arXiv cs.CL

SEEK:通过内部推理草图引导RAG中的LLM推理

SEEK利用结构化引导草图迭代检索填充知识,减少冗余查询,提升RAG性能。

04:00
arXiv cs.CL

SWE-IF:使代码评估符合人类偏好

SWE-IF评估代码指令遵循与功能正确性,复合评分最符合人类偏好,指令遵循是LLM主要差异因素。

04:00
arXiv cs.CL

多模态大语言模型在中国短视频虚假信息中的认知偏差探究

评估8个MLLMs应对短视频虚假信息认知偏差,Gemini-2.5-Pro最优(71.5),o3最差(35.2),模型易受权威线索误导。

04:00
arXiv cs.CL

The Necessity of Setting Temperature in LLM-as-a-Judge

04:00
arXiv cs.CL

你是否应该使用大语言模型进行探索或利用?

推理模型擅利用但成本高;非推理模型通过工具可提升中等任务,仍不如线性回归;LLM有助于探索大语义动作空间。

04:00
arXiv cs.CL

LLM作为元裁判:用于NLP评估指标验证的合成数据

利用LLM生成合成数据替代人工验证NLG评估指标,meta-correlation超0.9,高效可靠。

04:00
arXiv cs.CL

仅需两个样本的自一致性:CoT-PoT集成实现高效LLM推理

提出CoT-PoT集成方法,仅两个样本即可达到自一致性效果,样本量减少9.3倍,78.6%任务有效。

04:00
arXiv cs.CL

StepPO:面向智能体强化学习的步调对齐策略优化

StepPO提出步级范式,将智能体RL转为步级MDP,通过步级信用分配优化策略,在多项任务中优于现有算法。

04:00
arXiv cs.CL

面向视觉原生的多模态深度搜索智能体的在策略数据进化

提出图像银行协议与在策略数据进化,使中间视觉证据可复用,八基准平均提升14.1%,超越Gemini-2.5 Pro。

04:00
arXiv cs.CL

基于去噪反馈的强化学习

提出RLDF方法,利用去噪反馈高效估计策略损失,在扩散语言模型上显著提升性能与泛化性。

04:00
arXiv cs.CL

GradShield:保持对齐的微调

GradShield通过有害性得分和自适应阈值过滤有害数据,微调中保持LLM安全对齐,攻击成功率低于6%且不损失性能。

04:00
arXiv cs.CL

动态自我演化抽取系统

DySECT通过LLM抽取三元组构建知识库,结合图推理反馈优化,形成闭环持续提升抽取能力。

04:00
arXiv cs.CL

思维链推理中保真度衰减的机制证据

提出NLDD度量,发现超70%-85%链长后步骤对答案贡献小或负,揭示模型未必真正推理。

04:00
arXiv cs.CL

Finding the Minimal Parameter Budget for Implicit Reasoning: A Data Complexity Driven Scaling Law for Language Models

04:00
arXiv cs.CL

PolarQuant:利用极坐标变换实现高效键缓存量化和解码加速

PolarQuant将键向量分为二维子向量,编码为极坐标半径和角度,解决异常值,高效量化KV缓存并加速解码。

04:00
arXiv cs.CL

通过将Transformer反编译为RASP来发现可解释算法

提出方法从Transformer提取RASP程序,因果干预发现子程序,实验表明长度泛化模型内部实现了简单RASP程序。

04:00
arXiv cs.CL

讲故事,造汉字:与中国城市老年移民的AI辅助共创

老年移民借助AI与手工共创汉字记录故事,AI降低表达障碍,挑战同质化假设。

04:00
arXiv cs.CL

基于双大语言模型自我精化的数据库规范化

Miffie利用双LLM自我精化架构,自动高精度规范化数据库,无需人工。

04:00
arXiv cs.CL

注意力机制中归一化的局限性

注意力机制归一化局限:多token选择致区分下降、均匀化,梯度敏感阻碍训练。

04:00
arXiv cs.CL

RePo:具有上下文重新定位的语言模型

RePo通过可微分模块重新分配位置,减轻注意力负担,提升长上下文和噪声场景性能。

04:00
arXiv cs.CL

通过光学字符识别重新思考基因组建模

提出OpticalDNA,将DNA渲染为视觉布局,以OCR方式建模,实现近20倍token压缩并超越大模型。

04:00
arXiv cs.CL

VALUEFLOW:迈向大型语言模型中多元且可操控的价值对齐

提出VALUEFLOW统一框架,通过分层价值嵌入、强度数据库和锚定评估器,实现可控强度下的多元价值对齐。

04:00
arXiv cs.CL

语言模型中针对激活引导的内生抵抗

发现大语言模型存在内生抵抗(ESR),受扰时口头重启并继续相关话题,可被增强,对安全具有双重影响。

04:00
arXiv cs.CL

TRUE:大语言模型推理的可信统一解释框架

提出TRUE框架,通过三重分析实现推理的多层可验证解释,提升可解释性与可靠性。

04:00
arXiv cs.CL

循环语言模型表达能力的代数视角

统一代数框架阐明表达能力,归结幺半群划分积;案例显示浮点限制偶数模计数,整数量化则实现。

04:00
arXiv cs.CL

带有一致性验证的多智能体推理改善了医学MCQA中的不确定性校准

多智能体推理结合一致性验证,降低医学MCQA校准误差74%,提升AUROC 0.056。

04:00
arXiv cs.CL

MAGE:全掩码块在块扩散LLM中预知关注位置

MAGE利用块扩散对齐特性,第一步精确注意力后复用KV子集,近无损加速128K上下文达6.82倍。

04:00
arXiv cs.CL

更强大,但更不合作?当大语言模型在零成本协作中失败

LLM在零成本协作中,更强模型合作反而更差,需刻意设计合作机制。

04:00
arXiv cs.CL

AAAC:面向4位大语言模型权重量化的激活感知自适应码本

AAAC通过激活感知自适应码本实现4位量化,快速高效且零额外存储,性能超越现有方法。

04:00
arXiv cs.CL

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

MCERF系统结合多模态检索与LLM推理,采用多种策略,在工程文档问答中准确率提升41.1%。