10213 条条目 · 106 个活跃源
2026年6月12日
04:00
arXiv cs.CL

超越承诺边界:探究大型推理模型中的副现象思维链

研究发现推理存在“承诺边界”,后续步骤为副现象,早期退出可平均减少55%思维链长度且性能几乎无损。

04:00
arXiv cs.CL

大型语言模型中层级情感组织的涌现

LLMs自然形成符合人类心理的层级情感树,更大模型更复杂,且存在跨人群情感识别偏差。

04:00
arXiv cs.CL

多语言机器生成文本的作者归属

研究多语言环境下机器文本作者归属,发现单语方法跨语言迁移存在局限,需更鲁棒方案。

04:00
arXiv cs.CL

从基准到技能:LLM评估的低秩因子

因子分析揭示LLM性能矩阵低秩,少量技能维度可解释大部分基准表现,并提供冗余识别、子集建模、技能匹配三工具。

04:00
arXiv cs.CL

RAGPPI:药物发现中蛋白质-蛋白质相互作用的RAG基准

构建含4420问答对的RAGPPI基准,用于评估药物发现中蛋白质相互作用生物影响。

04:00
arXiv cs.CL

解析句法:语言建模与语法的子结构

语言模型在上下文无关语法子结构上损失线性递归,子语法预训练可提升小模型性能并改善内部表示。

04:00
arXiv cs.CL

MoReBench:评估语言模型中的过程性与多元道德推理——不止于结果

MoReBench基准含千个道德场景及数万准则,发现语言模型道德推理能力无法由现有基准预测,且存在框架偏好。

04:00
arXiv cs.CL

ChiKhaPo:一个大规模多语言基准测试,用于评估大型语言模型的词汇理解与生成能力

ChiKhaPo覆盖2700+语言,8个子任务评估词汇能力,发现现有SOTA模型表现不佳。

04:00
arXiv cs.CL

CuMA: 通过人口感知的适配器混合对齐大语言模型与稀疏文化价值观

CuMA通过人口感知混合适配器解耦冲突梯度,缓解均值崩溃,实现文化多样性对齐,性能最优。

04:00
arXiv cs.CL

NOVA: NOise-aware Verbal Confidence CAlibration for Robust Large Language Models in RAG Systems

04:00
arXiv cs.CL

基于大语言模型的嵌入:注意力值比隐藏状态更能编码句子语义

VA方法聚合注意力值,无训练超越其他LLM嵌入,改进版性能最优,微调可更强。

04:00
arXiv cs.CL

AfroScope:研究非洲语言景观的框架

提出AfroScope框架,含640种语言数据集和模型,层次分类法提升近亲语言识别F1达1.57点。

04:00
arXiv cs.CL

自蒸馏零:自我修订将二元奖励转化为密集监督

提出SD-Zero,通过自修订将二元奖励转化为密集token级自我监督,显著提升样本效率和推理性能。

04:00
arXiv cs.CL

当迭代RAG超越理想证据:科学多跳问答中的诊断研究

迭代RAG超越理想静态证据,提升达25.6个百分点,分阶段检索比证据本身更关键。

04:00
arXiv cs.CL

语言模型电路在神经元基础上具有稀疏性

发现MLP神经元与稀疏自编码器一样稀疏,用梯度归因追踪电路,少量神经元即可控制模型行为。

04:00
arXiv cs.CL

InnoEval:将研究想法评估视为基于知识的、多视角推理问题

提出InnoEval框架,通过知识检索与多视角评审实现深度创新评估,优于基线且与专家高度一致。

04:00
arXiv cs.CL

TAB-PO:针对令牌关键结构化生成的令牌级自适应屏障偏好优化

提出令牌级自适应屏障偏好优化,解决结构化生成梯度稀释与令牌侵蚀,在SciERC任务平均提升11.59%,超越所有基线。

04:00
arXiv cs.CL

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

04:00
arXiv cs.CL

BLUEmed:基于检索增强的多智能体辩论方法用于临床错误检测

BLUEmed结合混合RAG与多智能体辩论检测临床术语替换错误,少样本下准确率69.13%,优于单智能体RAG和纯辩论基线。

04:00
arXiv cs.CL

一个Token欺骗LLM裁判

仅需一个Token就能欺骗LLM裁判,Master-RM数据增强策略有效防御此类攻击。

04:00
arXiv cs.CL

认知宪政主义或:如何避免一致性偏差

主张为AI建立明确认知宪法,以自由式方法为核心,通过八项原则和四种取向规避一致性偏差。

04:00
arXiv cs.CL

C-QUERI:国会机构中的问题、交流与回答数据集

构建国会听证问答数据集,发现提问者党派可仅从问题预测,揭示跨党派提问策略差异。

04:00
arXiv cs.CL

构建未来:通过校准草稿图实现扩散LLM投机解码

Spiffy算法利用校准草稿图实现扩散LLM投机解码,推理加速达6.3倍,保证输出分布不变。

04:00
arXiv cs.CL

实用人格:通过桥接推理发现LLM人格

通过桥接推理构建知识图谱,从话语结构层面发现LLM人格,比表面词汇方法更稳定有效。

04:00
arXiv cs.CL

选择思考:通过局部充分性释放小语言模型潜力

利用局部充分性,让大模型从SLM候选中选择并蒸馏,使SLM自主重排序,大幅提升推理性能。

04:00
arXiv cs.CL

从孤立到纠缠:可解释性方法何时识别并解缠已知概念?

研究表明特征仅敏感于单概念但概念分散;操控影响多概念,相关性指标不足,需多概念评估。

04:00
arXiv cs.CL

推理模型能识别重要步骤,并在其激活中编码

模型激活比token更能识别重要推理步骤,且步骤重要性在生成前已内部编码,跨模型一致。

04:00
arXiv cs.CL

DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体

DSAEval基准含641个真实数据问题,评估13个LLM,Claude-Sonnet-4.5最强,多模态感知提升视觉任务性能2%-11%。

04:00
arXiv cs.CL

使用生成式人工智能进行因果推断:文本作为处理变量

提出GPI方法,利用生成式AI生成文本处理,用其内部表示高效准确地进行因果效应估计,无需学习因果表示,避免重叠假设问题。

2026年6月11日
04:00
arXiv cs.CL

结构性注意力税:检索格式如何独立于内容劫持上下文学习

知识图谱三元组格式导致注意力偏差,压缩演示注意力达42%,提出结构-语义解耦框架及缓解策略。

04:00
arXiv cs.CL

PoQ-Judge:面向去中心化LLM推理中成本感知质量证明的多架构评估框架

提出PoQ-Judge框架,训练专用评判模型实现无参考质量评估,最佳模型达0.747皮尔逊相关,级联评估降成本72.7%,问答任务优于摘要。

04:00
arXiv cs.CL

ProcessThinker:基于Rollout过程奖励增强多模态大语言模型推理

无需训练过程奖励模型,通过Rollout采样成功率作为步骤奖励,提升多步推理的准确性与一致性。

04:00
arXiv cs.CL

利用多模态语言模型检测社交媒体上的AI生成内容

提出持续收集多模态数据训练紧凑视觉语言模型,实现AI生成内容检测与解释,在公开和内部数据集达最优,部署后提升用户参与。

04:00
arXiv cs.CL

NightFeats @ MMU-RAGent NeurIPS 2025:面向文本生成任务的上下文优化多智能体RAG系统

NightFeats三阶段RAG系统(检索/策展/合成)引入时序语义重排序与矛盾消解,在MMU-RAGent竞赛中超越商业基线获最佳动态评估奖。

04:00
arXiv cs.CL

兼容性感知的动态微调方法

提出CADFT,利用模型似然的兼容性信号抑制高方差梯度,提升微调稳定性与泛化性。

04:00
arXiv cs.CL

单一越狱,多种语言:面向多语言越狱检测的语言不敏感意图表示学习

提出MLJailDe框架,通过回译增强和相对距离约束,跨11种语言越狱检测F1达98.5%,未见语言泛化F1达97.1%。

04:00
arXiv cs.CL

大型语言模型安全数据提取基准测试

评估LLM从安全数据表提取信息,文本优于多模态,最高准确率84%,未达工业门槛,需领域微调与人工验证。

04:00
arXiv cs.CL

LatticeBridge:用于忠实结构化序列合成的罕见事件序列推理

提出结合前缀语言模型、表面自动机与扭曲序列蒙特卡洛解码器,在多个基准上提升锚点覆盖率与精确满足率。

04:00
arXiv cs.CL

生物分歧:生物医学摘要中隐含语境矛盾的基准与评估框架

BioDivergence框架用六类冲突与13轴分歧本体区分上下文矛盾,含11865对声明,文章不相交设下准确率0.55。

04:00
arXiv cs.CL

T2MM:一种支持探究式建模的LLM架构

T2MM架构利用LLM在探究式建模中生成可交互动态模型,性能优于基线方法。

04:00
arXiv cs.CL

推理中的校准漂移:思维链预算如何导致大语言模型过度自信

推理预算超阈值引发模型过度自信,提出CABStop规则抑制校准漂移。

04:00
arXiv cs.CL

Schützen:在保加利亚语和德语语境下评估LLM安全性

介绍德-保双语安全数据集Schützen,评估LLM风险应答,发现跨语言安全行为差异显著。

04:00
arXiv cs.CL

EverydayGPT:用于高效安全混合GPT-RAG对话问答的置信度门控路由

提出置信度门控路由,85%查询用快速RAG(45ms)替代GPT(5.9s),延迟降低120倍,F1=0.226优于基线,无虚假信息。

04:00
arXiv cs.CL

超越压缩:面向长期智能体的结构化上下文驱逐

CWL通过结构化语义驱逐保留关键上下文,丢弃可恢复内容,实现长期智能体无限工作视界无性能退化。

04:00
arXiv cs.CL

生命句:语言模型能从纵向面板数据编码人类生命历程轨迹

LifeSentence模型将大语言模型与面板数据结合,用少量数据实现人生轨迹预测,揭示教育溢价、性别工资差距等社会分层模式。

04:00
arXiv cs.CL

Afrispeech 语义:评估跨领域和口音的口语语言模型中的音频语义推理

评估音频语言模型在五项语义推理任务,揭示跨口音和领域变化的局限性。

04:00
arXiv cs.CL

每个行为都有其代价:前沿大语言模型中的道德压缩合成

提出Moral Trolley Arena基准,发现LLM道德判断为压缩组合而非简单加和,应测量组合规则。

04:00
arXiv cs.CL

文本语义信息的几何轮廓:框架条件唯一性与标量摘要的权衡三角

提出文本语义几何框架,用新颖性、广度、整合度三坐标刻画,证明标量摘要存在不可调和权衡,推荐秩归一化标量。

04:00
arXiv cs.CL

移动NPU上的节能型设备端检索增强生成:骁龙X Elite上的系统设计与基准测试

在骁龙X Elite上,首个全NPU端到端RAG流水线实现能耗降低12倍、延迟降低4倍,且质量与CPU/GPU相当。

04:00
arXiv cs.CL

AI编码代理能复现社会科学发现

新基准测试显示AI编码代理能复现多数社会科学发现,但需注意提示设计避免偏差。