9866 条条目 · 106 个活跃源
2026年8月31日
04:00
arXiv cs.CL

SciReC:自适应交互下多模态多轮关系推理的诊断性评估

提出科学推理基准与缺陷诊断框架,评估多模态大模型关系推理,发现主要错误源于关系推理和记忆。

04:00
arXiv cs.CL

基于向量索引的输出嵌入加速LLM推理

以向量索引检索替代稠密输出投影,只取少量高概率词,单批解码吞吐最高提升82%,质量不变。

04:00
arXiv cs.CL

语言模型评分准则引导的强化学习综述

评分准则引导的强化学习综述:以结构化标准替代标量奖励,提出贝叶斯分类,分析粒度、语义漂移和奖励攻击。

04:00
arXiv cs.CL

情绪背景对大型语言模型支持仓促决策的影响:六款商业模型情绪脆弱性比较

情绪表达显著增强AI对仓促决策的支持(+12.9分),与对话长度无关;六模型中五款受影响,旗舰模型也未能幸免。

04:00
arXiv cs.CL

UIC-AIHealth4All在ArchEHR-QA 2026:以答案为先的临床问答证据锚定

提出答案优先的证据识别与生成管线,自一致性投票对齐,证据识别第三,生成第九,对齐第五,输出可读性低于临床参考。

04:00
arXiv cs.CL

XHotpotQA:多跳问答中跨语言知识组合的基准

XHotpotQA基准用于多跳问答跨语言知识组合,含证据依赖图与语言分配,验证显示问答错配显著降低F1,提供诊断与评估。

04:00
arXiv cs.CL

重锤还是手术刀?面向隐性仇恨言论的细粒度自适应框架

提出FAID:先细粒度分类,再对浅层、定向、语境依赖三类自适应推理,省算力且性能领先。

04:00
arXiv cs.CL

选择而非训练:基于LLM选择的模块化实体消歧的益处

将实体消歧分解为检索与选择,用LLM选择器时训练检索器收益甚微;无训练BM25+LLM在ZELDA达SOTA,支持弃权时F1达90.7。

04:00
arXiv cs.CL

INSPIRE:示例驱动数学推理的“先内化后提升”方法

提出INSPIRE方法,通过参考引导内化和分阶段偏好训练,提升LLM示例驱动推理,超越更大模型且不损害通用能力。

04:00
arXiv cs.CL

PACE:基于智能体自动化的发布者自适应内容提取

PACE智能体学习发布者配置,推理免大模型调用,高效提取文章、元数据、图像等,优于非手动基线,接近人工解析器。

04:00
arXiv cs.CL

从线性距离和相似性感知熵的视角看LLM中的句法表示

基于线性距离和相似性熵,预测句法关系重构准确率,揭示LLM句法表示的抽象性。

04:00
arXiv cs.CL

扩散语言模型的轨迹级投机解码

提出轨迹级投机解码,利用置信分层树探索与块并行验证,减少30-40%迭代,速度提升7-14倍,精度损失小于1%。

04:00
arXiv cs.CL

线性探针如何涌现?基于概念定向归因的电路追踪框架

提出CTA框架解释线性探针内部电路,图特征预测准确率,因果消融区分探针与输出机制。

04:00
arXiv cs.CL

知道再回答:解码语言模型实现可靠RAG

研究利用模型内部信号判断RAG证据是否充分或冲突,轻量线性分类器优于提示方法,可可靠用于RAG分流。

04:00
arXiv cs.CL

当分词器失效:面向低资源语言零样本迁移的字节级分块

提出适配层级网络,从冻结子词模型初始化字节嵌入,用分块对齐损失和词性监督,零样本迁移至低资源语言,词性标注提升13.3%。

04:00
arXiv cs.CL

低于噪声底限:小模型知识蒸馏中的双峰坍缩与不同失败模式

小模型KD单种子评估不可靠:种子方差大、多方法双峰坍缩,且存在错误选函数与输出截断等失败模式,仅渐进式与排名式稳定。

04:00
arXiv cs.CL

先使其可玩,再使其优秀:小型对话游戏智能体的分阶段交互学习

提出2B对话游戏模型:先模仿成功轨迹保可玩,再用加权回合与教师引导提决策,Playpen第二,已开源。

04:00
arXiv cs.CL

音视频大语言模型中的组合失败:跨模态冲突下的后期层先验主导

研究音视频冲突下AV-LLM组合泛化,发现后期层先验主导致失败,VideoLLaMA 2近乎随机,InternVideo2下降32.3%。

04:00
arXiv cs.CL

信息反局部性与大语言模型中的局部性偏差

大语言模型能学会反局部语言,损失相当,但越反局部收敛越慢,说明非局部依赖更难学,偏差在速度而非成败。

04:00
arXiv cs.CL

承重上下文:评估语言推理中上下文依赖的问题损伤评分

基于问题损伤评分的诊断框架评估上下文依赖:删除承重示例后,前沿大模型很少弃权,常仍答对。

04:00
arXiv cs.CL

PersonaEdit:用于个性化模型编辑的代表性样本选择

提出PersonaEdit聚类抽样法,减少编辑样本量且保持性能,结合检索增强可提升LLM个性化效果。

04:00
arXiv cs.CL

EvoHarmBench:用迭代式类人规避突破内容审核

首个动态对抗评测框架,迭代优化语义簇级规避并兼顾可读性,揭示商业审核系统攻击成功率达80.3%

04:00
arXiv cs.CL

合成语言能动性:具身可朽智能体如何通过有后果的社会经验习得语言可供性

定义合成语言能动性,构建具身可朽智能体,从影响存亡的社交后果中学习语言,表达受身体历史塑造并改变伙伴行为。

04:00
arXiv cs.CL

OpenStamp:面向开源语言模型的水印技术

OpenStamp将水印逻辑编入模型末层投影,抗改写与微调,性能损失小。

04:00
arXiv cs.CL

AI写作者具有一致的文体学足迹,而AI编辑则没有

AI生成文本有稳定的文体足迹(熵与词汇多样性),但AI编辑不呈现此特征,二者应分开研究。

04:00
arXiv cs.CL

LandingAgent:面向落地页的参考标注数据集与智能体生成框架

提出参考标注数据集与智能体框架,参考真实页面生成落地页,提升目标契合度与布局多样性。

04:00
arXiv cs.CL

智能体记忆如何助力可靠处理不可回答问题?

记忆可提升不可回答问题处理,但增益有选择性且易受数据集漂移影响;跨模型复用优于跨数据集,决策引导优于轨迹塑造,程序性记忆最可靠,关键在可迁移指导而非经验量。

04:00
arXiv cs.CL

QUORUM:使用多标注器的质量优化路由

QUORUM:预算感知路由,按实例分配人或LLM标注,多标注聚合,质量提升34.4%,成本降8.8%。

04:00
arXiv cs.CL

韩语谓词形态中词汇条件引发的实现歧义

韩语中相同词干词尾配置可因词汇身份产生不同表面形式,需靠词汇义与实现类确定,揭示纯形态表征的局限。

04:00
arXiv cs.CL

实体记忆图检索提升长对话问答中的证据覆盖

在LoCoMo十段对话1986问上,图检索将top-25证据召回从79.75%提至84.48%,但最终答案F1无显著差异。

04:00
arXiv cs.CL

H-Scale:面向NVFP4亚字节LLM推理的Hessian引导缩放因子精调

提出H-Scale轻量后处理方法,用二阶代理优化NVFP4分组缩放因子,零推理开销,提升主流LLM量化性能。

04:00
arXiv cs.CL

基于语言模型的古代文献文本修复

研究表明语言模型可辅助修复古代文献缺字,但无法全自动,效果因内容和缺字长度而异。

04:00
arXiv cs.CL

SimpCue:基于线索提示的多语言文本简化

研究发现预测线索提示略优,但收益有限且因语言和指标而异

04:00
arXiv cs.CL

超越全局标量:融合词元级统计与深度语义的对抗性AIGC文本检测

提出NeuroStat框架,融合词元级统计与深度语义,利用宏状态残差调制增强鲁棒性,在对抗基准MOSAIC上表现最佳。

04:00
arXiv cs.CL

CNeo-Bench:面向中文新词的大语言模型诊断基准

构建4759个中文新词基准,评估18个LLM:多数定义生成低于40%,存在识别-操作鸿沟;少样本提示可解部分难题,但错误仍多。

04:00
arXiv cs.CL

孪生世界:面向证据支撑推理的基于等变性弃权

提出孪生世界,以实体替换构造多重世界,用等变性违反作弃权信号,检测推理是否基于证据,提升可靠性。

04:00
arXiv cs.CL

FinExam-10K:检索何时助力金融推理?

发布FinExam-10K金融考试基准:10198题,最佳85.29%;检索增益微,门控提升至71.23%。

04:00
arXiv cs.CL

多方对话中的话轮转换结果预测:结合人际亲密度的语音与目光动态可解释建模

结合语音响度与目光特征,可解释模型预测四人对话话轮转换,AUC达0.76,目光在噪声下仍稳健。

04:00
arXiv cs.CL

颤抖的声音未必是回避:财报电话会议中文本与语音回避检测的基准测试

提出双维回避基准,含六十场财报会议五百零五问答,标注文本回避与语音信心;多模态模型难测语音信心,与人类差距大。

04:00
arXiv cs.CL

嵌套字节级词表:部署廉价,共享昂贵——一项预注册的阴性结果

嵌套BPE可切片部署,但共享模型逊于固定专家(32k差3.64%,8k差2.96%);控制令牌无效,输出限制主因。

04:00
arXiv cs.CL

滑动窗口优于线性注意力

滑动窗口注意力搭配sink节点,性能不输甚至超越后训练线性注意力模型,在长上下文任务中优势巨大,且无需后训练、成本极低。

04:00
arXiv cs.CL

用于立场感知论证检索的嵌入模型

现有模型偏重主题忽略立场,对比训练易过度校正;用平衡课程与LLM增强反向论证,提升立场感知检索。

04:00
arXiv cs.CL

当大型语言模型的语言自信与内部自信相背离时

研究发现大模型的语言自信与内部自信常不一致,属有损通道,需多维度评估。

04:00
arXiv cs.CL

CultureConverse:面向东亚与东南亚文化情境辅助的多语言多轮模拟评估框架

提出CultureConverse多语言多轮模拟评估框架,覆盖10个地区58个子群体,含14.6万评估片段,评估18个模型,微调可提升文化能力。