10213 条条目 · 106 个活跃源
2026年5月28日
04:00
arXiv cs.CL

ChildEval: 当大型语言模型遇见儿童个性

ChildEval基准测试评估大模型理解儿童个性化偏好能力,涵盖显隐式表达,微调可提升表现。

04:00
arXiv cs.CL

VibeSearchBench:在真实场景中评估长程主动搜索

提出VibeSearchBench基准,评估发现最佳F1仅30.30,揭示现有模型在长程主动搜索中严重不足,需提升推理与意图挖掘。

04:00
arXiv cs.CL

TARQ:面向稀有词鲁棒自动语音识别的尾部感知重构量化

TARQ通过无标签后训练量化平衡常见与罕见词校准,在不增总WER下显著降低罕见词错误率。

04:00
arXiv cs.CL

MERIT:通过评分标准指导的训练实现审稿人分配的专家匹配

提出两阶段框架,用强化学习和LLM训练审稿人评估器,再蒸馏为检索器,实现高效且优于大模型的审稿分配。

04:00
arXiv cs.CL

DecomposeRL:学习提出有用、信息丰富且多样的问题以进行半监督、可追踪的声明验证

提出DecomposeRL,用RL训练分解策略实现半监督声明验证,5K数据达86.3准确率,可追踪且高效。

04:00
arXiv cs.CL

玩转文字,奖励提升:训练语言模型进行创意联想

用可验证奖励强化学习在猜词游戏中训练LLM,发现大模型提升创造力,小模型提升推理能力。

04:00
arXiv cs.CL

GRADE:面向AI导师的泛化推理感知对话评估

GRADE系统评估AI导师对话,发现Gemma3模型最优,LoRA微调干扰指令,开源模型可媲美专有系统。

04:00
arXiv cs.CL

越南语自动语音识别的音节结构解码器

提出音素级音节结构解码器,在越南语ASR中优于预训练基线,词汇量显著减小。

04:00
arXiv cs.CL

中文标题:叙事扁平化:后训练如何压缩LLM小说中的主题、情感和风格变化

中文摘要:后训练压缩了小说的主题、情感和风格动态变化,导致叙事扁平化,专业文学受影响最大。

04:00
arXiv cs.CL

检索、奖励与训练协议:训练搜索智能体时什么最重要?

纠正语料覆盖问题比算法差异更有效,简单结果导向奖励在多数场景中表现最优。

04:00
arXiv cs.CL

AI研究代理限制科学探索

当前AI研究代理生成的想法比人类更集中、更贴近起始文献,倾向于局部细化而非拓宽科学探索。

04:00
arXiv cs.CL

语义流正则化:教LLM生成多样且连贯的响应

SFR通过条件流匹配正则化语义嵌入,提升LLM输出多样性与连贯性,零推理成本。

04:00
arXiv cs.CL

The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

04:00
arXiv cs.CL

ESC-Skills:发现并自我进化的情感支持对话技能

提出技能中心框架,通过干预单元建模与自我进化,提升情感支持对话的可解释性和效果。

04:00
arXiv cs.CL

GeneralThinker:通过似然引导的答案条件优化实现领域通用推理

GeneralThinker通过似然引导的答案条件优化实现密集奖励,无需领域验证器,在多个推理任务中取得最佳平均性能。

04:00
arXiv cs.CL

用结果说话:面向LLM行为基准测试的“重复优先”范式

提出重复优先范式,通过多维度复制验证评估LLM行为,揭示聚合分数隐藏的差异并诊断饱和度源。

04:00
arXiv cs.CL

DisasterBench:类型化工具接口约束下的LLM规划基准测试

DisasterBench评估显示,LLM灾难规划中工具不匹配与参数绑定错误是主要故障,语义推理与执行约束存在鸿沟。

04:00
arXiv cs.CL

后训练助手中的边界抑制不对称:过度扩展作为可控性代价

后训练优化导致助手过度扩展,用户要求缩窄时反回答不足等行为难以抑制,产生方向性可控性代价。

04:00
arXiv cs.CL

FinBoardBench:通过棋盘游戏模拟评估大语言模型的动态财富管理与战略金融推理能力

FinBoardBench通过经典棋盘游戏测试LLM的动态金融决策,发现其虽具基础规划但易因流动性不足导致失败。

04:00
arXiv cs.CL

对LLM中欺骗探测的压力测试:规模、鲁棒性与欺骗表示的几何结构

线性探测在干净数据AUROC≥0.998,风格偏移下崩溃;风格增强恢复至0.98;拒绝单方向与熵假设,失效因分布窄。

04:00
arXiv cs.CL

MemGuard:防止长期记忆增强型大语言模型中的记忆污染

MemGuard提出类型感知记忆框架,隔离异质记忆,可靠性提升28%,检索量减少5.8倍。

04:00
arXiv cs.CL

面向无限上下文大语言模型的周期性RoPE

提出周期性RoPE,结合滑动窗口与全局无位置编码注意力,避免位置耗尽,实现理论无限上下文,MiniWin模型长上下文效率与稳定性更优。

04:00
arXiv cs.CL

KVoiceBench、KOpenAudioBench 与 KMMAU:智能体驱动的韩语语音语言模型评估基准

提出智能体框架构建三个韩语语音基准(12345样本),评估8个模型发现英韩差异大,且口语QA与音频理解排名不同,暴露英语评估盲点。

04:00
arXiv cs.CL

审计生成解释中的立场不对称

提出对称性分解评估法(SDE),通过配对测试揭示模型在归责、背景上的立场不对称,指出开放性框架评估的困难。

04:00
arXiv cs.CL

用于设计稳定、高表达且低免疫原性的治疗性mRNA序列的进化方法

提出BERT-GA框架,整合深度学习与进化计算优化mRNA序列,实现翻译、稳定性与低免疫原性的最佳平衡。

04:00
arXiv cs.CL

重新思考视觉忽视:通过上下文偏好引导来减轻MLLM幻觉

提出CAS框架,通过上下文偏好向量在推理时注入残差,有效减轻物体幻觉且不增加延迟。

04:00
arXiv cs.CL

ResearchMath-14K: Scaling Research-Level Mathematics via Agents

04:00
arXiv cs.CL

毒性存在于何处?语言模型中的机制定位与定向抑制

通过分析激活差异定位毒性于早期MLP层并抑制,无需梯度下降,有效减毒保质,且发现单一评估者低估风险。

04:00
arXiv cs.CL

大语言模型推理的集成与跨架构解释

提出IAR框架,融合MIP与DTR方法,跨层追踪推理关键标记,跨架构验证解释能力。

04:00
arXiv cs.CL

超越块级局部提取:GraphRAG的跨块图增强

CrossAug用GNN自监督学习增强GraphRAG跨块关系,显著提升多跳问答性能。

04:00
arXiv cs.CL

KSAFE-MM:通过本地化情境化针对韩国文化风险的多模态安全基准

提出KSAFE-MM多模态安全基准,涵盖韩国文化风险。评估显示模型对文化攻击更脆弱,越狱策略成功率高达74.2%,且存在安全与过度拒绝权衡。

04:00
arXiv cs.CL

大型语言模型中的个性、角色与表达风格:一种交互主义分析

大语言模型个性表达是特质、角色与风格交互作用的情境依赖结果,而非直接指定。

04:00
arXiv cs.CL

ConvMemory:轻量级学习型记忆重排序器、一项负归因结果及研究预览版冲突编辑器

ConvMemory速度快但时间机制无效(本质为蒸馏),CCGE-LA预览版有增益。

04:00
arXiv cs.CL

ROSD:面向跨领域语言模型推理的反思性在线自蒸馏

ROSD通过反思引导和错误定位蒸馏,将模仿转为针对性修正,提升领域内推理和跨领域泛化能力。

04:00
arXiv cs.CL

超越Pass@k:面向多样本代码生成的冗余感知RLVR

提出基于JPlag相似度的反冗余奖励增强RLVR,降低冗余并提升有限预算下的可执行性能。

04:00
arXiv cs.CL

预训练模型评估的缺失环节:奖励引导解码无需参数更新即可解锁面向任务的行为

提出EBD框架,通过奖励引导解码激活预训练模型任务行为,无需参数更新即可显著提升指令遵循和性能。

04:00
arXiv cs.CL

面向可靠问答的知识依赖估计

提出Knot方法,通过子集反事实监督与潜在依赖因子建模,估计知识依赖,提升问答可靠性与风险筛查。

04:00
arXiv cs.CL

通过激进剪枝专家从大语言模型中提取小型翻译专家

通过剪枝无关专家可压缩MoE模型90%参数,无需重训练可剪50%专家,微调后可达75-90%剪枝率,翻译质量几乎无损。

04:00
arXiv cs.CL

你只需要提示:面向方面级情感分析的多视角提示大语言模型

提出LLM-MvP,多视角提示结合约束解码与批处理,以低成本达到与微调模型相当的ABSA性能。

04:00
arXiv cs.CL

解释预训练临床文本分类器的挑战

预训练临床文本分类器解释面临挑战:现有方法过度强调无关标记、归因不稳定且对噪声不鲁棒。

04:00
arXiv cs.CL

ConRAG:共识驱动的多视角检索用于多跳问答

ConRAG通过多视角证据共识检索,显著提升多跳问答性能,平均提升26.9%,创下MuSiQue新纪录。

04:00
arXiv cs.CL

PromptEmbedder:通过双LLM软提示实现高效可迁移的文本嵌入

双LLM软提示解耦嵌入知识,性能持平LoRA,显存减40%,训练加速3.7倍。

04:00
arXiv cs.CL

更好的中心词并不能保证更好的二值化成分句法分析

学习到的中心词预测未能提升二值化成分句法分析,标点敏感评估中甚至不如规则方法。

04:00
arXiv cs.CL

ATLAS:跨尺度的长上下文能力全方位测试

ATLAS框架通过分层分类与长度感知评分,揭示模型长上下文能力随长度变化而重新排序,强调按能力与长度评估。

04:00
arXiv cs.CL

SMILE-Next:教会大语言模型检测、分类和推理笑声

提出SMILE-Next数据集与笑声专用大模型,通过自指令和混合专家框架实现笑声检测、分类与推理,性能优于基线。

04:00
arXiv cs.CL

StoryLens: 基于上下文感知叙事丰富性的偏好对齐故事重写

上下文感知叙事丰富性显著提升故事重写中用户偏好对齐(24.5%),优于仅风格适应(2.3%),并构建了基准与评估框架。

04:00
arXiv cs.CL

面向大视觉语言模型幻觉缓解的风险感知选择性提示

研究发现验证提示效果因输入难度而异,提出风险感知选择性提示(RSP),根据不确定性选择性触发验证以减少负面影响。

04:00
arXiv cs.CL

LegalGraphRAG:面向可靠法律推理的多智能体图检索增强生成

提出层次化法律图和多智能体系统,通过检索、验证和裁决实现可靠法律推理,性能达最优。

04:00
arXiv cs.CL

现在提问,以后使用:长期LLM智能体主动性差距的基准测试

ATRBench首次量化了长期LLM智能体缺乏主动询问偏好以备后续使用的差距,前沿模型与理想值相差至少62个百分点。

04:00
arXiv cs.CL

通过字符对齐投影恢复中文词边界

提出基于对齐投影的中文词边界恢复方法,纠正过度切分错误,稳定带噪输入的注释与评估。