10213 条条目 · 106 个活跃源
2026年6月11日
04:00
arXiv cs.CL

人类与AI生成语言的动态:语义如何在不同时间尺度上波动

引入语义时间序列分析,发现ACW测度可揭示人类与AI语音中通用与具体词汇的时序组织差异。

04:00
arXiv cs.CL

基于场景的大语言模型文化价值观探测与引导——扩展版

提出场景化框架探测引导LLM文化价值观,发现维度间纠缠限制独立对齐,通用任务性能基本保持。

04:00
arXiv cs.CL

当更多文档损害RAG:用领域限定、模型无关的检索缓解向量搜索稀释

领域限定检索提升P@10至0.86,多智能体存在精度-忠实性悖论,建议先限定再单次合成。

04:00
arXiv cs.CL

通过激活引导克服全双工语音语言模型的状态惯性

发现全双工语音模型存在状态惯性致错过用户打断开头,通过激活引导无需微调即可显著改善中断处理。

04:00
arXiv cs.CL

When Probing Accuracy Saturates, Fragility Resolves: A Complementary Metric for LLM Pre-Training Analysis

04:00
arXiv cs.CL

SOMA-SQL: 通过合成日志与执行探测解决自然语言转SQL中的多源歧义

SOMA-SQL利用合成查询日志和歧义驱动探测自动消解NL2SQL多源歧义,平均执行准确率提升13%。

04:00
arXiv cs.CL

小实验,更便宜的决策:微预训练中阶段式晋升的案例研究

微预训练阶段式晋升用多阶段预算筛选配置,以有限GPU成本避免过度推广。

04:00
arXiv cs.CL

智能体技能评估与进化:框架与基准

综述技能进化与评估,分类四种范式与六类基准,揭示结构缺口及未来方向。

04:00
arXiv cs.CL

上下文感知的多模态口语对话声明验证

提出MAD2多轮音频对话基准及多模态融合方法,发现对话上下文提升验证,且结构比谬误框架更重要。

04:00
arXiv cs.CL

社会科学中的AI编码代理:方法论多样、经验一致、解释脆弱

AI代理在设计层多样且一致,但在解释层易受提示影响而改变结论。

04:00
arXiv cs.CL

教扩散模型从左至右推测

针对扩散草稿双向生成与自回归验证的不对称,提出三种正交训练干预,使接受长度提升21-76%。

04:00
arXiv cs.CL

LLM推理的元素周期表:推理范式、方法与故障模式的结构化综述

系统综述300余篇论文,提出LLM推理分类法,分析趋势与局限,指明未来方向。

04:00
arXiv cs.CL

APEX:动态数据选择的自动提示工程专家

APEX通过动态分层数据(易/难/混合),优先利用模型表现不一致的混合层生成有效变异和评估,提升数据效率,性能平均提升11.2%。

04:00
arXiv cs.CL

中心还是边缘:基于网页图中心性的预训练数据选择

利用网页图中心性选择预训练数据,混合中心与外围文档可提升模型性能,结合质量分类器效果更佳。

04:00
arXiv cs.CL

角色扮演时,模型是否相信自己所说的话?

角色扮演仅改变输出,不改变内部真实表征;紧急错位则改变内部表征,使错误陈述更接近真实。

04:00
arXiv cs.CL

ISE:一种基于执行的多轮操作系统智能体轨迹生成方法

提出ISE三阶段合成范式,构建ISETrace数据集,微调后任务通过率从19.3%升至37.7%,超越GPT-4o和四倍大模型。

04:00
arXiv cs.CL

从重复模式的层次复用衡量语言复杂性

提出ladderpath指数度量语言复杂度,跨语料库近似不变,支持等复杂度假说,揭示层次复用与认知分块关联。

04:00
arXiv cs.CL

SAGE:基于答案条件的言语不确定性对齐目标

提出SAGE(语义答案引导熵)与GUPO框架,通过对齐言语不确定性表达,在推理任务中降低校准误差和过度自信。

04:00
arXiv cs.CL

预训练自监督语音模型可以识别未见过的辅音

预训练自监督语音模型能准确识别罕见搭嘴音,甚至优于其他音,表明可泛化到稀有音素。

04:00
arXiv cs.CL

基于自适应工作者分配的多智能体推理用于立场检测

提出自适应分配工作者的多智能体推理框架,从推理层面合成预测,显著提升隐式立场检测性能。

04:00
arXiv cs.CL

你的LLM何时可引导?

基于早期隐藏状态预测LLM可引导性,分类器达0.7宏F1,用于优化引导强度搜索,大幅降低解码成本。

04:00
arXiv cs.CL

嘿,聊天机器人,你能教我吗?为真实场景中的人类学习构建苏格拉底式对话

提出将课程排序与对话分离的PPO策略辅导系统,在知识图上决策,显著提升学习效率与掌握速度。

04:00
arXiv cs.CL

评估基于音素的自动语音识别系统中的偏差:对IPA转录模型的分析

分析两种IPA转录ASR系统,发现跨语言和人口统计组存在持续性能差异。

04:00
arXiv cs.CL

中文标题

多格式训练提升语言模型跨格式鲁棒性,仅扩增30%训练项即可获大部分增益,格式多样性是关键。

04:00
arXiv cs.CL

UR-BERT:通过通用罗马化和语音令牌预测扩展多语言TTS的文本编码器

UR-BERT通过通用罗马化和语音令牌预测,实现495种语言TTS文本编码,在多种条件及未见语言上表现优异。

04:00
arXiv cs.CL

AI能否像规划师一样推理?——大型语言模型与专业判断的基准测试

提出UPBench评估LLM规划推理,发现其高阶分析优于事实回忆与综合判断,存在四种认知缺陷,建议区别授权使用。

04:00
arXiv cs.CL

层隔离评估:用无LLM、回归锁定的测试工具把关生产级LLM智能体的确定性骨架

层隔离评估分解代理为多层,用无LLM断言独立测试,证明聚合指标掩盖回归,而层切片可精准定位缺陷。

04:00
arXiv cs.CL

目标自动驾驶仪:面向无人值守长时域智能体的可验证防虚构防火墙

Autopilot执行模型通过外置门控状态机杜绝虚假成功,将虚构率从33.7%降至0.67%,以诚实换覆盖率。

04:00
arXiv cs.CL

用户端记忆中的基板不对称性:诊断框架

用户记忆分解为行为一致、事实存在与缺失三轴,不同基板各有优劣,路由本质是问题分类。

04:00
arXiv cs.CL

生产LLM系统中的外部经验服务:面向部署的质量-成本权衡研究

外部经验服务需权衡质量与成本,选择性检索优于全局注入,检索质量比数量更重要。

04:00
arXiv cs.CL

Lius:基于持续指令调优的指令语言学翻译模型——以古邦马来语为例

通过双语词典特征设计指令,采用持续指令调优微调LLM,模型Lius在低资源古邦马来语翻译上提升显著,减少对大规模平行数据依赖。

04:00
arXiv cs.CL

通过假设树精炼迈向通才自主研究

Arbor框架通过假设树精炼实现长期自主研究,在六个真实任务中取得超2.5倍增益。

04:00
arXiv cs.CL

跨开放任务的LLM创造力自动评估

提出自动化领域无关框架,用语义熵和检索式多智能体评判评估LLM发散与收敛创造力,高效通用。

04:00
arXiv cs.CL

WorldReasoner:评估语言模型代理是否通过有效推理预测事件

WorldReasoner评估语言模型预测的结果、证据与推理质量,发现时间有效检索最关键,因果图改善但校准概率仍困难。

04:00
arXiv cs.CL

我懂你的感受:通过多语言情感验证增强对话系统中的深层情感支持

提出多语言情感验证方法,含数据集与MEGUMI模型,基准显示LLM情感理解仍需提升。

04:00
arXiv cs.CL

Notes2Skills:从实验笔记本到确定性感知的科学智能体技能

Notes2Skills框架将实验笔记转为可验证技能,保留确定性,避免AI误判不确定结果。

04:00
arXiv cs.CL

GraspLLM:基于大语言模型实现文本属性图的零样本泛化

提出GraspLLM,结合图结构与LLM语义,通过子图对齐与对比学习,实现零样本跨数据集和任务泛化,性能领先。

04:00
arXiv cs.CL

中文标题:语言何时重要?多语言指令揭示视觉-语言-动作模型中的逐步语言敏感性

中文摘要:VLA模型对非英语指令成功率下降30-50%,语言影响在任务步骤中非均匀,提出逐步干预提升鲁棒性。

04:00
arXiv cs.CL

本体引导的多锚点图检索框架用于交通事故法律责任认定

提出OMAGR框架,通过本体对齐锚点并行检索,解决多维瓶颈,提升责任认定精度与忠实度。

04:00
arXiv cs.CL

uva-irlab-conv 在 SemEval-2026 任务 8 中:基于学习型稀疏检索和列表重排序的多轮 RAG

提出多轮RAG管道,结合学习型稀疏检索与LLM重排序生成,利用长上下文进行查询重写和列表重排序,提升跨领域鲁棒性。

04:00
arXiv cs.CL

使用微调轻量级语言模型对低资源语言孟加拉语的书面答案进行语义评分

针对孟加拉语书面答案,微调轻量模型实现语义评分,生成分数与反馈,与人类评分高度一致(rho=0.936)。

04:00
arXiv cs.CL

开放式自一致性中的表示空间一致性

提出基于嵌入的一致性方法,通过聚类采样输出在表示空间中的分布衡量一致性,在开放式任务中优于随机选择,且与生成质量正相关。

04:00
arXiv cs.CL

FORT-Searcher: 合成抗捷径的搜索任务以训练深度搜索代理

提出FORT框架,通过控制捷径风险合成抗捷径训练数据,训练出性能最佳的深度搜索代理。

04:00
arXiv cs.CL

无需受保护属性的去偏见:从文本档案中消除潜在概念

提出H-SAL方法,利用自我描述文本隐式去偏见,实验表明其效果优于或等于显式标签方法。

04:00
arXiv cs.CL

StanceNakba 2026:公共话语中面向行为者和话题的立场检测共享任务

该任务针对巴以冲突社交媒体,含英文行为者级和阿拉伯语跨话题立场检测,2606条数据,最佳F1达0.962/0.872。

04:00
arXiv cs.CL

Decoding Multimodal Cues: Unveiling the Implicit Meaning Behind Hateful Videos

04:00
arXiv cs.CL

用局部n-gram记忆增强分子语言模型

MolGram集成局部n-gram记忆模块,三任务上一致提升,超越3倍参数基线。

04:00
arXiv cs.CL

检测大型语言模型日语预训练语料中的敏感个人信息

针对日本《个人信息保护法》下的特殊要配虑个人信息,构建数据集并训练模型实现有效检测,为首个相关研究。

04:00
arXiv cs.CL

面向公平高效的大语言模型基准评估的软提示调优

软提示调优优化10个向量,高效弥补格式差距,公平评估大模型知识并预测后训练排名。

04:00
arXiv cs.CL

面向大语言模型的自适应多分辨率程序性知识压缩

SKIM框架将技能压缩至原长30%-60%,保持任务性能并优于现有方法。