10213 条条目 · 106 个活跃源
2026年6月18日
04:00
arXiv cs.CL

超越奖励工程:长上下文强化学习的数据配方

提出数据配方与最小GRPO结合,在长上下文推理和智能体任务中取得显著提升。

04:00
arXiv cs.CL

通过合成数据蒸馏实现高效金融语言理解

用合成数据蒸馏将大模型知识迁移至小模型,聚类选种生成样本,低资源下性能优异甚至超越教师模型。

04:00
arXiv cs.CL

如同火箭科学般简单:评估大语言模型理解比喻语言中否定表达的能力

研究发现否定与比喻结合对LLM构成挑战,提示风格显著影响模型性能。

04:00
arXiv cs.CL

使用评分规则引导的反事实建议改善医疗沟通

提出LM引导的反事实建议,调整沟通特征提升患者反馈,平均增益6.41%,93.31%建议非负。

04:00
arXiv cs.CL

多模态情感-原因对提取中的鲁棒配对置信度学习

提出RPCL训练框架,通过置信度差异约束和上下文扰动,提升配对置信度的鲁棒性,在三个数据集上显著提高性能。

04:00
arXiv cs.CL

SAGE:基于智能体引导探索的随机提示优化

提出SAGE多智能体随机提示优化框架,经8轮A/B测试显著提升心理健康聊天机器人次日留存,强调定性诊断与定量验证结合。

04:00
arXiv cs.CL

Language Models as Interfaces, Not Oracles: A Hybrid LLM-ML System for Pediatric Appendicitis

04:00
arXiv cs.CL

GraphPO: 基于图的策略优化用于推理模型

GraphPO将推理路径建模有向无环图,合并等价路径并分配效率与正确性优势,降低方差、提升推理效率。

04:00
arXiv cs.CL

超越分词:面向时间序列问答的直接时间步嵌入与对比对齐

CADE框架通过直接时间步嵌入和对比对齐,解决分词瓶颈,提升时间序列问答性能。

04:00
arXiv cs.CL

SenFlow:混合文档中AI生成文本检测的句子间流建模

SenFlow通过句子间依赖建模和结构化预测提升混合文档AI文本检测,在MOSAIC基准上取得SOTA,跨域F1提升4.15%。

04:00
arXiv cs.CL

G-IdiomAlign:基于释义锚点的跨语言习语对齐基准

提出G-IdiomAlign基准,发现LLM偏字面翻译,释义能改善但对齐效果有限。

04:00
arXiv cs.CL

Sumi:从头训练的开源均匀扩散语言模型

首个从零预训练的7B均匀扩散语言模型,在1.5T tokens上训练,性能可比自回归模型。

04:00
arXiv cs.CL

通过可引导的模型合并增强多语言推理

提出可引导模型合并框架,用门控交叉注意力自适应调节源模型贡献,显著提升多语言推理性能。

04:00
arXiv cs.CL

研究论文的哪些部分最能揭示其研究方法?来自图书馆与信息科学的证据

通过分段组合策略,发现方法信息在全文中分布不均,中后段判别力更强,结合元数据可提升分类效果。

04:00
arXiv cs.CL

领导力作为协调控制:多智能体LLM团队中的行为特征与恢复优势边界

多智能体LLM团队中,领导力协调仅在初始多数不可靠且任务可恢复时有效,符合权变理论预测。

04:00
arXiv cs.CL

Dango:一个严格仅使用L1的大语言模型,用于研究第二语言习得

提出1.8B参数纯L1大模型Dango,通过过滤与微调模拟人类二语习得,超越基线。

04:00
arXiv cs.CL

CEO-Bench:智能体能否玩转长期游戏?

CEO-Bench模拟初创公司500天经营,评估代理在长期规划与噪声环境中的表现,最强模型也难盈利。

04:00
arXiv cs.CL

用LOCUS释放法律:美国地方条例语料库

LOCUS是美国首部大规模地方条例语料库,覆盖9239个市县,助力法律AI研究并训练模型分析法律特征。

04:00
arXiv cs.CL

RECOM:自动评估指标在开放式Reddit问答中的有效性与区分性权衡

自动指标在开放式问答中存在有效性-区分性权衡,余弦相似度有效性高但区分力弱,BERTScore反之,建议双轴报告。

04:00
arXiv cs.CL

医学大语言模型适配中的权衡:一项基于法语问答的实证研究

医学LLM适配策略比较:持续预训练+微调效果最佳但增益小,纯微调为强默认方案,持续预训练提升开放式问答指标,跨语言迁移有效。

04:00
arXiv cs.CL

DreamReasoner-8B:面向扩散推理模型的块大小课程学习

DreamReasoner-8B采用从细到粗的块大小课程学习,克服大块训练推理差,性能媲美先进自回归模型。

04:00
arXiv cs.CL

通过多智能体虚拟博弈增强大语言模型的决策能力

提出多智能体虚拟博弈(MAFP),通过迭代最佳响应解决立场纠缠,提升决策质量与鲁棒性。

04:00
arXiv cs.CL

使用图灵奖励学习用户模拟器

提出Turing-RL方法,用图灵测试奖励训练用户模拟器,生成与真实用户难以区分的响应,效果优于基线。

04:00
arXiv cs.CL

层次结构的紧凑几何表示

为层次结构提供紧凑几何表示,证有向树3维嵌入,树宽图维数依赖参数,给出匹配上下界。

04:00
arXiv cs.CL

Evaluating Prompting-Based Defenses Against Domain-Camouflaged Injection Attacks

04:00
arXiv cs.CL

使用多LLM智能体模拟仇恨言论级联:经验基础、建模保真度与干预策略

多LLM智能体模拟仇恨级联,发现敌意同质性与星型拓扑;异质性关键,干预可降传播7.5%-12.9%。

04:00
arXiv cs.CL

REVES:基于修订与验证的测试时扩展增强训练

提出两阶段迭代框架,将中间步骤转为修订与验证提示,提升模型修正能力,在编码任务上取得显著增益,并泛化至约束满足问题。

04:00
arXiv cs.CL

人机协同演化动力学:长期交互中社会智能涌现的形式化理论

提出人机协同演化框架,揭示社会智能源于长期认知协同演化,而非孤立能力。

04:00
arXiv cs.CL

GateMem:多主体共享内存代理的内存治理基准

GateMem评估多主体共享内存代理的效用、访问控制与遗忘能力,现有方法无法兼顾三者,远未达可靠部署。

04:00
arXiv cs.CL

缓解评分错误并补偿非语言子测试:基于语音的痴呆症评估

通过整合转录分数和Whisper嵌入,减少错误并补偿缺失子测试,语音模型与专家评分高度相关,有效区分认知状态。

04:00
arXiv cs.CL

中文标题:将搜索从推理中解耦:一种面向LLM代理的供应商无关的接地架构

中文摘要:DSG架构解耦搜索与推理,降低91%成本与68%延迟,保持高精度,实现供应商无关的实时接地优化。

04:00
arXiv cs.CL

Graph-ESBMC-PLC:基于SMT模型检查的图形化PLCopen XML梯形图程序形式化验证

提出Graph-ESBMC-PLC,用DFS解析图形梯形图,实现形式化验证,三例图形程序验证成功,十一例文本测试无回归。

04:00
arXiv cs.CL

由AI撰写,由AI管理:语义空间控制与索引疾病消除——跨越391个连续会话

传统约束策略导致LLM患“索引疾病”,新机制“基线-日志物理分离”减少75%指令并彻底消除复发。

04:00
arXiv cs.CL

乌尔都语Katib手写数据集:面向离线乌尔都语手写文本识别的历史文档数据集及基于CRNN的基线评估

首个乌尔都语历史手写文本行数据集UKHD,评估CRNN模型,CNN-BGRU-CTC最优,低字符错误率,助力文献保存。

04:00
arXiv cs.CL

EARS:面向大规模多智能体系统可靠子智能体建模的解释性弃权机制

EARS通过子智能体解释性弃权向协调器反馈失败状态,提升大型MAS可靠性,响应通过率从68.5%升至78.9%。

04:00
arXiv cs.CL

ForecastBench-Sim:一个模拟世界预测基准

基于Freeciv游戏模拟世界,可快速生成多种预测问题,用于评估AI概率推理能力,补充真实世界基准。

04:00
arXiv cs.CL

原生主动感知作为全模态理解的推理

提出OmniAgent主动感知框架,解耦推理复杂度与视频时长,7B模型超越72B模型,多基准达SOTA。

04:00
arXiv cs.CL

TurnGuide:通过动态轮次级文本-语音交错增强有意义的全双工语音交互

TurnGuide通过动态轮次级文本-语音交错,提升全双工语音模型语义连贯性与轮次转换性能,达最优。

04:00
arXiv cs.CL

集成梯度可解释性在社会心理语义标记中的应用

利用集成梯度方法揭示词语级分类贡献,提升文本可解释性,并验证在少样本场景下的有效性。

04:00
arXiv cs.CL

STARE: 惊异度引导的令牌级优势重加权用于策略熵稳定性

基于惊异度重加权优势以稳定策略熵,STARE在AIME上提升4%-8%准确率。

04:00
arXiv cs.CL

利用不确定性感知注意力头的高效LLM幻觉检测

提出RAUQ无监督框架,利用不确定性注意力头单次前向传播检测LLM幻觉,计算开销<1%,性能优越。

04:00
arXiv cs.CL

ToolGrad:利用文本“梯度”高效生成工具使用数据集

ToolGrad通过先构建工具链再生成查询,实现低成本、高成功率的工具使用数据集生成。

04:00
arXiv cs.CL

基于大型语言吉布斯采样的结构化推理

利用LLM条件分布迭代重采样,避免顺序偏差,实现结构化概率推理。

04:00
arXiv cs.CL

重新思考奖励监督:基于评分标准的自蒸馏

提出评分标准自蒸馏框架,用结构化细粒度反馈指导推理,超越GRPO和OPSD。

04:00
arXiv cs.CL

IndicContextEval:一项评估音频大语言模型在8种印度语言中上下文利用能力的基准

提出涵盖8种印度语言、23个专业领域的56小时多语言基准,通过7级提示框架测试音频大语言模型是否真正利用上下文,揭示模型间显著差异。

04:00
arXiv cs.CL

Phonikud:克服希伯来语文本转语音中的语音未指定性

开源Phonikud系统解决希伯来语音素未指定问题,提升小型TTS模型性能至接近大型系统。

04:00
arXiv cs.CL

ActMem:弥合LLM智能体记忆检索与推理的鸿沟

提出ActMem框架,通过因果推理与语义图,解决记忆检索与推理脱节问题。

04:00
arXiv cs.CL

UniECG:统一模型中的心电图理解与生成

UniECG统一模型支持双交互:根据信号生成解释,根据文本生成心电信号示例,辅助互动式心电图教育。

04:00
arXiv cs.CL

UMA-Split: 面向英语和普通话的非自回归语音识别的单峰聚合

提出UMA-Split,分割聚合帧映射多token,解决英语单峰权重失效,适用英汉非自回归语音识别。

04:00
arXiv cs.CL

Probing Semantic Alignment, Lexical Invariance, and Syntactic Influence in LLM Metaphor Processing