超越奖励工程:长上下文强化学习的数据配方
提出数据配方与最小GRPO结合,在长上下文推理和智能体任务中取得显著提升。
通过合成数据蒸馏实现高效金融语言理解
用合成数据蒸馏将大模型知识迁移至小模型,聚类选种生成样本,低资源下性能优异甚至超越教师模型。
如同火箭科学般简单:评估大语言模型理解比喻语言中否定表达的能力
研究发现否定与比喻结合对LLM构成挑战,提示风格显著影响模型性能。
使用评分规则引导的反事实建议改善医疗沟通
提出LM引导的反事实建议,调整沟通特征提升患者反馈,平均增益6.41%,93.31%建议非负。
多模态情感-原因对提取中的鲁棒配对置信度学习
提出RPCL训练框架,通过置信度差异约束和上下文扰动,提升配对置信度的鲁棒性,在三个数据集上显著提高性能。
SAGE:基于智能体引导探索的随机提示优化
提出SAGE多智能体随机提示优化框架,经8轮A/B测试显著提升心理健康聊天机器人次日留存,强调定性诊断与定量验证结合。
Language Models as Interfaces, Not Oracles: A Hybrid LLM-ML System for Pediatric Appendicitis
GraphPO: 基于图的策略优化用于推理模型
GraphPO将推理路径建模有向无环图,合并等价路径并分配效率与正确性优势,降低方差、提升推理效率。
超越分词:面向时间序列问答的直接时间步嵌入与对比对齐
CADE框架通过直接时间步嵌入和对比对齐,解决分词瓶颈,提升时间序列问答性能。
SenFlow:混合文档中AI生成文本检测的句子间流建模
SenFlow通过句子间依赖建模和结构化预测提升混合文档AI文本检测,在MOSAIC基准上取得SOTA,跨域F1提升4.15%。
G-IdiomAlign:基于释义锚点的跨语言习语对齐基准
提出G-IdiomAlign基准,发现LLM偏字面翻译,释义能改善但对齐效果有限。
Sumi:从头训练的开源均匀扩散语言模型
首个从零预训练的7B均匀扩散语言模型,在1.5T tokens上训练,性能可比自回归模型。
通过可引导的模型合并增强多语言推理
提出可引导模型合并框架,用门控交叉注意力自适应调节源模型贡献,显著提升多语言推理性能。
研究论文的哪些部分最能揭示其研究方法?来自图书馆与信息科学的证据
通过分段组合策略,发现方法信息在全文中分布不均,中后段判别力更强,结合元数据可提升分类效果。
领导力作为协调控制:多智能体LLM团队中的行为特征与恢复优势边界
多智能体LLM团队中,领导力协调仅在初始多数不可靠且任务可恢复时有效,符合权变理论预测。
Dango:一个严格仅使用L1的大语言模型,用于研究第二语言习得
提出1.8B参数纯L1大模型Dango,通过过滤与微调模拟人类二语习得,超越基线。
CEO-Bench:智能体能否玩转长期游戏?
CEO-Bench模拟初创公司500天经营,评估代理在长期规划与噪声环境中的表现,最强模型也难盈利。
用LOCUS释放法律:美国地方条例语料库
LOCUS是美国首部大规模地方条例语料库,覆盖9239个市县,助力法律AI研究并训练模型分析法律特征。
RECOM:自动评估指标在开放式Reddit问答中的有效性与区分性权衡
自动指标在开放式问答中存在有效性-区分性权衡,余弦相似度有效性高但区分力弱,BERTScore反之,建议双轴报告。
医学大语言模型适配中的权衡:一项基于法语问答的实证研究
医学LLM适配策略比较:持续预训练+微调效果最佳但增益小,纯微调为强默认方案,持续预训练提升开放式问答指标,跨语言迁移有效。
DreamReasoner-8B:面向扩散推理模型的块大小课程学习
DreamReasoner-8B采用从细到粗的块大小课程学习,克服大块训练推理差,性能媲美先进自回归模型。
通过多智能体虚拟博弈增强大语言模型的决策能力
提出多智能体虚拟博弈(MAFP),通过迭代最佳响应解决立场纠缠,提升决策质量与鲁棒性。
使用图灵奖励学习用户模拟器
提出Turing-RL方法,用图灵测试奖励训练用户模拟器,生成与真实用户难以区分的响应,效果优于基线。
层次结构的紧凑几何表示
为层次结构提供紧凑几何表示,证有向树3维嵌入,树宽图维数依赖参数,给出匹配上下界。
Evaluating Prompting-Based Defenses Against Domain-Camouflaged Injection Attacks
使用多LLM智能体模拟仇恨言论级联:经验基础、建模保真度与干预策略
多LLM智能体模拟仇恨级联,发现敌意同质性与星型拓扑;异质性关键,干预可降传播7.5%-12.9%。
REVES:基于修订与验证的测试时扩展增强训练
提出两阶段迭代框架,将中间步骤转为修订与验证提示,提升模型修正能力,在编码任务上取得显著增益,并泛化至约束满足问题。
人机协同演化动力学:长期交互中社会智能涌现的形式化理论
提出人机协同演化框架,揭示社会智能源于长期认知协同演化,而非孤立能力。
GateMem:多主体共享内存代理的内存治理基准
GateMem评估多主体共享内存代理的效用、访问控制与遗忘能力,现有方法无法兼顾三者,远未达可靠部署。
缓解评分错误并补偿非语言子测试:基于语音的痴呆症评估
通过整合转录分数和Whisper嵌入,减少错误并补偿缺失子测试,语音模型与专家评分高度相关,有效区分认知状态。
中文标题:将搜索从推理中解耦:一种面向LLM代理的供应商无关的接地架构
中文摘要:DSG架构解耦搜索与推理,降低91%成本与68%延迟,保持高精度,实现供应商无关的实时接地优化。
Graph-ESBMC-PLC:基于SMT模型检查的图形化PLCopen XML梯形图程序形式化验证
提出Graph-ESBMC-PLC,用DFS解析图形梯形图,实现形式化验证,三例图形程序验证成功,十一例文本测试无回归。
由AI撰写,由AI管理:语义空间控制与索引疾病消除——跨越391个连续会话
传统约束策略导致LLM患“索引疾病”,新机制“基线-日志物理分离”减少75%指令并彻底消除复发。
乌尔都语Katib手写数据集:面向离线乌尔都语手写文本识别的历史文档数据集及基于CRNN的基线评估
首个乌尔都语历史手写文本行数据集UKHD,评估CRNN模型,CNN-BGRU-CTC最优,低字符错误率,助力文献保存。
EARS:面向大规模多智能体系统可靠子智能体建模的解释性弃权机制
EARS通过子智能体解释性弃权向协调器反馈失败状态,提升大型MAS可靠性,响应通过率从68.5%升至78.9%。
ForecastBench-Sim:一个模拟世界预测基准
基于Freeciv游戏模拟世界,可快速生成多种预测问题,用于评估AI概率推理能力,补充真实世界基准。
原生主动感知作为全模态理解的推理
提出OmniAgent主动感知框架,解耦推理复杂度与视频时长,7B模型超越72B模型,多基准达SOTA。
TurnGuide:通过动态轮次级文本-语音交错增强有意义的全双工语音交互
TurnGuide通过动态轮次级文本-语音交错,提升全双工语音模型语义连贯性与轮次转换性能,达最优。
集成梯度可解释性在社会心理语义标记中的应用
利用集成梯度方法揭示词语级分类贡献,提升文本可解释性,并验证在少样本场景下的有效性。
STARE: 惊异度引导的令牌级优势重加权用于策略熵稳定性
基于惊异度重加权优势以稳定策略熵,STARE在AIME上提升4%-8%准确率。
利用不确定性感知注意力头的高效LLM幻觉检测
提出RAUQ无监督框架,利用不确定性注意力头单次前向传播检测LLM幻觉,计算开销<1%,性能优越。
ToolGrad:利用文本“梯度”高效生成工具使用数据集
ToolGrad通过先构建工具链再生成查询,实现低成本、高成功率的工具使用数据集生成。
基于大型语言吉布斯采样的结构化推理
利用LLM条件分布迭代重采样,避免顺序偏差,实现结构化概率推理。
重新思考奖励监督:基于评分标准的自蒸馏
提出评分标准自蒸馏框架,用结构化细粒度反馈指导推理,超越GRPO和OPSD。
IndicContextEval:一项评估音频大语言模型在8种印度语言中上下文利用能力的基准
提出涵盖8种印度语言、23个专业领域的56小时多语言基准,通过7级提示框架测试音频大语言模型是否真正利用上下文,揭示模型间显著差异。
Phonikud:克服希伯来语文本转语音中的语音未指定性
开源Phonikud系统解决希伯来语音素未指定问题,提升小型TTS模型性能至接近大型系统。
ActMem:弥合LLM智能体记忆检索与推理的鸿沟
提出ActMem框架,通过因果推理与语义图,解决记忆检索与推理脱节问题。
UniECG:统一模型中的心电图理解与生成
UniECG统一模型支持双交互:根据信号生成解释,根据文本生成心电信号示例,辅助互动式心电图教育。
UMA-Split: 面向英语和普通话的非自回归语音识别的单峰聚合
提出UMA-Split,分割聚合帧映射多token,解决英语单峰权重失效,适用英汉非自回归语音识别。