FinPersona-Bench:自主金融智能体纵向心理稳定性基准
提出FinPersona-Bench评估LLM金融智能体指令随时间衰退现象,发现保守与激进代理需差异化干预。
AutoTrainess:教会语言模型自主改进语言模型
AutoTrainess通过将人类经验外化为接口和规则,引导语言模型自主完成训练迭代,在PostTrainBench上超越纯CLI基线。
基于双重语义嵌入的大型语言模型鲁棒文本水印
提出DEW语义水印,通过双重嵌入增强鲁棒性,抵抗释义和翻译,保持文本质量,实现可靠AI部署。
STEB:风格文本嵌入基准
STEB是首个标准化风格嵌入评估的开源基准,含96数据集7语言,显示语义嵌入不适用于风格任务,且无通用最优方法。
超越对话的心智理论与说服:评估LLMs通过规划与行动诱导信念状态的能力
GPT-5在非对话规划心智理论任务中成功率80%,超越人类但不够稳健;模型诱导真实信念优于错误信念。
看见不等于共享:一些视觉-语言模型在不对称对话中高估共同基础
VLM高估共同基础,将地图内容误认为已共享理解,而非通过对话历史跟踪建立。
基础ASR模型适配构音障碍语音:案例研究
通过微调Whisper基础模型,仅1.4小时数据使构音障碍语音词错误率降至15.8%,全部数据达9.7%,证实个性化微调有效。
面向低资源班图语音识别的音调条件课程学习
提出音调条件课程框架,结合混合难度评分与门控适配器,使班图语音识别平均词错误率降至28.41%。
LLM中的道德安全:通过困惑线索揭露表演性顺从
当前公平性评估高估道德安全,模型在模糊线索下暴露表演性顺从,隐藏标签使有害决策增4.4%,提出线索可见性差距度量。
TalentCLEF 2026 概览:面向人力资本管理的技能与职位智能
TalentCLEF 2026挑战赛分岗位匹配与技能匹配两任务,吸引113支团队超400次提交,推动人力资本管理NLP研究。
CHERRY:压缩分层专家与递归表示产出
提出三种计算高效语言模型训练技术:SGT实现4.5倍监督效率,深度压缩2.5倍参数,专家融合提升性能。
跨语言关系抽取与大语言模型:面向罗马尼亚语的零样本、少样本与微调评估
大模型跨语言关系抽取:罗马尼亚语零样本比英语低3-5pp,少样本增益小,QLoRA微调提升F1超22pp;小型编码器更高效。
前馈层中的显式模糊逻辑:自遗忘量词发现可读的语法许可检测器
提出显式模糊逻辑前馈层结合自遗忘量词,生成可读的语法许可检测器,性能持平基线。
ViTL:基于视觉语言模型的时态逻辑引导零样本自然语言导航
ViTL框架将自然语言指令转为时态逻辑,结合方向评分,实现零样本多目标导航。
LuxEmo:卢森堡语表现力文本转语音语料库
提出卢森堡语21小时情感语音语料库LuxEmo,含4类情感,并基准测试5个表现性TTS系统。
DigitalCoach:人类与智能体计算机使用指导中的沟通与立足差距
该数据集揭示模型指导人类使用计算机时缺乏解释、诊断和视觉立足,导致学习者被动跟随指令。
面向大语言模型代理的生成式技能组合
提出SkillComposer,通过约束自回归解码联合预测技能子集、数量和顺序,提升LLM代理复杂任务成功率。
基于技能蒸馏的可扩展浏览器行为克隆
通过技能蒸馏将人类浏览器交互转化为自然语言技能并组织成技能图,实现可扩展行为克隆,解决决策瓶颈。
当大型语言模型粗心读取表格时:衡量与减少数据引用错误
揭示LLM表格任务中数据引用错误普遍存在,提出批评模型方法可显著提升准确率至12%,并训练轻量级批评模型高效检测错误。
强化学习结合元认知反馈使LLM忠实表达不确定性
提出RLMF与元认知数据选择,实现LLM忠实不确定性校准,性能最高提升63%,增强模型自我认知与表达能力。
内省耦合:固定监督下自解释训练追踪行为变化
固定反事实解释训练使语言模型解释比训练目标更忠实于自身行为,且能追踪行为变化,无需更新监督。
极简LLM系统中的涌现文化
极简LLM系统中,代理自发合作、管理存储、生成复杂文化产物,展现出结构化长程相干性。
不依赖ASR的多模态频谱时间建模用于早期痴呆检测
提出无需ASR的频谱时间建模,以频谱位移场为生物标志物,多模态融合效果因语料而异,跨语言架构稳定。
图书馆与信息科学中研究方法的使用频率与应用多样性:1991年至2021年的持续调查
近31年LIS研究:方法从理论转向实证,主题从系统转向用户,揭示18主题与16方法动态关系。
信息大地:一种叙事锚定的语义优先文档嵌入投影
以用户选定文档为极点,经纬度编码叙事进展与主题偏差的文档球面投影法。
分解即指纹:智能体技能的逐组件身份标识
提出120字节局部敏感指纹,以组件三元组识别技能身份,AUC达0.974,性能优异。
Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?
ShopX:面向智能购物中意图到商品履约的基础模型
ShopX统一意图理解与执行规划,通过语义ID直接操作商品空间,减少智能购物中语言与商品间的损耗,提升复杂请求处理效果。
Falsification, Not Exposure: An Internally Preregistered Placebo-Controlled Decomposition of Self-Repair Feedback in Frozen Small Code Models
RCT:一个由机器人收集的触觉-视觉-语言数据集,用于触觉泛化
RCT数据集含29K触觉帧来自122种工业材料,发现接触序列重叠导致评估偏差,强调新材料泛化是触觉感知核心挑战。
UniSAE:通过离散音素后验图建模实现说话人、情感和低级内容的统一语音属性编辑
提出UniSAE统一框架,通过离散音素后验图实现说话人、情感和内容的子音素到单词级编辑,支持多属性联合修改。
SpikeLogBERT:使用脉冲变压器网络的节能日志解析
SpikeLogBERT结合脉冲变压器与知识蒸馏,在HDFS数据集上实现0.99997解析精度,能耗降低62.6%。
RMSNorm Transformer的带符号置换坐标传输
RMSNorm需带符号置换规范,符号边缘化消除匹配天花板,坐标保持传输恢复91.1%跨运行坐标。
Review Residuals: Update-Conditioned Residual Gating for Transformers
MECoBench:具身环境中多模态智能体协作的系统研究
MECoBench系统研究多模态智能体协作,发现协作提升任务完成但需平衡成本,通信是关键,协作增强鲁棒性。
SemRF: 语言模型中残差流动态的语义参考框架
提出SemRF框架,通过锚点固定实现残差动态的稳定语义测量,并揭示低曲率与参数效率的关联。
从多模态感知到战略推理:AI生成游戏解说综述
提出AI生成游戏解说统一框架,分类描述、分析、背景三类解说,综述方法、数据集与评估指标,指出挑战与未来方向。
QVal: 低成本评估长时域LLM智能体的密集监督信号
QVal免训练测试平台直接评估密集监督信号,发现简单提示基线优于多数方法,且性能按方法族聚类。
不确定时验证:超越自洽性的黑盒幻觉检测
提出两阶段算法,动态切换自一致性与交叉验证,在降低计算成本的同时保持高检测性能。
在意外中学习:大型语言模型中模型崩溃的自适应缓解
发现困惑度是模型崩溃关键,提出优先训练高困惑度文档的过滤策略,有效缓解崩溃,性能媲美纯人类数据。
SAGE:针对自由形式问答的大语言模型搜索增强评估方法
SAGE框架通过主动检索合成外部证据评估LLM输出,无需参考答案,与人工评估高度一致。
重新思考面向查询增强的在策略优化
本研究系统比较提示与强化学习查询增强,发现简单方法常优于RL,并提出混合方法OPQE。
双向过程奖励模型
BiPRM通过并行逆向评估与门控融合实现双向过程奖励,仅增0.3%参数,推理延迟5%,性能平均提升10.6%-37.7%。
提炼精髓:通过序列截断实现高效推理蒸馏
仅训练前50%的令牌可保留91%性能,减少50%训练时间、内存与算力。
自适应分配测试时计算会怎样?
提出验证器引导的自适应框架,通过PRM动态分配计算,在多个基准上显著提升性能。
InfiniteWeb:面向GUI智能体训练的可扩展Web环境合成
提出InfiniteWeb系统,自动生成大规模功能Web环境用于GUI智能体训练,在OSWorld等基准上显著提升性能。
FairJudge:一种自适应、去偏见且一致的LLM评判系统
FairJudge通过可学习策略和训练范式,实现自适应、去偏见且一致的LLM评判,显著提升性能。
Beyond Scalar Rewards: Dense Feedback for LLM Policy Synthesis in Sequential Social Dilemmas
BLUEX v2:对巴西大学入学考试开放式问题的大语言模型基准测试
BLUEX v2基准测试巴西大学入学开放式问题,评估21个LLM,发现数学推理与图像理解最困难。
RARE:面向高相似语料的冗余感知检索评估框架
现有评估忽视冗余,RARE通过分解事实和CRRF生成构建真实基准,揭示鲁棒性缺口。