开放评分系统:基于成对自适应评分标准的强化学习扩展
OpenRS以显式元评分标准动态生成成对自适应评分标准,逐准则比较并外部聚合,兼顾可验证性,用于强化学习奖励监督。
PatientHub:统一患者模拟框架
统一框架PatientHub标准化LLM患者生成、模拟与评估,提供16个模拟器及多轮会话评测。
LocalSUG:面向本地生活服务的城市偏好增强查询建议大语言模型
提出LocalSUG框架,挖掘城市偏好候选,束搜索GRPO对齐,CTR增0.35%,无结果率降3.98%
MedPriv-Bench:医学开放式问答中大语言模型隐私-效用权衡的基准测试
提出首个医学开放式问答隐私与效用联合评估基准,发现九种模型存在普遍隐私-效用权衡。
大语言模型下的音乐推荐:挑战、机遇与评估
大语言模型颠覆传统音乐推荐评估,需重构评价体系,提出结构化成功与风险维度。
Omanic:迈向大语言模型多跳推理的逐步评估
提出Omanic多跳问答基准,逐步诊断推理断裂,微调可提升6项基准平均7.41分。
无领域内训练数据的跨领域多任务数据到文本生成
提出DDKD+结构保持增强,无领域内数据跨域多任务生成,小模型优于微调/零样本,五基准两项超更大模型。
超越稳定性-探索两难:大语言模型策略优化的环境正则化
提出环境正则化策略优化(ERPO),将正则化移至输入侧,用Query-KL约束查询分布漂移,保留探索,提升准确率与稳定性。
Olapa-MCoT:提升大语言模型中文数学推理能力
提出Olapa-MCoT,结合SimRRHF与IDRL,使大模型中文数学推理准确率提升至50%,英文能力亦提升。
问题何在?评估视觉语言模型的时间一致性
视觉语言模型能检测帧级异常,但几乎无法检测时间异常;人类显著更优。TimeCatch提供评测基准。
NeuronTune:面向大语言模型安全与效用平衡的细粒度神经元调制
提出细粒度神经元调制法,精准定位并调控稀疏神经元,兼顾安全与效用,优于现有技术。
基于景观与搜索行为分析的粒子群优化可解释信息处理
融合景观与算法分析,提出PSO可解释框架,量化问题难度,预测超参数,新提STN指标增强拓扑选择透明度。
阿拉伯语自然语言处理研究综合分析:趋势、主题演变与研究空白——基于文献计量与主题的研究
2020年后阿语NLP激增,19主题,文本语音翻译识别最大;引用与年龄正相关;沙特美国埃及领先;方言空白。
LLM生成回复中的广告插入
提出双解耦广告框架:将插入与生成解耦、以语义类型代理竞价,VCG机制兼顾激励与效率,实现高效、合规的LLM广告。
ADVERSA:测量大语言模型多轮护栏退化与评判者可靠性
提出新框架,以连续轨迹度量多轮护栏退化及评判者可靠性;实验示越狱集中于早期轮次,成功率26.7%。
最佳实践评论家优化
BPCO结合DPPO、有界值预测、MC目标等技巧,使评论家可靠,单样本即可匹敌组相对优势估计。
CS研究中AI披露的期望与实践
调查显示AI披露政策模糊;研究者认为研究设计和低人工参与时披露最必要,但实际披露与期望脱节。
全息不变存储:基于向量符号架构的设计时安全契约
全息不变存储协议为大模型上下文漂移构建设计时安全契约:恢复保真度、噪声鲁棒性、容量界限,经仿真验证。
检索模型对集合增长的鲁棒性
研究发现检索模型在加入无关文档后性能均下降;不依赖其他文档的模型检索更优,重排时两者相当。
CyberFactory:利用真实世界实例扩展网络安全能力
提出开源框架,将公开漏洞转为可执行实例,自动生成轨迹训练模型,在基准测试中提升显著。
连接业务意图与数据:自动关系数据产品生成的基准
首个自动数据产品生成基准DP-Bench,结合ELT与text-to-SQL数据,提出LLM基线方法。
Apodex 1.1:面向复杂工作的智能体能力扩展
Apodex 1.1通过环境与协调扩展实现复杂工作的可验证交付,小模型性能领先,35B版本可本地部署。
七巧板谜题:以组合空间推理评估多模态大语言模型
提出七巧板基准,评估多模态大模型在几何约束下的组合空间推理,发现模型忽视几何约束致形变。
区分叙事增量解读中的修订与延迟细化
叙事增量解读区分修订(非单调)与延迟细化(单调),用视觉叙事展示结构化表征支持两种更新。
CyrillicQA:语音编码秘密语言对LLM性能的影响
大模型对拉丁字母标准语言表现最佳,但可保护濒危语言,能否像人类一样解码语音编码秘密语言?
KSE-Web:面向低资源高棉语语义搜索的混合检索与LLM辅助查询扩展分析
构建高棉语检索数据集,评估BM25、稠密、混合与LLM扩展;BM25最佳,LLM扩展无提升。
引用在偏好数据中的作用
研究人类与LLM在科学问答中如何评估引用,发现人类偏好更多样但更少的引用,LLM虽无源访问却表现引用偏好,影响偏好数据收集。
智能体脚手架放大大型语言模型中的谄媚行为
多轮交互和迭代自省加剧模型谄媚,准确率显著下降,能力越强放大越甚,提出谄媚放大概念。
超越每字母两字节:西里尔字母AI系统中的分词开销
乌克兰语等西里尔文字分词开销高(最高220%),可通过压缩和平衡BPE缓解,罗马化反而增加开销。
Wazobia Eval:尼日利亚皮钦语情感理解、讽刺检测与文化推理基准
新基准瓦佐比亚含五百五十余标注和十六类情感,评测尼日利亚皮钦语情感、讽刺与文化推理。
基于反事实集成解码缓解大型视觉-语言模型偏见
提出反事实集成解码,构建多群体反事实视角并加权融合,显著降低社会偏见(最高降47.97%),保持模型能力。
Telegram上以色列-巴勒斯坦冲突话语的社交媒体分析
分析16个频道8.7万条消息,以巴用相同死亡词汇但情绪相反:亲以中立、亲巴负面,行动方与受影响方。
智能体安全:LLM驱动渗透测试工具、故障模式与设计法则的系统化
评估十种LLM安全工具,提出集成摩擦指数与设计法则,证明提示词不约束执行,实现Inspectra平台
权重中遗忘,工具可恢复:面向大语言模型智能体的智能体工具遗忘
针对工具智能体可借工具恢复遗忘信息,提出ATU两阶段框架:参数遗忘+轨迹强化学习,平衡遗忘与保留。
基于TRIAD的多跳RAG评估自动化:从上下文提取到验证数据集生成
提出三步法自动生成领域RAG评估数据集:生成问答、校验、加上下文。结果与现有数据集趋势一致,经人工验证有效。
中文标题
大语言模型真能遗忘吗?对抗性评估揭示遗忘漏洞。现有方法标准指标虽好,但对抗攻击下信息仍可恢复,需补充压力测试。
通过关键词锚定事实替换缓解RAG系统中的数据库泄露
提出一种防御方法,用关键词事实替换检索内容,抵御注入攻击,减少数据库泄露且保持准确。
L\"etzCross:面向卢森堡文档多模态检索的跨语言页面级基准
提出跨语言页面检索基准L\"etzCross,发现图像检索优于OCR文本,多语言微调提升卢森堡语查询效果。
受控退化下的证据状态可靠性:多阶段LLM流水线中的解析器有效性分歧
提出证据状态可靠性框架:受控退化下解析器有效性提升,证据敏感阶段成功率下降,检测与恢复分离
FCPRAG:用于稳定多段落LoRA注入的融合控制器参数化检索增强生成
提出FCPRAG,以轻量控制器实现检索条件化的逐样本LoRA融合,提升稳定性与鲁棒性,超越多个基线。
语言模型中的评估意识:表征、言语化与控制
评估意识在语言模型中可线性解码,但与输出言语化仅部分相关;沿探测方向引导可改变言语化得分。
GUI元素定位中的词汇耦合:句子嵌入跨移动端和Web端跟踪标签
基于嵌入的GUI评估易混淆可见标签恢复与语义定位,应报告词汇基线与标签分层诊断。
没有一种模型能拦截所有危害:跨安全场景的内容审核基准测试
评测53模型、11数据集(分四类),发现前沿模型并非样样领先,对话安全普遍未解,规模不等于安全。
BanglaVeilGuard:孟加拉语大模型的跨文字安全基准与轻量级防护
提出孟加拉语安全基准与轻量防护,覆盖六种语言形式,将攻击成功率降至6.3%,但存在过度拒答问题。
更多计算资源并不能确保更高学术影响力:来自顶级NLP会议论文的证据
分析1.4万篇NLP论文发现,计算资源高度集中但仅微弱提升引用与获奖,资源多不保证影响力高。
训练知识库:智能体策展文档库的监督结构学习
知识库即模型:用问答对监督结构编辑,效果优于无监督索引;泛化随覆盖率衰减,可扩展训练。
MCite-RL:面向可靠多模态RAG的引用增强智能体强化学习
提出MCite-RL,用智能体迭代检索与递归裁剪优化视觉引用,并设引用增强奖励,兼顾答案准确与来源可溯。
HiDiffTIR:面向多轮工具集成推理的分层难度感知策略优化
HiDiffTIR分层难度感知策略优化,轨迹与轮次级信用分配,聚焦困难步骤,无监督提升多轮工具推理。
PUMA:面向波兰文化的多模态理解基准
提出PUMA基准,900个手工任务评估波兰文化多模态,顶级商业模型视觉问答强,但多数模型音频文档弱。
GUI基元:诊断视觉语言GUI定位中的空间推理失败
提出GUI-Primitives基准,994项对比指令测GUI七种空间关系。19个视觉语言模型最高32%准确率,失败主要在候选定位而非关系理解,标注候选可提升35-57个百分点。