对抗性风格优化:基于GRPO的风格触发优化增强视觉语言模型越狱攻击
发现多模态大模型安全防御易被风格触发绕过,提出GRPO驱动的对抗风格优化(ASO),显著提升越狱攻击成功率。
利用自然语言自编码器探测Qwen2.5-7B中的潜在哥伦比亚身份推断
本研究表明Qwen2.5-7B在处理提示时可能内隐编码哥伦比亚身份和刻板印象,且早于输出表达。
基于共识的大语言模型相对偏好评估框架
提出共识框架,用多模型投票匿名排名衡量相对偏好,发现一致模式,提供可扩展比较方法。
评估设计条件影响专家与自动MeSH差距:Cohen基准上词袋与BiomedBERT的控制比较
专家与自动MeSH标签的分类差距随评估设计变化,从+0.096降至+0.02,结论依赖于评估方式。
版权法合规性的智能体评估
提出Copyright-Bench基准评估LLM智能体版权合规性,发现智能体常选侵权内容,违规率受偏好和时间压力影响。
Humanly: 一个可配置且可追溯的人机协作写作环境
Humanly平台记录写作过程与AI辅助,生成可追溯证书,支持配置化异常检测,区分手工与自动打字。
Khondo:孟加拉语表单文档包分割的多模态基准
首个孟加拉语表单文档包分割基准,发现页面顺序恢复是主要挑战,语言是次要因素。
数据质量胜于容量:将文档内化到LoRA适配器用于闭卷问答
通过LoRA将文档内化到模型权重,数据质量是关键,单次整理使闭卷问答准确率从57.7%升至85.7%,超越检索增强方法。
利用外部知识的检索增强大语言模型修复历史文档
本文提出ARI框架,结合大语言模型与检索增强生成,有效恢复历史文档中断裂的命名实体,显著提升修复效果。
分析语言模型中的自残表征:一项跨架构研究
发现自残信息集中于模型最后3-7%层,精确探针不总是线性可分,不同模型表征存在差异。
知足常乐:强化学习如何缓解大语言模型任务冲突的综合分析
RL通过在线数据、知足常乐目标及正负例优化减少任务冲突,提升模型合并效果。
面向NRC反应堆操纵员执照考试的多模态语言模型微调与检索策略基准测试
微调加固定分块RAG在核反应堆操纵员考试中达79.7%准确率,通过8/14场,无微调则全失败。
开发与验证大型语言模型依赖量表(LLM-D12)的西班牙语版本
验证西班牙语版LLM依赖量表,双维度结构信效度良好,为组织情境中LLM心理依赖研究提供工具。
DWT-Fusion:一种基于信号的无需训练的LLM生成文本检测框架
提出DWT-Fusion框架,基于小波多分辨率分析与校准加权投票,无需训练即可检测LLM文本,AUROC达0.99。
MoE²-LoRA:当MoE模型遇上MoE风格的低秩适配
提出MoE²-LoRA,通过双通道路由条件投影和跨层共享专家池,实现动态适配与知识共享,在MoE微调中达最优性能且保留泛化能力。
优先基于事实真相:一种用于智能体记忆的纵向评估工具,以及记忆架构排名中的任期交叉效应
提出事实先行的评估方法,发现记忆架构排名随历史长度反转,并发布开源库Veracium。
Analyzing Toxic Behavior and Its Impact on the Mastodon Community
J-CoT:J空间中的思维链
提出基于J空间用词汇索引系数传递中间状态的循环推理框架,无需全文或完整隐藏状态,性能超越最强基线。
原生多模态预训练的从头扩展
该研究揭示原生多模态预训练的可预测缩放规律,语言与多模态目标行为不同,文本重混合物在大模型更高效,且促进跨模态迁移。
中文标题:FSE:基于快慢专家的持续学习命名实体识别模型
中文摘要:提出快慢专家增强的跨度NER模型,通过共享与任务专精结合实现持续学习,并引入长度衰减负采样,在CLNER上达到SOTA。
MEUSLI:面向基于大语言模型的语音识别及其他任务的多语言投影器
MEUSLI是首个开源多语言投影器家族,连接Whisper与多语言LLM,支持28种欧洲语言ASR,并可扩展至语音翻译等任务。
从义务到规范:需求工程中验证欧盟AI法案要求之调研
组织缺乏将欧盟AI法义务转化为可测试要求的系统流程,LLM工具提供潜力但需安全保障。
从孤立任务到结构化能力:面向大型语言模型的多层分类法
提出14领域91子技能的多层LLM能力分类法,分析3万余论文揭示研究侧重与覆盖盲区。
基于语法书的低资源机器翻译合成数据生成的因子研究
利用语法书和大模型生成合成语料微调机器翻译,因子研究表明三种低资源语言多数配置优于基线,最佳ChrF++提升达8.8。
面向共情响应生成的动态常识协调
DCC框架动态协调常识知识,提升共情响应情感分类准确性与多样性,生成更相关、连贯、信息丰富的响应。
大型语言模型与人类在创造力评估中的趋同与分歧原因
LLM在创造力评估中与人类标准在新颖性上趋同,在上下文信息上分歧,且不同模型标准不同。
技能自我对弈:通过共同演化技能推动LLM能力前沿
技能自我对弈(Skill-SP)通过提议、求解与技能控制器的协同进化,平衡验证与探索,持续提升LLM能力。
面向低资源阿拉伯字母语言的生物医学机器翻译:基于跨语言迁移与LoRA适配器合并
LoRA适配器合并零数据实现低资源语言生物医学翻译,接近监督适应性能。
grapheme-kit:面向多语言NLP的字素级度量与文本处理
grapheme-kit库将文本度量从Unicode码点提升至字素簇层级,更准确评估复杂文字,改进泰米尔语和僧伽罗语处理。
当伦理与收益相悖:道德困境中的LLM智能体
LLM在道德与利益冲突时合作率7.9%-76.3%,行为受游戏结构和道德框架影响最大,暴露其道德脆性。
Nanbeige4.2-3B:在紧凑模式中释放智能体能力
Nanbeige4.2-3B是3B参数的紧凑通用智能体模型,通过Looped Transformer和强化学习,性能超越更大模型,适合本地助手。
DBA-Bench:面向基于LLM的数据库运维代理的生产保真度基准测试
填补生产运维四大评估差距,含106场景,自动化安全通过率仅12.4%,远低于人类DBA(93.4%)。
基于字节前缀边缘化的跨分词器在线策略蒸馏
提出BPM方法,在字节空间对齐师生词汇,实现质量保持的在线蒸馏,在数学编程任务上显著超越基线。
不透明的认知中介:LLM部署配置如何影响伪科学的验证
商业LLM对伪科学的立场取决于部署配置(系统提示、安全层等),而非模型稳定属性,构成公共关切。
面向投机解码中接受率崩溃的对抗性提示
ADSD提示后缀攻击使投机解码采样时间增加62.3%,任务质量未损。
机器人学习中的进展奖励建模:综合综述
本综述统一了机器人学习中的进展奖励建模视角,从接口、方法与数据三方面分析,总结当前局限与未来方向。
利用水平适切的具体化对话代理减少外语焦虑
提出多智能体系统生成CEFR适切对话,提升句子匹配度,但焦虑降低不显著,提供可用性见解。
教大语言模型自我进化:用强化学习培养核心元技能
MetaEvolve框架通过强化学习培养LLM自我进化元技能,在编码任务上显著提升,分布外性能提高24.12%。
WHBench:通过专家参与验证评估前沿LLM在女性健康话题上的表现
WHBench评估22个模型在47个女性健康场景的表现,最高72.1%,揭示临床需专家监督。
在关键处最大化局部熵:前缀感知的局部化大语言模型遗忘
通过局部熵最大化,仅抑制敏感前缀和扁平化关键logits,实现高效遗忘并减少性能损失。
使用大语言模型衍生嵌入的可解释社交媒体文本抑郁检测
利用LLM摘要嵌入训练监督模型,在抑郁检测中比零样本更准确,尤其多分类任务,建议LLM作为语义解释器。
学习为事实性推理
提出兼顾事实精度、细节和相关性奖励函数,在线RL训练减少大模型幻觉率23.1%,提升答案细节23%。
MedKGent:用于构建时间演化医学知识图谱的大型语言模型智能体框架
MedKGent利用LLM代理从PubMed摘要增量构建含15.6万实体、297万三元组的时间演化医学知识图谱,有效率达90%,显著提升医学问答性能。
InteractComp:基于模糊查询的搜索代理评估
新基准InteractComp揭示,搜索代理面对模糊查询时交互能力停滞且过度自信,强制交互可大幅提升性能,为评估训练提供资源。
SwiftMem:基于查询感知索引的快速智能体记忆
SwiftMem通过时空索引限定检索至相关子集,实现毫秒级延迟,兼顾精度与速度。
构建通用多语言命名实体识别模型的关键因素
系统实验揭示多语言NER设计关键,Otter模型在100+语言上F1提升5.3%,效率远超同类。
语言感知蒸馏:仅需ASR监督的多语言指令跟随语音LLM方法
提出语言感知蒸馏法,用查询库与门控网络解决多语言干扰,指令跟随提升14%,Audio-MLQA超越基线32%。
LMEB:长时程记忆嵌入基准
提出LMEB基准(22数据集193任务),挑战长时程记忆检索,大模型不总优,能力独立于传统检索。
AI能否消除新闻偏见?大语言模型干预提升跨党派接受度,但高估自身效果
LLM的实质重构可提升保守派信任,但模型高估效果且心理预测失准。