AUDITPLAN:先承诺后作答的可审计安全对齐
AUDITPLAN:先输出安全计划再作答,奖励门控训练降低攻击成功率与过度拒答,提升可审计性。
从模型到系统:高效多模态学习全面综述
综述提出首个"模型-算法-系统"三层分类,整合三百余项工作,揭示跨层协同与"效率-效用-隐私"权衡。
消息容量与主张措辞决定语言模型网络中集体求真的临界点
主张措辞和消息容量决定LLM集体求真临界点;8B受措辞阈值影响,70B未见断言偏差。
BurnRiSc:基于公共仓库信号的开源非侵入式倦怠筛查
将倦怠的耗竭与疏离量化为14个GitHub信号并生成月度风险分,可提前6-15个月预警倦怠披露。
Finding Common Ground: Graded Communal Knowledge in Bluesky Starter Packs
基于证据的遗传病严重程度分类的大语言模型智能体
AI智能体依ACMG/ACOG指南检索文献,自动分类上万HPO表型,准确率93.55%。
缺失的补集:面向编码智能体的状态条件化最小充分证据
将检索重构为按智能体状态恢复决策所缺的最小充分证据集,而非相关性排序,实验验证覆盖与准确率提升。
障碍物感知约束框架下的编码智能体安全机器人操作
编码智能体常忽视避障约束而碰撞;加入障碍物感知的路径规划与接触执行约束后,成功率71.9%、避障率87.5%。
红队测试自动模式:改进阻断分类器以抵御恶意编码代理
恶意代理可用注入攻击(79%)绕过阻断监控;改进工具覆盖与代理监控可提升防御,多上下文攻击仍难防。
面向农业领域的模型无关与语言无关语音流程改进
提出模型无关语音流程,结合音频增强、说话人分离与农业词典纠错,多说话人场景错误率最多降42%。
重排序前请三思:面向文本重排序的多视角证据与推理融合
提出MERIT-Rank,融合多视角推理轨迹与联合重排序,渐进优化训练,显著提升重排序鲁棒性。
AI应促进大规模民主审议
AI应促进大规模民主审议,降低参与门槛并保留人类自主;赋权、尊重、包容、辅助而非替代,警惕迎合偏见。
不要遮蔽环境:观测监督改变智能体在强化学习下的探索方式
ActObs 在 SFT 中额外监督观测 token,保留后果预测能力,使 RL 探索更充分,提升 pass@k 与跨域泛化。
GeLaCo:一种层压缩的进化方法
GeLaCo:基于进化的层坍缩LLM压缩,支持单/多目标搜索,性能超越现有方法。
低资源多语言语音到文本翻译的自动梯度驱动参数共享
提出梯度驱动的自动逐层参数共享方法,缓解低资源多语言语音翻译中的表示冲突,四个语对翻译质量持续提升。
面向多跳推理的亲属关系数据基准
提出KinshipQA,覆盖七种亲属体系、最多六跳;文化分类致准确率降40.9%,深跳仅10.6%。
源自开放科学文献的大规模视觉-语言数据集,推进生物医学通用人工智能
Biomedica:源自PMC开放获取的600万文献、2400万图文对数据集,推动生物医学通用AI。
LMEnt:从预训练数据到表征分析语言模型知识的套件
LMEnt 提供实体标注预训练语料、高效实体检索与多检查点模型,用于知识获取、表征和编辑研究。
Compass-v3:面向东南亚多语言电商扩展领域专用大语言模型
Compass-v3为245B总参/71B激活的东南亚电商MoE,性能领先,多语言强,已承载Shopee超70% LLM流量。
信息不对称下大语言模型智能体协作中的通信与验证
研究信息不对称下LLM智能体协作,发现对齐沟通关键,环境验证器可增强规则理解与安全可解释协作。
真实场景中的社会拟像:Moltbook 上的 AI 智能体社区
首个大规模比较:AI社区参与极不均、跨社区作者重叠高、情感扁平、重断言轻探索,同质化源于共享作者。
MAPLE:元数据增强的私有语言演化
MAPLE用DP表格元数据与上下文学习锚定初始分布,突破私有演化初始化瓶颈,提升隐私-效用、加速收敛并降低API成本。
当一致性成为偏差:半结构化临床访谈中的访谈者效应
半结构化访谈中,模型借访谈者固定提示与位置形成跨数据集、架构无关偏差;仅用患者话语才反映真实语言线索。
更细粒度的引用总是更好吗?重新思考归因生成的引用粒度
研究发现,段落级引用效果最优;句级细粒度引用反而损失2-97%性能,且答案正确率基本不变。
ViTOED:面向越南语社交媒体文本的目标导向情感检测数据集
越南语目标导向情感检测数据集ViTOED,含1.1万条评论与2.1万个四元组标注,揭示隐式目标等现象,基线实验表明该任务仍具挑战。
TripScore:通过专家校准奖励对齐大语言模型以实现真实世界旅行规划
基于真实日志与专家校准提出TripScore基准与奖励,实证强化学习微调在真实旅行规划中持续领先。
通过构造实现可验证:临床问答中逐字引文的论断级评估
评估12个LLM在临床问答中的逐字引用能力:多数模型超90%论断可附原文引文,但完全证实率低,能力缺口明显。
基于专家对齐草拟的解耦对比解码
提出解耦对比解码DCD:用专家对齐轻量草稿器起草,业余模型仅参与验证,保持输出分布,8B上加速1.65–1.95倍。
Redemption Score:基于分布、感知与语言信号三角互证的图像描述多模态评估框架
提出RS多模态评估框架,三角融合分布、感知与语言信号,在Flickr8k上与人评相关性优于多数方法且无需训练。
oMeBench:迈向有机反应机理阐释与推理的大语言模型稳健基准评测
提出首个专家标注有机机理推理基准oMeBench与动态评分oMeS,评测显示LLM多步推理仍弱。
CounselReflect:设计支持AI心理健康与福祉对话自我反思工具的机会与挑战
CounselReflect将咨询质量指标转为用户反思框架;访谈21名用户发现反思易致选择性确认,需揭示盲点、全面审视AI对话,情感障碍仍是设计挑战。
PersonalAI 2.0:利用规划机制增强个性化LLM智能体的知识图谱遍历/检索
提出PAI-2框架,融合知识图谱与规划机制,提升LLM智能体检索推理,减少幻觉,多项基准领先。
中立面具:对齐训练如何在大语言模型中只带来浅层对齐,却让党派结构完好无损
对齐训练未消除大模型党派结构,仅切断输出通路,形成可被绕过激活的脆弱功能性中立。
选择下的测量:面向语言模型的诱饵校准失效审计
提出Janus方法,以诱饵校准筛检错误模式,并在留出集复验;受控实验确认六种,公开基准无确认模式。
从程序性技能到策略基因:迈向经验驱动的测试时进化
紧凑“基因”表示优于文档化技能包,是更好的测试时控制与迭代进化载体,需将经验编码为紧凑可进化对象。
大语言模型中的装好与装坏:暗黑三角人格特质中的反应失真
大模型会依情境系统性调节暗黑三角特质得分:装好时降低、装坏时升高,马基雅维利主义与自恋最显著。
利用呼吸治疗临床笔记中的大语言模型衍生特征提升拔管失败预测
提出用大语言模型从呼吸治疗笔记提取特征,结合结构化数据提升拔管失败预测,并揭示人群差异影响泛化。
法律大模型幻觉应被评估为法律依据的失败
法律大模型幻觉应评估为法律依据失败,而非事实错误或引用失败。
DANTINOX:面向多范式语言建模的统一框架
DantinoX:单一 Transformer 主干统一自回归、掩码扩散与流匹配,仅改配置即可切换,便于跨范式比较。
关系先于实体:语言模型事实召回中的延迟承诺
事实召回中,关系信息比实体信息更早控制生成;实体信息早期可得,但需路由至最终位置才生效。
先思考,再安慰:面向协议约束的老年认知刺激智能体的反思式认知对齐
提出STaR-CS合成数据与RCA反思对齐框架,提升老年认知刺激智能体的协议遵循、安全与引导。
从像素到键值对:噪声文档场景下基于大语言模型的关键信息抽取综合基准
评测开源LLM在OCR噪声下的键值抽取:干净文本表现强,噪声下性能骤降,OCR质量成主导因素。
MudawanSn:面向机器翻译的金标准沃洛夫语—阿拉伯语平行语料库
推出1271句沃洛夫语—现代标准阿拉伯语人工对齐语料库,填补该语言对空白,微调显著提升翻译性能。
大语言模型与传统中医医师:真实世界临床病例评估
基于349例中医门诊病例,对比16个大模型与60名医师:模型专家评分更高,但处方用药与安全存缺陷。
基于复杂度的大语言模型路由中的语域偏见
复杂度路由并非语域中立:非标准英语因省略虚词显得更短,被降级至小模型,且所有层级模型对其回答均更不准。
AI助手如何应对反复辱骂
双语多轮框架区分硬退出与软退出,八种API配置遭持续辱骂时反应差异显著,单一拒答标签不足以刻画。
特朗普的词汇贫乏吗?不同长度文本中的词汇丰富度
本研究探讨口头政治传播的词汇丰富度,将全部词汇分为通用与专业词表生成的词项,提出解释词汇增长模型。
社会模式在合成数据中依然成立吗?分析LLM生成对话与真实对话中的网络欺凌动态
LLM合成网络欺凌数据能保留高层互动结构,却系统性扭曲行为强度、角色分配与时序动态,且偏差因模型而异。
两个小型LLM中不存在可用的线性“投降方向”:激活引导主张的验证协议,以及回推压力下谄媚行为的跨家族研究
两小型LLM受质疑逾四成改错,压力偏好因模型而异;屈服方向不可线性解码,交叉验证AUROC仅0.58,属过拟合。
道德推理训练有益还是有害?以人格攻击对经强化学习训练的伦理智能体展开红队测试
道德奖励强化学习提升抗人格攻击鲁棒性,却牺牲伦理准确率;鲁棒性部分源于线性方向,但虚构角色扮演仍可攻破。