BLINDSPOT:长周期工具使用智能体的安全与拒绝校准基准
长周期工具智能体的轨迹级安全校准基准,含22类攻击、35个场景,评测13个模型,揭示失败常滞后显现。
超越文化知识:评估大语言模型的阿拉伯文化适宜性
AraBehave基准:文化适宜性分规范立场与事实准确两维度,通用模型立场欠妥,阿拉伯模型多杜撰经典。
大语言模型何时应当弃答?面向选择性风险控制的自我提问链
提出CoSQ提示框架,以自我提问评估信息是否充分,支撑不足时选择弃答,降低错误承诺率并提升准确率。
面向工具集成LLM智能体的对抗攻击通用防御
提出工具过滤与工具召回两种通用防御,结合思维链提示,四类攻击下攻击成功率大幅下降,多处达0%。
面向语言模型的安全纠错:冻结基座调整与能力保持
提出轻量logit纠错模块CRN v2,冻结基座仅训0.73%参数,纠错53.3%且不损能力,KL约束关键。
面向零样本跨语言音频深度伪造检测的语言正交化
提出语言正交化,消除自监督语音模型中与语言相关的干扰,在未见语言上稳定降低等错误率。
CLASH:口语讽刺检测中词汇与韵律依赖的反事实审计
提出双语反事实框架CLASH,审计口语讽刺检测对词汇和韵律的依赖:词汇线索具显著优势,声学敏感非鉴别力。
LoopSpec:面向循环Transformer的流水线自推测解码
LoopSpec为循环模型提出免训练自推测解码,流水线重叠草稿生成与验证,无损提速最高6.83倍。
ThinkFlow:面向终身对话智能体的自演化概率潜在记忆
提出ThinkFlow自演化概率潜在记忆框架,绕过文本瓶颈,实现无标签终身对话个性化。
LSREP:一种用于评估对话记忆的纵向状态回放协议,并以 ICE v2 作为经审计的本地优先架构
LSREP以纵向状态回放协议评估对话记忆;ICE v2本地优先近追平向量RAG,公开诊断却大幅落后。
VideoMM:面向高效视频多模态大语言模型的自适应宏-微推理
VideoMM通过宏代理筛选与微观Token按需推理,解耦选择与推理,显著加速长视频多模态模型并提升精度。
鸡尾酒会场景下的音视频话轮转换预测
音视频话轮预测模型在鸡尾酒会噪声下性能骤降(F1最多跌38%),微调可提升鲁棒性但收益因模态而异。
被打断的陪伴:AI伴侣中断的心理社会反应风险评估框架与跨平台定量分析
研究AI伴侣中断,提出四维风险评估框架,跨平台分析发现中断会立即增加焦虑、压力、自杀表达和悲伤。
面向长期对话的交互式记忆学习
提出交互式记忆学习框架,将长期对话记忆转为可学习交互策略,经强化学习与延迟奖励持续提升回复质量。
跨标准 LoRA 适配器的共享前缀 KV 复用:质量与服务权衡
标准LoRA适配器共享前缀KV缓存复用:质量略降,预填充成本降低,热缓存首字延迟随上下文增长,内存未实际共享。
ScienceBuddy:面向交互式科学智能体的递归嵌套式自我改进
推出交互式科研工作空间,科学智能体双层递归自改进:内层优化框架、外层训练模型。
CareMirror:将照护者福祉纳入痴呆症照护生态体系
为痴呆症家庭照护者构建CareMirror福祉生态,访谈14人:其重视福祉与临床可见性,但忧反思负担与自动共享,主张AI辅助而非取代。
面向LLM助手的可验证社会推理
提出Fuse多智能体仿真框架,以用户咨询构建可验证社会推理真值;评估多个LLM,发现用户中介与偏见框架影响推理,并开源数据。
上下文学习与指令微调:小型及多语言语言模型案例
多语言场景下指令微调数据稀缺,研究比较上下文学习与指令微调,发现二者仍有差距,需进一步探索。
LACE:面向动态帧率编解码器的逐层压缩
提出逐层压缩动态帧率编解码器LACE,各量化层独立分段,改善率-质量权衡与TTS效率。
R3:稳健且不依赖评分标准的奖励模型
R3:不依赖评分标准、可跨维度泛化且可解释的奖励模型,支持透明灵活评估与多元价值对齐。
基于自反馈强化学习的大语言模型后训练
用模型自身置信度作奖励,通过自反馈强化学习后训练,无需人工标注,提升校准与推理。
基于人口普查与土地利用数据的大语言模型生成个体出行日记
研究用大语言模型结合人口普查与土地利用数据生成个体出行日记,逼真度媲美经典模型且具零样本可行性。
SciNLP:NLP领域全文科学实体与关系抽取的领域专用基准
首个NLP领域全文科学实体关系抽取基准SciNLP,含60篇论文、6429实体、1649关系,验证模型并构建知识图谱。
文字碎片化与格式:是什么导致开放大语言模型中的英语-孟加拉语性能差距?
发布8个英译孟加拉语基准,评测10个开源LLM;差距部分源于格式评分,孟加拉语分词成本高约五倍。
大语言模型中的拒绝行为不止一个方向
拒绝对应多个几何方向,但沿任一方向引导产生相同权衡,实为共享一维旋钮;由共享核心与特定潜变量构成。
对学习者语料库进行持续预训练能提升英语水平测试中的自动作文评分吗?——来自 EFCAMDAT 的证据
基于 EFCAMDAT 的持续预训练可提升英语作文自动评分,但受语料水平与模型架构影响,跨测试迁移不稳定。
PARSA-Bench:波斯语音频语言模型综合基准
首个波斯语文化音频理解基准,含16项任务,发现音频理解是主要瓶颈,唯诗歌韵律音频优于文本。
面向世界建模的神经符号协同
NeSyS 融合大模型语义先验与符号规则,交替训练,兼顾表达力与鲁棒性,提升世界模型预测精度与数据效率。
MASCOT:多智能体社交协作陪伴系统
MASCOT多智能体社交协作陪伴框架,通过双层优化缓解人格崩溃与社交谄媚,提升角色一致性并减少冗余对话。
SITA:面向低资源声调语言的说话人不变与声调感知语音表征学习
SITA两阶段适配预训练语音模型,兼顾说话人不变与声调保留,在低资源声调语言上取得检索与识别最佳权衡。
对齐打地鼠:微调激活大语言模型对受版权保护书籍的逐字回忆
微调可绕过安全对齐,让大模型逐字复现受版权书籍,最高达90%,并跨作者泛化,揭示权重存副本。
YFPO:融合神经元引导奖励的配对特征偏好优化
YFPO将响应级偏好学习与神经元级奖励耦合,用内部数学特征信号辅助大模型推理后训练。
迈向稳健的基于大语言模型的评审器:偏见分类评估与去偏优化
提出 JudgeBiasBench 与偏见感知训练,系统评估并缓解 LLM 评审器的 4 维 12 类偏见。
大语言模型能否模拟学生的错误推理?——一项关于干扰项生成的案例研究
LLM生成选择题干扰项:数学题解正解并模拟错误,科学题多靠语义相似;提供正解提升与人工干扰项一致性。
K-Bench:用于评估大语言模型在高风险心理健康对话中表现的临床校准基准
临床校准基准K-Bench,覆盖自杀、自残等高风险多轮对话,评估33个模型安全性并设防优化排行榜。
衡量 AI 辅助内容生成中的人类贡献
提出信息论框架,以互信息和自信息比量化人类对AI辅助生成内容的贡献,实验证明可区分贡献度。
标准语音与带口音语音及其语音克隆的声学与感知差异
口音克隆感知相似度更低、可懂度增益更大;口音保持应显式纳入说话人身份保持。
EviSI:一种用于同声传译的基于证据的评估智能体
EviSI是基于证据与MQM/口译标准的同传评估智能体,四维评分并去重;英中/中英系统排序优于BLEU/COMET,多语扩展正相关。
SyncVoice:简单有效的视觉增强TTS自动视频配音
提出SyncVoice,将文本-视觉融合模块轻量集成到预训练TTS,实现同步视频配音;零样本达SOTA,并可统一中英配音。
鲁棒性作为任务性能的涌现属性
任务表现与鲁棒性强正相关,掌握任务后鲁棒性自然涌现,主因任务能力而非模型固有属性。
MiCRo:面向个性化偏好学习的混合建模与上下文感知路由
MiCRo用两阶段框架,以上下文感知混合建模与在线路由,无需细粒度标注,捕捉多样偏好并提升个性化。
稀疏注意力中的路由吸收:为何随机门控难以被超越
稀疏注意力中,模型与掩码共适应导致路由吸收,使学习门控难显著优于随机门控。
IndicQE-APE:面向印度语系语言的质量评估与自动译后编辑统一基准
整合印度语质量评估与译后编辑数据,发布含12.6万实例、九语向、四类标签的统一基准,并评测六种大模型与三种指标。
思考更深,而非更长:面向组合泛化的内存高效深度循环 Transformer 测试时推理
深度循环 Transformer 以共享权重迭代实现常数内存、线性延迟的测试时推理,步数匹配任务复杂度可提升组合泛化并外推。
CVSS-X:面向28种语言的多语言语音到语音翻译语料库
发布CVSS-X语料库,将英译扩展至28种语言,约24万对语音、超1.6万小时,规模为CVSS八倍,含两种变体,质量相当。
锥形束CT报告生成中部分可观测目标下的临床推理
CBCT颌面报告生成中,复合目标仅词法项可见;优化复合目标提升事实蕴涵,词法指标偏爱听写惯例。
面向生物医学与临床文本抽取式摘要的混合分层一维CNN-BiLSTM框架
提出分层1D-CNN-BiLSTM抽取式摘要,直接选句避免幻觉,提升生物医学与临床文本事实可靠性。
RFCLLM:评估大语言模型对网络协议状态机的推理能力
通过4类任务、1482条查询覆盖16种协议,评估大模型将自然语言规范映射为有限状态机的能力与偏差。
PhysMent:面向物理问题中大语言模型推理的交互式方法
PhysMent 让 LLM 通过 MuJoCo 模拟器交互实验推理物理;定性任务达80%,多步定量任务多低于30%,瓶颈在工具使用而非概念。