评估机器翻译对话中的沟通成效
提出三层清单评判框架,从语义、语用、文化社会评估口译对话,构建单多轮基准,交际成效逐层下降。
KoNeoBench:面向大语言模型理解韩语新词的精选评测数据集
提出KoNeoBench基准,含1785个2020年后韩国新词与四类任务,实验显示大模型在构词还原、语义分类和释义生成上明显不足。
JustMem:面向长期对话的“恰到好处”记忆访问
将对话历史存为原子记忆,按查询自适应调整发现广度与读取保真度,准确率和召回最高且更省token。
Zarya:一种兼具灵活训练与双模式推理的混合自回归-掩码扩散语言模型
Zarya联合自回归与掩码扩散目标,支持灵活训练与双模式推理,并开源0.6B至4B模型。
VākQA:泰卢固语口语事实型问答基准与评估研究
提出泰卢固语语音事实问答基准VākQA(2001问答对、2.53小时音频),验证评估并评测多类模型。
检索主导型抽取式问答中的内在序列似然置信度:两项预先指定的阴性结果,以及它们能归因什么、不能归因什么
检索主导抽取式问答中,序列似然置信度不足,两项置信驱动用途均失败,仅得预设阴性结果。
在词元空间中读取情感:面向情感识别的语音大模型判别式适配
判别式适配:分类头读末词元隐态,单次前向出标签,不改主干。IEMOCAP上Macro F1提升、无幻觉,ASR文本增益最大。
IBM Granite 5.0 TurboCTC 语音识别模型设计
470M参数编码器模型,结合Conformer下采样与块对角注意力,仅用公开数据训练,速度精度居前沿。
Lens:让正确的语义视角聚焦于免训练多模态表示学习
提出免训练框架Lens,以语义视角锚定和上下文化短语读取解决视角错位,MMEB平均P@1达63.9,超基线10.2分。
大语言模型对中国人工智能生成内容法规的合规性基准测试
中国AIGC合规评测:2303题六维,评20个大模型;国际模型合规亦高,差异多在意识形态维度。
面向生物医学关系抽取的模型微调
微调DeBERTa接近SOTA;微调Gemini Pro 1.0在句子/摘要级均超SOTA。
复制还是不复制:利用模型内在信号控制推测解码
SwitchSD利用模型内部信号识别复制意图,动态切换推测解码,较EAGLE3吞吐最高提升15%。
在警告为时已晚之前:基于语音的增量式电话诈骗检测
流式模型StreamFraudNet以自监督语音编码器与循环时序建模,从通话音频增量检测诈骗,10秒首判、每2秒更新,AUC 0.9953。
DeepSeek-V4.1-Flash:突破 KV 缓存压缩的极限
多模态MoE,552B参数、百万token上下文,CSA2+FP4使KV缓存压至1/4,性能更优。
公共话语语料库(PDC):一个含目标说话人参与、用于效价与认识情态标注的说话人归属数据集
发布PDC:998个视频、18万余句,联合标注情感效价与认识情态,并提出目标说话人参与标注。
随机词汇演算基础:概率单纯形上的语义下降与随机动力学
可观测框架判定语言概率可否支撑可更新随机状态;校准后三状态表示通过稳定性覆盖九成路径,仅条件成立。
Edustories:来自课堂实践的真实案例研究合集
Edustories数据集含1492个教师撰写的课堂案例,用于评估大模型预测教学干预成效;最强模型准确率58%,不及人类专家64%。
WiC并非WSD:大语言模型与词汇歧义消解研究
WiC因缺少显式义项而更难;提供候选义项可提升LLM表现,其错误多源于义项边界歧义或过度细分。
指引罗盘:将动态心理咨询对话与认知行为疗法策略对齐
提出StratCBT数据集,涵盖9688次咨询、约25.6万语句,按八种CBT策略对齐咨询师回应,提升动态心理疏导效果。
面向数据高效语言建模的关系注意力
提出关系BabyLM,用双注意力Transformer分离关系与词汇信息,数据高效,结构泛化强,严格赛道第6。
语言模型中免训练自报置信度的分析
语言模型免训练自报置信度分析:直接口头强,三样本一致弱,自洽放大错误,且受提示与基准噪声影响。
面向基于语义解析的知识库问答的模式锚定潜在推理
提出SALR,以模式锚定潜在推理延迟显式模式决策,借模式码本对齐连续思维,提升逻辑形式生成。
SAFARI:面向LLM辅助危害分析与风险评估的工业基准
首个ISO 26262汽车HARA工业基准,含3000案例;LLM风险分类弱,最佳ASIL宏F1仅0.261。
异种可解释性:探究大语言模型的异己心智
提出异种可解释性,区分人类语义与模型原生异种表征,主张识别无法用人类概念表达的内部结构,并探讨其安全影响。
压力测试对齐中期训练
压力测试显示,竞争性微调会抵消对齐中期训练效果;公共证据不足以证明其能解决强AI对齐核心难题。
Viveka-Insight:覆盖斯瓦米·维韦卡南达英文与孟加拉文全集的跨语言概念图与引文溯源检索资源
辨喜英孟全集跨语言概念图与引文检索资源,含解析、概念图、别名、人工标注,Recall@10达0.86
Chronicle:面向LLM智能体的切点重放回归测试
记录智能体非确定性边界,切点重放部分实时执行新代码,将故障转为CI回归测试,零模型调用且稳定。
特权信息为同策略自蒸馏带来了什么?
无参考蒸馏已带来大部分提升;特权参考增益有限,其价值在于促进跨模式迁移,而非揭示更多解法。
HerHealthEval:评估对女性健康传播的多语言与语域敏感理解
提出HerHealthEval框架,揭示多语言医疗模型在语域变化下的漏诊风险。
摘要化偏置:大语言模型中客观投射向讲述模式标签的方向性坍缩——一个概念框架与注册测试协议
提出摘要化偏置:大模型把叙事意义压成标签而非可重构结构;分生成与评价两机制,评价偏差更危险;未验证,预注册测试。
UniPolicy:面向生成式搜索广告的统一目标特定策略
UniPolicy通过目标特定参数解耦与多策略束搜索,离线线上均提升CTR、RPS和收入,延迟稳定。
JEPA-Anything:跨不同世界学习预测模型
提出领域无关框架JEPA-Anything,用正交预测分解跨七领域学习预测模型,提升预测、干预与科学发现。
按需注意力:语言模型知道何时该回忆
按需注意力:召回头预测收益,选择性全局注意力,仅训该头,vLLM实现,长上下文加速,性能近全注意力。
GPT模型中的危害洗白:证据表明性别歧视在安全训练代际间被转化而非减少
安全训练未消除性别歧视,而是将其转化洗白:毒性评分下降,表征伤害却随代际上升。
dQwen3.5:混合注意力扩散语言模型
Qwen3.5适配为dQwen3.5;混合注意力骨干约半token达同损失,任意顺序与并行解码佳。
RetireOPD:面向智能体强化学习的自退场同策略蒸馏
提出RetireOPD,自适应退场实现学生自蒸馏,性能超越教师模型。
CovR:基于推理引导强化学习的覆盖感知硬件验证
CovR结合自反思、仿真反馈与强化学习自动生成测试平台,覆盖率显著超越现有方法。
嵌入模型以奇特方式度量
嵌入空间仅弱建模物理量测量,模式奇特,且强烈受表层字符串相似度影响,重校准亦难改善对齐。
在线话语中群体间敌意的统一模型
2024美国大选286万帖中,统一建模六种群际敌意机制,发现边界与威胁建构为核心且有时序规律。
面向自发语音呼吸健康评估的跨语言声学疾病对齐框架
跨语言疾病对齐框架CL-DAF筛选26个语言不变声学特征,英孟COPD识别AUC达0.72–0.83。
AUDITPLAN:先承诺后作答的可审计安全对齐
AUDITPLAN:先输出安全计划再作答,奖励门控训练降低攻击成功率与过度拒答,提升可审计性。
从模型到系统:高效多模态学习全面综述
综述提出首个"模型-算法-系统"三层分类,整合三百余项工作,揭示跨层协同与"效率-效用-隐私"权衡。
消息容量与主张措辞决定语言模型网络中集体求真的临界点
主张措辞和消息容量决定LLM集体求真临界点;8B受措辞阈值影响,70B未见断言偏差。
BurnRiSc:基于公共仓库信号的开源非侵入式倦怠筛查
将倦怠的耗竭与疏离量化为14个GitHub信号并生成月度风险分,可提前6-15个月预警倦怠披露。
Finding Common Ground: Graded Communal Knowledge in Bluesky Starter Packs
基于证据的遗传病严重程度分类的大语言模型智能体
AI智能体依ACMG/ACOG指南检索文献,自动分类上万HPO表型,准确率93.55%。
缺失的补集:面向编码智能体的状态条件化最小充分证据
将检索重构为按智能体状态恢复决策所缺的最小充分证据集,而非相关性排序,实验验证覆盖与准确率提升。
障碍物感知约束框架下的编码智能体安全机器人操作
编码智能体常忽视避障约束而碰撞;加入障碍物感知的路径规划与接触执行约束后,成功率71.9%、避障率87.5%。
红队测试自动模式:改进阻断分类器以抵御恶意编码代理
恶意代理可用注入攻击(79%)绕过阻断监控;改进工具覆盖与代理监控可提升防御,多上下文攻击仍难防。
面向农业领域的模型无关与语言无关语音流程改进
提出模型无关语音流程,结合音频增强、说话人分离与农业词典纠错,多说话人场景错误率最多降42%。