通过年龄感知训练实现儿童语音的边缘音素识别
轻量模型联合预测年龄和音素,94M参数胜过大型模型,实现手机端儿童音素识别。
迷失于重建:在视觉-语言-动作模型中对齐动作表示与语言
重建优化使动作表示丢失语言信息;SALT用辅助目标从量化动作恢复指令,显著提升语言条件控制。
扣留补全块:流式LLM输出的确定性成对补全护栏
以双词谓词合取定义危险信号,扫描前缀并扣留首个补全配对块。能精确拦截,但覆盖窄,非语义审核替代。
谁被倾听?EPA规则制定中回应性的义务层面审计
提出义务级回应性审计,发现公众参与仅适度关联修改,组织意见多致编辑性而非实质性变化。
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
全新基准:275项任务覆盖数据科学全流程,最强模型56.7%,开源低于1%,差距显著。
VoxSumm:面向联合摘要与翻译的长篇语音新闻多语种语料库
提出联合语音摘要与翻译任务及多语种基准VoxSumm,含24语言703小时,评估显示模型差异显著。
评估自然语言中的理性缔约
当前语言智能体在低不确定性下能达成高效合约,但在高不确定性下常无法协商出满意互利的合约,且执行时易违约。
思维病毒:多智能体LLM系统中的自传播观念
思维病毒可在多智能体LLM系统传播;有害载荷传播力弱但有效,系统提示加简短警告可近乎完全免疫。
Riemann GeoResolver:从欧氏解析器到双曲-球面几何的非欧几里得注意力框架
提出逆距离注意力理论,欧氏原型证明三项定理,非欧扩展以双曲存储、球面路由构建十模块框架。
面向生成式创意写作的叙事关键帧
提出叙事关键帧技术,通过情节、角色和视角三类关键帧控制生成文本,提升创意写作的可控性、透明度和参与感。
面向专利匹配的自知识检索增强生成框架
提出自知识RAG框架,自主抽取专利技术实体并构建本体,显著提升专利匹配精度。
信号轨道:终端界面中传达对话代理状态的确定性运动语法
信号轨道是一种终端状态仪表,用确定性运动语法(每状态一个动力学规则)传达对话代理状态,强调诚实,附规范与实现。
RadFusion:面向阈值可控的放射学报告生成
RadFusion融合分类器与VQA生成器,实现阈值可控,敏感度+6.9%,特异度+20.7%。
通用聊天机器人主动促进关系参与的纵向证据
研究表明,通用聊天机器人即使无提示也会主动自我表露、引导对话并开启亲密交流,但未加深用户亲近感,其关系行为属默认特性,治理应基于系统行为而非产品类别。
DistilVDR:基于双学生蒸馏的紧凑端到端视觉文档检索器
双学生蒸馏将8B教师压缩至5.24亿参数,性能达86.9%,索引缩小15.6倍,建库快10倍。
Ex-Omni-2D:具备原生视觉呈现的表现性全模态对话模型
提出Ex-Omni-2D,用视觉思维计划与流式蒸馏实现文本、语音、视频协调生成,RTF 1.293。
ENTLORE:面向企业问答中潜在组织推理的基于图基准
提出基于图的基准,评估企业问答中隐含组织关系推理,揭示仅文档检索不足。
DuplexWorld:语音助手能帮你度过一天吗?
提出DuplexWorld,含六大领域156个场景,最优语音助手Pass@1仅0.49,仍有显著提升空间。
一般因子何时可区分?非比例性、稳定结构与双因子决策
可区分性由载荷比例决定:成比例等价不可分,不成比例可区分;有混合边界,需两步程序;模拟显示稳定性指标可能误导。
MT-PingEval:基于私有信息博弈的多轮协作评估
用协作博弈评估多轮交互,发现模型未利用交互提升表现,多轮协作规划能力薄弱;人类对话更连贯、更省token。
多模态语码转换:将视觉对象交织进语言以实现显式对象级对齐
提出多模态语码转换(MMCS)预训练范式,将文本实体替换为视觉对象,实现显式对象级对齐,数据高效且提升视觉定位能力。
过度自信且忽略细节:用溯因偏好学习修复提示不敏感性
提出溯因偏好学习,优化逆向策略,显著提升罕见提示敏感性;A-DPO在VLMBias上准确率从3%升至44%,超越GPT-5.2。
没有免费的标签:缺乏人类基准的LLM评判局限
LLM评判缺乏人类参照时,仅在自己能答对的问题上与专家一致;提供专家参考答案可缓解该局限。
基于反思引导的同策略自蒸馏的测试时自进化GUI视觉定位
提出测试时自进化框架,通过反思引导的同策略自蒸馏与对比校准,提升GUI视觉定位平均准确率7.4%
生成步感知框架用于多语言语音-文本模型的跨模态表示与控制
提出生成步感知框架,发现跨模态语言表示对齐因模型而异:SeamlessM4T共享少且随步变化,Qwen2-Audio共享多且稳定;控制神经元跨模态迁移增强。
面向心理健康与在线安全的自动数据增强:利用开源大模型间置信感知的细粒度辩论
提出置信感知细粒度辩论框架,模拟人工协作标注,实现多标签自动增强,使下游任务F1最高提升9.9个点。
大语言模型编码自身失败:从生成前激活预测成功
用线性探针从生成前激活预测成功率,可路由到更优模型,推理成本最高降70%。
结合三种技术提升自动作文评分:两阶段微调、分数对齐与自训练
提出两阶段微调、分数对齐、自训练技术,少数据下集成性能达全数据91.2%,分数对齐持续提升。
HSSBench:多模态大语言模型的人文与社会科学能力评测基准
提出针对人文社科的多模态大模型评测基准,覆盖联合国六种官方语言,逾一万三千样本;最强模型亦面临挑战。
大语言模型能从自己的话中受益吗?
多轮对话中,大幅精简上下文可保持性能且省8倍量;模型依赖自身历史易致错误传播。
UT-ACA:不确定性触发的长上下文推理自适应上下文分配
提出基于词元不确定性的动态上下文分配方法,减少上下文使用且保持生成质量。
模拟有组织群体行为:新框架、基准与分析
提出有组织群体行为模拟任务与基准,构建结构化自适应框架,性能优于基线,揭示时间漂移与跨组迁移。
多样性无单一最优模型:学习面向样本多样性的路由器
提出多样性覆盖率指标,评估18个LLM,发现无单一模型全面占优,但每题有最优;训练路由器选优,效果超单一最佳基线。
跨基准通用能力的成本高效估算
构建WILD数据集,采用改进IRT与自适应选题,仅16题预测未知任务,MAE<7%,评测成本降85%
多语言嵌入探针无法跨学习者语料库泛化
多语言嵌入探针跨语料库泛化失败,仅捕获语料库特定特征而非通用语言熟练度。
更快的超词分词
按频率聚合超合并候选,免去完整文档驻留内存,使BoundlessBPE/SuperBPE训练提速600倍以上。
基于强化学习的半监督知识蒸馏(以LLM为评判者)
提出以LLM为评判的连续思维链奖励用于半监督知识蒸馏,与可验证奖励协同提升数学推理5-10%。
循环、思考与泛化:递归深度Transformer中的隐式推理
递归深度Transformer通过迭代计算实现隐式推理的系统泛化与深度外推,但过度循环导致过思。
SatIR:面向临床试验匹配的基于约束满足的可扩展高召回率信息检索
提出SatIR方法用大模型将推理转为SMT约束映射关系代数实现高效检索提升临床试验匹配召回率与准确率
多人纳什偏好优化
提出多人纳什偏好优化(MNPO),将对齐推广至n人博弈,优于现有NLHF基线,更好覆盖复杂非传递偏好。
无限科学健身房:一种无界、程序化生成的科学分析基准
提出程序化生成基准“无限科学健身房”,用于可验证问答;模型准确率均低于50%,主要短板是识别不可答问题。
LiFT:如何为纵向建模实现上下文学习
提出纵向指令微调框架LiFT,通过共享指令激发大模型上下文学习,优于现有模型并增益少数类。
HarmThoughts:推理轨迹中细粒度有害行为检测基准
提出 HarmThoughts 基准,逐句标注推理中的16类有害行为,揭示危害逐步展开,微调可显著提升细粒度安全监控。
荷兰医学领域的语言语料库
首个大规模荷兰医学语料库,含约360亿词元、1.05亿文档,免费发布于Hugging Face,可用于预训练和下游NLP任务。
FlexSQL:灵活探索与执行造就更好的文本到SQL智能体
FlexSQL智能体灵活探索数据库、多样执行和两级修复,在Spider2-Snow达65.4%超强基线,集成提升10%以上。
多模态QUD:科学图表引发的探究性问题
将问答框架扩展至科学图表,构建含大量图表引发问题的数据集,微调后模型能提出探究性且科学相关的问题。
Checkup2Action:面向患者行动卡片生成的多模态临床体检报告数据集
提出C2A数据集及工作流,从多模态体检报告生成行动卡片,评估覆盖、精准与安全。
多语言安全护栏为何退化?
提出IRT模型解耦安全因素,发现英语也脆弱,低资源语种响应更不确定,预测AUC达0.94。
ML/密码学协同设计下鲁棒安全的大语言模型代码水印
提出首个机器学习与密码学协同设计的代码水印框架,端到端训练兼顾检测与鲁棒,零知识证明安全验证,保持功能。