MiniMax-H3-Turbo-Lora 模型介绍
推出 MiniMax-H3-Turbo-Lora,附相关链接。
迈向多模态预训练的物理原理
探索多模态预训练中的知识流动、模态协同、早期统一与配方,揭示其内在规律。
MerchantBench:在电商运营中评估大语言模型智能体的长期连贯性
提出MerchantBench基准,衡量LLM智能体在电商运营中的长期连贯性。
双锚定策略蒸馏
提出双锚定策略蒸馏方法,利用双重锚点提升策略迁移稳定性与性能。
长程任务框架:推进面向现实世界的长程智能体
提出LongHorizon-Harness框架,旨在推动智能体在真实世界任务中的长程决策与执行能力。
Qwen-UI-Agent技术报告
该报告提出Qwen-UI-Agent,面向下一代真实世界中心的图形用户界面基础智能体。
探索性建模:解锁第三个预训练轴与端到端生成
探索性建模提出新预训练轴,实现端到端生成。
@_akhaliq: DeepSeek-V4-Flash-0731 发布
DeepSeek-V4-Flash-0731已发布,附链接。
ID-V2V:身份保持的视频重风格化
提出ID-V2V方法,实现视频风格化时保持人物身份特征不变。
CoRT:用于Token级别评分引导策略优化的反事实重放
提出CoRT方法,通过反事实重放与Token级评分引导,优化策略性能。
TurboVLA
TurboVLA是实时视觉-语言-动作模型,在RTX 4090上以32Hz运行,显存小于1GB。
相关性的新角色
相关性在智能搜索中扮演新角色,引导语料库交互。
HiFi-UMI:仅从高保真UMI数据学习可部署的操作策略
仅从高保真UMI数据学习可部署的操作策略。
@_akhaliq: A.X K2 刚刚在 Hugging Face 上发布
A.X K2模型(大型稀疏MoE,688B参数/33B激活)已上线Hugging Face。
从专有到开源
通过多智能体协议蒸馏弥合智能体搜索中的分布差距
StateAct:面向长程电脑操作的代理,程序状态优先于像素
论文提出StateAct方法,强调在长程电脑使用代理中优先处理程序状态而非像素信息。
@_akhaliq:通过 hf Claude 在 Claude Code 中使用 Kimi K3
介绍通过 hf Claude 在 Claude Code 中集成 Kimi K3 的方法。
@_akhaliq: Kimi K3 发布
Kimi K3 已正式发布。
Apple-π:用视频进行思考的基准测试,迈向基于法则的物理智能
提出Apple-π基准,通过视频推理评估物理法则理解,推动物理智能发展。
SLAI T-Rex:在昇腾超算集群上对DeepSeek-V4系列进行全参数后训练
在昇腾超算集群上全参数后训练DeepSeek-V4系列,提升模型性能。
在开放权重语言模型中读取与引导材料科学机制的表示
研究在开放权重语言模型中读取和引导材料科学机制表征的方法。
DataFlow-Harness:可编辑LLM数据管道的代码智能体平台
基于代码智能体构建可编辑的大语言模型数据管道平台。
@_akhaliq:Solar Open2 250B 刚刚在 Hugging Face 发布
Solar Open2 250B 模型已上线 Hugging Face。
@_akhaliq: ABot-World-0
单个桌面GPU即可运行无限交互世界
苹果提出无需环境的API调用代理合成数据生成方法
苹果提出无需真实环境的合成数据生成技术,用于训练API调用代理
@_akhaliq: Motif-3-Beta 刚刚在 Hugging Face 上线
发布 314B 总参数/13B 激活的稀疏 MoE 模型,支持 256K 上下文、多语言通用。
VideoChat3
完全开放的高效通用视频理解MLLM
@_akhaliq: thinkingmachines Inkling is now available in claude code via hf claude https://t.co/r1HWiGqtIU
弱到强泛化:直接在线策略蒸馏
直接在线策略蒸馏方法实现弱模型引导强模型泛化,提升AI对齐性能。
@_akhaliq: Bonsai 27B 现可通过 Claude Code 中的 hf Claude 获取
Bonsai 27B 模型已集成至 Claude Code,通过 hf Claude 可直接使用。
面向语言智能的可扩展视觉预训练
通过大规模视觉预训练提升语言智能,实现可扩展的跨模态学习。
长程终端基准
通过密集奖励评分测试智能体在长时域终端任务中极限性能的基准。
视频生成模型是通用视觉学习者
视频生成模型可应用于多种视觉任务,展现通用学习能力。
OPSD-V:后训练少步自回归视频生成器的在策略自蒸馏
提出在线策略自蒸馏,优化少步自回归视频生成器后训练。
@_akhaliq:Vidu S1
Vidu S1是一个实时交互式视频生成模型。
@_akhaliq:LingBot-World 2.0(无限版)已在Hugging Face发布
零质量漂移的长时生成,支持丰富动作事件,导演智能体驱动实时演化。
@_akhaliq: LingBot-Video 已在 Hugging Face 发布
基于MoE的具身智能视频基础模型,30B参数推理仅激活3B,利用7万小时具身数据增强。
RynnWorld-4D
4D具身世界模型助力机器人操作
Gemma 4 技术报告
Gemma 4 技术报告发布
@_akhaliq: Wan-Streamer v0.2
Wan-Streamer v0.2 实现更高分辨率,延迟不变。
@_akhaliq:PixWorld
在像素空间中统一3D场景生成与重建
密集空间感知的视觉预训练
提出视觉预训练方法,用于提升密集空间感知任务性能。