HelloAI
📄 论文精读 🏆 必读经典 · 2025 · Meta AI · Blog 2025-04

The Llama 4 Herd: Scout, Maverick, Behemoth — Meta 的首个 MoE 家族

Meta AI (Llama Team)
📖 如果你只读一段,读这段
Meta 2025-04-05 发布 Llama 4 家族——Scout(17B 激活 / 16 专家 / 10M 上下文)、Maverick(17B 激活 / 128 专家)、Behemoth(288B 激活 / 16 专家 / 总 2T 参数)。Meta 首次用 MoE 架构,10M context 超越所有同期模型。Behemoth 作为 teacher model 用 codistillation 训出前两者。
#Llama 4#MoE#Meta#Open Weight#必读#经典

为什么这篇论文重要

Llama 系列在开源 LLM 圈是基石——Llama 1 / 2 / 3 各代发布都是行业事件。 Llama 4 是 Meta 第一次用 MoE 架构,意味着:

  • 开源生态从 dense → MoE 时代正式过渡
  • 100B+ 大模型也能在合理硬件上跑(激活参数远小于总参数)
  • 10M 上下文窗口——彻底超越 Gemini 1.5 Pro 的 2M

这是开源 LLM 工程能力的一次大跃迁。

三个模型

1. Scout(17B 激活 · 16 专家)

最小尺寸——但 10M 上下文

维度数值
激活参数17B
总参数16 × 17B(含 routing)
上下文窗口10M tokens
训练数据30T+ tokens(多模态)
目标单 H100 部署 + 长上下文

意义:第一个开源的 10M context 模型——可以一次塞下整套法律案卷、整本小说、整个大型代码库。

2. Maverick(17B 激活 · 128 专家)

激活参数同 Scout,但专家数 8× → 更强:

  • 多模态最强:图像理解 / OCR / 表格解析
  • 数学 / 推理:对标 GPT-4o
  • 适合 GPU 集群(多张 A100/H100)部署

3. Behemoth(288B 激活 · 16 专家 · 总 ~2T 参数)

Teacher model——未单独开源:

  • 用于通过 codistillation 训练 Scout 和 Maverick
  • 在数学 / 科学 / STEM benchmark 超越 GPT-4.5 / Claude 3.7 Sonnet / Gemini 2.0 Pro

技术创新

1. MoE 首次进入 Llama 家族

Meta 之前的 Llama 1/2/3 都是 dense 模型——为什么这次切到 MoE?

原因:

  • 推理成本:MoE 总参数大但每次只激活一小部分
  • 训练效率:MoE 在固定算力下学得比 dense 多
  • DeepSeek V3 的示范:2024-12 DeepSeek V3 证明 MoE 可以做到前沿质量

Meta 用 16 / 128 专家两种配置——探索”专家粒度 vs 路由复杂度”权衡。

2. 原生多模态

不是”加一个 vision encoder 包装一下”—— Llama 4 训练数据从一开始就包含图像 + 视频。 30T tokens 包括 image / video data。

3. 10M 上下文(Scout)

Llama 3 是 128K。Llama 4 Scout 是 10M——80× 增长

技术路线(论文细节有限,但业界推测):

  • RoPE 频率调整 + 长文档训练
  • 注意力变体(局部 + 全局 hybrid)
  • 大量长上下文 supervised data

4. Codistillation 训练管线

Behemoth (teacher) → Scout / Maverick (student) 的蒸馏:

  • Behemoth 单独训练(极贵)
  • 然后用它生成大量”软标签” 给小模型学
  • 小模型学到接近 teacher 的能力但成本低

License

Llama 4 仍是 “Open Weight” 而非真正开源

  • 权重公开下载(HuggingFace)
  • 商用许可:< 7 亿 MAU 公司免费
  • 7 亿+ MAU 公司(Google / Apple / Microsoft / Amazon / Meta)需单独商务谈判
  • 训练数据 / 详细 recipe 仍部分保密

性能对比

BenchmarkScoutMaverickBehemothGPT-4oClaude 3.7
MMLU-Pro75%80%86%82%84%
GPQA57%64%74%60%67%
MATH-50078%85%92%86%88%

注:数字来自 Meta 自报,第三方复现可能不同。

它的不足 / 争议

1. Behemoth 未开源

“Teacher model”未公开下载——开源社区无法完全复现。

2. “开放权重” 不等于开源

和 DeepSeek 的”代码 + 论文 + recipe 全公开” 相比,Meta 仍保留训练核心 know-how。

3. 10M 上下文的真实能力

公开 benchmark 上”haystack 测试” 准——但真实任务能否用好这 10M 仍有争议。 社区报告:超 1M 后效果下降明显。

4. MoE 部署复杂度

对中小公司:MoE 模型推理需要更多 GPU 显存(虽然激活少,但需要全部专家可被路由)。 工程难度高于 dense Llama 3。

影响

对开源生态

  • MoE 成为新标杆:之后所有开源前沿模型都要权衡 dense vs MoE
  • 10M context 民主化:原来只有 Gemini 闭源能做到长上下文 → 现在开源可用
  • Hugging Face 生态:所有人能下、能 fine-tune、能私有部署

对 Meta 战略

  • Meta 把 Llama 当作”绑定 AI 生态”的工具——既不直接收钱,又确保不被 OpenAI / Anthropic 锁死供应
  • Llama 4 是 Meta AI(即将合并 Reality Labs)的基石

对国产开源(DeepSeek / Qwen / Kimi)

  • 直接竞争——开源前沿模型的”美中两强”格局形成
  • 后续 DeepSeek V4 等会向 Llama 4 看齐 + 反向超越

推荐配套阅读

💡 一句话总结

Llama 4 = “开源 MoE + 10M 上下文 + 原生多模态” 三合一。 它让开源世界终于有了能和 GPT-4o / Claude 3.7 一战的旗舰模型。 但 Behemoth 不开源 + 训练 recipe 部分保密 = 开源精神打折扣。

真正完全开源的旗舰仍然是 DeepSeek——Llama 4 是”开放权重的最强”,DeepSeek 是”开源的最强”。

📬

想要更多论文精读

订阅每周精选 —— 下一篇论文笔记直接送邮箱。

💬

讨论区

· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 —— 在 src/components/Comments.astro 顶部填入 仓库 ID 和分类 ID(见组件注释里的配置步骤)。