The Llama 4 Herd: Scout, Maverick, Behemoth — Meta 的首个 MoE 家族
为什么这篇论文重要
Llama 系列在开源 LLM 圈是基石——Llama 1 / 2 / 3 各代发布都是行业事件。 Llama 4 是 Meta 第一次用 MoE 架构,意味着:
- 开源生态从 dense → MoE 时代正式过渡
- 100B+ 大模型也能在合理硬件上跑(激活参数远小于总参数)
- 10M 上下文窗口——彻底超越 Gemini 1.5 Pro 的 2M
这是开源 LLM 工程能力的一次大跃迁。
三个模型
1. Scout(17B 激活 · 16 专家)
最小尺寸——但 10M 上下文:
| 维度 | 数值 |
|---|---|
| 激活参数 | 17B |
| 总参数 | 16 × 17B(含 routing) |
| 上下文窗口 | 10M tokens |
| 训练数据 | 30T+ tokens(多模态) |
| 目标 | 单 H100 部署 + 长上下文 |
意义:第一个开源的 10M context 模型——可以一次塞下整套法律案卷、整本小说、整个大型代码库。
2. Maverick(17B 激活 · 128 专家)
激活参数同 Scout,但专家数 8× → 更强:
- 多模态最强:图像理解 / OCR / 表格解析
- 数学 / 推理:对标 GPT-4o
- 适合 GPU 集群(多张 A100/H100)部署
3. Behemoth(288B 激活 · 16 专家 · 总 ~2T 参数)
Teacher model——未单独开源:
- 用于通过 codistillation 训练 Scout 和 Maverick
- 在数学 / 科学 / STEM benchmark 超越 GPT-4.5 / Claude 3.7 Sonnet / Gemini 2.0 Pro
技术创新
1. MoE 首次进入 Llama 家族
Meta 之前的 Llama 1/2/3 都是 dense 模型——为什么这次切到 MoE?
原因:
- 推理成本:MoE 总参数大但每次只激活一小部分
- 训练效率:MoE 在固定算力下学得比 dense 多
- DeepSeek V3 的示范:2024-12 DeepSeek V3 证明 MoE 可以做到前沿质量
Meta 用 16 / 128 专家两种配置——探索”专家粒度 vs 路由复杂度”权衡。
2. 原生多模态
不是”加一个 vision encoder 包装一下”—— Llama 4 训练数据从一开始就包含图像 + 视频。 30T tokens 包括 image / video data。
3. 10M 上下文(Scout)
Llama 3 是 128K。Llama 4 Scout 是 10M——80× 增长。
技术路线(论文细节有限,但业界推测):
- RoPE 频率调整 + 长文档训练
- 注意力变体(局部 + 全局 hybrid)
- 大量长上下文 supervised data
4. Codistillation 训练管线
Behemoth (teacher) → Scout / Maverick (student) 的蒸馏:
- Behemoth 单独训练(极贵)
- 然后用它生成大量”软标签” 给小模型学
- 小模型学到接近 teacher 的能力但成本低
License
Llama 4 仍是 “Open Weight” 而非真正开源:
- 权重公开下载(HuggingFace)
- 商用许可:< 7 亿 MAU 公司免费
- 7 亿+ MAU 公司(Google / Apple / Microsoft / Amazon / Meta)需单独商务谈判
- 训练数据 / 详细 recipe 仍部分保密
性能对比
| Benchmark | Scout | Maverick | Behemoth | GPT-4o | Claude 3.7 |
|---|---|---|---|---|---|
| MMLU-Pro | 75% | 80% | 86% | 82% | 84% |
| GPQA | 57% | 64% | 74% | 60% | 67% |
| MATH-500 | 78% | 85% | 92% | 86% | 88% |
注:数字来自 Meta 自报,第三方复现可能不同。
它的不足 / 争议
1. Behemoth 未开源
“Teacher model”未公开下载——开源社区无法完全复现。
2. “开放权重” 不等于开源
和 DeepSeek 的”代码 + 论文 + recipe 全公开” 相比,Meta 仍保留训练核心 know-how。
3. 10M 上下文的真实能力
公开 benchmark 上”haystack 测试” 准——但真实任务能否用好这 10M 仍有争议。 社区报告:超 1M 后效果下降明显。
4. MoE 部署复杂度
对中小公司:MoE 模型推理需要更多 GPU 显存(虽然激活少,但需要全部专家可被路由)。 工程难度高于 dense Llama 3。
影响
对开源生态
- MoE 成为新标杆:之后所有开源前沿模型都要权衡 dense vs MoE
- 10M context 民主化:原来只有 Gemini 闭源能做到长上下文 → 现在开源可用
- Hugging Face 生态:所有人能下、能 fine-tune、能私有部署
对 Meta 战略
- Meta 把 Llama 当作”绑定 AI 生态”的工具——既不直接收钱,又确保不被 OpenAI / Anthropic 锁死供应
- Llama 4 是 Meta AI(即将合并 Reality Labs)的基石
对国产开源(DeepSeek / Qwen / Kimi)
- 直接竞争——开源前沿模型的”美中两强”格局形成
- 后续 DeepSeek V4 等会向 Llama 4 看齐 + 反向超越
推荐配套阅读
- HelloAI L4-01 LLM 是怎么炼成的
- HelloAI L4-12 LLM 成本优化(MoE 部署细节)
- 论文:DeepSeek V3(MoE 同代对手)
- 论文:Llama 3 技术报告(前一代对照)
- The Llama 4 herd(Meta 官方)
Llama 4 = “开源 MoE + 10M 上下文 + 原生多模态” 三合一。 它让开源世界终于有了能和 GPT-4o / Claude 3.7 一战的旗舰模型。 但 Behemoth 不开源 + 训练 recipe 部分保密 = 开源精神打折扣。
真正完全开源的旗舰仍然是 DeepSeek——Llama 4 是”开放权重的最强”,DeepSeek 是”开源的最强”。
想要更多论文精读
订阅每周精选 —— 下一篇论文笔记直接送邮箱。
讨论区
· 用 GitHub 账号登录评论src/components/Comments.astro 顶部填入
仓库 ID 和分类 ID(见组件注释里的配置步骤)。