model · 2024/12/6 18:00:00
Meta 发布 Llama 3.3 70B:70B 性能接近 405B 旗舰
Llama 3.3 70B 通过改进训练 + 后训练对齐,让 70B 模型在多数基准上接近 Llama 3.1 405B。推理 / 部署成本大幅降低,开源生态获益。
来源:Meta AI
查看原文 →
Meta 发布 Llama 3.3 70B-Instruct —— 用 70B 参数追上自家 405B 旗舰的性能。
主要数字(对比 Llama 3.1 405B):
| Benchmark | Llama 3.3 70B | Llama 3.1 405B |
|---|---|---|
| MMLU | 86.0 | 88.6 |
| HumanEval | 88.4 | 89.0 |
| MATH | 77.0 | 73.8 |
| GPQA | 50.5 | 50.7 |
| IFEval | 92.1 | 88.6 |
70B 在多个基准上反超 405B——主要靠 改进的后训练(post-training)方法。
关键改进:
- 在线 DPO(动态偏好优化)
- 改进的拒绝采样
- 增加合成数据
- 工具调用准确度提升
部署成本:
- 70B 单 H100 80GB 可跑(4-bit 量化)
- 405B 需要 8× H100
- 5-10× 成本差异——但精度只差 2-5%
编辑批注:Llama 3.3 是”知识蒸馏 + 后训练”在中等模型上的胜利。证明继续扩参数不是唯一路 —— 改进训练方法的边际收益越来越大。 对开源社区是好消息:能用 70B 干 405B 的活,成本结构友好得多。