关键数字
| 时间 | 里程碑 |
|---|---|
| 2016-02 | High-Flyer(幻方)量化基金成立(梁文锋) |
| 2023-07 | DeepSeek 公司成立 |
| 2024-12-25 | DeepSeek V3 发布(671B MoE) |
| 2025-01 | DeepSeek R1 发布——推理模型,性能对标 OpenAI o1 |
| 2025-01 | "震动美股"——NVIDIA 一周跌近 17% |
| 2025-2026 | 持续迭代 V3.1 / V3.5 / R2 / V4 |
训练成本(公司自报,有争议):
- V3 base:约 $5.58M(2.79M H800 GPU 小时)
- R1 增量训练:约 $294K
- 对比:OpenAI GPT-4(2023)训练成本约 $100M+
注:自报数字未包含人工 / 研发 / 数据采集 / 失败实验等全成本。完整 R&D 投入可能 10-50× 该数字。
它做对了什么
1. 母公司有 GPU 库存 + 算力研发 know-how
High-Flyer 是量化交易公司—— 早在 2020 年代初就**囤了大量 GPU 用于交易策略训练**。 这成为 DeepSeek 的"先发资本"。
美国出口管制后中国大模型团队都缺 GPU——只有 High-Flyer 仍有数千张 H800。
2. 真正的开源(不是 "开放权重")
DeepSeek 不只放权重,**论文 + 代码 + 训练 recipe 全公开**:
- V3 技术报告:完整训练细节
- R1 论文:第一次开源"推理模型 + RL"的完整路线
- Code 仓库:MIT License 商用友好
这让全球研究者立即能复现、改进、商用——形成"开源标杆"地位。
3. MoE + 工程优化的极致
V3 是 671B 参数 MoE 但**激活只用 37B**—— 推理成本和 70B dense 模型相当,但能力对标 GPT-4。
R1 论文展示了**纯 RL 训出推理能力**(不依赖大量 SFT)—— 这条路线被业界普遍认为是"o1 路径的中国版"。
4. API 极致便宜
DeepSeek API 价格典型为同档 OpenAI / Anthropic 的 **1/10 - 1/20**:
- V3 input: $0.27/M tokens (vs Claude Sonnet $3)
- R1 input: $0.55/M tokens (vs o3 $10)
结果:全球大量"价格敏感"应用切换到 DeepSeek + 兼容 OpenAI SDK。
5. "技术辐射" 而非"商业辐射"
DeepSeek 是少数公开宣称"不打算搞 B2C 应用"的前沿 lab—— 专注模型本身。结果:
- 不和应用层公司竞争 = 它们都用 DeepSeek 作为底座
- 反而获得了更深的 mindshare
- 对 NVIDIA 和西方 LLM 公司的"威慑性" 来自技术本身
它面临的挑战
1. 美国出口管制 → GPU 升级路径不确定
- H100 / H200 / B200 限制中国销售
- DeepSeek 现有 H800 是"次优替代"
- 下一代训练算力是大问号
2. 商业模式 + 收入
DeepSeek API 价格压得太低 = 盈利能力存疑。 靠 High-Flyer 的钱烧——这种模式能持续多久?
3. 监管 + 数据合规
- 中国监管:模型必须通过"算法备案"、内容审查
- 海外监管:欧盟 / 美国部分州对中国 AI 服务有限制
- 地缘政治不确定性会持续影响商业拓展
4. "300 人小团队 vs 30000 人巨头"
DeepSeek 团队比 OpenAI / Anthropic 小一个数量级。 短期是"高效"优势,长期是"研究广度"风险—— 多线投入(推理 / 多模态 / Agent / 机器人)需要规模。
5. 关键人物风险
梁文锋是技术 + 商业双核心。一旦他出问题(监管 / 健康 / 出走),公司方向可能动摇。
对你 / 我有什么启发
做模型 / AI 创业
- 限制是发明之母——GPU 短缺逼出 MoE / 训练效率创新
- 开源 + 低价 是中国 AI 公司的差异化招数 → 全球用户即时拥抱
- 聚焦"模型层",不下场抢应用 → 反而获得更深技术 mindshare
- 母公司算力 / 现金支持 是早期 LLM 创业的关键护城河
用 DeepSeek 的人
- API 极致便宜——大批量 / 后台任务的最优选
- R1 在推理 / 数学 / 代码上接近 o1 但价格 1/20
- **敏感数据**慎重——通过 DeepSeek 官方 API 数据流经中国
- 本地部署:V3 / R1 权重公开,可自行私有化
对地缘政治的启示
- "用算力卡住中国"的策略并不绝对——DeepSeek 证明算法 / 工程效率能部分补偿
- 开源模型让"中美 LLM 二元" 变成"中美 + 全球开源" 三元
- 对**全球应用开发者**——多了一个不绑定美西方的选项
开放问题
- "几百万训出 R1" 是否言过其实?完整 R&D 成本到底是多少?
- 下一代(V4 / V5)能不能在 H800 限制下保持竞争力?
- DeepSeek 会不会被中国政府要求"做大做强",反而失去当前的灵活性?
- 开源 + 低价的商业模式能不能撑过 3-5 年?