HelloAI
🇨🇳 开源模型

DeepSeek:对冲基金做出来的开源 LLM

杭州一家量化对冲基金(High-Flyer)孵化的 AI 公司—— 用 $6M 训出 V3、$294K 训出 R1, 震动整个西方 AI 圈。

关键数字

时间里程碑
2016-02High-Flyer(幻方)量化基金成立(梁文锋)
2023-07DeepSeek 公司成立
2024-12-25DeepSeek V3 发布(671B MoE)
2025-01DeepSeek R1 发布——推理模型,性能对标 OpenAI o1
2025-01"震动美股"——NVIDIA 一周跌近 17%
2025-2026持续迭代 V3.1 / V3.5 / R2 / V4

训练成本(公司自报,有争议)

  • V3 base:约 $5.58M(2.79M H800 GPU 小时)
  • R1 增量训练:约 $294K
  • 对比:OpenAI GPT-4(2023)训练成本约 $100M+

注:自报数字未包含人工 / 研发 / 数据采集 / 失败实验等全成本。完整 R&D 投入可能 10-50× 该数字。

它做对了什么

1. 母公司有 GPU 库存 + 算力研发 know-how

High-Flyer 是量化交易公司—— 早在 2020 年代初就**囤了大量 GPU 用于交易策略训练**。 这成为 DeepSeek 的"先发资本"。

美国出口管制后中国大模型团队都缺 GPU——只有 High-Flyer 仍有数千张 H800。

2. 真正的开源(不是 "开放权重")

DeepSeek 不只放权重,**论文 + 代码 + 训练 recipe 全公开**:

  • V3 技术报告:完整训练细节
  • R1 论文:第一次开源"推理模型 + RL"的完整路线
  • Code 仓库:MIT License 商用友好

这让全球研究者立即能复现、改进、商用——形成"开源标杆"地位。

3. MoE + 工程优化的极致

V3 是 671B 参数 MoE 但**激活只用 37B**—— 推理成本和 70B dense 模型相当,但能力对标 GPT-4。

R1 论文展示了**纯 RL 训出推理能力**(不依赖大量 SFT)—— 这条路线被业界普遍认为是"o1 路径的中国版"。

4. API 极致便宜

DeepSeek API 价格典型为同档 OpenAI / Anthropic 的 **1/10 - 1/20**:

  • V3 input: $0.27/M tokens (vs Claude Sonnet $3)
  • R1 input: $0.55/M tokens (vs o3 $10)

结果:全球大量"价格敏感"应用切换到 DeepSeek + 兼容 OpenAI SDK。

5. "技术辐射" 而非"商业辐射"

DeepSeek 是少数公开宣称"不打算搞 B2C 应用"的前沿 lab—— 专注模型本身。结果:

  • 不和应用层公司竞争 = 它们都用 DeepSeek 作为底座
  • 反而获得了更深的 mindshare
  • 对 NVIDIA 和西方 LLM 公司的"威慑性" 来自技术本身

它面临的挑战

1. 美国出口管制 → GPU 升级路径不确定

  • H100 / H200 / B200 限制中国销售
  • DeepSeek 现有 H800 是"次优替代"
  • 下一代训练算力是大问号

2. 商业模式 + 收入

DeepSeek API 价格压得太低 = 盈利能力存疑。 靠 High-Flyer 的钱烧——这种模式能持续多久?

3. 监管 + 数据合规

  • 中国监管:模型必须通过"算法备案"、内容审查
  • 海外监管:欧盟 / 美国部分州对中国 AI 服务有限制
  • 地缘政治不确定性会持续影响商业拓展

4. "300 人小团队 vs 30000 人巨头"

DeepSeek 团队比 OpenAI / Anthropic 小一个数量级。 短期是"高效"优势,长期是"研究广度"风险—— 多线投入(推理 / 多模态 / Agent / 机器人)需要规模。

5. 关键人物风险

梁文锋是技术 + 商业双核心。一旦他出问题(监管 / 健康 / 出走),公司方向可能动摇。

对你 / 我有什么启发

做模型 / AI 创业

  • 限制是发明之母——GPU 短缺逼出 MoE / 训练效率创新
  • 开源 + 低价 是中国 AI 公司的差异化招数 → 全球用户即时拥抱
  • 聚焦"模型层",不下场抢应用 → 反而获得更深技术 mindshare
  • 母公司算力 / 现金支持 是早期 LLM 创业的关键护城河

用 DeepSeek 的人

  • API 极致便宜——大批量 / 后台任务的最优选
  • R1 在推理 / 数学 / 代码上接近 o1 但价格 1/20
  • **敏感数据**慎重——通过 DeepSeek 官方 API 数据流经中国
  • 本地部署:V3 / R1 权重公开,可自行私有化

对地缘政治的启示

  • "用算力卡住中国"的策略并不绝对——DeepSeek 证明算法 / 工程效率能部分补偿
  • 开源模型让"中美 LLM 二元" 变成"中美 + 全球开源" 三元
  • 对**全球应用开发者**——多了一个不绑定美西方的选项

开放问题

  • "几百万训出 R1" 是否言过其实?完整 R&D 成本到底是多少?
  • 下一代(V4 / V5)能不能在 H800 限制下保持竞争力?
  • DeepSeek 会不会被中国政府要求"做大做强",反而失去当前的灵活性?
  • 开源 + 低价的商业模式能不能撑过 3-5 年?

外部资料

相关