HelloAI
📄 论文精读 🏆 必读经典 · 2016 · DeepMind · Nature 2016

Mastering the Game of Go with Deep Neural Networks and Tree Search (AlphaGo)

David Silver, Aja Huang, et al. (DeepMind)
📖 如果你只读一段,读这段
DeepMind 2016 年的 AlphaGo 在围棋上打败李世石——是 AI 史上的"Sputnik 时刻"。深度学习 + 蒙特卡洛树搜索的组合,启发了后来所有 RL 进展。
#AlphaGo#RL#DeepMind#AI 史#必读#经典

为什么这篇论文重要

2016 年 3 月,AlphaGo 以 4-1 击败围棋世界冠军李世石

这件事的意义不只是”AI 赢了一场棋赛”——

  • 围棋被认为是 AI 难以攻克的圣杯(搜索空间 1017010^{170},远超国际象棋)
  • 业内多数人预计还要 10-20 年 才会有 AI 战胜人类顶尖棋手
  • AlphaGo 提前实现,震动整个领域

这是 AI 史上最重要的”Sputnik 时刻”之一—— 2016 年起全球资本和人才涌入 AI,部分源自这场比赛。

核心架构:神经网络 + 树搜索

AlphaGo 的关键创新是把深度学习和**蒙特卡洛树搜索(MCTS)**结合:

三个网络

  1. Policy Network 策略网络:预测”高手会下哪一步”

    • 输入:棋盘状态
    • 输出:每个空位的概率(“应该下这里的可能性”)
  2. Value Network 价值网络:预测”当前局面谁会赢”

    • 输入:棋盘状态
    • 输出:标量(黑方胜率)
  3. Fast Rollout Network:策略网络的轻量版,用于快速模拟

MCTS 搜索

对当前局面:
  从根节点开始
  反复执行:
    1. 选择(Selection):用 UCB 策略选下一节点
    2. 扩展(Expansion):到达未访问节点时扩展
    3. 模拟(Simulation):用 fast rollout 跑到游戏结束
    4. 回传(Backpropagation):把胜负信号回传更新统计
  累积 10000+ 次模拟后
  选访问次数最多的根子节点 = 最佳下一步

Policy network 用来引导”选择”步骤(应该深入哪些有希望的分支)。 Value network 用来加速”模拟”(不需要每次都跑到游戏结束)。

训练管线

阶段 1:监督学习

从 KGS 围棋服务器收集 3000 万人类对局—— 训练策略网络模仿人类下法。

阶段 2:强化学习

让策略网络和自己之前的版本对弈 —— 通过 self-play 改进。

for iteration in range(N):
    new_policy = train_via_self_play(current_policy, opponent_pool)
    if new_policy_wins(against_old):
        current_policy = new_policy
        opponent_pool.append(new_policy)

阶段 3:价值网络

从 self-play 数据训出 value network—— 让它能”看一眼局面就估出胜率”。

与李世石的世纪之战

2016 年 3 月,5 局比赛:

结果关键
1AlphaGo 胜第 102 步神之一手
2AlphaGo 胜第 37 步 — 史上最著名 AI 招法
3AlphaGo 胜李世石举棋不定
4李世石胜第 78 步”神之一手”(人类版)
5AlphaGo 胜收尾

第二局第 37 步——AlphaGo 下出一个”远离实战”的奇怪招式。 顶尖棋手当场说”这是 bug 吧”。 100 步后回看——这是绝妙的中盘策略,奠定胜局。

李世石赛后说:“我感到震撼。我从未想过 AI 会这样下棋。“

AlphaGo 之后

DeepMind 持续演化:

AlphaGo Zero(2017)

完全不用人类数据——从零开始 self-play。 3 天训练后碾压原版 AlphaGo(100-0)。 证明:人类知识不是必须的,self-play + RL 足够。

AlphaZero(2017)

通用化——同一算法学会围棋、国际象棋、将棋。 都达到超人类水平。

MuZero(2019)

不需要游戏规则——模型自己学游戏规则 + 玩。 扩展到 Atari、其他场景。

AlphaProof / AlphaGeometry(2024)

数学证明 + 几何证明—— IMO 银牌 / 金牌水平

每一代都更通用,从”专门一个游戏”到”任意任务”。

影响

对 AI 研究

  • 验证了”深度学习 + 搜索” 的范式
  • RL 从冷门变成主流
  • self-play 思想后来用在 RLHF、Constitutional AI 等

对工业

  • 中国 / 美国 / 全球对 AI 投资暴涨
  • 围棋 AI 商业化(绝艺、Katago 等)
  • 围棋职业棋界改用 AI 训练

对哲学

  • “AI 创造力” 的讨论第一次进入公众视野
  • 第 37 步引发的”什么是直觉” 大讨论
  • AGI 时间表预测被压缩

AlphaGo 和 LLM 的关系

表面上无关——一个是棋类 AI,一个是文本。 但思想血脉相通:

AlphaGoLLM
Policy network 模仿人类高手LLM 模仿人类文本
Self-play 改进RLHF / Self-improvement
MCTS 搜索Tree of Thoughts / o1 推理
Value network 评估局面Reward model 评估回复

OpenAI o1 的”长思维链推理”——很多研究者认为是借鉴了 AlphaGo 的 MCTS 思想,把推理从单链变成”内部搜索”。

一个事后回顾

李世石 2019 年退役时说:

“面对 AI,即使我成为第一人也不够。 AI 是无法被打败的存在。”

这段话被广泛流传—— 但也有解读认为李世石被”AI 不可战胜”误导。 实际上:

  • 李世石赢的第 4 局永远改变了 AI 哲学——AI 不是无敌的
  • 自此之后自动驾驶、医疗 AI、机器人都强调”人机协作”而非”AI 替代”

推荐配套阅读

  • HelloAI: L6-01 为什么需要对齐(AI 自主行动的边界)
  • AlphaGo 论文(Silver et al. 2016, Nature)
  • AlphaGo Zero 论文(2017)
  • 纪录片:AlphaGo(Netflix)
  • 书:Deep Thinking(Garry Kasparov)
💡 历史地位

2016 年 AlphaGo vs 李世石——这一周可能比 1997 年深蓝 vs 卡斯帕罗夫更重要。

深蓝赢了国际象棋,但靠的是”硬算”(每秒 2 亿种局面)。 AlphaGo 赢了围棋,靠的是””(看了 3000 万棋谱 + 自我对弈)。

这是 AI 第一次表现出类似学习的能力—— 而不是单纯的”计算暴力”。

2022 ChatGPT 让大众惊讶—— 但AI 圈内的”震撼时刻”在 2016 年 3 月就发生了

📬

想要更多论文精读

订阅每周精选 —— 下一篇论文笔记直接送邮箱。

💬

讨论区

· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 —— 在 src/components/Comments.astro 顶部填入 仓库 ID 和分类 ID(见组件注释里的配置步骤)。