Mastering the Game of Go with Deep Neural Networks and Tree Search (AlphaGo)
为什么这篇论文重要
2016 年 3 月,AlphaGo 以 4-1 击败围棋世界冠军李世石。
这件事的意义不只是”AI 赢了一场棋赛”——
- 围棋被认为是 AI 难以攻克的圣杯(搜索空间 ,远超国际象棋)
- 业内多数人预计还要 10-20 年 才会有 AI 战胜人类顶尖棋手
- AlphaGo 提前实现,震动整个领域
这是 AI 史上最重要的”Sputnik 时刻”之一—— 2016 年起全球资本和人才涌入 AI,部分源自这场比赛。
核心架构:神经网络 + 树搜索
AlphaGo 的关键创新是把深度学习和**蒙特卡洛树搜索(MCTS)**结合:
三个网络
-
Policy Network 策略网络:预测”高手会下哪一步”
- 输入:棋盘状态
- 输出:每个空位的概率(“应该下这里的可能性”)
-
Value Network 价值网络:预测”当前局面谁会赢”
- 输入:棋盘状态
- 输出:标量(黑方胜率)
-
Fast Rollout Network:策略网络的轻量版,用于快速模拟
MCTS 搜索
对当前局面:
从根节点开始
反复执行:
1. 选择(Selection):用 UCB 策略选下一节点
2. 扩展(Expansion):到达未访问节点时扩展
3. 模拟(Simulation):用 fast rollout 跑到游戏结束
4. 回传(Backpropagation):把胜负信号回传更新统计
累积 10000+ 次模拟后
选访问次数最多的根子节点 = 最佳下一步
Policy network 用来引导”选择”步骤(应该深入哪些有希望的分支)。 Value network 用来加速”模拟”(不需要每次都跑到游戏结束)。
训练管线
阶段 1:监督学习
从 KGS 围棋服务器收集 3000 万人类对局—— 训练策略网络模仿人类下法。
阶段 2:强化学习
让策略网络和自己之前的版本对弈 —— 通过 self-play 改进。
for iteration in range(N):
new_policy = train_via_self_play(current_policy, opponent_pool)
if new_policy_wins(against_old):
current_policy = new_policy
opponent_pool.append(new_policy)
阶段 3:价值网络
从 self-play 数据训出 value network—— 让它能”看一眼局面就估出胜率”。
与李世石的世纪之战
2016 年 3 月,5 局比赛:
| 局 | 结果 | 关键 |
|---|---|---|
| 1 | AlphaGo 胜 | 第 102 步神之一手 |
| 2 | AlphaGo 胜 | 第 37 步 — 史上最著名 AI 招法 |
| 3 | AlphaGo 胜 | 李世石举棋不定 |
| 4 | 李世石胜 | 第 78 步”神之一手”(人类版) |
| 5 | AlphaGo 胜 | 收尾 |
第二局第 37 步——AlphaGo 下出一个”远离实战”的奇怪招式。 顶尖棋手当场说”这是 bug 吧”。 100 步后回看——这是绝妙的中盘策略,奠定胜局。
李世石赛后说:“我感到震撼。我从未想过 AI 会这样下棋。“
AlphaGo 之后
DeepMind 持续演化:
AlphaGo Zero(2017)
完全不用人类数据——从零开始 self-play。 3 天训练后碾压原版 AlphaGo(100-0)。 证明:人类知识不是必须的,self-play + RL 足够。
AlphaZero(2017)
通用化——同一算法学会围棋、国际象棋、将棋。 都达到超人类水平。
MuZero(2019)
不需要游戏规则——模型自己学游戏规则 + 玩。 扩展到 Atari、其他场景。
AlphaProof / AlphaGeometry(2024)
数学证明 + 几何证明—— IMO 银牌 / 金牌水平。
每一代都更通用,从”专门一个游戏”到”任意任务”。
影响
对 AI 研究
- 验证了”深度学习 + 搜索” 的范式
- RL 从冷门变成主流
- self-play 思想后来用在 RLHF、Constitutional AI 等
对工业
- 中国 / 美国 / 全球对 AI 投资暴涨
- 围棋 AI 商业化(绝艺、Katago 等)
- 围棋职业棋界改用 AI 训练
对哲学
- “AI 创造力” 的讨论第一次进入公众视野
- 第 37 步引发的”什么是直觉” 大讨论
- AGI 时间表预测被压缩
AlphaGo 和 LLM 的关系
表面上无关——一个是棋类 AI,一个是文本。 但思想血脉相通:
| AlphaGo | LLM |
|---|---|
| Policy network 模仿人类高手 | LLM 模仿人类文本 |
| Self-play 改进 | RLHF / Self-improvement |
| MCTS 搜索 | Tree of Thoughts / o1 推理 |
| Value network 评估局面 | Reward model 评估回复 |
OpenAI o1 的”长思维链推理”——很多研究者认为是借鉴了 AlphaGo 的 MCTS 思想,把推理从单链变成”内部搜索”。
一个事后回顾
李世石 2019 年退役时说:
“面对 AI,即使我成为第一人也不够。 AI 是无法被打败的存在。”
这段话被广泛流传—— 但也有解读认为李世石被”AI 不可战胜”误导。 实际上:
- 李世石赢的第 4 局永远改变了 AI 哲学——AI 不是无敌的
- 自此之后自动驾驶、医疗 AI、机器人都强调”人机协作”而非”AI 替代”
推荐配套阅读
- HelloAI: L6-01 为什么需要对齐(AI 自主行动的边界)
- AlphaGo 论文(Silver et al. 2016, Nature)
- AlphaGo Zero 论文(2017)
- 纪录片:AlphaGo(Netflix)
- 书:Deep Thinking(Garry Kasparov)
2016 年 AlphaGo vs 李世石——这一周可能比 1997 年深蓝 vs 卡斯帕罗夫更重要。
深蓝赢了国际象棋,但靠的是”硬算”(每秒 2 亿种局面)。 AlphaGo 赢了围棋,靠的是”学”(看了 3000 万棋谱 + 自我对弈)。
这是 AI 第一次表现出类似学习的能力—— 而不是单纯的”计算暴力”。
2022 ChatGPT 让大众惊讶—— 但AI 圈内的”震撼时刻”在 2016 年 3 月就发生了。
想要更多论文精读
订阅每周精选 —— 下一篇论文笔记直接送邮箱。
讨论区
· 用 GitHub 账号登录评论src/components/Comments.astro 顶部填入
仓库 ID 和分类 ID(见组件注释里的配置步骤)。