幕 / 从赢下一盘棋,到生成一个世界

第37手,走出了熟悉的棋路

AlphaGo带来的震动,来自胜利,也来自它找到的出人意料的策略。

本篇目录 +

2016年3月,首尔。AlphaGo与李世石的第二局比赛进行到第37手,机器下出了一步让许多职业棋手意外的棋。人们开始重新审视自己熟悉的棋盘。

一场比赛,两种难忘的瞬间

那一步成为这场比赛的象征之一。第四局,李世石的第78手也留下了著名的反转时刻。最终,AlphaGo以4比1赢得系列赛,李世石赢下第四局。

比赛的意义不只是“机器赢了”。人类设计的系统可能找到与人类习惯不同、却有价值的策略;同时,机器也会犯错,其表现需要在具体对局中分析。[1]

学习与搜索一起工作

AlphaGo结合神经网络、搜索与强化学习。网络帮助评估局面和可能的落点,搜索探索后续变化,训练则让系统根据经验改进。

围棋提供了清晰的规则、可判定的胜负与能够重复练习的环境。强化学习把注意力放在行动及其后果上:哪些选择更可能带来长远的好结果?[2]

自己练习,也需要条件

2017年的AlphaGo Zero减少了对人类棋谱的依赖,通过自我对弈学习。这与2016年对战李世石的版本不同;随后AlphaZero又探索了围棋、国际象棋和将棋。

“自学”并不意味着没有人的参与。研究者仍然规定规则、目标、结构与训练环境。现实生活的目标经常模糊,行动代价也未必可逆,因此不能把棋盘上的结论直接搬到社会里。[3][4]

留给你的一个问题

如果“赢”的定义不再清楚,机器应该依据什么来选择下一步?

机器下出了好棋,说明它有创造力吗?

如果把创造力理解为产生新颖且有价值的结果,这些棋步提供了值得讨论的例子。若把创造力定义为包含主观意图或体验,比赛本身并不能回答全部问题。

讨论一个能力词之前,先说明自己采用什么定义,能够减少许多看似激烈、实际谈论不同问题的争论。

故事里的人与想法

本篇来源

沿着原始资料,继续了解故事。团队发布与回顾代表发布者提供的记录。

  1. 团队发布与回顾 · Google/DeepMindWhat We Learned in Seoul with AlphaGo
  2. 研究论文与原著 · David Silver等Mastering the Game of Go with Deep Neural Networks and Tree Search
  3. 团队发布与回顾 · DeepMindAlphaGo Zero: Starting from Scratch
  4. 研究论文与原著 · David Silver等Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

整理于2026年9月16日