第四幕 / 从赢下一盘棋,到生成一个世界
第37手,走出了熟悉的棋路
AlphaGo带来的震动,来自胜利,也来自它找到的出人意料的策略。
本篇目录 +
2016年3月,首尔。AlphaGo与李世石的第二局比赛进行到第37手,机器下出了一步让许多职业棋手意外的棋。人们开始重新审视自己熟悉的棋盘。
一场比赛,两种难忘的瞬间
那一步成为这场比赛的象征之一。第四局,李世石的第78手也留下了著名的反转时刻。最终,AlphaGo以4比1赢得系列赛,李世石赢下第四局。
比赛的意义不只是“机器赢了”。人类设计的系统可能找到与人类习惯不同、却有价值的策略;同时,机器也会犯错,其表现需要在具体对局中分析。[1]
学习与搜索一起工作
AlphaGo结合神经网络、搜索与强化学习。网络帮助评估局面和可能的落点,搜索探索后续变化,训练则让系统根据经验改进。
围棋提供了清晰的规则、可判定的胜负与能够重复练习的环境。强化学习把注意力放在行动及其后果上:哪些选择更可能带来长远的好结果?[2]
自己练习,也需要条件
2017年的AlphaGo Zero减少了对人类棋谱的依赖,通过自我对弈学习。这与2016年对战李世石的版本不同;随后AlphaZero又探索了围棋、国际象棋和将棋。
“自学”并不意味着没有人的参与。研究者仍然规定规则、目标、结构与训练环境。现实生活的目标经常模糊,行动代价也未必可逆,因此不能把棋盘上的结论直接搬到社会里。[3][4]
留给你的一个问题
如果“赢”的定义不再清楚,机器应该依据什么来选择下一步?
机器下出了好棋,说明它有创造力吗?
如果把创造力理解为产生新颖且有价值的结果,这些棋步提供了值得讨论的例子。若把创造力定义为包含主观意图或体验,比赛本身并不能回答全部问题。
讨论一个能力词之前,先说明自己采用什么定义,能够减少许多看似激烈、实际谈论不同问题的争论。
本篇来源
沿着原始资料,继续了解故事。团队发布与回顾代表发布者提供的记录。
- 团队发布与回顾 · Google/DeepMindWhat We Learned in Seoul with AlphaGo ↗
- 研究论文与原著 · David Silver等Mastering the Game of Go with Deep Neural Networks and Tree Search ↗
- 团队发布与回顾 · DeepMindAlphaGo Zero: Starting from Scratch ↗
- 研究论文与原著 · David Silver等Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm ↗
整理于2026年9月16日