棋力技术史 · 10
从 AlphaGo 到 Transformer KataGo 的围棋 AI 十年 SOTA
按公开论文、模型和直接对局重建 2016 至 2026 年的棋力前沿:逐代拆解网络宽深、参数规模、训练与搜索预算,并解释为什么 5,185、14,554 与相对 +300 Elo 不能写在同一张排行榜上。
先定义 SOTA:模型、搜索和 Elo 必须成套比较
围棋引擎不是单独一张神经网络。一次可复现实验至少要固定权重、引擎版本、规则与贴目、执黑执白、每手 visits 或墙钟时间、硬件后端、线程和批处理。Elo 只由同一对局池里的胜负关系确定:若 A 对 B 胜率为 p,则分差约为 400·log10(p/(1−p));60%、75%、90% 胜率分别约等于 +70、+191、+382 Elo。跨论文的绝对值还取决于锚点和参赛者,因此只能比较同池分差或直接交手,不能把所有数字纵向相减。
Elo 是特定对局图上的相对坐标;改变对手池、搜索量、时间、硬件或规则,就改变了坐标系。 2015–2016:AlphaGo 把卷积直觉、价值判断与树搜索接在一起
初代 AlphaGo 使用彼此分离的策略网络和价值网络,主体都是约 13 层、192 个卷积滤波器的深度 CNN;监督策略先从人类职业棋谱学到 57% 左右的落子预测率,再经自我对弈强化,另有快速 rollout policy。MCTS 将策略先验、价值网络与快速模拟组合起来。Nature 论文的分布式 AlphaGo Fan 由 1,202 个 CPU 和 176 个 GPU 支撑,在其 BayesElo 池中为 3,144;后来的 AlphaGo Lee 使用不同系统与硬件,在 2017 论文重建的同池中为 3,739。它们不是一个“约几百万参数模型”单独下棋,而是多网络、多搜索器和大规模推理硬件组成的系统。
AlphaGo 时代的参数不能只报一个总数:策略、价值和 rollout 分工,搜索与分布式硬件决定最终棋力。 2017:AlphaGo Master 与 AlphaGo Zero 把双网络压成统一残差塔
AlphaGo Zero 用一个同时输出 policy 与 value 的残差网络替代分离网络和 rollout,只输入最近八个局面的黑白棋子与行棋方。论文所谓 20/40 block 实际是输入卷积后接 19/39 个残差块,每块两层 3×3、256 通道,粗略约 23M/46M 参数;每手用 1,600 次 MCTS 模拟。三日 20-block 版本以 100:0 击败 AlphaGo Lee,四十日 40-block 版本在论文统一的 5 秒/手池中达到 5,185 Elo,对 AlphaGo Master 的 4,858 是 +327 Elo,并以 89:11 直接获胜。这里的关键升级是统一网络、纯自我对弈和更干净的 PUCT,而不只是把网络加深。
同池 5,185 对 4,858 可以相减;它不能与今天 KataGo 训练站的五位数内部评级直接相减。 2018–2019:闭源峰值之后,SOTA 转向可复现的 AlphaZero 路线
AlphaZero 将同一算法推广到围棋、国际象棋和将棋,但公开围棋结果只以 60:40 击败三日版 AlphaGo Zero 20-block,不能据此宣称超过四十日 40-block 的绝对峰值。工程前沿则迅速开放:PhoenixGo 以 20-block 网络赢得 2018 福州世界人工智能围棋大赛;ELF OpenGo 用 20×256、约 23M 参数,在 2,000 张 V100 上训练,9 天达到超人、完整训练约 16 天,并以 20:0 击败顶尖职业棋手。2019 年 KataGo 的首篇论文仍从零自我对弈,却以 ownership、score、辅助策略目标、全局池化、forced playout 与 policy target pruning 改写样本效率,在不足 30 张 V100 上 19 天超过 ELF,训练算力约降 50 倍。
2018 后要分两条线:闭源系统的已知上限,以及任何人能下载权重、复跑对局的公开前沿。 2020–2023:KataGo 的主线不是盲目堆参数,而是让每次评估更值钱
2020 年 g170 的 b20c256 已在中高搜索量追平或超过 Leela Zero 最终 40-block 网络,同时支持日规则、让子与更准确的目差。随后公共分布式训练扩到 b40c256 和 b60c320;更大的 b60 每次评估更强,却更慢、更吃显存。2022–2023 年的 nested bottleneck residual block 先以 1×1 将通道压到一半,在内部运行两组残差 3×3,再扩回主干;配合 fixed-variance 初始化、单次 batch normalization、短期价值不确定性和 soft policy target,b18c384nbt 以接近 b40c256 的速度,做到只略弱于计算量约两倍的 b60c320。块数因此不再等于有效深度,更不等于棋力。
b18c384nbt 的胜点来自嵌套瓶颈与训练目标;18、384 是结构索引,不是可直接换算的 Elo。 2024–2025:公开前沿从“最强一手”扩展到人类建模与稳健性
2024 年 Human SL 模型 b18c384nbt-humanv0 由人类棋谱监督训练,可按 rank_20k 至 rank_9d、preaz_20k 至 preaz_9d,以及 proyear_1800 至 proyear_2023 预测不同水平和年代的人类落子。它通常作为第二模型输出 humanPolicy,不是替换主模型的更强 SOTA;用多 visits 搜索还会修掉目标等级本来会犯的战术错误。同期主自我对弈网络扩到 73M 参数的 b28c512nbt。更广义的 SOTA 也必须包含稳健性:针对循环棋形的对抗策略曾以极高胜率击败超人设置,说明常规 Elo、极端分布外局面和规则正确性是三项不同能力。
Human SL 优化“人会怎么下”,主模型优化“怎样更强”;鲁棒性测试又是第三条轴,三者不能合成一个分数。 2026:Transformer KataGo 以全局注意力重写空间通信
KataGo v1.17 首次在主要后端支持 Transformer,v1.18 又显著优化 CUDA 并加入 ROCm 与 ONNX。网络先用单个 3×3 卷积把 22 个输入平面映射到主干,随后在 nested bottleneck 中反复执行 attention+MLP;位置由每个头可学习二维频率的 RoPE 注入。官方发布三档:小型 b10c384h6nbttflrs 每次评估已强于最强 b18;中型 b10c512h8nbt3tflrs 有 10 块、每块 3 层注意力、每层 8 头,共 240 头与 29M 参数;大型 b11c768h12nbt3tflrs 有 396 头与 71M 参数。以 73M 的 b28c512 卷积网为零点,中型网在等评估次数约 +50 Elo、等时间约 +120;大型网约 +460/+300。234M 的 b40c768 虽在等评估次数约 +400,却因单次评估慢,等时间只约 +70。训练站当前最强可信 b40 的 14,554.2±20.9 是等 visits 内部评级,不能跨池使用。大型 Transformer 对 b28 的 +300 等时间换算为预期胜率约 85%,这才是“更少参数、更强每秒”的含义。
截至 2026-08-24,三档 Transformer 已发布可用;公共主训练页仍以 b40c768 为最新主线,官方表述是即将切换。
论文与一手资料
比较任意两个围棋 AI 前先写下
- 网络结构与参数量
- 模型权重和引擎版本
- 等 visits 还是等时间
- 规则、贴目、颜色与硬件
- Elo 是否来自同一对局池