棋力技术史 · 10

从 AlphaGo 到 Transformer KataGo 的围棋 AI 十年 SOTA

按公开论文、模型和直接对局重建 2016 至 2026 年的棋力前沿:逐代拆解网络宽深、参数规模、训练与搜索预算,并解释为什么 5,185、14,554 与相对 +300 Elo 不能写在同一张排行榜上。

  1. 先定义 SOTA:模型、搜索和 Elo 必须成套比较

    围棋引擎不是单独一张神经网络。一次可复现实验至少要固定权重、引擎版本、规则与贴目、执黑执白、每手 visits 或墙钟时间、硬件后端、线程和批处理。Elo 只由同一对局池里的胜负关系确定:若 A 对 B 胜率为 p,则分差约为 400·log10(p/(1−p));60%、75%、90% 胜率分别约等于 +70、+191、+382 Elo。跨论文的绝对值还取决于锚点和参赛者,因此只能比较同池分差或直接交手,不能把所有数字纵向相减。

    Elo 是特定对局图上的相对坐标;改变对手池、搜索量、时间、硬件或规则,就改变了坐标系。
  2. 2015–2016:AlphaGo 把卷积直觉、价值判断与树搜索接在一起

    初代 AlphaGo 使用彼此分离的策略网络和价值网络,主体都是约 13 层、192 个卷积滤波器的深度 CNN;监督策略先从人类职业棋谱学到 57% 左右的落子预测率,再经自我对弈强化,另有快速 rollout policy。MCTS 将策略先验、价值网络与快速模拟组合起来。Nature 论文的分布式 AlphaGo Fan 由 1,202 个 CPU 和 176 个 GPU 支撑,在其 BayesElo 池中为 3,144;后来的 AlphaGo Lee 使用不同系统与硬件,在 2017 论文重建的同池中为 3,739。它们不是一个“约几百万参数模型”单独下棋,而是多网络、多搜索器和大规模推理硬件组成的系统。

    AlphaGo 时代的参数不能只报一个总数:策略、价值和 rollout 分工,搜索与分布式硬件决定最终棋力。
  3. 2017:AlphaGo Master 与 AlphaGo Zero 把双网络压成统一残差塔

    AlphaGo Zero 用一个同时输出 policy 与 value 的残差网络替代分离网络和 rollout,只输入最近八个局面的黑白棋子与行棋方。论文所谓 20/40 block 实际是输入卷积后接 19/39 个残差块,每块两层 3×3、256 通道,粗略约 23M/46M 参数;每手用 1,600 次 MCTS 模拟。三日 20-block 版本以 100:0 击败 AlphaGo Lee,四十日 40-block 版本在论文统一的 5 秒/手池中达到 5,185 Elo,对 AlphaGo Master 的 4,858 是 +327 Elo,并以 89:11 直接获胜。这里的关键升级是统一网络、纯自我对弈和更干净的 PUCT,而不只是把网络加深。

    同池 5,185 对 4,858 可以相减;它不能与今天 KataGo 训练站的五位数内部评级直接相减。
  4. 2018–2019:闭源峰值之后,SOTA 转向可复现的 AlphaZero 路线

    AlphaZero 将同一算法推广到围棋、国际象棋和将棋,但公开围棋结果只以 60:40 击败三日版 AlphaGo Zero 20-block,不能据此宣称超过四十日 40-block 的绝对峰值。工程前沿则迅速开放:PhoenixGo 以 20-block 网络赢得 2018 福州世界人工智能围棋大赛;ELF OpenGo 用 20×256、约 23M 参数,在 2,000 张 V100 上训练,9 天达到超人、完整训练约 16 天,并以 20:0 击败顶尖职业棋手。2019 年 KataGo 的首篇论文仍从零自我对弈,却以 ownership、score、辅助策略目标、全局池化、forced playout 与 policy target pruning 改写样本效率,在不足 30 张 V100 上 19 天超过 ELF,训练算力约降 50 倍。

    2018 后要分两条线:闭源系统的已知上限,以及任何人能下载权重、复跑对局的公开前沿。
  5. 2020–2023:KataGo 的主线不是盲目堆参数,而是让每次评估更值钱

    2020 年 g170 的 b20c256 已在中高搜索量追平或超过 Leela Zero 最终 40-block 网络,同时支持日规则、让子与更准确的目差。随后公共分布式训练扩到 b40c256 和 b60c320;更大的 b60 每次评估更强,却更慢、更吃显存。2022–2023 年的 nested bottleneck residual block 先以 1×1 将通道压到一半,在内部运行两组残差 3×3,再扩回主干;配合 fixed-variance 初始化、单次 batch normalization、短期价值不确定性和 soft policy target,b18c384nbt 以接近 b40c256 的速度,做到只略弱于计算量约两倍的 b60c320。块数因此不再等于有效深度,更不等于棋力。

    b18c384nbt 的胜点来自嵌套瓶颈与训练目标;18、384 是结构索引,不是可直接换算的 Elo。
  6. 2024–2025:公开前沿从“最强一手”扩展到人类建模与稳健性

    2024 年 Human SL 模型 b18c384nbt-humanv0 由人类棋谱监督训练,可按 rank_20k 至 rank_9d、preaz_20k 至 preaz_9d,以及 proyear_1800 至 proyear_2023 预测不同水平和年代的人类落子。它通常作为第二模型输出 humanPolicy,不是替换主模型的更强 SOTA;用多 visits 搜索还会修掉目标等级本来会犯的战术错误。同期主自我对弈网络扩到 73M 参数的 b28c512nbt。更广义的 SOTA 也必须包含稳健性:针对循环棋形的对抗策略曾以极高胜率击败超人设置,说明常规 Elo、极端分布外局面和规则正确性是三项不同能力。

    Human SL 优化“人会怎么下”,主模型优化“怎样更强”;鲁棒性测试又是第三条轴,三者不能合成一个分数。
  7. 2026:Transformer KataGo 以全局注意力重写空间通信

    KataGo v1.17 首次在主要后端支持 Transformer,v1.18 又显著优化 CUDA 并加入 ROCm 与 ONNX。网络先用单个 3×3 卷积把 22 个输入平面映射到主干,随后在 nested bottleneck 中反复执行 attention+MLP;位置由每个头可学习二维频率的 RoPE 注入。官方发布三档:小型 b10c384h6nbttflrs 每次评估已强于最强 b18;中型 b10c512h8nbt3tflrs 有 10 块、每块 3 层注意力、每层 8 头,共 240 头与 29M 参数;大型 b11c768h12nbt3tflrs 有 396 头与 71M 参数。以 73M 的 b28c512 卷积网为零点,中型网在等评估次数约 +50 Elo、等时间约 +120;大型网约 +460/+300。234M 的 b40c768 虽在等评估次数约 +400,却因单次评估慢,等时间只约 +70。训练站当前最强可信 b40 的 14,554.2±20.9 是等 visits 内部评级,不能跨池使用。大型 Transformer 对 b28 的 +300 等时间换算为预期胜率约 85%,这才是“更少参数、更强每秒”的含义。

    截至 2026-08-24,三档 Transformer 已发布可用;公共主训练页仍以 b40c768 为最新主线,官方表述是即将切换。

论文与一手资料

  1. Google Research · AlphaGo 论文
  2. Nature · AlphaGo Zero 论文
  3. UCL · AlphaZero 开放版本
  4. ICML · ELF OpenGo
  5. KataGo · Accelerating Self-Play Learning in Go
  6. KataGo 方法与架构说明
  7. KataGo Human SL 文档
  8. 对抗策略击败超人围棋 AI 论文
  9. KataGo v1.17.1 Transformer 发布说明
  10. KataGo v1.18.0 后端与 CUDA 发布说明
  11. KataGo 2026 Transformer 结构与 Elo 研究
  12. KataGo 分布式训练与评级说明

比较任意两个围棋 AI 前先写下

  • 网络结构与参数量
  • 模型权重和引擎版本
  • 等 visits 还是等时间
  • 规则、贴目、颜色与硬件
  • Elo 是否来自同一对局池
阅读模型与读数