模型考古 · 20

KataGo 的答案有保质期吗

同一局面换网络、引擎、搜索量或对称方向,第一候选可能改变。本文不编造一次历史跑分,而是建立一张可复现的“答案护照”,判断旧分析还能不能引用。

  1. 答案不是一个坐标,而是一组运行条件

    KataGo 的输出由网络、引擎版本、规则、贴目、搜索预算、对称方向与随机设置共同产生。只保存“推荐 Q10”会丢掉复现实验所需的大部分条件。

    同一棋盘在两张答案护照下比较,改变的是实验条件而不只是坐标。
  2. 先分开原始策略与搜索第一候选

    官方说明指出 raw policy 不会被搜索改写,而 analysis 的 order=0 是搜索排序结果。二者可能指向不同区域,因此模型漂移与搜索漂移必须分别报告。

    A 线显示神经网络第一直觉,B 线显示搜索后的 order=0;两者回答不同问题。
  3. 架构升级会改变单位访问的含义

    KataGo 1.17 引入的 Transformer 网络被官方描述为每次访问更强,并常比旧卷积网络更快。跨架构只对齐 visits,不能保证对齐计算量或判断质量。

    相同 visits 不等于相同计算;对比需同时记录网络架构与实耗时。
  4. 网络档案的 Elo 只能在训练运行内理解

    公开网络页保留历史检查点,但明确提醒不同训练运行的近似 Elo 不可直接横比,且误差约有两个标准差。文章因此用日期与网络身份定位历史,不拼接一条虚假的统一棋力线。

    历史检查点按训练运行分栏,不把不可比的 Elo 连成一条精确曲线。
  5. 对称与随机性是最低成本的压力测试

    固定 nnRandomize、根对称和搜索量后再做八种棋盘对称,可检查标签是否依赖偶然方向。若第一候选频繁分裂,应把它标为搜索不稳,而不是宣布旧模型错误。

    八种等价方向若不能回到同一候选簇,答案尚不适合写成定论。
  6. 用三种过期状态替代新旧二分

    旧答案可以是坐标仍稳、理由已变;坐标改变但价值近似;或局部结论真正翻转。三种状态对应继续引用、加注条件与撤回重写,不必把每次升级都包装成革命。

    保留、加注、退役三种状态比“新模型更强”提供更多编辑信息。
  7. 发布答案时附上一张可复算护照

    最低字段应包含 engine、network、rules、komi、maxVisits、nnRandomize、rootSymmetry、分析日期,以及 raw policy 与 order=0。未来只需重跑同一护照即可测量真实漂移。

    答案护照把旧文章从截图变成可重跑的研究记录。

官方资料

  1. KataGo Training History
  2. KataGo public networks
  3. KataGo 1.17 Transformer release
  4. Analysis Engine documentation
  5. Policy and search clarification

引用旧 AI 结论前

  • 网络和引擎版本可定位
  • 规则与贴目已保存
  • raw policy 与 order=0 已分开
  • 随机性与对称设置已冻结
  • 漂移状态不是只写新或旧
打开搜索稳定性研究