模型考古 · 20
KataGo 的答案有保质期吗
同一局面换网络、引擎、搜索量或对称方向,第一候选可能改变。本文不编造一次历史跑分,而是建立一张可复现的“答案护照”,判断旧分析还能不能引用。
答案不是一个坐标,而是一组运行条件
KataGo 的输出由网络、引擎版本、规则、贴目、搜索预算、对称方向与随机设置共同产生。只保存“推荐 Q10”会丢掉复现实验所需的大部分条件。
同一棋盘在两张答案护照下比较,改变的是实验条件而不只是坐标。 先分开原始策略与搜索第一候选
官方说明指出 raw policy 不会被搜索改写,而 analysis 的 order=0 是搜索排序结果。二者可能指向不同区域,因此模型漂移与搜索漂移必须分别报告。
A 线显示神经网络第一直觉,B 线显示搜索后的 order=0;两者回答不同问题。 架构升级会改变单位访问的含义
KataGo 1.17 引入的 Transformer 网络被官方描述为每次访问更强,并常比旧卷积网络更快。跨架构只对齐 visits,不能保证对齐计算量或判断质量。
相同 visits 不等于相同计算;对比需同时记录网络架构与实耗时。 网络档案的 Elo 只能在训练运行内理解
公开网络页保留历史检查点,但明确提醒不同训练运行的近似 Elo 不可直接横比,且误差约有两个标准差。文章因此用日期与网络身份定位历史,不拼接一条虚假的统一棋力线。
历史检查点按训练运行分栏,不把不可比的 Elo 连成一条精确曲线。 对称与随机性是最低成本的压力测试
固定 nnRandomize、根对称和搜索量后再做八种棋盘对称,可检查标签是否依赖偶然方向。若第一候选频繁分裂,应把它标为搜索不稳,而不是宣布旧模型错误。
八种等价方向若不能回到同一候选簇,答案尚不适合写成定论。 用三种过期状态替代新旧二分
旧答案可以是坐标仍稳、理由已变;坐标改变但价值近似;或局部结论真正翻转。三种状态对应继续引用、加注条件与撤回重写,不必把每次升级都包装成革命。
保留、加注、退役三种状态比“新模型更强”提供更多编辑信息。 发布答案时附上一张可复算护照
最低字段应包含 engine、network、rules、komi、maxVisits、nnRandomize、rootSymmetry、分析日期,以及 raw policy 与 order=0。未来只需重跑同一护照即可测量真实漂移。
答案护照把旧文章从截图变成可重跑的研究记录。
官方资料
引用旧 AI 结论前
- 网络和引擎版本可定位
- 规则与贴目已保存
- raw policy 与 order=0 已分开
- 随机性与对称设置已冻结
- 漂移状态不是只写新或旧