搜索稳定性研究简报 · 15

KataGo 多搜几千 visits,答案真的会更可靠吗

500 个职业局面、两种强模型与八种棋盘对称变换显示:更多搜索通常降低中位波动,却可能先暴露分裂。稳定坐标、稳定目差与可信教学标签是三件不同的事。

  1. visits 是搜索预算,不是答案置信度

    visits 记录树搜索分配了多少访问,却不会自动告诉你第一候选是否已经收敛。局面复杂度、候选价值间距、线程调度和神经网络先验都会改变同一预算的含义。因此 512 visits 不能统一翻译成“足够可靠”,更不能把访问数当作百分比置信区间。

    同一 visits 在宽候选与窄候选局面中对应不同的收敛状态。
  2. 128 到 512 visits 仍有四分之一第一候选改变

    在冻结的 500 个职业局面中,b11 Transformer 在 128 与 512 visits 的第一候选一致率为 74.8%。根目差变化的中位数只有 0.131 目,但 90 分位达到 0.600 目。典型局面看起来稳定,尾部却足以推翻教学措辞;只报告中位数会漏掉最危险的标签。

    坐标一致 74.8%,目差变化中位 0.131 目;稳定中心与危险尾部同时存在。
  3. 换一个强模型,第一候选也会重新排序

    在 100 个局面的交叉教师子样本中,b11 与另一 b10 Transformer 在同为 512 visits 时第一候选一致率为 78.0%。模型一致不能证明绝对正确,但模型分歧说明结论依赖架构、训练或搜索交互。高损失、低人类概率的戏剧性案例尤其应该先做交叉教师复核。

    相同预算下模型间 78.0% 一致,剩余分歧必须进入审计而非自动写故事。
  4. 旋转与反射会暴露被单一方向隐藏的误差

    十个异常局面被变换为正方形的八种 D4 对称,并把结果映射回原坐标。512 visits 时只有 60% 的局面八方向第一候选完全一致;2,048 visits 升到 80%。对称测试不是把一个局面变成八份独立证据,而是在检查训练得到的近似不变性是否足以支持唯一标签。

    八种 D4 输入回到同一坐标后,检查旋转与反射是否仍给出同一候选。
  5. 更多搜索可能先揭开分裂,再让它收敛

    羽根直树的审计局面在 512 visits 八方向全部选择 B17,到了 2,048 visits 却分成四个旋转选 B17、四个反射选 B7;直到 8,192 visits 才八方向统一为 B7。更深搜索不是单调地强化原答案,它有时先证明浅层一致只是偶然,再找到新的稳定候选。

    512 一致、2,048 反射分裂、8,192 收敛:深搜可以先破坏表面确定性。
  6. 稳定坐标仍可能藏着不稳定价值

    有些局面在所有方向和预算都选择同一坐标,根目差范围却仍超过一目。对教学而言,“走哪里”稳定不等于“差多少”稳定;后者直接影响能否使用“明显亏损”“必须”之类强措辞。至少应同时保存候选集合、第一坐标、目差范围与主变化,而不是只存一个 bestMove。

    坐标门与价值门分开通过;任何一门失败都应降低讲解语气。
  7. 停止规则应该由风险决定,而不是固定数字

    普通复盘可以在候选集合、坐标和目差都稳定时停止;若标签将触发重点训练、公开批评或历史结论,就提高预算并加入交叉模型与对称审计。若更深搜索仍分裂,应显示不确定性或撤销标签。算力最值得花在会改变教学动作的边界局面,而不是平均分给每一手。

    低风险确认早停,高风险教学升级预算;持续分裂则压下标签。

模型与方法来源

  1. KataGo Transformer 架构与对称性研究
  2. KataGo 公开网络与评级说明
  3. KataGo Analysis Engine 文档

发布 AI 结论前检查

  • 记录实际 visits 而非只记预设名
  • 比较至少两个搜索预算
  • 坐标稳定与目差稳定分别通过
  • 高风险案例经过模型或对称复核
  • 持续分裂的标签已降低语气或撤销
阅读完整实验