围棋 AI 实证研究 · 13
围棋 AI 最有意思的前沿,是它如何暴露人类看不见的好棋
50 盘职业棋、500 个局面、397,561 次实际搜索访问、10,000 次整盘聚类 bootstrap,以及最高 8,192 visits × 八种棋盘对称变换:我们不再只问 AI 哪手最好,而是测量人类为何难以发现、标签是否可靠,以及什么才值得教。
SOTA 不是一个永恒榜首,而是一组测量角色
截至 2026 年 8 月 24 日,KataGo 最新公开引擎是 v1.18.0。本文使用 v1.17.x 发布的 b11 768 通道 Transformer 作为强教师、b10 512 通道 Transformer 做交叉检查,并用 b18 Human SL 读取按棋力与年代条件化的人类策略。官方网络页也提醒,不同机器人或训练 run 的近似 Elo 不能直接拼成总榜。 因此这里的 SOTA 不等于宣称一块权重永远世界第一。强教师回答候选价值,交叉教师暴露模型依赖,Human SL 描述人可能怎么下;三者角色不同,任何一个都不是无误差真值。
从公开棋谱到冻结的 500 局面设计
样本来自 AEB/CWI 公开领域职业棋谱。我们从 1950–1969 到 2016–2023 五个年代各取 10 盘日本头衔战,每盘确定性抽取主线中段 10 个局面。日本规则与 SGF 贴目保持不变,避免看过结果后挑例子。 主教师分别搜索 128 与 512 visits;Human SL 对每个局面输出 5 段、9 段、棋局年代匹配与 2023 年四种策略;另一个强模型复核 100 个局面。所有区间用 10,000 次整盘 bootstrap,而不是把同一盘的十个相邻局面当作十份独立证据。
唯一第一候选不是好的教学单位
对年代匹配的人类策略,AI 唯一第一候选的中位概率为 22.4%,而价值距离第一候选不超过一目的候选集合达到 80.0%,差 57.6 个百分点。唯一候选概率低于 1% 的局面占 13.4%,整个好棋集合低于 5% 的却只有 4.0%。 这区分了两类完全不同的情况:棋手没有进入 AI 的高价值区域;或者棋手已经进入高价值区域,只是没猜中搜索噪声与细微目差决定的第一坐标。前者可能是概念盲点,后者常常不值得被写成错误。
好棋越不可见,实战损失通常越大
482 个局面能在同一个 512-visit 根搜索中找到实战着并计算目差损失。实战损失与好棋集合惊奇度的 Spearman 相关为 0.419,整盘聚类 95% 区间为 0.327–0.503。 为排除某几盘棋整体更复杂的影响,我们把损失秩和惊奇度秩在每盘棋内去中心。盘内相关仍为 0.413,区间 0.309–0.508。它支持“人类越难想到 AI 的好棋区域,失分越大”的假说,但仍不是教学效果的因果证据。
现代策略覆盖稍高,但不能读成时代棋力榜
把同一局面分别输入棋局年代匹配的 proyear profile 与 proyear_2023,现代策略对一分内好棋集合的平均概率总体高 2.2 个百分点,聚类区间为 1.6–2.9。较早年代的差异更明显,2005–2015 的区间则跨过零。 这可以描述策略分布怎样迁移,却不能证明现代棋手整体强了多少。样本不是全球职业棋随机样本,棋局结构、定式、赛事与棋手构成都随时间变化,Human SL 也只是从棋谱学习到的条件分布。
预算、模型和八对称审计会推翻漂亮故事
128 与 512 visits 的第一候选一致率只有 74.8%;另一强模型在 100 个局面上的一致率为 78.0%。对十个异常局面做 D4 八对称审计后,2,048 visits 时只有八个达到八方向完全一致,且同一方向的 512/2,048 候选只有 67.5% 保持不变。 8,192 visits 的定向复核展示了两种相反结果:羽根直树局面最终八方向收敛到 B7;坂田荣男局面原先的 A4 大恶手标签被彻底推翻,而且仍没有跨八方向稳定的一分内唯一候选。可靠系统必须允许撤销标签,而不是替低预算结果编出确定叙事。
下一代复盘应保存证据链,而不是一个 isBestMove
一个候选课题应依次通过预算门、模型门与 D4 对称门,再用目标棋力或年代的 Human SL 判断它是常见、边缘还是隐藏。稳定且隐藏的局面适合优先教学;稳定且常见的局面只需简短确认;不稳定的局面应展示不确定性或暂不生成讲解。 最终还缺最关键的一步:随机比较按目差排序与按目差、可发现性、稳定性联合排序,测量数日后的延迟回忆和陌生局面迁移。只有后者稳定改善下一盘的决策,‘可教学性’才从漂亮假说变成产品事实。
公开资料与复现边界
下一轮真正值得花算力的地方
- 对异常尾部做 8,192 / 32,768 visits 双模型全审计
- 强制分析 Human SL 高概率但主搜索未保留的候选
- 按棋手与未来时间留出验证
- 随机测试延迟回忆与陌生局面迁移