研究特稿 · 11

比最优着更重要:围棋 AI 应该开始测量“人能不能发现”

当公开模型已经远超职业棋手,继续只报胜率、目差和第一选,会把最宝贵的信息压扁。本文提出一套可验证的数据框架,把最优性、人类可发现性与模型不确定性放回同一局面,说明下一代复盘为什么应从答案机器变成学习测量仪。

  1. 棋力还在增长,但新的稀缺品已经不是“更强答案”

    截至 2026-08-24,KataGo 公共训练累计约 9680 万盘训练棋、48.2 亿行训练数据和 945 个网络。新发布的 b11 Transformer 约 7100 万参数,在一份公开单卡近似测试中,相对 7300 万参数的 b28 卷积网达到约 +460 Elo 的等评估次数优势和 +300 Elo 的等时间优势;两种口径都只在该测试内成立。供给正在从“偶尔得到一个超人类答案”转为“廉价地反复观察多个超人类系统”。真正稀缺的因而变成:怎样判断一个答案对具体的人是否可见、可学,以及模型自己是否确信。

    这不是说普通用户需要同时运行所有模型,而是研究数据应当保留比较能力。训练站的绝对 Elo 来自等 visits 的内部对局池,大模型因此获得更多实际计算;等时间结果又随 GPU 与后端改变。文章只使用同一实验内的相对差,产品侧则应先在自己的硬件上测每秒评估数和端到端延迟。最强模型负责给出当前上界,小模型与旧模型负责暴露判断是架构进步、搜索加深,还是单纯花了更多时间。

    同一公开数据池正在产生不同架构的观察者;研究价值来自可控制的比较,不来自把跨池 Elo 拼成榜单。
  2. 把每个决定放进三轴坐标:损失、可发现性、不确定性

    第一轴是最优性损失 L:从行棋方视角比较实战着与稳定首选的目差,胜率只作辅助,因为均势附近与胜负已定时同样的目数会对应完全不同的胜率摆幅。第二轴是可发现性 F:给定段位与年代的人类策略,对首选、实战着和可接受候选分别分配多少概率。第三轴是不确定性 U:换搜索预算、模型代际、棋盘旋转或合理参数后,首选与价值是否稳定。传统复盘只显示 L;三轴数据能区分“明显漏看”“难而重要”“无关紧要”和“AI 自己也没想清楚”。

    U 不应只写成候选着是否相同。可以同时记录预算梯上的首选翻转次数、首选与第二名的目差间隔、policy 的 Jensen–Shannon divergence、卷积与 Transformer 的 scoreLead 差,以及八种棋盘对称输入还原后的策略一致率。它们分别捕捉搜索不足、近似并列、分布整体改变、价值模型分歧和实现中的方向偏差。只有多项都稳定,自动讲解才适合使用“明显”“必须”这类强词。

    三轴不是一个新总分:损失、可发现性和五种稳定性证据保留为可检查的独立读数。
  3. Human SL 补上缺失的人类先验,但它不是弱化版 SOTA

    KataGo 的 b18c384nbt-humanv0 从人类棋谱监督学习,可按现代 rank_20k 至 rank_9d、AI 前 preaz_20k 至 preaz_9d,以及 proyear_1800 至 proyear_2023 输出 humanPolicy。正确用法是保留正常强模型完成价值分析,同时用一评估、完整温度与真实行棋历史读取人类策略;多 visits 会替目标段位解开本来不会解开的战术。Human SL 的胜率和目差也可能受认输、段位误标、让子配对与异常棋谱偏差影响,所以本文只把它当作“人可能怎么下”的概率模型,不当作胜负裁判。

    段位概率最好画成整条曲线,而不是只取一个 profile。若最佳手在 rank_5k 几乎不可见、rank_1k 开始上升、rank_2d 后成为常见选择,它很像一条真实的学习阶梯;若直到 rank_9d 仍极低,就更可能是 AI 特有发现或数据稀疏区。proyear 曲线则能找出 AI 时代前后职业布局选择的迁移,但它只描述模型从棋谱学到的相关性,不能单凭时间变化证明 AlphaGo 导致了某个定式流行。

    从 5k 到 2d 的概率上升可形成学习阶梯;年代曲线适合发现变化,不自动提供因果解释。
  4. Action-value 让系统第一次能问:看见候选之后,真的知道后果吗

    策略概率 P 只说明模型愿不愿意先看一手,不说明这手被认真搜索后会怎样。KataGo v1.16 开始在新生成的自对弈样本中记录 qValueTargetsNCMove,为局面中被搜索的动作提供后续胜负与目差目标;这不代表历史 48.2 亿行都带有该字段,也尚未成为公开主模型的成熟产品输出。研究上可以把 raw policy、根节点访问分布、每个候选的搜索后 Q 值与最终深搜值分开:低 P、高 Q 是“难发现的好手”,高 P、低 Q 是“直觉诱饵”,两者对教学完全不同。

    一个实用的候选记录至少包含 move、raw policy、humanPolicy、visits、edgeVisits、scoreLead、winrate、PV 与搜索预算。对同一候选在预算梯上追踪 Q,可以观察它是早期误判后被纠正,还是始终稳定。若 action-value 训练进一步成熟,还可以训练无需完整 MCTS 的候选重排器;但它必须与深搜教师在未见棋手和未来棋谱上校准,不能因为训练 loss 下降就宣称已经学会搜索。

    瀑布图把“先想到”“投入多少搜索”“读完以后值多少”排列在一起,异常候选会自然浮现。
  5. 复盘优先级不应等于最大损失:先定义“可教学性”

    本文提出一个待验证而不是既成事实的排序:Priority = L × Fnext × C。L 是截断后的目数损失;Fnext 是比当前棋手高约两级的人类策略找到最佳或等价好手的概率,用来近似“近期可达”;C 是跨预算、跨模型与对称变换的一致性。大损失但 Fnext 极低的神仙手适合收藏,不一定适合本周训练;中等损失、Fnext 高且反复出现的习惯错误,通常更值得先讲。公式必须保留三个分量并接受教练校正,不能再压成一个貌似客观的神秘总分。

    Fnext 选择“高两级”只是可检验起点,不是假定统一学习速度。级位跨度、段位跨度、儿童与成人、职业与业余可能需要不同邻域;同一棋手还会在布局、死活和官子上拥有不同的局部水平。更好的长期版本会依据个人历史估计领域化的可达概率,并把重复错误频率加入排序。第一版应保持透明:显示损失、目标段位命中率、稳定性和出现次数,让用户或教练能指出排序错在哪里。

    高损失高可达优先讲,高损失低可达先收藏;低置信度局面进入人工复核而不是自动定性。
  6. 一条可信的数据管线,必须保存模型身份证和反事实预算梯

    最小记录从原始 SGF 开始,保存棋谱来源与许可、规则、贴目、棋盘大小、完整手顺、双方段位与日期。每次分析还要固定引擎版本、权重哈希、后端、硬件、线程、batch、随机性、行棋方视角和预算;建议在 32、128、512、2048 visits 上形成预算梯,再对卷积与 Transformer 至少各保留一个冻结模型。Human SL 应保存 profile、是否使用历史和完整策略。训练与评测必须按棋手和时间切分,而不是随机拆散同一盘的局面,否则同一人的定式与相邻手会泄漏到测试集。

    还要防止标签把模型版本变化误当作人的进步。每条记录应保存原始输出而不是只存最终分类,并允许新模型离线重放同一冻结测试集。棋谱去重需在切分之前完成;同一公开对局的转存、不同注释版本和局部截取不能跨集合。若使用用户私有棋谱,应默认只为该用户生成特征,训练用途另行取得明确同意,并避免保存可反推出身份的用户名和时间组合。

    预算梯、冻结模型与按时间重放组成版本账本;原始证据仍在,分类规则才能安全迭代。
  7. 真正的终点不是漂亮图表,而是证明下一盘真的学会了

    第一阶段可以发布三种诚实内容:新旧模型分歧图谱、不同年代职业棋手策略迁移、以及按段位分层的“最值得复盘”局面集。但产品成败不能用点击率或用户停留替代学习效果。离线先测人类落子概率校准、候选价值误差、跨预算翻转率与教练排序一致性;在线再做延迟复测和下一盘迁移:读者数日后能否在陌生但同型的局面中先检查正确问题。只有当个性化排序稳定优于“按最大目损排序”,可教学性才从漂亮假说升级为可靠功能。

    最有说服力的实验可以很小:随机抽取不同段位棋手,为每人选择十个 Priority 高的局面与十个单纯目损最高的局面,要求先口述判断信号,再看短解释;一周后用不同棋谱中的同型局面复测。主要终点是检查顺序和候选集合是否改善,次要终点才是答对率。这样可以区分背住坐标与学会决策程序,也能检验 Human SL 排序是否真的比强模型单独排序多提供价值。

    离线校准、教练复核、延迟回忆、陌生局面迁移四道门,缺一项都不足以证明学习价值。

一手资料与研究依据

  1. KataGo 公共训练统计与网络评级口径
  2. KataGo v1.17.1 Transformer 模型发布说明
  3. KataGo Transformer 结构、对称性与等时测量
  4. KataGo Human SL Analysis Guide
  5. KataGo v1.16 action-value 训练字段
  6. 职业棋手对 AI 的适应:130 万次决策
  7. AI 围棋程序与职业棋手决策改善
  8. 针对超人类围棋 AI 的对抗策略

启动这项研究前必须冻结

  • 棋谱许可、来源、段位与日期
  • 主模型、Human SL 与引擎哈希
  • 规则、贴目、视角和完整历史
  • 多档 visits 与墙钟耗时
  • 跨模型、跨对称稳定性
  • 按棋手和时间隔离的测试集
  • 延迟复测与新局面迁移指标
打开分析样例