棋力分层实证研究 · 14
同一个局面,5 段、9 段与职业模型分别看得见什么
在同一批 50 盘职业棋、500 个局面上,9 段 Human SL 对 AI 一目内好棋集合的中位覆盖为 82.7%,5 段为 77.5%。差异真实存在,却远不是一条处处递增的棋力阶梯。
把同一批局面交给四个不同的人类策略观察者
样本固定为 50 盘职业棋、每盘 10 个中盘局面,共 500 个决定点。强教师用 b11 Transformer 在 128 与 512 visits 下生成候选;Human SL 分别输出 rank_5d、rank_9d、棋局年代匹配与 2023 职业策略。比较对象完全相同,因此这里测量的是策略分布差异,不是让不同段位各做一套题。
一套冻结局面同时进入 5d、9d、年代职业与 2023 职业四条策略通道。 不要先问谁猜中唯一第一坐标
512-visit 教师保留下来的候选中,距离第一候选不超过一目的招法共同组成好棋集合。这个集合承认围棋价值面通常连续:若六个候选几乎等价,人类进入其中五个并不等于完全没看见。段位比较因此使用好棋集合的策略概率,同时保留唯一第一候选概率,避免把搜索噪声包装成唯一答案。
唯一第一候选只是一点;一目内好棋集合才是更稳健的教学区域。 9 段平均看见更多,但差距只有五个百分点
5 段策略对好棋集合的中位覆盖为 77.5%,9 段为 82.7%。逐局面配对后,9 段平均高 5.1 个百分点;按整盘棋聚类 bootstrap 的 95% 区间为 4.3 至 5.9 个百分点。在 76.2% 的局面中 9 段覆盖更高,说明信号稳定存在,但它描述的是概率质量移动,不是每题必然领先。
500 局面的配对结果:5d 77.5%,9d 82.7%,平均差 5.1 个百分点。 更高段位不是每个局面都更像 AI
仍有接近四分之一的局面没有出现 9 段更高覆盖,且有少数局面 5 段策略明显更集中在当前 AI 好棋集合。这可能来自常见手法在不同棋力数据中的频率、局面类型、样本稀疏或教师自身不稳定。正确叙述是总体分布随棋力移动,而不是把单个 Human SL 概率当成某位棋手的心理或段位鉴定。
总体趋势允许反例;局面类型与模型不确定性不能被一条平均线抹掉。 教学边界比段位标签更有用
若一手在 5 段策略中已很常见,复盘只需确认它解决了什么问题;若它从 5 段到 9 段明显上升,它更像近期可达的训练目标;若连 9 段和职业策略都极低,则应先检查搜索预算、模型与对称稳定性,再决定是否收藏为深手。产品不应说“5 段必须会这手”,而应显示这手处在哪条可达性带上。
确认、训练、收藏和暂缓四个动作,由可达性与稳定性共同决定。 个性化复盘必须保存证据而不是隐藏总分
每条教学候选至少保存实战目损、一目内候选集合、目标 Human SL profile、集合概率、搜索预算、跨预算一致性和模型身份。若系统只留下“适合 5 段”这样的最终标签,模型升级后就无法分辨是棋手进步还是裁判变化。原始分量保持可见,棋手和教练才能指出排序为什么不合适。
损失、可发现性与稳定性分别留档,最终排序可以重算而无需重写故事。 下一步不是继续算平均值,而是验证迁移
本研究证明段位条件策略能分离出稳定的总体差异,却没有证明看到某种解释后会变强。真正的下一步是随机比较按最大目损与按目损、可达性、稳定性联合排序的复盘;数日后用不同棋谱中的同型局面测试检查顺序与候选集合。只有陌生局面的判断发生变化,棋力分层才从内容推荐升级为学习事实。
离线概率差异之后,还要经过延迟回忆与陌生局面迁移两道因果门槛。
数据、模型与棋谱来源
生成分层讲解前检查
- 比较的是同一批冻结局面
- 使用好棋集合而非唯一第一点
- 目标 profile 与搜索预算已记录
- 反例与不稳定局面没有被平均值隐藏
- 学习效果仍标记为待验证