棋力別の実証研究 · 14

同じ局面を5段・9段・プロの方策はどこまで見つけられるか

同じプロ棋譜50局・500局面で、AIの1目以内好手集合に対するHuman SLの中央値は9段82.7%、5段77.5%でした。差は実在しますが、すべての局面で単調に上がる階段ではありません。

  1. 同じ固定局面を四つの人間方策へ渡す

    標本はプロ棋譜50局、各局の中盤10局面、合計500判断点です。強いb11 Transformer教師が128/512 visitsで候補を作り、Human SLがrank_5d、rank_9d、対局年代一致プロ、2023年プロの方策を全局面へ返します。同一局面を比べるため、段位ごとに別問題を解かせるのではなく方策分布の移動を測れます。

    一つの固定標本を5d、9d、年代一致プロ、2023年プロの四方策へ流します。
  2. 唯一の第一座標を当てたかから始めない

    512-visit教師が残した候補のうち第一候補から1目以内を好手集合とします。ほぼ同価値の手が六つある時、五つの領域へ入った人を「見えていない」とは言えません。そこで段位比較は好手集合の方策確率を主に使い、唯一第一候補の確率は補助として残します。search noiseを唯一の正解へ変えないためです。

    唯一第一候補は一点で、1目以内好手集合がより安定した教材領域です。
  3. 9段は平均して約5ポイント多く見つける

    好手集合coverageの中央値は5段77.5%、9段82.7%です。局面ごとのpaired差は平均5.1ポイントで、対局cluster bootstrap 95%区間は4.3〜5.9ポイントでした。76.2%の局面で9段が高く、signalは安定しています。ただし確率massの移動であり、上位profileが全問で勝つという意味ではありません。

    500局面のpaired結果は5d 77.5%、9d 82.7%、平均差5.1ポイントです。
  4. 高段位でも全局面でAIに近づくわけではない

    約4分の1の局面では9段のcoverageが高くなく、少数では5段方策の方が現在のAI好手集合へ明確に集中しました。定型手の頻度、局面type、学習dataの疎さ、教師の不安定性が影響し得ます。言えるのは全体分布が棋力とともに移ることまでで、Human SL確率を特定棋士の心理や段位認定に使うことはできません。

    全体傾向は反例を残し、局面typeとmodel不確実性を平均で消しません。
  5. 段位labelより教学境界の方が役に立つ

    5段ですでに一般的な手なら、検討は何を解決したかの確認で足ります。5段から9段へ大きく上がる手は近い学習目標です。9段やプロでも極端に低いなら、まずbudget・model・対称性の安定を監査し、深い手として収集するか決めます。「5段なら必須」と断言せず、どの到達帯にあるかを見せる方が実用的です。

    確認、教学、収集、保留を到達可能性とlabel安定性の二軸で選びます。
  6. 個人化検討は秘密の総合点でなく証拠を残す

    各教材候補には実戦目損、1目以内候補集合、対象Human SL profile、集合確率、search budget、budget一致、model identityを保存します。「5段向け」という最終labelだけでは、model更新と人の成長を区別できません。分量を個別表示すれば、棋士や指導者が順位の不自然さを具体的に直し、将来再計算できます。

    損失、発見可能性、安定性を分離保存し、新modelで順位を再計算できます。
  7. 次は平均値でなく未知局面への転移を測る

    本研究は棋力条件付き分布差を示しましたが、説明を読めば強くなるとは証明していません。最大目損順と、損失・到達可能性・安定性の共同順を無作為比較し、数日後に別棋譜の同型局面で確認順序と候補集合を試す必要があります。未知局面で判断が変わって初めて棋力別教学は学習上の事実になります。

    offline確率差の先に、遅延記憶と未知局面transferの因果gateがあります。

data・model・棋譜の出典

  1. KataGo · Human SL Analysis Guide
  2. KataGo公開networkとrating注記
  3. AEB/CWIパブリックドメイン棋譜

棋力別説明を作る前の確認

  • 同じ固定局面を比較した
  • 唯一座標でなく好手集合を使った
  • 対象profileとsearch budgetを記録した
  • 反例と不安定labelを残した
  • 学習効果は未検証と明記した
発見可能性研究を開く