学習可能性map · 23

AI最善と人間が学べる手の距離

HumanSLは棋力別の人間着手を予測しますが、最大確率、sampling、目標棋力は同じではありません。教学はAIに最も近い人でなく次に到達できる判断を探します。

  1. 最強と人間らしさを別軸へ

    標準KataGoは強手をsearchし、HumanSLは棋力・年代別の人間分布をmodel化します。好手の発見可能性を問えますが個人の心は読みません。

    同一盤をAI value軸とHumanSL discoverability軸へ入れます。
  2. top-1が最も人間らしいとは限らない

    研究はargmax、sampling、softmaxを比較し、中間temperatureが目標棋力を作りやすいとしました。最大確率を唯一自然な手にしません。

    Aはtop-1、Bは分布を保ち、局部習慣が変わります。
  3. 直前手との距離は人間のsignal

    一致率、likelihood、直前手距離を測り、距離補正が特に弱い棋力で人間らしさを改善しました。人は全局最善へ飛ぶ前に局部応答しがちです。

    AIの全局jumpと人の局部応答の距離を盤上で比べます。
  4. 棋力は確率帯でhard gateではない

    multi-skill policy研究は実験で10局80%、20局92%のrank推定でした。分布が情報を持つ証拠で、一局への確定段位証明ではありません。

    5k、1d、5d、9dを連続帯として表示します。
  5. bridge moveが習慣と概念を結ぶ

    AI最善がtarget profileで極低なら座標しか残りません。同じ方向・弱点・先手概念を示す少し低価値のbridge moveを探します。

    Aは隠れた最善、Bは同概念への到達可能なbridgeです。
  6. 学習は遅延とtransferを通る

    一度理解しても学習とは限りません。数日後、別棋譜の同型局面で確認順、候補、理由を試し、画像記憶と判断を分けます。

    training盤とtransfer盤は構造だけ共有し座標は共有しません。
  7. 段位labelでなく個人frontier

    目損、target profile確率、concept bridge、search安定性、transfer結果を保存します。frontierは人とmodelとともに更新します。

    learning cardにvalue、reachability、stability、transferを並べます。

HumanSLと棋力研究

  1. KataGo Human SL release
  2. HumanSL human-likeness study
  3. Multiple-skill policy study

学べる提案の前

  • strengthと人間らしさを分離
  • top-1で分布を代用しない
  • target profileを保存
  • 答えだけでなくbridgeを出す
  • 遅延transferを検証
棋力別検討を開く