学習可能性map · 23
AI最善と人間が学べる手の距離
HumanSLは棋力別の人間着手を予測しますが、最大確率、sampling、目標棋力は同じではありません。教学はAIに最も近い人でなく次に到達できる判断を探します。
最強と人間らしさを別軸へ
標準KataGoは強手をsearchし、HumanSLは棋力・年代別の人間分布をmodel化します。好手の発見可能性を問えますが個人の心は読みません。
同一盤をAI value軸とHumanSL discoverability軸へ入れます。 top-1が最も人間らしいとは限らない
研究はargmax、sampling、softmaxを比較し、中間temperatureが目標棋力を作りやすいとしました。最大確率を唯一自然な手にしません。
Aはtop-1、Bは分布を保ち、局部習慣が変わります。 直前手との距離は人間のsignal
一致率、likelihood、直前手距離を測り、距離補正が特に弱い棋力で人間らしさを改善しました。人は全局最善へ飛ぶ前に局部応答しがちです。
AIの全局jumpと人の局部応答の距離を盤上で比べます。 棋力は確率帯でhard gateではない
multi-skill policy研究は実験で10局80%、20局92%のrank推定でした。分布が情報を持つ証拠で、一局への確定段位証明ではありません。
5k、1d、5d、9dを連続帯として表示します。 bridge moveが習慣と概念を結ぶ
AI最善がtarget profileで極低なら座標しか残りません。同じ方向・弱点・先手概念を示す少し低価値のbridge moveを探します。
Aは隠れた最善、Bは同概念への到達可能なbridgeです。 学習は遅延とtransferを通る
一度理解しても学習とは限りません。数日後、別棋譜の同型局面で確認順、候補、理由を試し、画像記憶と判断を分けます。
training盤とtransfer盤は構造だけ共有し座標は共有しません。 段位labelでなく個人frontier
目損、target profile確率、concept bridge、search安定性、transfer結果を保存します。frontierは人とmodelとともに更新します。
learning cardにvalue、reachability、stability、transferを並べます。
HumanSLと棋力研究
学べる提案の前
- strengthと人間らしさを分離
- top-1で分布を代用しない
- target profileを保存
- 答えだけでなくbridgeを出す
- 遅延transferを検証