worst-case研究 · 25

超人囲碁AIはなぜ弱そうな奇手に負けるのか

ICMLのadversarial policyは超人設定KataGoへ97%超で勝ちました。より強い囲碁でなくsystematic mistakeを誘発します。平均棋力とworst-case robustnessは別です。

  1. 超人平均性能は全分布を保証しない

    通常self-playは一般的対局分布を最適化し、adversarial trainingは稀で反復可能なfailureを探します。平均強度とworst caseは別測定です。

    通常軌道と対抗軌道はstate spaceの別領域へ進みます。
  2. cyclic attackは全局状態の誤認を使う

    公開攻撃は巨大cycle groupの生死・終局価値をAIが誤り、相手が外で得点します。教学盤は構造だけ説明し逐手scriptは出しません。

    中央cycleと外側territoryを同時に読みます。
  3. 97%は人間一般の勝率ではない

    指定victimに対する学習済みadversarial policyの数字です。誰でも現行KataGoに勝てる意味ではありませんが、人間expertが核心を実行できたと論文は報告します。

    勝率とvictim版、visits、attacker identityを並べます。
  4. 既知攻撃修正後もadaptive attack

    AAAI 2025は手作り局面、iterated adversarial training、architecture変更を検討しました。旧攻撃を防いでも防御へ再学習した攻撃には耐えません。

    fixed attack gateとadaptive gateを分けます。
  5. rulesもfailure機構になる

    公開gift attackはpositional superkoで予期した取り返しを封じます。rulesをinputにし、別ko ruleではfailureが消えるか確認します。

    未来の取り返しが一方のko ruleだけで閉じます。
  6. 平均とworst caseを同時報告

    self-play Eloだけでは稀なfailureを隠し、attack勝率だけでは日常riskを誇張します。通常強度、fixed suite、adaptive red teamを並べます。

    三列scorecardで能力を一数値へ潰しません。
  7. blind spotをtrust boundaryへ

    複雑cycle、長い死活、rules敏感局面で不確実性を出し、model変更、深いsearch、人間確認を許します。超人AIにもabstainが必要です。

    second opinionが必要な形と監査経路を盤へ示します。

査読研究

  1. ICML · Adversarial Policies Beat Superhuman Go AIs
  2. AAAI · Can Go AIs Be Adversarially Robust?
  3. FAR AI · positional adversarial training

AI blind spotを読む時

  • 平均とworst caseを分離
  • victim版とvisitsを特定
  • rulesを条件に入れる
  • fixedとadaptiveを分ける
  • 全modelへ外挿しない
search安定性を開く