worst-case研究 · 25
超人囲碁AIはなぜ弱そうな奇手に負けるのか
ICMLのadversarial policyは超人設定KataGoへ97%超で勝ちました。より強い囲碁でなくsystematic mistakeを誘発します。平均棋力とworst-case robustnessは別です。
超人平均性能は全分布を保証しない
通常self-playは一般的対局分布を最適化し、adversarial trainingは稀で反復可能なfailureを探します。平均強度とworst caseは別測定です。
通常軌道と対抗軌道はstate spaceの別領域へ進みます。 cyclic attackは全局状態の誤認を使う
公開攻撃は巨大cycle groupの生死・終局価値をAIが誤り、相手が外で得点します。教学盤は構造だけ説明し逐手scriptは出しません。
中央cycleと外側territoryを同時に読みます。 97%は人間一般の勝率ではない
指定victimに対する学習済みadversarial policyの数字です。誰でも現行KataGoに勝てる意味ではありませんが、人間expertが核心を実行できたと論文は報告します。
勝率とvictim版、visits、attacker identityを並べます。 既知攻撃修正後もadaptive attack
AAAI 2025は手作り局面、iterated adversarial training、architecture変更を検討しました。旧攻撃を防いでも防御へ再学習した攻撃には耐えません。
fixed attack gateとadaptive gateを分けます。 rulesもfailure機構になる
公開gift attackはpositional superkoで予期した取り返しを封じます。rulesをinputにし、別ko ruleではfailureが消えるか確認します。
未来の取り返しが一方のko ruleだけで閉じます。 平均とworst caseを同時報告
self-play Eloだけでは稀なfailureを隠し、attack勝率だけでは日常riskを誇張します。通常強度、fixed suite、adaptive red teamを並べます。
三列scorecardで能力を一数値へ潰しません。 blind spotをtrust boundaryへ
複雑cycle、長い死活、rules敏感局面で不確実性を出し、model変更、深いsearch、人間確認を許します。超人AIにもabstainが必要です。
second opinionが必要な形と監査経路を盤へ示します。
査読研究
AI blind spotを読む時
- 平均とworst caseを分離
- victim版とvisitsを特定
- rulesを条件に入れる
- fixedとadaptiveを分ける
- 全modelへ外挿しない