최악 조건 연구 · 25

초인 바둑 AI는 왜 약해 보이는 괴수에 질까

ICML adversarial policy는 초인 설정 KataGo에 97% 넘게 이겼습니다. 더 강한 바둑이 아니라 systematic mistake를 유도했습니다. 평균 기력과 worst-case robustness는 다릅니다.

  1. 초인 평균 성능이 모든 분포를 보장하지 않음

    보통 self-play는 흔한 대국 분포를 최적화하고 adversarial training은 드물지만 반복 가능한 failure를 찾습니다. 평균 강도와 worst case는 다른 측정입니다.

    보통 경로와 대항 경로가 state space의 다른 영역을 방문합니다.
  2. cyclic attack은 전판 상태 오판을 이용

    공개 공격은 큰 cycle group의 생사나 최종 가치를 AI가 오판하는 동안 공격자가 밖에서 득점합니다. 교육 판은 구조만 설명하고 수순 exploit script는 주지 않습니다.

    중앙 cycle과 바깥 territory를 함께 읽습니다.
  3. 97%는 일반 인간 승률이 아님

    지정한 초인 victim에 대한 학습된 adversarial policy 결과입니다. 누구나 현행 KataGo를 이긴다는 뜻은 아니지만 인간 expert가 핵심을 이해하고 실행했다고 보고합니다.

    승률 옆에 victim 버전, visits와 attacker identity를 둡니다.
  4. 알려진 공격을 막아도 adaptive attack

    AAAI 2025는 손수 만든 국면, 반복 adversarial training과 architecture 변경을 봤습니다. 옛 공격을 막아도 방어에 맞춰 재학습한 공격을 견디지 못했습니다.

    fixed attack gate와 adaptive gate는 다른 시험입니다.
  5. rules가 failure 메커니즘에 참여

    공개 gift attack은 positional superko로 예상 되따냄을 막습니다. rules를 input으로 보고 다른 ko rule에서 같은 failure가 사라지는지 봅니다.

    미래 되따냄이 한 ko rule에서만 닫힙니다.
  6. 평균과 worst case 함께 보고

    self-play Elo만 보면 드문 failure를 숨기고 attack 승률만 보면 일상 위험을 과장합니다. 일반 강도, fixed suite와 adaptive red team을 함께 둡니다.

    세 칸 scorecard로 능력을 한 숫자에 뭉치지 않습니다.
  7. blind spot을 trust boundary로

    복잡 cycle, 긴 사활과 rules 민감 상태에 불확실성을 보이고 model 교체, 깊은 search와 인간 검토를 허용합니다. 초인 AI도 abstain이 필요합니다.

    second opinion이 필요한 모양과 감사 경로를 판에 표시합니다.

동료 심사 연구

  1. ICML · Adversarial Policies Beat Superhuman Go AIs
  2. AAAI · Can Go AIs Be Adversarially Robust?
  3. FAR AI · positional adversarial training

AI blind spot 주장 읽기

  • 평균과 worst case 분리
  • victim 버전과 visits 식별
  • rules를 시험에 포함
  • fixed와 adaptive 분리
  • 모든 model로 외삽하지 않기
search 안정성 열기