기력 기술사 · 10

AlphaGo에서 Transformer KataGo까지의 바둑 AI 10년 SOTA

2016~2026년 최전선을 논문, 공개 가중치와 직접 대국으로 재구성합니다. 너비, 깊이, 파라미터, 학습과 탐색을 비교하고 5,185, 14,554와 상대 +300 Elo가 같은 척도가 아닌 이유를 설명합니다.

  1. 먼저 SOTA를 정의합니다: 모델, 탐색과 Elo는 한 실험입니다

    바둑 엔진은 신경망 하나가 아닙니다. 재현 가능한 비교는 가중치, 엔진 버전, 규칙과 덤, 흑백, 수당 visits 또는 시간, backend, thread와 batch를 고정합니다. Elo는 같은 대국 pool의 승패로 맞춘 상대 좌표입니다. A가 B에게 이길 확률을 p라 하면 차이는 약 400·log10(p/(1−p))이며 60%, 75%, 90%는 약 +70, +191, +382 Elo입니다. 절대값은 anchor와 참가자에도 좌우되므로 같은 pool 안의 차이나 직접 대국만 비교하고 서로 다른 논문의 숫자를 빼면 안 됩니다.

    Elo는 한 대국 graph의 상대 좌표입니다. 상대, 탐색, 시간, hardware나 규칙이 바뀌면 좌표계도 바뀝니다.
  2. 2015–2016: AlphaGo가 합성곱 직감, 가치와 트리 탐색을 연결합니다

    초기 AlphaGo는 각각 약 13개 합성곱 층과 192 filter를 둔 별도 policy network와 value network를 사용했습니다. 지도 policy는 프로 기보에서 약 57% 착수 예측률을 얻은 뒤 자기 대국으로 강화됐고 빠른 rollout policy도 있었습니다. MCTS가 policy prior, value와 rollout을 합쳤습니다. Nature 논문의 분산 AlphaGo Fan은 CPU 1,202개와 GPU 176개를 써 BayesElo pool에서 3,144였고, 뒤의 AlphaGo Lee는 다른 시스템으로 2017년 논문 재구성 pool에서 3,739였습니다. 둘 다 작은 모델 하나가 아니라 여러 network, 탐색과 분산 추론이 만든 시스템이었습니다.

    초기 AlphaGo에는 정직한 단일 파라미터 합계가 없습니다. policy, value, rollout, 탐색과 분산 hardware의 역할이 달랐습니다.
  3. 2017: AlphaGo Master와 Zero가 두 network를 하나의 잔차 타워로 합칩니다

    AlphaGo Zero는 분리 network와 rollout을 policy와 value를 함께 내는 잔차 network 하나로 바꿨고 최근 여덟 국면의 돌과 둘 차례만 입력했습니다. 20/40-block은 입력 합성곱 뒤 19/39 residual block이며 각 블록은 256 channel 3×3 층 두 개, 대략 23M/46M 파라미터입니다. 수마다 MCTS simulation 1,600회를 썼습니다. 3일 20-block은 AlphaGo Lee를 100–0으로 이겼고 40일 40-block은 같은 5초/수 pool에서 5,185 Elo, AlphaGo Master의 4,858보다 +327, 직접 대국은 89–11이었습니다. 핵심은 깊이만이 아니라 dual-head, 순수 자기 대국과 간결한 PUCT의 결합입니다.

    5,185와 4,858은 같은 pool이라 차이를 낼 수 있습니다. 오늘 KataGo의 다섯 자리 rating과는 직접 비교할 수 없습니다.
  4. 2018–2019: 비공개 정점 뒤 최전선이 재현 가능성으로 이동합니다

    AlphaZero는 바둑, 체스와 쇼기에 같은 algorithm을 확장했지만 공개 바둑 결과는 3일 20-block AlphaGo Zero를 60–40으로 이긴 것이며 40일 정점을 넘었다는 증거는 아닙니다. 공개 구현은 빠르게 전진해 PhoenixGo가 20-block으로 2018 푸저우 세계 AI 바둑 대회에서 우승했습니다. ELF OpenGo는 약 23M 파라미터의 20×256을 V100 2,000장에서 학습해 9일 만에 초인, 전체 약 16일, 정상급 프로에게 20–0을 기록했습니다. 2019년 KataGo는 무작위 자기 대국을 유지하면서 ownership, score, 보조 policy, global pooling, forced playout와 policy target pruning으로 30장 미만 V100, 19일 만에 ELF를 넘어 학습 계산을 약 50배 줄였습니다.

    2018년 뒤에는 비공개 시스템의 알려진 상한과 code, weight와 대국을 재현할 수 있는 공개 최전선을 따로 추적해야 합니다.
  5. 2020–2023: KataGo는 크기만 키우지 않고 한 번의 평가 가치를 높입니다

    2020년 g170 b20c256은 중간~높은 탐색량에서 Leela Zero 최종 40-block과 같거나 더 강했고 일본식 규칙, 접바둑과 정확한 집 차이를 지원했습니다. 분산 학습은 b40c256과 b60c320으로 커졌고 b60은 평가당 강하지만 느리고 무거웠습니다. 2022–2023년 nested bottleneck residual block은 1×1로 channel을 절반으로 줄여 내부의 두 3×3 residual pair를 실행한 뒤 trunk로 넓힙니다. fixed-variance 초기화, 한 번의 batch normalization, 단기 value uncertainty와 soft policy target을 더해 b18c384nbt는 b40c256과 비슷한 속도로 계산이 약 두 배 무거운 b60c320보다 평가당 조금 약할 뿐이었습니다. 블록 수는 유효 깊이나 기력의 대리값이 아니게 됐습니다.

    b18c384nbt의 효율은 nested bottleneck과 학습 target에서 옵니다. 18과 384는 구조 이름이지 Elo 변환값이 아닙니다.
  6. 2024–2025: 공개 최전선이 최선의 수에서 인간 모델과 견고성으로 넓어집니다

    2024년 Human SL b18c384nbt-humanv0은 인간 기보를 학습해 rank_20k~rank_9d, preaz_20k~preaz_9d, proyear_1800~proyear_2023 조건으로 착수를 예측합니다. 보통 humanPolicy를 내는 두 번째 network이며 주 SOTA를 대체하는 더 강한 모델이 아닙니다. 많은 visits는 목표 급수가 놓칠 전술을 풀어 버립니다. 주 자기 대국 계보는 73M 파라미터 b28c512nbt로 확대됐습니다. 더 넓은 SOTA에는 견고성도 필요합니다. 순환 형태의 adversarial policy가 초인 설정에 매우 높은 승률을 기록해 일반 Elo, 분포 밖 행동과 규칙 정확성이 서로 다른 능력임을 보였습니다.

    Human SL은 사람이 둘 법한 수, 주 모델은 기력, robustness는 세 번째 축을 최적화합니다. 한 rating으로 합칠 수 없습니다.
  7. 2026: Transformer KataGo가 층별 전달을 전역 attention으로 바꿉니다

    KataGo v1.17은 주요 backend에 Transformer를 넣었고 v1.18은 CUDA를 크게 최적화하며 ROCm과 ONNX를 추가했습니다. 단일 3×3 convolution이 입력 plane 22개를 trunk로 옮긴 뒤 nested bottleneck에서 attention+MLP를 반복합니다. 위치는 head별 학습 가능한 2차원 주파수 RoPE로 들어갑니다. 공개된 세 크기 가운데 소형 b10c384h6nbttflrs는 evaluation당 이미 최강 b18보다 강합니다. 중형 b10c512h8nbt3tflrs는 10 block×블록당 attention layer 3개×layer당 8 head, 총 240 head와 29M 파라미터입니다. 대형 b11c768h12nbt3tflrs는 396 head, 71M입니다. 73M b28c512 convnet을 0으로 두면 중형은 같은 evaluation에서 약 +50 Elo, 같은 시간에서 +120, 대형은 +460/+300입니다. 234M b40c768은 evaluation당 +400이지만 느려 시간당 +70뿐입니다. 학습 site의 현재 최강 확정 b40은 같은 visits 내부 pool에서 14,554.2±20.9이며 이동 가능한 rating이 아닙니다. 대형 Transformer의 같은 시간 +300은 b28 상대 기대 승률 약 85%로, 이것이 더 적은 파라미터로 더 강하다는 실제 의미입니다.

    2026-08-24 현재 Transformer 세 크기는 공개됐고 public main run은 여전히 b40c768이며 project는 전환 예정이라고 설명합니다.

논문과 1차 자료

  1. Google Research · AlphaGo 논문
  2. Nature · AlphaGo Zero 논문
  3. UCL · AlphaZero 공개 원고
  4. ICML · ELF OpenGo
  5. KataGo · Accelerating Self-Play Learning in Go
  6. KataGo 방법과 architecture
  7. KataGo Human SL guide
  8. Adversarial Policies Beat Superhuman Go AIs
  9. KataGo v1.17.1 Transformer release
  10. KataGo v1.18.0 backend와 CUDA release
  11. KataGo 2026 Transformer 구조와 Elo 연구
  12. KataGo 분산 학습과 rating

두 바둑 AI를 비교하기 전 기록

  • 구조와 파라미터 수
  • weight와 engine 버전
  • 같은 visits인지 같은 시간인지
  • 규칙, 덤, 흑백과 hardware
  • Elo가 같은 대국 pool인지
모델과 지표 읽기