연구 특집 · 11

최선의 수를 넘어: 바둑 AI는 사람이 찾을 수 있는지를 측정해야 한다

공개 model이 프로를 크게 넘어선 지금 승률, 집 차이와 첫 후보만으로는 중요한 증거가 사라집니다. 최적성, 인간의 발견 가능성과 model 불확실성을 한 국면에서 결합해 복기를 정답 기계에서 학습 측정기로 바꾸는 연구 틀을 제안합니다.

  1. 기력은 계속 오르지만 더 강한 답은 이미 희소 자원이 아닙니다

    2026-08-24 현재 KataGo 공개 run은 약 9,680만 훈련 대국, 48.2억 row와 945개 network를 보고합니다. 공개된 71M parameter b11 Transformer는 한 GPU의 근사 비교에서 73M b28 CNN보다 같은 evaluation에서 약 +460 Elo, 같은 시간에서 약 +300이었습니다. 이 수치는 그 비교 안에서만 유효합니다. 핵심 변화는 가끔 초인적 답 하나를 얻던 단계에서 여러 초인적 system을 싸게 반복 관찰하는 단계로 넘어간 것입니다. 이제 희소한 것은 특정 사람이 그 답을 볼 수 있는지, 가까운 시기에 배울 수 있는지, model도 그 판단을 확신하는지 측정하는 방법입니다.

    모든 사용자가 모든 model을 실행할 필요는 없습니다. 연구 record가 비교 가능성을 남겨야 한다는 뜻입니다. 훈련 site의 절대 Elo는 같은 visits의 내부 pool이어서 느린 대형 network가 실제 계산을 더 씁니다. 같은 시간 추정은 GPU와 backend에 따라 달라집니다. 한 실험 안의 상대 차이만 쓰고 배포 hardware에서 초당 evaluation과 end-to-end latency를 측정해야 합니다. 최강 model은 현재 상한을, 소형과 구형 model은 차이가 architecture, 깊은 탐색, 단순 계산 시간 중 어디서 왔는지 보여 줍니다.

    한 공개 data pool이 서로 다른 architecture 관찰자를 만들며 호환되지 않는 Elo를 합치지 않고 통제 비교로 증거를 만듭니다.
  2. 모든 결정을 세 축에 놓습니다: 손실, 발견 가능성, 불확실성

    최적성 손실 L은 둔 사람 시점에서 실전 수와 안정된 최선 수의 집 차이를 비교합니다. 승률은 보조로 둡니다. 호각과 승부가 거의 끝난 국면에서 같은 집 변화가 서로 다른 승률 변화를 만들기 때문입니다. 발견 가능성 F는 단급과 시대를 조건으로 한 human policy가 최선, 실전, 허용 후보에 주는 확률입니다. 불확실성 U는 탐색 budget, model 세대, 판 대칭과 합리적인 parameter 변화 뒤에도 판단이 유지되는지를 봅니다. L만 보여 주던 복기에서 섞였던 명백한 누락, 깊고 중요한 수, 중요하지 않은 차이와 AI 미결 국면을 나눌 수 있습니다.

    U는 첫 후보가 같은지만 보면 안 됩니다. budget ladder의 첫 수 반전 횟수, 1위와 2위 집 차이 margin, policy 사이 Jensen–Shannon divergence, Transformer와 CNN의 scoreLead 차이, 여덟 판 대칭을 원래 방향으로 돌린 policy 일치율을 함께 기록합니다. 탐색 부족, 거의 같은 후보, 전체 분포 변화, value 불일치와 방향 artifact를 따로 잡습니다. 여러 안정성 근거가 일치할 때만 자동 설명이 ‘명백히’나 ‘반드시’ 같은 강한 말을 써야 합니다.

    새로운 비밀 총점이 아니라 손실, 발견 가능성과 다섯 안정성 신호를 각각 검사할 수 있게 남깁니다.
  3. Human SL은 인간 prior를 보충하지만 약한 SOTA 판정기가 아닙니다

    b18c384nbt-humanv0는 인간 기보로 지도 학습해 현대 rank_20k~rank_9d, AI 이전 preaz_20k~preaz_9d, proyear_1800~proyear_2023의 humanPolicy를 냅니다. 가치 판단에는 정상적인 강한 model을 유지하고 인간 policy는 한 evaluation, full temperature와 실제 수순 이력으로 읽어야 합니다. 많은 visits는 목표 단급이 풀지 못할 전술까지 풀기 때문입니다. Human SL의 승률과 집 차이에는 기권, 단급 오표기, 접바둑 배정과 이상 기보 bias가 들어갈 수 있습니다. 여기서는 사람이 어떻게 둘지의 확률 model이지 승패 판정자가 아닙니다.

    profile 하나가 아니라 단급 전체 ribbon을 그립니다. 최선 수가 5k에서 거의 없고 1k부터 오르며 2d에서 흔해지면 실제 학습 경계에 가깝습니다. 9d에서도 낮다면 AI 고유 발견이나 희소 data 영역일 수 있습니다. proyear ribbon은 AI 시대 전후 포석 이동을 찾지만 기보에서 배운 상관관계입니다. 시간 변화만으로 AlphaGo가 정석 유행의 원인임을 증명할 수 없고 대회, rules와 기사 구성도 함께 바뀔 수 있습니다.

    5k에서 2d로 오르는 확률은 학습 ladder 후보이며 연대 curve는 변화를 찾지만 인과를 홀로 제공하지 않습니다.
  4. Action-value는 후보를 본 뒤 결과까지 이해했는지 묻습니다

    policy prior P는 network가 먼저 주목하는 수를 말하지만 읽은 뒤의 결론은 말하지 않습니다. v1.16 이후 새 KataGo 자가 대국 sample은 qValueTargetsNCMove로 탐색한 action의 승패와 집 차이 target을 기록할 수 있습니다. 과거 48.2억 row 모두에 있는 것이 아니며 성숙한 공개 product head도 아닙니다. raw policy, root visits, 후보별 탐색 후 Q와 최종 deep search를 분리하면 낮은 P와 높은 Q의 숨은 좋은 수, 높은 P와 낮은 Q의 직관적 함정을 구분합니다. 두 경우에는 서로 다른 설명이 필요합니다.

    실용 후보 record에는 move, raw policy, humanPolicy, visits, edgeVisits, scoreLead, 승률, PV와 탐색 budget이 들어갑니다. 같은 후보의 Q를 ladder에서 추적하면 얕은 오판이 고쳐지는지 계속 안정적인지 알 수 있습니다. action-value 훈련이 성숙하면 완전한 MCTS 없는 후보 reranker도 가능하지만 보지 않은 기사와 미래 기보에서 deep-search 교사에 calibration해야 합니다. training loss 감소만으로 탐색 효과를 배웠다고 할 수 없습니다.

    무엇을 먼저 보았는지, 탐색을 얼마나 주었는지, 읽은 뒤 가치가 얼마인지 waterfall로 맞춰 이상 후보를 드러냅니다.
  5. 복기 우선순위를 최대 손실과 같게 두지 말고 가르칠 가능성을 정의합니다

    여기서는 검증되지 않은 가설 Priority = L × Fnext × C를 제안합니다. L은 상한을 둔 집 손실, Fnext는 현재보다 약 두 단계 높은 human policy가 최선 또는 동등한 수를 찾을 확률로 가까운 도달 가능성을 근사합니다. C는 budget, model과 대칭 변환 사이 일치도입니다. 큰 손실이지만 Fnext가 매우 낮은 신의 수는 모을 가치는 있어도 이번 주 훈련에는 맞지 않을 수 있습니다. 중간 손실이고 Fnext가 높으며 반복되는 습관이 먼저입니다. 세 성분을 따로 보여 주고 지도자가 고칠 수 있게 해야지 또 하나의 불투명 점수로 만들면 안 됩니다.

    Fnext의 두 단계 위는 검증 출발점이지 모두의 학습 속도가 같다는 가정이 아닙니다. 급 사이, 단 사이, 어린이와 성인, 프로와 아마는 다른 이웃이 필요할 수 있습니다. 한 기사도 포석, 사활과 끝내기의 지역 수준이 다릅니다. 장기적으로 개인 이력에서 분야별 도달 확률과 반복 빈도를 추정해야 합니다. 첫 버전은 손실, 목표 단급 확률, 안정성과 횟수를 투명하게 보여 사용자나 지도자가 순위가 틀린 이유를 정확히 지적하게 합니다.

    큰 손실이고 도달 가능하면 먼저 다루고 도달이 어렵다면 저장합니다. 낮은 confidence는 자동 판정 대신 사람 검토로 갑니다.
  6. 신뢰할 dataset에는 model 신원과 반사실 budget ladder가 필요합니다

    원본 SGF에서 출처, license, rules, 덤, 판 크기, 전체 수순, 양쪽 단급과 날짜를 보존합니다. 분석마다 engine version, weight hash, backend, hardware, thread, batch, 난수, 둔 사람 시점과 budget을 고정하고 32, 128, 512, 2048 visits 같은 ladder를 만듭니다. 고정 CNN과 Transformer를 하나씩 남기고 Human SL은 profile, 이력 설정과 전체 policy를 저장합니다. 훈련과 평가는 국면을 무작위로 나누지 말고 기사와 미래 기간을 hold out해야 합니다. 인접 수와 한 기사의 포석이 양쪽에 새면 성능이 부풀려집니다.

    label이 model upgrade를 인간 성장으로 착각하지 않게 최종 분류뿐 아니라 raw 출력을 저장하고 새 model을 고정 test set에 다시 돌립니다. dedup은 분할 전에 해야 하며 같은 공개 대국의 미러, 다른 주석본과 국면 조각이 서로 다른 집합에 들어가면 안 됩니다. 사용자 비공개 기보는 기본적으로 그 사용자용 feature만 계산하고 훈련에는 별도의 명시적 동의를 받으며 username과 시각 조합 같은 재식별 정보도 저장하지 않습니다.

    budget ladder, 고정 model과 시간 재실행이 version ledger를 만들고 원 증거를 남겨 분류 규칙을 안전하게 바꿉니다.
  7. 끝은 아름다운 차트가 아니라 다음 대국에서 판단이 바뀌는 것입니다

    초기 결과로 CNN과 Transformer 불일치 지도, proyear에 따른 프로 스타일 이동, 단급별 복기 가치 국면집을 정직하게 만들 수 있습니다. 그러나 click이나 체류 시간은 학습 효과가 아닙니다. offline에서는 human move 확률 calibration, 후보 가치 오차, budget 사이 첫 수 반전율과 지도자 순위 일치를 측정합니다. online에서는 지연 재시험과 전이를 보고 며칠 뒤 같은 구조의 낯선 국면에서 올바른 질문을 먼저 확인하는지 봅니다. 개인화 순위가 최대 집 손실 순위를 안정적으로 이길 때만 가르칠 가능성이 가설에서 기능이 됩니다.

    설득력 있는 실험은 작아도 됩니다. 여러 단급 참가자에게 Priority 상위 열 국면과 최대 집 손실만으로 고른 열 국면을 주고 짧은 설명 전 판단 신호를 말하게 합니다. 일주일 뒤 다른 기보의 같은 구조로 시험합니다. 주요 결과는 좌표 기억만이 아니라 확인 순서와 후보 집합이 좋아지는지입니다. 답 외우기와 의사결정 절차 학습을 나누고 Human SL이 강한 model 단독 순위보다 실제 가치를 더하는지 직접 시험합니다.

    offline calibration, 지도자 검토, 지연 회상과 낯선 국면 전이라는 네 gate를 통과해야 학습 가치를 주장할 수 있습니다.

1차 자료와 연구

  1. KataGo 공개 run 통계와 rating 방법
  2. KataGo v1.17.1 Transformer model
  3. KataGo Transformer 구조, 대칭성과 동일 시간 측정
  4. KataGo Human SL Analysis Guide
  5. KataGo v1.16 action-value field
  6. 130만 프로 결정에서 인간의 AI 적응
  7. 바둑 AI와 프로 의사결정 개선
  8. 초인적 바둑 AI 상대 적대 policy

연구 전에 고정할 것

  • 기보 license, 출처, 단급과 날짜
  • 주 model, Human SL과 engine hash
  • rules, 덤, 시점과 전체 이력
  • visits ladder와 wall-clock
  • model 사이와 대칭 안정성
  • 기사와 시간을 분리한 test
  • 지연 재시험과 전이 지표
분석 예시 열기