바둑 AI 실증 연구 · 13
바둑 AI의 가장 흥미로운 최전선은 인간에게 보이지 않는 좋은 수를 드러내는 방식이다
프로 기보 50국, 500국면, 실제 검색 visits 397,561회, 대국 단위 bootstrap 10,000회, 그리고 여덟 가지 판 대칭에서 최대 8,192 visits까지 감사했습니다. 최선의 수뿐 아니라 인간이 왜 놓치는지, label이 안정적인지, 무엇을 가르칠 가치가 있는지를 측정합니다.
SOTA는 영원한 1위가 아니라 측정 역할의 조합
2026년 8월 24일 기준 최신 공개 engine은 KataGo v1.18.0입니다. 이 연구는 v1.17.x의 b11 768-channel Transformer를 강한 교사로, b10 512-channel Transformer를 cross-check로, b18 Human SL을 기력·시대 조건 인간 policy로 사용했습니다. 공식 network page도 다른 bot이나 run의 근사 Elo를 직접 비교하지 말라고 경고합니다. 여기서 SOTA는 weight 하나가 영원히 세계 1위라는 뜻이 아닙니다. 교사는 후보 가치, 다른 model은 model 의존성, Human SL은 사람이 둘 법한 수를 측정합니다. 역할이 다르고 어느 것도 오류 없는 oracle이 아닙니다.
공개 기보에서 동결된 500국면 설계까지
AEB/CWI public-domain 프로 기보에서 1950–1969부터 2016–2023까지 다섯 시대별 일본 타이틀전 10국을 고르고, 각 대국 본선 중반에서 10국면을 결정적으로 추출했습니다. 일본 규칙과 SGF 덤을 유지해 결과를 본 뒤 예시를 고르지 않았습니다. 주 교사는 128/512 visits, Human SL은 5d, 9d, 시대 일치, 2023 네 policy를 출력했고 다른 강한 model이 100국면을 확인했습니다. 모든 구간은 대국 단위 bootstrap 10,000회로 구해 같은 대국의 인접 10국면을 독립 증거로 취급하지 않았습니다.
유일한 1위 후보는 좋은 교육 단위가 아니다
시대 일치 policy에서 AI 1위 후보의 확률 중앙값은 22.4%, 1집 이내 좋은 수 집합은 80.0%로 57.6%포인트 차이였습니다. 1위 후보가 1% 미만인 국면은 13.4%지만 좋은 수 집합 전체가 5% 미만인 경우는 4.0%뿐입니다. AI의 고가치 영역에 전혀 들어가지 못한 경우와 영역에는 들어갔지만 검색 noise와 작은 가치 차이가 올린 1위 좌표만 놓친 경우는 다릅니다. 전자는 개념 blind spot일 수 있지만 후자를 실수라고 부를 필요는 없는 경우가 많습니다.
좋은 수 집합이 덜 보일수록 실전 손실은 커진다
482국면에서 실전 수가 같은 512-visit root search에 남아 같은 기준의 집 손실을 계산했습니다. 손실과 좋은 수 집합 surprisal의 Spearman 상관은 0.419, 대국 cluster 95% 구간은 0.327–0.503입니다. 몇 대국 전체가 더 어려웠던 가능성을 없애려고 두 rank를 대국 안에서 중심화해도 상관은 0.413, 구간 0.309–0.508이었습니다. 발견 가능성 가설을 지지하지만 특정 설명이 학습을 일으킨다는 인과 증거는 아닙니다.
현대 policy coverage가 조금 높지만 시대 기력표는 아니다
같은 국면에서 proyear_2023은 시대 일치 profile보다 1집 이내 좋은 수 집합에 평균 2.2%포인트 더 높은 확률을 주었고 cluster 구간은 1.6–2.9였습니다. 오래된 시대의 차이가 더 크고 2005–2015 구간은 0을 가로지릅니다. 이는 policy 분포의 이동이지 현대 기사가 몇 집 더 강한지를 측정하지 않습니다. 표본은 세계 프로 바둑의 무작위 표본이 아니며 판 구조, 정석, 대회와 기사 구성도 시간과 함께 바뀝니다.
budget·model·대칭 감사는 매력적인 이야기를 뒤집는다
128과 512 visits의 1위 후보 일치율은 74.8%, 다른 강한 model은 100국면에서 78.0% 일치했습니다. 이상 10국면의 D4 감사에서 2,048 visits에 8국면만 여덟 방향 완전 일치했고, 같은 방향의 512/2,048 후보 유지율도 67.5%였습니다. 8,192 visits에서 하네 나오키 국면은 B7로 여덟 방향 수렴했습니다. 반면 사카타 에이오의 옛 A4 악수 label은 기각됐고, 여덟 방향 모두에서 1집 이내인 단일 후보도 없었습니다. 신뢰할 system은 얕은 결과에 설명을 붙이기보다 label을 철회할 수 있어야 합니다.
다음 세대 복기에는 isBestMove가 아니라 증거 chain이 필요하다
교육 후보는 budget gate, cross-model gate, D4 symmetry gate를 통과한 뒤 대상 기력·시대 Human SL로 common, marginal, hidden을 판정해야 합니다. 안정적이고 hidden이면 우선하고, 안정적이고 common이면 짧게 확인하며, 불안정하면 불확실성을 보이거나 자동 설명을 멈춥니다. 남은 종착점은 인과 실험입니다. 집 손실만으로 정렬한 복기와 손실·발견 가능성·안정성을 함께 쓴 복기를 무작위 비교해 며칠 뒤 기억과 낯선 국면 transfer를 측정해야 합니다. 다음 대국의 판단이 좋아져야 teachability가 제품 사실이 됩니다.
공개 자료와 재현 경계
다음 계산 budget을 쓸 가치가 있는 곳
- 이상 tail을 8,192 / 32,768 visits와 두 model로 감사
- 주 search가 버린 Human SL 고확률 수를 강제 평가
- 기사와 미래 기간을 hold-out
- 지연 기억과 낯선 국면 transfer를 무작위 비교