기력별 실증 연구 · 14

같은 국면을 5단·9단·프로 정책은 어디까지 볼 수 있을까

같은 프로 기보 50국과 500국면에서 AI의 1집 이내 좋은 수 집합에 대한 Human SL 중앙값은 9단 82.7%, 5단 77.5%였습니다. 차이는 실제지만 모든 국면에서 오르는 계단은 아닙니다.

  1. 같은 동결 국면을 네 인간 정책 관찰자에게 줍니다

    표본은 프로 기보 50국에서 중반 10국면씩 고른 500개 결정입니다. 강한 b11 Transformer 교사가 128/512 visits 후보를 만들고 Human SL이 rank_5d, rank_9d, 대국 시대 프로와 2023 프로 정책을 모든 국면에 반환합니다. 국면이 같으므로 단급별 다른 시험이 아니라 정책 분포의 이동을 측정합니다.

    한 동결 표본이 5d, 9d, 시대 프로와 2023 프로 네 정책 통로로 들어갑니다.
  2. 유일한 첫 좌표를 맞혔는지부터 묻지 않습니다

    512-visit 교사가 남긴 후보 중 첫 후보에서 1집 이내인 수를 좋은 수 집합으로 둡니다. 거의 같은 수가 여섯 개인데 다섯 영역에 들어간 사람을 아이디어를 못 봤다고 할 수 없습니다. 따라서 기력 비교는 좋은 수 집합의 정책 확률을 중심으로 하고 유일한 첫 수 확률은 보조로 남겨 search noise를 하나의 정답으로 만들지 않습니다.

    유일 첫 후보는 한 점이고 1집 이내 좋은 수 집합이 더 안정적인 교육 영역입니다.
  3. 9단은 평균 약 5포인트 더 많이 봅니다

    좋은 수 집합 coverage 중앙값은 5단 77.5%, 9단 82.7%입니다. 국면별 paired 차이는 평균 5.1포인트이며 대국 cluster bootstrap 95% 구간은 4.3~5.9포인트입니다. 76.2% 국면에서 9단이 높아 신호는 안정적이지만 확률 mass의 이동이지 상위 profile이 모든 문제에서 앞선다는 뜻은 아닙니다.

    500국면 paired 결과는 5d 77.5%, 9d 82.7%, 평균 차이 5.1포인트입니다.
  4. 높은 단도 모든 국면에서 AI에 가까워지지는 않습니다

    약 4분의 1 국면에서는 9단 coverage가 더 높지 않았고 일부에서는 5단 정책이 현재 AI 좋은 수 집합에 더 집중했습니다. 익숙한 수법 빈도, 국면 유형, 드문 학습 data나 불안정한 교사가 원인일 수 있습니다. 전체 분포가 기력과 함께 이동한다고 말할 수 있을 뿐 Human SL 확률로 특정 기사의 생각을 읽거나 단을 판정할 수 없습니다.

    전체 추세가 반례를 보존해 국면 유형과 model 불확실성을 평균으로 지우지 않습니다.
  5. 단급 label보다 교육 경계가 더 유용합니다

    5단 정책에서 이미 흔한 수라면 무엇을 해결했는지 확인하면 됩니다. 5단에서 9단으로 크게 오르는 수는 가까운 학습 목표입니다. 9단과 프로에서도 매우 낮다면 먼저 budget, model과 대칭 안정성을 감사하고 깊은 수로 수집할지 정합니다. ‘5단이면 반드시 알아야 한다’ 대신 어느 도달 구간에 있는지 보여 주는 편이 실용적입니다.

    확인, 교육, 수집, 보류를 도달 가능성과 label 안정성으로 함께 고릅니다.
  6. 개인화 복기는 숨은 총점 대신 증거를 남깁니다

    각 교육 후보에는 실전 집 손실, 1집 이내 후보 집합, 대상 Human SL profile, 집합 확률, search budget, budget 일치와 model identity를 저장해야 합니다. ‘5단용’이라는 최종 label만 남으면 model update와 인간 성장을 구분하지 못합니다. 구성 요소가 보여야 기사와 지도자가 순위가 왜 틀렸는지 지적하고 나중에 다시 계산할 수 있습니다.

    손실, 발견 가능성과 안정성을 분리 저장해 새 model로 순위를 다시 계산합니다.
  7. 다음 실험은 평균이 아니라 낯선 국면 전이를 봐야 합니다

    이 연구는 기력 조건 분포 차이를 보였지만 설명을 읽으면 강해진다고 증명하지 않았습니다. 최대 집 손실 순서와 손실·도달 가능성·안정성을 합친 순서를 무작위 비교하고 며칠 뒤 다른 기보의 같은 구조에서 확인 순서와 후보 집합을 시험해야 합니다. 낯선 국면의 판단이 바뀔 때만 기력별 교육이 학습 사실이 됩니다.

    offline 확률 차이 뒤에는 지연 회상과 낯선 국면 transfer라는 인과 gate가 있습니다.

data·model·기보 출처

  1. KataGo · Human SL Analysis Guide
  2. KataGo 공개 network와 rating 안내
  3. AEB/CWI 퍼블릭 도메인 프로 기보

기력별 설명 전 확인

  • 같은 동결 국면을 비교했다
  • 유일 좌표 대신 좋은 수 집합을 썼다
  • 대상 profile과 search budget을 기록했다
  • 반례와 불안정 label이 보인다
  • 학습 효과는 미검증으로 표시했다
발견 가능성 연구 열기