학습 가능성 지도 · 23
AI 최적과 인간이 배울 수 있는 수의 거리
HumanSL은 기력별 인간 착수를 예측하지만 최대 확률, sampling과 목표 기력은 같지 않습니다. 교육은 AI와 가장 닮은 사람이 아니라 다음에 닿을 판단을 찾아야 합니다.
최강과 인간다움을 다른 축으로
표준 KataGo는 강한 수를 search하고 HumanSL은 기력·시대별 인간 분포를 model합니다. 좋은 수 발견 가능성을 물을 수 있지만 개인 마음을 읽지는 않습니다.
한 판이 AI value 축과 HumanSL discoverability 축으로 들어갑니다. top-1이 자동으로 가장 인간답지는 않음
연구는 argmax, sampling과 softmax를 비교해 중간 temperature가 목표 기력을 더 잘 만든다고 봤습니다. 가장 큰 확률을 유일한 자연스러운 수로 만들지 않습니다.
A는 top-1, B는 분포를 보존해 국부 습관이 달라집니다. 직전 수와 거리는 인간의 단서
착수 일치, likelihood와 직전 수 거리를 쓰고 거리 보정이 특히 약한 기력에서 인간다움을 개선했습니다. 사람은 전판 최적점보다 국부에 먼저 응답하곤 합니다.
AI 전판 jump와 인간 국부 응답 거리를 한 판에서 봅니다. 기력은 확률 band이지 hard gate가 아님
multi-skill policy 연구는 실험에서 10국 80%, 20국 92% rank 추정을 보였습니다. 분포가 정보를 지닌다는 뜻이지 한 판으로 기력을 확정한다는 뜻은 아닙니다.
5k, 1d, 5d, 9d를 네 벽이 아닌 연속 band로 봅니다. bridge move가 습관과 목표 개념을 연결
AI 수가 target profile에서 거의 없으면 좌표만 남을 수 있습니다. 같은 방향·약점·선수 개념을 보여 주는 조금 낮은 가치의 bridge move를 찾습니다.
A는 숨은 최적점, B는 같은 개념으로 가는 도달 가능한 bridge입니다. 학습은 지연과 transfer를 통과
한 번 이해했다고 배운 것은 아닙니다. 며칠 뒤 다른 기보의 같은 구조에서 확인 순서, 후보와 이유를 시험해 screenshot 기억과 판단을 나눕니다.
training 판과 transfer 판은 구조만 공유하고 좌표는 공유하지 않습니다. 기력 sticker가 아닌 개인 frontier
집 손실, target profile 확률, concept bridge, search 안정성과 transfer 결과를 남깁니다. frontier는 사람과 model에 따라 갱신됩니다.
learning card에 value, reachability, stability와 transfer를 나란히 둡니다.
HumanSL과 기력 연구
배울 수 있는 제안 전
- strength와 인간다움을 나눈다
- top-1로 분포를 대신하지 않는다
- target profile을 남긴다
- 답만 주지 말고 bridge를 준다
- 지연 transfer를 검증한다