룰 민감도 · 22
덤이나 룰만 바꿔도 AI 최선 수가 뒤집힐까
komi는 승패 경계를 옮기고 area, territory, ko, 자살과 tax rules는 끝내기 장부를 바꿉니다. 승률 이동보다 후보 순위가 어디서 교차하는지 봅니다.
komi는 먼저 승패 경계를 옮김
같은 판에서 komi를 바꾸면 승률 curve가 생깁니다. SAI는 multi-komi를 sigmoid로 model해 국면에 맥락 없는 고정 승률 하나만 있지 않음을 보입니다.
A/B 판은 komi만 다르며 반전보다 curve를 먼저 봅니다. score 이동은 최선 수 이동이 아님
모든 후보가 함께 움직이면 승률은 변해도 order=0은 같습니다. 후보 가치 curve가 교차해야 답변 반전입니다.
한 승률 차보다 두 후보 curve의 교차가 중요합니다. area와 territory는 끝내기 가격이 다름
area는 판 위 산 돌을 세고 territory는 집과 사석을 씁니다. button과 seki tax도 반집 경계를 바꿔 끝내기 순서가 달라질 수 있습니다.
같은 끝내기를 area와 territory ledger로 비교합니다. ko rule은 합법적 미래를 바꿈
simple ko, positional superko와 situational superko는 다른 제약입니다. 현재 수가 합법이어도 미래 되따냄과 바꿔치기 값이 달라집니다.
미래 되따냄에서 갈리고 한쪽만 superko로 닫힙니다. engine과 network 모두 rule을 알아야 함
KataGo rules 문서는 옛 network가 새 engine 안에서도 복잡 rule을 오평가할 수 있다고 경고합니다. 둘의 identity를 함께 저장합니다.
새 engine과 옛 network 조합이 자동으로 유효한 비교는 아닙니다. 두 komi 대신 반전 구간 scan
판, model, visits와 random을 고정하고 0.5집 간격으로 komi를 훑어 rules별 top3를 남깁니다. 교차는 구간으로 보고합니다.
이산 sample로 후보 순위 band와 첫 안정 교차 구간을 만듭니다. 반전 atlas를 교육 조건으로
영원한 최선이라 하지 말고 어느 rules, komi 범위와 국면 경계에서 효율적인지 씁니다. server나 대회가 바뀌면 다시 판단할 수 있습니다.
최종 card에 좌표, rules, komi 구간과 tradeoff를 함께 둡니다.
rules와 방법 자료
rule 반전 실험 전
- 판과 model 고정
- komi를 구간 scan
- 순위와 승률 분리
- engine과 network 기록
- 각 rules에서 합법성 확인