설명 신뢰도 · 26
바둑을 말하는 언어 model은 이해할까 그렇게 들릴 뿐일까
LoGos는 구조화 바둑 data, 긴 reasoning과 RL을 섞어 프로급 착수를 보고합니다. 하지만 유창한 해설에도 판이나 engine이 지지하지 않는 atomic claim이 있을 수 있습니다. 문체 아닌 claim을 검증합니다.
착수 강도와 설명 품질 분리
강한 좌표를 골라도 두터움, 축이나 선수 설명이 틀릴 수 있고 용어가 유창해도 강한 착수를 증명하지 않습니다. 독립 benchmark가 필요합니다.
한 응답을 move track과 language track으로 나눠 채점합니다. 순수 문장보다 구조화한 판 input
LoGos는 전문 바둑 data와 general long reasoning을 섞고 rules-aware board tool과 KataGo-Bench를 제공합니다. 프로급 주장은 보고된 task와 setup 안에서 읽습니다.
좌표 문장과 명시적 board state가 다른 검증 path로 갑니다. 개념이 encoding돼도 충실히 말하는 것은 아님
ACL 2022는 인간 주석 1만 국으로 policy network를 probe해 ko와 atari 같은 개념을 뒷 layer에서 예측했습니다. 내부 signal과 말 사이에 충실한 bridge가 필요합니다.
network 안 concept probe와 자연어 사이에 한 층이 남습니다. 긴 해설을 atomic claim으로
‘백을 공격하며 선수를 유지한다’에는 합법성, 대상, 강제성과 미래 가치 claim이 있습니다. rules, KataGo variation과 expert reference로 각각 보냅니다.
유창한 한 문단이 네 개의 검증 가능한 claim card가 됩니다. LLM 자기평가 아닌 tool-augmented 평가
2026 ACT-Eval chess 연구는 tool 없는 강 model에도 틀린 subclaim이 많다고 봤습니다. tool은 사실성을 높이지만 expert concept coverage는 여전히 제한적입니다.
한 총점을 factual correctness와 concept coverage로 나눕니다. 국소 수순의 연속성으로 근거와 유창함 구분
같은 역사 국면에서 A와 B를 전환하며 설명을 한 수씩 대조하세요. 모양, 수순, 역할이 A에만 있는데 같은 이유를 B에 그대로 붙이면 그 이유는 B의 변화로 뒷받침되지 않습니다. 승률과 집 차이는 국소 효율을 수치화하지만 실제 돌에 대한 설명을 대신하지는 못합니다.
5·6수에서 A는 중앙을 이어 가고 B는 두 귀로 뜁니다. B에 같은 중앙전 설명을 붙여도 판 위 근거가 없습니다. 설명 contract 공개
합법성, 후보 순위, PV support, rule 조건, fact claim, 교육 비유와 불확실성을 나열합니다. 언어는 정리하고 tool은 제한하며 expert는 coverage를 감사합니다.
contract가 각 문장을 어떤 증거가 보증하는지 보여 줍니다.
model·data·평가
AI 바둑 해설 공개 전
- 착수와 설명을 따로 채점
- 좌표를 rules로 검증
- 문장을 atomic claim으로 분해
- PV를 과잉 해석하지 않기
- 사실성과 concept coverage 분리