解释可信度 · 26

会讲围棋的语言模型,是真的懂还是说得像懂

LoGos 把结构化围棋数据、长推理与强化学习混合,报告了职业级落子能力;但流畅解释仍可能包含无法由棋盘或引擎支持的原子断言。答案要逐条验,不靠整体文风。

  1. 先把落子能力与解释能力拆开

    模型能给出强坐标,不代表它对厚薄、征子或先后手的每句解释都正确;反过来,术语流畅也不证明落子强。两项需要独立基准。

    同一输出分成坐标轨与语言轨,分别评分。
  2. 结构化棋盘输入比纯文字更可靠

    LoGos把围棋专业数据与通用长推理混合,并提供含规则处理的棋盘工具和KataGo-Bench。论文报告职业级表现,但结论应限制在其任务与评测设置。

    纯坐标文本与显式棋盘状态进入不同验证路径。
  3. 概念存在于策略网络,不等于自动可说清

    ACL 2022用一万盘人类注释探测policy network,发现ko、atari等高层概念在后层可被非平凡预测。表示中有signal,仍需要忠实的语言映射。

    network内部concept probe与最终自然语言之间还有一层翻译。
  4. 把长讲解拆成原子断言

    一句“这手攻击白棋并保持先手”至少含落点合法、攻击对象、应手强制性和后续价值四项。逐项路由到规则引擎、KataGo变化与专家概念库,才能定位幻觉。

    一段流畅文字被拆成四张可验证claim卡。
  5. 借用工具增强评测而不是LLM自评

    2026棋类讲解研究ACT-Eval显示,无工具的强模型仍有大量错误子断言,工具能提高事实正确性但专家概念覆盖仍有限。围棋应采用同样的claim-level审计。

    整体高分被拆成factual correctness与concept coverage两条曲线。
  6. 用局部连续变化区分“有证据”和“只顺口”

    在同一历史局面切换A、B,并逐手核对解释:如果一段说明提到的棋形、次序或作用只出现在A,却原样套到B,这个理由就没有被B的变化支持。胜率和目差能说明局部效率差,但不能替代对具体棋形的解释。

    看第5、6手:A在中央连续落子,B跳到两个角;B若仍使用同一段中央战解释,理由就没有棋盘支持。
  7. 发布一份解释合同

    最终输出列出合法性、候选排名、PV支持、规则条件、事实claim、教学类比与不确定性。语言模型负责组织,棋盘与工具负责约束,专家负责概念完整性。

    解释合同让读者知道每句话由哪类证据担保。

模型、数据与评测

  1. LoGos paper
  2. LoGos code and benchmark
  3. ACL · natural-language Go annotations
  4. ACT-Eval hallucination methodology

发布AI讲棋前

  • 落子与解释分别评分
  • 所有坐标先过规则引擎
  • 长句拆成原子claim
  • PV只支持它实际展示的内容
  • 事实正确与概念覆盖分开
打开棋力分层研究