可学性地图 · 23

AI 最优与人类可学之间隔着多远

HumanSL 能按棋力预测人类着手,但最高概率、按分布采样与目标棋力并不是同一件事。教学要找的不是最像 AI 的人,而是下一步刚好可达的判断。

  1. 先把最强与最像人分成两轴

    标准KataGo寻找强着,HumanSL学习不同棋力和年代的人类分布。两者一起用可以问“好手是否可发现”,但任何一个都不是学生思想的读取器。

    同一盘面同时进入AI价值轴与HumanSL可发现性轴。
  2. top-1并不自动最像目标棋力

    HumanSL研究比较最高概率、直接采样与softmax,发现中间温度更能达到期望棋力。教学工具不能把概率第一当成唯一自然手。

    A取top-1,B保留分布;两种agent的局部习惯不同。
  3. 距离上一手是被忽略的人类线索

    研究用着手吻合率、likelihood和距上一手距离衡量人类相似,并发现按距离校正可改善尤其较弱棋力的表现。人常先回应局部,而非瞬间跳到全局最佳点。

    AI全局跳转与人类局部回应在同一棋盘形成可见距离差。
  4. 棋力差异是概率带不是硬门槛

    多棋力策略研究用不同skill policy改善段位估计,10盘达到80%、20盘92%的实验准确率。它支持分布有信息,不支持给一盘棋盖确定段位章。

    5k、1d、5d、9d显示连续带,而非四道绝对墙。
  5. 桥接手连接当前习惯与目标概念

    若AI好手在目标profile中极低,直接展示常常只留下坐标。更好的教学是找一手价值稍低但能暴露同一方向、弱点或先后手概念的桥接手。

    A是难以发现的最优点,B是同概念但更可达的桥接点。
  6. 可学性还要经过延迟与迁移

    一次看懂不等于学会。数日后用不同棋谱的同型局面测试检查顺序、候选集合与理由,才能区分记住截图和获得判断。

    训练盘与迁移盘只共享结构,不共享坐标记忆。
  7. 生成个人学习前沿而不是段位标签

    每条建议同时保存目损、目标profile概率、同概念桥接手、搜索稳定性与迁移结果。前沿会随棋手和模型更新,而不是永久写着“5段必会”。

    学习card把价值、可达性、稳定性和迁移四项并列。

HumanSL与棋力研究

  1. KataGo Human SL release
  2. HumanSL human-likeness study
  3. Multiple-skill policy study

生成可学建议前

  • 强度与像人程度分开
  • 不用top-1代替分布
  • 目标profile可追溯
  • 提供桥接手而非只给答案
  • 延迟迁移仍需验证
打开棋力分层研究