可学性地图 · 23
AI 最优与人类可学之间隔着多远
HumanSL 能按棋力预测人类着手,但最高概率、按分布采样与目标棋力并不是同一件事。教学要找的不是最像 AI 的人,而是下一步刚好可达的判断。
先把最强与最像人分成两轴
标准KataGo寻找强着,HumanSL学习不同棋力和年代的人类分布。两者一起用可以问“好手是否可发现”,但任何一个都不是学生思想的读取器。
同一盘面同时进入AI价值轴与HumanSL可发现性轴。 top-1并不自动最像目标棋力
HumanSL研究比较最高概率、直接采样与softmax,发现中间温度更能达到期望棋力。教学工具不能把概率第一当成唯一自然手。
A取top-1,B保留分布;两种agent的局部习惯不同。 距离上一手是被忽略的人类线索
研究用着手吻合率、likelihood和距上一手距离衡量人类相似,并发现按距离校正可改善尤其较弱棋力的表现。人常先回应局部,而非瞬间跳到全局最佳点。
AI全局跳转与人类局部回应在同一棋盘形成可见距离差。 棋力差异是概率带不是硬门槛
多棋力策略研究用不同skill policy改善段位估计,10盘达到80%、20盘92%的实验准确率。它支持分布有信息,不支持给一盘棋盖确定段位章。
5k、1d、5d、9d显示连续带,而非四道绝对墙。 桥接手连接当前习惯与目标概念
若AI好手在目标profile中极低,直接展示常常只留下坐标。更好的教学是找一手价值稍低但能暴露同一方向、弱点或先后手概念的桥接手。
A是难以发现的最优点,B是同概念但更可达的桥接点。 可学性还要经过延迟与迁移
一次看懂不等于学会。数日后用不同棋谱的同型局面测试检查顺序、候选集合与理由,才能区分记住截图和获得判断。
训练盘与迁移盘只共享结构,不共享坐标记忆。 生成个人学习前沿而不是段位标签
每条建议同时保存目损、目标profile概率、同概念桥接手、搜索稳定性与迁移结果。前沿会随棋手和模型更新,而不是永久写着“5段必会”。
学习card把价值、可达性、稳定性和迁移四项并列。
HumanSL与棋力研究
生成可学建议前
- 强度与像人程度分开
- 不用top-1代替分布
- 目标profile可追溯
- 提供桥接手而非只给答案
- 延迟迁移仍需验证