最坏情况研究 · 25

超人围棋 AI 为什么会输给看似很弱的怪招

ICML 研究训练出的对抗策略在超人设置下对 KataGo 胜率超过 97%,靠的不是更强围棋,而是诱发系统性误判。平均棋力与最坏情况稳健性必须分开。

  1. 超人平均表现不保证每种分布都稳

    传统自我对弈主要优化常见对局分布;对抗训练则主动寻找稀有但可重复的失败区。两种测量回答平均强度与最坏情况两个问题。

    普通对局路径与对抗路径在状态空间走向不同区域。
  2. 循环攻击利用的是整体状态误判

    公开研究中的核心攻击围绕巨大循环形:AI错误判断一组棋的死活或终局价值,对手在外围拿够目数。教学图只解释结构,不提供逐手利用脚本。

    中央循环组与外围地盘必须同时读,不能只看局部提子。
  3. 97%结果不是弱棋手普遍能赢AI

    该数字来自训练出的adversarial policy对指定超人设置,不代表任意人类或任意新版KataGo都能复现。论文同时指出人类专家能理解并实施核心策略。

    实验胜率旁必须并列victim版本、visits与攻击者身份。
  4. 补上已知漏洞仍会出现适应性新攻击

    AAAI 2025 比较手工局面训练、迭代对抗训练与架构改变;这些防御能挡住部分旧攻击,却没有承受为它们重新训练的adaptive attacks。

    固定攻击测试与适应性攻击测试是两道不同闸门。
  5. 规则可以参与失败机制

    公开gift attack案例利用positional superko阻止预期回提,说明稳健性测试必须把rules作为输入而非背景文字。不同规则下失败路线可能不成立。

    同一未来回提在两套ko规则下分别开放与封闭。
  6. 防御报告要同时给平均与最坏情况

    只公布普通自我对弈Elo会隐藏稀有失败;只公布攻击胜率也会夸大日常风险。版本报告应并列常规强度、固定攻击集与适应性红队结果。

    三栏scorecard避免用一个数字概括全部能力。
  7. 把盲点当作信任边界而不是奇闻

    分析工具应在复杂循环、超长死活和规则敏感局面显示不确定性,并允许换模型、加搜索和人工复核。超人AI仍需要知道何时不该独断。

    最终棋盘标出需要second opinion的形状与复核路径。

同行评审研究

  1. ICML · Adversarial Policies Beat Superhuman Go AIs
  2. AAAI · Can Go AIs Be Adversarially Robust?
  3. FAR AI · positional adversarial training

阅读AI盲点时

  • 平均与最坏情况分开
  • victim版本与visits明确
  • 规则写入测试条件
  • 固定攻击与adaptive attack分开
  • 不把论文结果外推到所有模型
打开搜索稳定性研究