最坏情况研究 · 25
超人围棋 AI 为什么会输给看似很弱的怪招
ICML 研究训练出的对抗策略在超人设置下对 KataGo 胜率超过 97%,靠的不是更强围棋,而是诱发系统性误判。平均棋力与最坏情况稳健性必须分开。
超人平均表现不保证每种分布都稳
传统自我对弈主要优化常见对局分布;对抗训练则主动寻找稀有但可重复的失败区。两种测量回答平均强度与最坏情况两个问题。
普通对局路径与对抗路径在状态空间走向不同区域。 循环攻击利用的是整体状态误判
公开研究中的核心攻击围绕巨大循环形:AI错误判断一组棋的死活或终局价值,对手在外围拿够目数。教学图只解释结构,不提供逐手利用脚本。
中央循环组与外围地盘必须同时读,不能只看局部提子。 97%结果不是弱棋手普遍能赢AI
该数字来自训练出的adversarial policy对指定超人设置,不代表任意人类或任意新版KataGo都能复现。论文同时指出人类专家能理解并实施核心策略。
实验胜率旁必须并列victim版本、visits与攻击者身份。 补上已知漏洞仍会出现适应性新攻击
AAAI 2025 比较手工局面训练、迭代对抗训练与架构改变;这些防御能挡住部分旧攻击,却没有承受为它们重新训练的adaptive attacks。
固定攻击测试与适应性攻击测试是两道不同闸门。 规则可以参与失败机制
公开gift attack案例利用positional superko阻止预期回提,说明稳健性测试必须把rules作为输入而非背景文字。不同规则下失败路线可能不成立。
同一未来回提在两套ko规则下分别开放与封闭。 防御报告要同时给平均与最坏情况
只公布普通自我对弈Elo会隐藏稀有失败;只公布攻击胜率也会夸大日常风险。版本报告应并列常规强度、固定攻击集与适应性红队结果。
三栏scorecard避免用一个数字概括全部能力。 把盲点当作信任边界而不是奇闻
分析工具应在复杂循环、超长死活和规则敏感局面显示不确定性,并允许换模型、加搜索和人工复核。超人AI仍需要知道何时不该独断。
最终棋盘标出需要second opinion的形状与复核路径。
同行评审研究
阅读AI盲点时
- 平均与最坏情况分开
- victim版本与visits明确
- 规则写入测试条件
- 固定攻击与adaptive attack分开
- 不把论文结果外推到所有模型