近期网络热传柯洁直播片段,里面提到一种对付围棋 AI 的思路,被网友概括为 “装弱智”。
开局故意下臭棋,下到AI都看不下去了,直接把他判定成低水平选手。AI一放松,不再做复杂防御。
这段话最近传得很热,但要说清楚,柯洁2026年8月直播谈的是寻找围棋AI的特殊漏洞,并不是已经通过公开正式比赛证明职业棋手重新超过了顶级AI。
有意思的是,找AI漏洞这件事,柯洁并不是现在才想到。
2017年5月,中国乌镇围棋峰会上,柯洁与DeepMind研发的AlphaGo进行三番棋。当时柯洁是世界顶尖职业棋手,首局执黑下了289手,最终以四分之一子的差距落败。
面对已经强得惊人的AlphaGo,柯洁思考的问题之一,就是能不能找到程序没有处理好的地方。
九年之后,柯洁直播里的说法变得随意很多,意思却没有完全变。不是正面跟AI拼每一步的计算,而是尝试把棋局带到AI不熟悉的状态。
柯洁提到的办法包括故意下出不符合正常棋理的着法,再寻找机会攻击大块棋。不过,把这种机制解释成AI认定对方水平低,所以像人一样轻敌,并不严谨。AI没有人的轻敌心理,真正值得注意的是神经网络在罕见棋形中的判断偏差。
这件事后来真被研究人员做成了实验。
2022年11月,Tony T. Wang、Adam Gleave、Tom Tseng、Kellin Pelrine等研究人员公开针对KataGo的研究。
他们训练的程序并没有在正常围棋上超过KataGo,而是专门寻找KataGo容易判断错误的局面。在特定超人类棋力设置下,对抗程序的胜率超过97%。论文后来于2023年收入国际机器学习大会ICML论文集。
研究人员找到的关键办法叫循环攻击。
对抗程序会设法形成一种很不寻常的棋形,让KataGo的大块棋出现环状结构,然后慢慢从外围包围。KataGo在相当长时间里仍认为自己的大块棋没有危险,于是继续在别处落子。等KataGo终于判断大龙可能被吃,往往已经来不及处理。
更离谱的一幕随后出现了。研究人员发现,这种套路并不需要顶尖职业棋手才能操作。理解方法后,人类棋手也能够复现。
论文记录,一名具备围棋经验的论文作者曾用类似方法攻击KataGo、Leela Zero等程序,还曾在测试中战胜获得九颗让子的JBXKata005。
不过,这并不代表所有围棋AI都存在完全相同的漏洞。针对KataGo训练出的程序直接转攻Leela Zero时,132局只赢8局,胜率约6.1%;攻击ELF OpenGo则是142局赢5局,约3.5%。能赢说明漏洞具有一定迁移能力,但远没有达到攻击KataGo时的效果。
KataGo开发者也没有坐着等输。2022年12月以后,训练过程开始加入循环攻击相关局面,让新模型专门学习这些过去罕见的棋形。旧套路的效果因此下降。
研究人员随后重新训练攻击程序,继续找新模型的问题。2024年6月,Tom Tseng等人公布进一步研究。
他们测试人工构造局面的对抗训练、反复攻防训练以及改变网络结构等方法。结果很直接,针对已经发现的攻击进行训练确实有效,可针对升级模型重新训练的新攻击者,仍然能够找到新的失误方式。
这样再看柯洁直播里的那句“装弱智”,意思就清楚多了。真正值得关注的不是人类突然恢复了正面对抗AI的优势,而是一个棋力远超人类的系统,也可能在非常少见的合法局面中判断失常。
2017年柯洁面对AlphaGo时还在寻找那个可能存在的漏洞。几年以后,研究人员真的把类似问题摆到了棋盘上。
如今柯洁再次谈起这件事,棋盘上的问题已经变了,争论也没有结束。下一步真正难回答的,已经不是AI到底有多会下棋,而是还有多少AI从没认真见过的棋。
