Ataraxos 是 MIT、卡内基梅隆、纽约大学和斯坦福团队在 2026 年 9 月 30 日发表于《自然》的 AI 系统。它在"陆军棋"(Stratego)上大比分击败世界第一的人类选手——AI 首次在信息不完全棋类上甩开人类顶尖高手。名字源自希腊语,意为"泰然自若",也正是它的棋风。
第一招:自博弈炼出"蓝图策略"
团队用自博弈强化学习训练 Ataraxos:模型自我对弈大量对局,练出"蓝图策略"。算法更高效:学得快,不穷举每种走法。棋力严格超过 DeepMind 的 DeepNash,训练样本不到其百分之一,自博弈对局不到三十分之一——DeepMind 烧掉数百万美元的老路线,从没击败过人类顶尖棋手。
第二招:落子前先"脑补"对手的底牌
蓝图策略只是起点。每步之前,Ataraxos 先用"决策时规划"临场修正:调用生成模型按概率推测对手隐藏棋子身份,还原最可能的棋盘状态,再评估未来走法选出最优一手。团队认为,这个生成模型的创新用法补上了通往超人类水平的最后一块拼图。
战绩与通用性
Ataraxos 以 15 胜 1 负 4 平击败世界最强陆军棋手,创纪录分差;世锦赛对阵人类顶尖打出 39 胜 2 负。它还被搬到 Barrage Stratego、协作纸牌 Hanabi、"二打一"斗地主,全部超人类水平。
它计算风险的方式和人类迥异:人类王牌暴露会慌、过度补救反而泄露信息;它异常镇定,不交代底牌。
从棋盘到谈判桌
陆军棋常被用来建模现实非完全信息问题:交易、指挥、谈判、网络安全都是同类结构。团队下一步想加上可解释性,让 Ataraxos 能向人类解释决策——"人类必须对是否采纳建议有最终决定权,落地前得先能审计模型的决策。"
强化学习驱动决策在推理模型上也验证过,阿里 QwQ-32B 就用强化学习把 32B 推理能力推到更大模型水平。Ataraxos 证明,这条路在"看不见底牌"的博弈里同样走得通。