아타락소스는 MIT, 카네기멜런, 뉴욕대학교, 스탠퍼드 팀이 2026년 9월 30일 Nature에 발표한 AI 시스템이다. '육군 체스'(스트라테고)에서 세계 1위 인간 플레이어를 큰 점수 차로 꺾었다. 불완전 정보 게임에서 AI가 인간 최고를 결정적으로 따돌린 것은 역사상 처음이다. 이름은 그리스어에서 유래했으며 '태연자약'을 뜻한다. 두는 모양새 그대로다.
첫 번째 수: 자가 대결로 단련한 '청사진 전략'
연구팀은 자가 대결 강화 학습으로 아타락소스를 훈련했다. 모델이 자기 자신과 대량의 대국을 두며 '청사진 전략'을 벼린다. 알고리즘은 더 효율적이다. 빠르게 배우고 모든 수를 열거하지 않는다. 기량은 DeepMind의 DeepNash를 엄밀히 뛰어넘었고, 학습 샘플은 그 100분의 1 미만, 자가 대결 대국 수는 30분의 1 미만이었다. 수백만 달러를 쏟아부은 DeepMind의 기존 노선은 인간 최고 고수를 한 번도 꺾지 못했다.
두 번째 수: 두기 전에 상대의 숨은 패를 '머릿속으로 복원'
청사진 전략은 출발점에 불과하다. 매 수마다 아타락소스는 '의사결정 시점 계획'으로 그때그때 선택을 다듬는다. 생성 모델을 호출해 상대의 숨은 말의 정체를 확률적으로 추론하고, 가장 그럴듯한 판을 재구성한 뒤 미래 전개를 평가해 최선수를 고른다. 연구팀은 이 생성 모델의 혁신적 활용이 초인 수준으로 가는 마지막 조각이었다고 본다.
전적, 그리고 범용성
아타락소스는 세계 최강의 스트라테고 플레이어를 15승 1패 4무로 꺾어 기록적인 점수 차를 냈다. 세계 선수권에서는 인간 최고를 상대로 39승 2패를 기록했다. Barrage Stratego, 협력 카드 게임 Hanabi, '2대 1' 도우디주에도 이식됐고, 모두 초인 수준에 도달했다.
리스크 계산은 인간과 전혀 다르다. 인간은 비장의 패가 드러나면 당황해 과잉 수정하며 정보를 흘린다. 아타락소스는 소름 끼칠 정도로 침착해서 비밀을 내주지 않는다.
판 위에서 협상 테이블로
스트라테고는 현실의 불완전 정보 문제를 모델링하는 데 흔히 쓰인다. 거래, 지휘, 협상, 사이버보안은 같은 구조다. 팀의 다음 단계는 해석 가능성이다. 아타락소스가 자신의 의사결정을 설명하게 하는 것. "권고를 따를지 말지 최종 결정권은 인간이 가져야 합니다. 도입 전에 모델의 의사결정을 감사할 수 있어야 합니다."
강화 학습 기반 의사결정은 추론 모델에서도 입증됐다. 알리바바의 QwQ-32B는 강화 학습으로 32B 추론 능력을 더 큰 모델 수준으로 끌어올렸다. 아타락소스는 이 접근법이 '패가 보이지 않는' 승부에서도 마찬가지로 통함을 증명했다.