ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
AtaraxosがNatureに掲載:MITチーム、1%の学習量でAIが軍人将棋の人間トップを超える

AtaraxosがNatureに掲載:MITチーム、1%の学習量でAIが軍人将棋の人間トップを超える

AI情報 • Admin • • 5 回閲覧

Ataraxosは、MIT、カーネギーメロン、ニューヨーク大学、スタンフォードのチームが2026年9月30日にNatureに発表したAIシステムだ。「軍人将棋」(ストラテゴ)で世界1位の人間プレイヤーに大差で勝利した。不完全情報ゲームでAIが人間のトップを決定的に引き離したのは史上初だ。名前はギリシャ語に由来し「泰然自若」を意味する。そのまま棋風でもある。

第一の手:自己対戦で鍛えた「青写真戦略」

チームは自己対戦強化学習でAtaraxosを訓練した。モデルが自分自身と大量に対戦し、「青写真戦略」を練り上げる。アルゴリズムはより効率的で、速く学び、あらゆる手を列挙しない。棋力はDeepMindのDeepNashを厳密に上回り、学習サンプルはその100分の1未満、自己対戦局数は30分の1未満だった。数百万ドルを投じたDeepMindの旧来路線は、人間のトップ棋士を一度も破れなかった。

第二の手:指す前に相手の伏せ札を「脳内補完」

青写真戦略は出発点にすぎない。一手ごとに、Ataraxosは「デシジョンタイム・プランニング」でその場で選択を磨く。生成モデルを呼び出し、相手の隠れた駒の正体を確率的に推測し、最も確からしい盤面を再構成してから、未来の展開を評価して最善手を選ぶ。チームは、この生成モデルの革新的な使い方が超人レベルへの最後のピースだったと考えている。

戦績、そして汎用性

Ataraxosは世界最強のストラテゴプレイヤーに15勝1敗4分で勝利し、記録的な差をつけた。世界選手権では人間のトップ相手に39勝2敗。Barrage Stratego、協力型カードゲームのHanabi、「2対1」のドウディージューにも移植され、すべてで超人レベルに達した。

リスク計算は人間と全く違う。人間は切り札を暴かれると慌てて過剰に修正し、情報を漏らす。Ataraxosは不気味なほど落ち着き、秘密を明かさない。

盤上から交渉テーブルへ

ストラテゴは現実の不完全情報問題のモデルとしてよく使われる。取引、指揮、交渉、サイバーセキュリティは同じ構造を持つ。チームの次のステップは解釈可能性だ。Ataraxosに意思決定を説明させる。「推奨に従うかどうか、最終決定権は人間が持たなければならない。導入の前にモデルの意思決定を監査できなければならない」。

強化学習による意思決定は推論モデルでも実証済みだ。アリババのQwQ-32Bは強化学習で32Bの推論力をより大きなモデル並みに引き上げた。Ataraxosは、このアプローチが「札が見えない」勝負でも同様に通用することを証明した。

おすすめツール

もっと見る