ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
GPT-6 Luna(Max)は1タスク5セント、コスパで Agent Arena 23 位に

GPT-6 Luna(Max)は1タスク5セント、コスパで Agent Arena 23 位に

AI情報 • Admin • • 5 回閲覧

GPT-6 Luna(Max)は、1 エージェントタスクあたりのコストを 5 セントまで引き下げた。9 月 28 日、Arena の公式アカウントはこの軽量モデルが Agent Arena にランクインし、23 位になったと発表した。ネット改善は +1.6%——8000 件の実際のエージェント会話に基づく統計で、前世代の GPT-5.6 Luna(xHigh)から 6 つ順位を上げた。 OpenAI にとって、これは「安くても良いものがある」ことの公開検証だ。

5 セントとはどういう水準か

比較すれば分かる。同 GPT-6 ファミリーのフラグシップ Sol(Max)は Agent Arena で 6 位、1 タスクあたりのコストは約 0.76 ドルだ。24 時間 365 日稼働が必要なエージェント——カスタマーサポートの Q&A、データクレンジング、継続監視、バッチコンテンツ処理——にとって、1 タスク 70 セントの差は、1 日 100 万回実行すれば数十万ドルの差になる。軽量モデルのランキングにおける価値は、絶対順位にあるのではなく、「十分使えて安い」という象限に位置があるかどうかだ。関連記事

OpenAI の製品ラインの役割分担が形になりつつある

Luna の位置づけは発表時から明確だ。公式データによれば、高推論ティアで前世代から 5.4 ポイント向上し、1 タスクあたりのコストは 58% 低下した。今回の Agent Arena での +1.6%(平均モデルに対するネット改善)は、その役割をさらに裏付ける——フラグシップと上限を競うのではなく、「大規模展開」のラインでデフォルトの選択肢になることだ。Sol が OpenAI の技術的天井を証明し、Luna がエージェントを価格に敏感なあらゆる場面に届ける。

この役割分担はランキングの動向にも表れている。軽量モデルはコスト効率を武器に Agent Arena のような実戦ランキングを着実に上げ、フラグシップモデルは Text Arena のような能力ランキングで守りを固める。2 つのラインが並走していることは、大規模モデル市場の競争が層化したことを示す——上限と規模は、2 つの異なるビジネスになりつつある。

向いている人、向いていない人

高頻度・低複雑度・耐障害性の高いエージェントタスクを展開するなら、Luna(Max)のようなモデルは優先的に評価する価値がある。コストの桁が変われば、「自動化する価値がある」タスクの境界線そのものが変わるからだ。一方、複雑で長期のタスク——多段階推論、ツールチェーンの編成、1 回の失敗のコストが高い場面——では、23 位の +1.6% が思い出させる。「平均を少し上回る」程度であり、フラグシップモデルが依然として堅実な選択だ。安さは強みだが、万能ではない。

おすすめツール

もっと見る