ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
Artificial Analysis が GPT-6 Sol/Luna を評価:コスト半減、能力は一進一退

Artificial Analysis が GPT-6 Sol/Luna を評価:コスト半減、能力は一進一退

AI情報 Admin 7 回閲覧

2026年9月22日、第三者のAIベンチマーク機関 Artificial Analysis が GPT-6 Sol と GPT-6 Luna の独立評価レポートを公開した。両モデルの発表後、初めての本格的な第三者スコアカードである。価格は確かに半減したが、能力の変化は一方的ではない——伸びた評価もあれば、後退した評価もある。

Artificial Analysis の中心的な測定結果によると、Intelligence Index のフル評価を回すコストは、GPT-6 Sol(最大 effort)で1タスクあたり約1.06ドルと、GPT-5.6 Sol の1.99ドルからほぼ半減。Luna は0.18ドルから0.07ドルへ、約6割の削減だ。Intelligence Index の総合スコアは前世代とほぼ同水準だが、内訳を見ると、コーディングエージェント能力は Sol がわずかに伸び、Luna はわずかに後退。知識労働系の評価では両モデルとも後退した。

値下げは本物:API価格は半額に

Sol の入出力価格は100万トークンあたり4ドル/20ドルから2ドル/10ドルへ、Luna は0.20ドル/1.20ドルから0.10ドル/0.50ドルへ。キャッシュ読み取りの90%割引とキャッシュ書き込みの25%割増は据え置きだ。興味深いことに、両モデルとも1タスクあたりの出力トークンはむしろ微増しており(Sol は2.9万→3.1万)、コスト削減は純粋に値下げによるものだ。評価対象は、OpenAI が9月22日に発表した GPT-6 Sol と Luna(本サイトの発表報道で既報)である。

伸びた点:コーディングとハルシネーション抑制

Artificial Analysis の Coding Agent Index(OpenAI 自社の Codex 環境で測定)では、Sol が57点を獲得し、GPT-5.6 Sol を2点上回った。Terminal-Bench 4.0 も37%から43%に向上している。ハルシネーション抑制も大きな改善点だ。知識系ベンチマーク AA-Omniscience では、Sol のハルシネーション率が92%から60%へ、Luna が93%から77%へ低下した。ただし Sol の手口は「慎重さ」で、回答率を99%から83%に下げ、誤答を約4分の1減らす代わりに、正答率も59%から54%に落としている。

後退した点:知識労働系ベンチマークは両モデルとも低下

44職種の経済価値タスクを集めた GDPval-AA v2.1 では、Sol が約100 Elo ポイント、Luna が約75ポイント低下。複数週にわたる知識労働プロジェクトの評価 AA-Briefcase v1.1 でも、Luna は約45ポイント落とした(Sol は横ばい)。数百件の出力を人手で点検した評価チームは、後退の主因を「成果物が短くなり、採点基準の必須要素を落としがち」にあると見ている——トークン節約のために回答を書きすぎないようにした結果だ。

選ぶ基準は価格だけでなく workload で

Codex のようなコーディングエージェントでコード系タスクを回すなら、Sol が割安だ。スコアは高く、1タスクあたり2.99ドルと前世代の半額で、「能力—コスト」のパレートフロンティア上にきっちり乗っている。抽出・要約のような高頻度の定型タスクなら Luna のコスト優位は依然として大きい。ただし長文ドキュメントを扱い、完成度の高い成果物が要る知識労働では、少量トラフィックで出力の完全性を検証してから本格移行したい。

今回の値下げは、Anthropic が Claude Opus 5.5 を20%値下げして発表したのと同じ日だった。2つのフロンティアラボが24時間以内に相次いで価格カードを切った形だ。Artificial Analysis の結論は抑制的だ。OpenAI はコスト効率フロンティアの大きな領域を押さえたが、「安い」は「全面的に強い」とは限らない。モデル選びで大事なのは、自分のタスクが「伸びた側」と「後退した側」のどちらにあるかだ。

おすすめツール

もっと見る