9 月 29 日、OpenAI は DevDay 2026 で GPT-6.1 Sol を発表した。GPT-6 Sol のアップグレード版で、エージェント型コーディング、computer use、専門業務ワークロードにおける知能は GPT-6 Astra に迫りながら、標準の入力・出力トークン価格は Astra の 5 分の 1 だという。
今回の発表の核心は価格だ。API の標準価格は入力 100 万トークンあたり 2 ドル、出力 10 ドル。キャッシュ入力はわずか 0.10 ドルで、標準入力より 95% 安く、GPT-6 Sol のキャッシュ入力の半額だ。OpenAI によれば、これにより「リクエストをまたいでコンテキストを再利用する」エージェントを構築・実行する余地が大きく広がる。提供範囲は、9 月 29 日から ChatGPT Work と Codex の Plus、Pro、Business、Enterprise、Edu ユーザー。API では gpt-6.1-sol として利用できる。通常の Chat にはまだ未対応だ。数日中には GPT-6.1 Sol Ultrafast も登場し、Codex 内のトークン生成速度が最大 8 倍になる。
ベンチマーク:Astra に追いついた領域
- DeepSWE v1.1(実コードベースでの長期ソフトウェア工学タスク):Astra と同等を約 5 分の 1 のコストで達成。GPT-6 Sol の最高スコアを 6.4 ポイント上回り、推論負荷も低い。
- GDP.pdf(表・図・細則を含む複雑な PDF から専門的な質問に回答):フォールバック付き Opus 5.5 を上回り、タスクあたりコストは半分以下。Astra の最高水準に迫り、コストは約 5 分の 1。
- AutomationBench(47 ツール、営業・マーケ・オペレーション部門をまたぐ多段階業務フロー):中程度の推論設定で Opus 5.5 を 2.2 ポイント上回り、コストは約 3 分の 1。GPT-6 Sol からは 4.8 ポイント向上。
- OSWorld 2.0 オフラインセット(長期の computer-use ワークフロー):GPT-6 Sol を 7 ポイント上回る。最大推論設定では Astra との差は 2.1 ポイント、タスクあたりコストは約 7 分の 1。
- Terminal-Bench Science 0.1(データ分析・シミュレーション・定理証明などの科学ワークフロー):GPT-6 Sol の 2 倍以上のスコア。タスク平均コストは 5.47 ドルで、Opus 5.5 の 23.21 ドル、Astra の 23.80 ドルを大きく下回る。
正確性と安全性:間違いが減り、挙動も素直に
正確性評価では、低推論設定における事実誤りを含む回答の割合が 11.4% から 7.7% に低下(約 32% 減)。各設定で Astra との差は 1.9 ポイント以内に収まる。アライメント評価では、「検索ツール故障の申告」「明示的制限の尊重」「エージェントタスクでの権限外行為の回避」といった難問での失敗率が GPT-6 Sol を下回る。自動安全レビュアーの回避試行は観測されず、Astra および GPT-6 Sol と同等だという。
意味すること:Astra が足踏みする中、Sol が現実解に
その数日前、OpenAI は来月予定だった GPT-6.1 Astra のリリースを、安全アライメント試験の基準未達を理由に中止した。Astra が「極限の知能」なら、Sol は「十分な知能を使える価格で」。開発者にとって本当のシグナルは、長期エージェントタスクのコスト構造が変わったことだ。キャッシュ入力 100 万トークン 0.10 ドルは、「コードベース全体をエージェントに長期投入する」を贅沢から日常操作に変える。代償も明確だ。依然として Astra ではない。Terminal-Bench Science の 68.1% は Astra が保持する最高記録であり、最難関の科学研究には OpenAI も Astra を推奨している。