はじめに
OpenAIはGPT-5.6シリーズに大幅な価格調整を実施しました。
2026年7月30日より、同社はGPT-5.6 LunaのAPI価格を80%値下げし、GPT-5.6 Terraの価格を20%値下げしました。フラッグシップモデルGPT-5.6 Solの標準価格は変わりませんが、OpenAIは高速モードを導入し、標準モードの最大2.5倍の処理速度を実現しつつ、同じモデル知能を維持しています。
この変更は、OpenAIがGPT-5.6 SolがGPT-5.6自体をサービスするためのシステム最適化にどのように貢献したかを示すエンジニアリング分析レポートを公開したタイミングで発表されました。OpenAIによると、本番グレードのGPUカーネルの改善によりエンドツーエンドのサービスコストが20%削減され、投機的デコードの改善によりトークン生成効率が15%以上向上したとのことです。
その結果、OpenAIはいわゆるコストパフォーマンス最前線においてより積極的な戦略を取っています。それは、使用する知能の量とタスクの経済的価値を一致させるというものです。

開発者にとって最も重要な変更は一目瞭然です。Lunaは高スループットのエージェントワークロードに対して圧倒的に低価格になり、Terraは日常使用のコストが下がり、遅延が価格よりも重要な場合にはSolをより高いサービスレベルで購入できます。
- Lunaは80%値下げ、Terraは20%値下げ、Solは高速モードを導入
7月30日の価格更新はGPT-5.6シリーズ全体に及びますが、モデルごとの調整幅は異なります。
GPT-5.6 Luna:最大の値下げ
Lunaには最も大幅な値下げが適用されました。
標準API価格は以下の水準から調整されました:
| トークン種別 | 旧価格 | 新価格 | 変化 |
|---|---|---|---|
| 入力 | 1.00ドル / 100万トークン | 0.20ドル / 100万トークン | -80% |
| 出力 | 6.00ドル / 100万トークン | 1.20ドル / 100万トークン | -80% |
OpenAIはLunaをGPT-5.6シリーズで最速かつ最も手頃な価格のモデルと位置づけ、コスト重視の高スループットワークロードに最適化しています。
これには以下のタスクが含まれます:
- 分類
- 情報抽出
- バックグラウンドエージェント
- 日常的なコーディング作業
- テスト生成
- 構造化出力ワークフロー
- ツールを使用するサブエージェント
- 大規模ドキュメント処理
低価格化は特にエージェントループの経済性を変えました。1つのユーザーリクエストが単純な補完ではなく、複数回のモデル呼び出しを伴う可能性があるためです。
OpenAIによると、Lunaはツールを使用し多段階のワークフローを完了できるため、エージェントの動作をより高価なフロンティアレベルに限定することなく、より多くの作業を低コストのモデルに割り当てることが現実的になりました。
GPT-5.6 Terra:小規模だが意義深い値下げ
Terraの標準API価格は以下の通りです:
| トークン種別 | 旧価格 | 新価格 | 変化 |
|---|---|---|---|
| 入力 | 2.50ドル / 100万トークン | 2.00ドル / 100万トークン | -20% |
| 出力 | 15.00ドル / 100万トークン | 12.00ドル / 100万トークン | -20% |
Terraは依然としてGPT-5.6シリーズの中間モデルです。
Lunaより強力な推論能力を必要とするが、Solの高コストまでは不要なワークロード向けに設計されています。
代表的な用途には以下が含まれます:
- 日常的なエンタープライズエージェント
- コーディング支援
- ワークスペースQ&A
- ドキュメント分析
- 範囲を限定した調査
- 多段階の専門ワークフロー
OpenAIは、Notionが個人エージェントワークロードにTerraを使用している顧客の1つであると言及しました。例えば、遅延に敏感なワークスペースQ&Aや範囲を限定したタスクなどです。
GPT-5.6 Solは標準価格を維持
Solの標準API価格は変わりません:
| トークン種別 | 標準価格 |
|---|---|
| 入力 | 5.00ドル / 100万トークン |
| 出力 | 30.00ドル / 100万トークン |
Solの変更は値下げではありません。
その代わりに、OpenAIは高速モードを導入しました。
Sol高速モード:最大2.5倍の高速化
高速モードは、OpenAIの以前の「優先処理」という用語に取って代わるものです。
GPT-5.6 Solについて、OpenAIは高速モードの処理速度が標準処理より最大2.5倍高速で、モデル知能は不変であると述べています。
代償は価格です。
高速モードのコストは標準処理の2倍です。
Solの場合、これは以下のことを意味します:
| トークン種別 | 標準 | 高速モード |
|---|---|---|
| 入力 | 5.00ドル / 100万 | 10.00ドル / 100万 |
| キャッシュ入力 | 0.50ドル / 100万 | 1.00ドル / 100万 |
| 出力 | 30.00ドル / 100万 | 60.00ドル / 100万 |
既存のAPIリクエストでは以下の使用法:
service_tier="priority"
後方互換性が維持され、高速モードにルーティングされます。
OpenAIは以下もサポートしています:
service_tier="fast"
これは改名されたサービス識別子です。
待ち時間のコストが高速な推論のコストを上回る場合に、高速モードは有用です。
例としては以下が挙げられます:
- インタラクティブなコーディングエージェント
- 時間に敏感な本番ワークフロー
- リアルタイムのアナリスト支援
- 高価値の顧客オペレーション
- 多段階で遅延が蓄積する複雑なエージェントタスク
20回や30回のモデル呼び出しを必要とするワークフローでは、個々の呼び出しの遅延が低くても、単一のチャット応答よりも全体的に体感速度が大幅に遅くなる可能性があります。そのため、エージェントシステムでは、より高速な処理が不釣り合いに重要な影響を与える可能性があります。
ChatGPT WorkとCodexの使用量計測方法にも変更
LunaとTerraの低価格化は、ChatGPT WorkとCodexの使用量計算方法にも反映されています。
OpenAIの発表:
- 無料ユーザーとGoユーザーはTerraを使用できます。
- Plus、Pro、Business、EnterpriseユーザーはTerraとLunaを選択できます。
- サブスクリプション価格と割り当て予算は変わりません。
- LunaとTerraが安くなったため、現在これらのモデルを使用すると消費するクレジットが少なくなります。
これは有料サブスクリプション自体が安くなることを意味するものではありません。
この変更は、ユーザーがLunaまたはTerraを選択した場合、同じ割り当てをより長く使用できることを意味します。

コストパフォーマンスがより重要なモデル指標に
OpenAIはArtificial Analysis Intelligence Index v4.1に基づく価格と知能の比較チャートを公開し、Lunaの新しい位置づけを示しました。
このチャートでは、GPT-5.6 Lunaは知能指数50ポイント以上に位置し、価格調整後のLunaのうち
設定された推定タスクコストは約 0.05ドル です。
このデータは、個別のAPI呼び出しの価格と混同されるべきではありません。
Artificial Analysis は、モデルのトークン使用量とベンチマークの加重手法に基づいて、インテリジェンス指数タスクあたりのコストを算出しています。実際の本番環境でのリクエストコストは、以下によって異なります:
-
入力サイズ
-
出力サイズ
-
推論の深さ
-
プロンプトキャッシュ
-
ツール呼び出し回数
-
エージェントの実行ターン数
-
長いコンテキストの課金
-
リトライ機構
7月30日の値下げ以前、Artificial Analysis は、GPT-5.6 Luna の最大推論構成におけるインテリジェンス指数を約51と報告していました。
新しいより低いトークン価格により、Luna は「インテリジェンス対コスト」曲線の低コスト側へさらに近づきました。
OpenAI が伝えるより広範なメッセージは、企業はあらゆる場面で最も高価なモデルを使用すべきではないということです。
ワークフローでは、まず Sol を使用して曖昧さを排除し計画を立て、その後、明確に定義された実装、テスト、または反復的なタスクを Luna に割り当てる可能性があります。
下位層のモデルがツールの使用やマルチステップワークフローの完了にすでに十分な能力を持っている場合、このようなモデルルーティングはより魅力的になります。
- GPT-5.6 は GPT-5.6 を実行するインフラストラクチャの最適化に貢献
今回の値下げの前日、OpenAI は GPT-5.6 がどのように効率化されたかについての詳細な技術記事を公開しました。
この話で最も異例な点は、GPT-5.6 Sol 自体が最適化プロセスに関与したことです。
OpenAI によれば、同社のエンジニアは Codex を通じて Sol を使用し、本番システムの分析、パフォーマンスコードの作成、代替案のテスト、実験の監視を行いました。
同社は、主に3つのレベルの最適化について説明しています:
- エージェントツールスイート
- API とリクエストオーケストレーション
- GPU インフラストラクチャ上でのモデル推論
Sol は本番環境のGPUカーネルの最適化を支援
推論層において、OpenAI は GPT-5.6 Sol が本番カーネルを自律的に書き換え、最適化したと述べています。
GPUカーネルは、アクセラレータハードウェア上で数学演算を効率的に実行する役割を担う低レベルプログラムです。
基盤となるモデルアーキテクチャが変わらなくても、非効率なメモリ移動、同期、スケジューリング、データレイアウトにより、高価なGPUリソースが十分に活用されない可能性があります。
OpenAI は、Sol が以下のような最適化可能な計算タイプの特定を支援したと述べています:
- 事前計算可能なもの
- 回避可能なもの
- 並列化可能なもの
- 並べ替え可能なもの
- より効率的なカーネルで実装可能なもの
同社は特に、Triton と Gluon という2つのGPUプログラミング技術がこの作業に使用されたと言及しました。
OpenAI によると、カーネルの改善および関連するサービス最適化により、GPT-5.6 のエンドツーエンドのサービスコストが20%削減されました。
Sol は投機的デコードも改善
もう一つの重要な最適化は、投機的デコードによるものです。
投機的デコードの簡略化されたバージョンは以下の通りです:
- より小さなドラフトモデルが、いくつかの可能性のある後続トークンを予測します。
- メインモデルがこれらの候補トークンを並行して評価します。
- 受け入れられたトークンは、同じ量の順次生成作業を必要とせずに出力できます。
したがって、ドラフトモデルの品質が極めて重要です。
OpenAI は、GPT-5.6 Sol が投機モデルのアーキテクチャ向けに数百の実験を設計し実行したと述べており、変更点は以下の通りです:
- 規模
- 構造
- 特徴
- トレーニング構成
Sol はトレーニングプロセスも監視し、ハードウェア障害やトレーニングの不安定性が発生した場合には介入しました。
OpenAI によると、これにより得られた改善によりトークン生成効率が15%以上向上しました。

負荷分散も同様に重要
モデルコストは、単一のGPU内部で実行されるコードだけに依存するわけではありません。
リクエストは、以下の間でルーティングされる必要があります:
- リージョン
- データセンター
- アクセラレータの種類
- クラスター
- モデルインスタンス
- モデルサブネットワーク
- 計算コア
ワークロードの割り当てが不適切で一部のハードウェアがアイドル状態になると、アクセラレータの性能が高くても、コストが高いままになる可能性があります。
OpenAI は、Sol が本番トラフィックの分析、負荷不均衡の根本原因の特定、代替ルーティング戦略のテスト、リクエストを分散するためのヒューリスティックルールの調整を支援したと述べています。
このような運用レベルの最適化は、対応するハードウェアへの追加投資なしに、全体のスループットを向上させることができます。
コンテキスト管理による重複計算の削減
数分で紹介サイトを作り、リード獲得を伸ばす
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
OpenAI はまた、Codex や ChatGPT Work などのシステムで使用されるエージェントフレームワークも最適化しました。
エージェントは、最終結果を返す前に、モデルとツールを複数回呼び出す必要がある場合があります。
例えば、Codex は以下のことを行う可能性があります:
- ソースコードを確認する。
- デプロイ履歴を検索する。
- インシデントレポートを読む。
- ファイルを編集する。
- テストを実行する。
- エラーを確認する。
- コードを修正する。
- テストを再実行する。
各ループは、コンテキスト、ツール定義、以前の結果、環境情報を運ぶ可能性があります。
これらのコンテキストが不必要に増大すると、コストとレイテンシも増加します。
OpenAI は、そのエージェントフレームワークが遅延ディスカバリなどの技術を採用し、必要な場合にのみツール、スキル、プラグイン、MCP統合を公開すると述べています。
ツール出力は、モデルが異なる制限を要求しない限り、デフォルトで 10,000トークンに制限されます。
これにより、大規模なツール結果がコンテキストウィンドウを不必要に満たす可能性が低減されます。
履歴の追記のみ許可によるプロンプトキャッシュの保持
エージェントループは通常、同じ指示とコンテキストを複数回再利用します。
プロンプトキャッシュを使用すると、安定したプロンプトプレフィックスの再計算を回避できます。
ただし、キャッシュが機能するのは、繰り返されるプレフィックスが完全に同一である場合のみです。
OpenAI は、そのフレームワークがモデルから見える履歴の追記のみの特性を維持していると述べています:
- 新しいメッセージは末尾に追加されます。
- ツール結果は末尾に追加されます。
- 環境の更新は末尾に追加されます。
- ツールの順序は決定論的です。
- ランタイムの承認設定はツール定義では処理されません。
この設計により、Codex と ChatGPT Work におけるプロンプトキャッシュの再利用率が向上します。
基本原則はシンプルです:
モデルがより安価になるのは、トークンコストが低いからだけでなく、周囲のシステムが最初から不必要なトークンの生成と処理を回避しているからです。
効率化のループは複合効果を生み出す
OpenAI はこれをフィードバックループとして説明しています。
より強力なモデルは、エンジニアが以下を改善するのに役立ちます:
- GPUカーネル
- ルーティング
- 投機的デコード
- キャッシュ
- ワークロード構成
- エージェントオーケストレーション
これらの改善により、コストとレイテンシが削減されます。
より効率的なインフラストラクチャにより、より強力なモデルを大規模に実行することが経済的になります。
OpenAI は、これによりモデル研究開発から大規模デプロイまでのサイクルが短縮され、AIイノベーションの反復速度が加速すると考えています。
次世代の最適化効果を見つける必要があります。
7月30日のLunaとTerraの価格引き下げは、これまでで最も顕著な顧客向けの結果です。
- 開発者の反応:Luna がより注目を集め、競合他社は新たな価格圧力に直面
元の中国語レポートはまた、発表後の開発者コミュニティの熱狂的な反応を強調しました。
一部のユーザーは、Luna の値下げ幅の大きさに焦点を当てました。
80%の削減は、フロンティアAPIで一般的な段階的な価格調整よりもはるかに大きいものです。
他の人々は、Luna は値下げ前に過小評価されていた、特にエージェントワークロードにおいて——より強力なプランナーの指導の下で、低コストのモデルが日常的な実行タスクを処理できるシナリオ——と考えました。
今回の価格調整はまた、Kimi K3 を含む他のコスト重視のモデルとの即座の比較を引き起こしました。
コミュニティで流行したバイラルなミーム画像は、この状況を次のように説明しました:Luna が突然、Kimi K3 の低価格ポジショニングに引き寄せられたユーザーをめぐって競争し始めた。
このミームは面白いですが、技術的なベンチマークではないため、本文の画像には含まれていません。
開発者は即座に Anthropic が応答するかどうかを問いただした
もう一つの一般的な反応は、@Anthropic に対して、Claude API の価格がそれに応じて調整されるかどうかを尋ねるものでした。
この反応は、大規模言語モデルのフロンティアにおける競争環境のより広範な変化を反映しています。
1年前、最も顕著な競争は以下に集中していました:
- ベンチマークスコア
- コーディング能力
- コンテキストウィンドウ
- マルチモーダル機能
これらの側面は依然として重要です。
しかし、本番レベルのエージェントを実行する開発者は、ますます以下に注目しています:
- タスク完了あたりのコスト
- レイテンシ
- 出力トークン使用量
- プロンプトキャッシュ効率
- ツール呼び出し回数
- 信頼性
- モデルルーティングの柔軟性
最も安いトークンが、必ずしも最も安いワークフローとは限らない。
同様に、最も賢いモデルが、ワークフローのすべてのステップにおいて最良のモデルであるとは限らない。
Lunaの値下げにより、モデルルーティングの魅力が高まる
あるタスクが5つの段階で構成されているとしよう:
- 曖昧な問題を理解する。
- 計画を立てる。
- 一般的なファイルを修正する。
- テストを書く。
- 結果を確認する。
あるチームは、段階1と2でSolを使用するかもしれない。
作業が明確に指定されている場合、Lunaは段階3から5を処理できる。
Lunaが安ければ安いほど、定型的なエージェントワークをフラッグシップモデルから分流させる動機が強まる。
これは、Lunaがすべての能力においてSolに匹敵するという意味ではない。
つまり、小さいモデルの価値は、割り当てられた特定のタスクに対して十分に賢いかどうかに依存する。
重要な指標は、成功あたりのコストである
OpenAIの新しい宣伝文句は、1ドルあたりの成果を繰り返し強調している。
これは、トークン価格だけに注目するよりも有用だ。
本番環境での評価では、以下を追跡すべきである:
- タスク成功率
- 入力トークン
- 出力トークン
- キャッシュ入力の再利用
- モデルラウンド数
- ツール呼び出し
- エンドツーエンドのレイテンシ
- リトライ率
- 人間による修正時間
- 成功タスクあたりの総コスト
トークンあたりのコストが5分の1のモデルでも、大量のリトライが必要であれば、依然として高くつく可能性がある。
より高価なモデルでも、より少ないステップで作業を完了できれば、全体のコストが低くなる可能性がある。
新しいLunaの価格設定により、計算コストは小さなモデルにとって有利になったが、開発者は依然として
特定のワークロードに対する評価を行う必要がある。
結論:モデル競争は、インテリジェンスとコストの比率へとシフトしている
7月29日と7月30日に発生した出来事は、OpenAIが2つの関連する理念を同時に推進していることを示している。
まず、GPT-5.6は、GPT-5.6自体を実行するインフラストラクチャを改善するために、ますます多く使用されている。
次に、同社はこれらの効率性の向上の一部を、より低い顧客価格とより高速なサービスオプションに転換している。
これにより、競争環境が変化した。
モデル市場の次の段階は、単に次のものだけではない:
どのモデルが最も賢いか?
それに加えて:
開発者は、1ドルを費やし、1秒のレイテンシを待つごとに、どれだけの有用なインテリジェンスを購入できるか?
Lunaの80%値下げにより、この問題は特に顕著になっている。
Terraは、日常的なプロフェッショナルワークにとってより安価になった。
Solは依然としてハイエンドモデルだが、Fastモードにより、開発者は時間が重要な場合に、より多くの費用を支払ってより高速な処理を利用できるようになった。
モデルの品質がより多くのタスクで接近するにつれて、同じハードウェアでより多くの有用な作業を実現し、これらの効率改善をより良い価格設定に転換できる企業が、ますます重要な競争優位性を得る可能性がある。
よくある質問
新しいGPT-5.6 Luna APIの価格はいくらですか?
2026年7月30日以降、OpenAIはGPT-5.6 Lunaの標準処理モードでの価格を、入力トークン100万あたり0.20ドル、出力トークン100万あたり1.20ドルとしています。これは、当初のトークン100万あたり1ドル/6ドルから80%の値下げです。
新しいGPT-5.6 Terraの価格はいくらですか?
GPT-5.6 Terraは現在、標準処理モードでの価格が、入力トークン100万あたり2ドル、出力トークン100万あたり12ドルです。OpenAIは、これは以前のトークン100万あたり2.50ドル/15ドルから20%の値下げであると述べています。
GPT-5.6 Solは値下げされましたか?
いいえ。Solの標準API価格は、依然として入力トークン100万あたり5ドル、出力トークン100万あたり30ドルです。主な変更点は、Fastモードの導入です。
GPT-5.6 Sol Fastモードとは何ですか?
Fastモードは、OpenAIのより高速なAPI処理層であり、従来のPriority Processing(優先処理)という名称に取って代わるものです。GPT-5.6 Solの場合、OpenAIは、標準トークン価格の2倍で、標準モードの最大2.5倍の処理速度を提供でき、モデルのインテリジェンスレベルは変わらないと述べています。
旧来のPriority Processing APIリクエストはまだ有効ですか?
はい。OpenAIは、priorityサービス層を使用したリクエストは引き続き後方互換性があり、自動的にFastモードを使用すると述べています。開発者は、fastサービス層の値を使用することもできます。
GPT-5.6は本当に自身の最適化を支援したのですか?
OpenAIは、人間主導のエンジニアリングプロセスでCodexを通じて使用されたGPT-5.6 Solが、本番トラフィックの分析、GPUカーネルの書き換え、数百回の投機的デコード実験の実行、およびトレーニングプロセスの監視に役立ったと述べています。OpenAIは、エンドツーエンドのサービスコストを20%削減し、トークン生成効率を15%以上向上させたことの一部を、これらの作業の成果としています。
値下げによりChatGPTのサブスクリプションは変わりますか?
サブスクリプション料金とクォータ予算は変わりません。OpenAIは、基盤となる価格が低くなったため、LunaとTerraは現在、CodexおよびChatGPT Workで消費するクレジットが少なくなっていると述べています。
Lunaは現在、すべてのエージェントワークロードにとって最良のモデルですか?
いいえ。Lunaははるかに安価ですが、モデル選択は依然としてタスクの難易度と許容可能なエラー率に依存します。一般的な戦略は、曖昧な計画タスクにはより強力なモデルを使用し、明確に定義された実行タスクにはより安価なモデルを使用することです。
関連ツール
- OpenAI API:GPT-5.6モデルおよびAPIサービスにアクセスするためのOpenAIの開発者プラットフォーム。
- GPT-5.6 Sol:フラッグシップGPT-5.6モデルの公式仕様。
- GPT-5.6 Terra:バランス型GPT-5.6層の公式モデルドキュメント。
- GPT-5.6 Luna:コスト重視型GPT-5.6層の公式ドキュメント。
- Codex:OpenAIのエージェントコーディング環境。GPT-5.6の最適化作業の一部で使用された。
- Artificial Analysis:インテリジェンスレベル、速度、トークン使用量、タスクあたりのコストを網羅する独立したモデル分析プラットフォーム。
関連リンク
- OpenAI:GPT-5.6で価格性能比の最前線を前進:7月30日に発表された、LunaおよびTerraの値下げとSol Fastモードに関するOpenAIの公式発表。
- OpenAI:GPT-5.6がフロンティアインテリジェンスとフロンティア効率をどのように融合させるか:負荷分散、GPUカーネル、投機的デコード、コンテキスト管理、プロンプトキャッシングに関するエンジニアリングの詳細。
- OpenAI Fastモード:より高速なAPI処理とFastモードの価格設定に関する公式ドキュメント。
- OpenAI GPT-5.6発表:GPT-5.6ファミリーの当初の一般的な利用可能性に関する発表とベンチマークの背景。
- Artificial Analysis:GPT-5.6ベンチマーク:7月30日の値下げ前の、GPT-5.6のインテリジェンスレベル、コーディングパフォーマンス、速度、コストに関する独立した分析。
- [Artificial Analysis GPT-5.6 Luna](https://artificialanalysis.
ai/models/gpt-5-6-luna/):Lunaのモデルレベル方法論とインテリジェンス指数の詳細。
- OpenAIモデルカタログ:公式APIモデルカタログと現在のモデル仕様。
まとめ
OpenAIはGPT-5.6 Luna APIの価格を80%引き下げ、Terraは20%引き下げる一方、Sol Standardの価格は据え置きました。Solには代わりにFastモードが新設され、API処理速度を最大2.5倍に高速化できますが、価格はStandardの2倍です。
このタイミングは、OpenAIの最近のエンジニアリング作業と密接に関連しています。同社によると、GPT-5.6 SolはGPUカーネル、投機的デコード、負荷分散、エージェント基盤の最適化に貢献し、エンドツーエンドのサービスコストを20%削減し、一部のテクノロジースタックではトークン生成効率を15%以上向上させました。
開発者にとっての結果は、コストパフォーマンスの幅が広がったことです。Solは最も困難なタスクに、Terraはバランスの取れた専門タスクに、Lunaは大規模エージェント実行をより低価格で利用できます。
GPT-5.6の更新は、フロンティアモデルの競争が、単なるベンチマーク上のインテリジェンス水準ではなく、成功した結果あたりのコストにますます焦点を当てていることを示しています。



