本文へスキップ
Injoys
AIデータ

OpenAI GPT-5.6の価格・速度改定とモデル選択戦略

OpenAIは2026年7月30日からGPT-5.6 LunaとTerraのAPI価格をそれぞれ80%、20%引き下げ、SolにFast modeを導入した。今回の改定は、すべての作業に最上位モデルを使うのではなく、計画・実行・検証の各段階に合わせてモデルを配置し、結果当たりのコストを下げる戦略に重点を置いている。

閲覧数 11 読了目安 14分 KO EN JA ES

この記事を聞く・本文を読む

音声で聞く、または文字だけ読む。

OpenAI GPT-5.6の価格・速度改定とモデル選択戦略

Supertonic 3 AI生成音声

0:00 20:37

音声ダウンロード

ファイル名
openai-gpt-5-6-price-performance-model-routing-ja.mp3
形式
MP3 (audio/mpeg)
再生時間
20:37
ファイルサイズ
14.2 MB
生成エンジン
Supertonic 3

AIで生成した音声です。個人利用の範囲で自由にダウンロードしてご利用いただけます。

OpenAI GPT-5.6の価格・速度改定とモデル選択戦略

読了目安 14分

OpenAI GPT-5.6の価格・速度改定とモデル選択戦略
OpenAIは2026年7月30日からGPT-5.6 LunaとTerraのAPI価格をそれぞれ80%、20%引き下げ、SolにFast modeを導入した。今回の改定は、すべての作業に最上位モデルを使うのではなく、計画・実行・検証の各段階に合わせてモデルを配置し、結果当たりのコストを下げる戦略に重点を置いている。
GPT-5.6 LunaのAPI価格は、入力100万トークン当たり0.20ドル、出力100万トークン当たり1.20ドルに引き下げられた。
GPT-5.6 TerraのAPI価格は、入力100万トークン当たり2ドル、出力100万トークン当たり12ドルに引き下げられた。
GPT-5.6 SolのFast modeは、発表時点でStandard処理より最大2.5倍高速で、価格は2倍となり、モデルの知能水準は維持される。
企業はSolで複雑な判断と計画を行い、LunaまたはTerraで反復実行と検証を処理する階層型構成を適用できる。
OpenAIは、モデル、推論インフラ、エージェントハーネスの共同最適化により、価格引き下げと処理量の改善が可能になったと説明している。
OpenAIは、GPT-5.6製品群の実行効率の改善を、API価格の引き下げと処理速度の向上につなげた。重要なのは、最も強力なモデル1つをすべての作業に適用することではなく、作業のリスク・複雑さ・レイテンシ・検証可能性に応じてSol、Terra、Lunaを組み合わせ、結果当たりのコストを下げることである。
価格と性能の数値は、OpenAIが2026年7月30日に発表した内容に基づく。顧客企業のベンチマークと効率改善の数値は、OpenAIまたは発表内で引用された企業による測定結果であるため、すべての環境で同様に再現されるとは限らない。
2026年7月30日のAPI価格変更
GPT-5.6 LunaとTerraの変更後のAPI価格は次のとおりである。
モデル | 入力100万トークン | 出力100万トークン | 引き下げ幅 | 主な役割 GPT-5.6 Luna | 0.20ドル | 1.20ドル | 80% | 大量処理、反復作業、明確な実行業務 GPT-5.6 Terra | 2ドル | 12ドル | 20% | 品質・コスト・速度のバランスが必要な日常業務 GPT-5.6 Sol | 発表上の変更なし | 発表上の変更なし | なし | 複雑な推論、計画、重要な意思決定
ChatGPTとCodexの有料サブスクリプション価格や全体の割り当て予算は、今回の発表では変更されない。ただし、TerraとLunaを使用する際に差し引かれるクレジットは減少する。AWS経由の価格変更は、7月30日遅くから順次適用されるとOpenAIは案内した。
APIコストの計算例
トークンコストは次のように計算できる。
総コスト = 入力トークン数 ÷ 1,000,000 × 入力単価 + 出力トークン数 ÷ 1,000,000 × 出力単価
たとえば、入力1,000万トークンと出力200万トークンを処理する場合、単純なトークン単価に基づくコストは次のとおりである。
モデル | 入力コスト | 出力コスト | 合計 Luna | 2ドル | 2.40ドル | 4.40ドル Terra | 20ドル | 24ドル | 44ドル
実際の請求額には、キャッシュの適用有無、選択した処理方式、ツール呼び出し構造など、サービスごとの条件が影響する可能性がある。
GPT-5.6製品群の役割
GPT-5.6は単一モデルではなく、コストと性能が異なる階層型の製品群で構成される。
GPT-5.6 Sol
Solは、最高水準の推論と複雑な問題解決を担う。要件が曖昧な場合や失敗コストが大きい判断、長期計画、重要な結果のレビューに適している。
GPT-5.6 Terra
Terraは、性能、コスト、応答速度のバランスを目標とする。組織内の質疑応答、範囲が定められたエージェント業務、一般的な分析やコーディングなど、Lunaより高い判断力が必要だが、常にSolを使用する必要はない作業に適している。
GPT-5.6 Luna
Lunaは最も高速で低価格な階層である。単純な短文生成だけでなく、ツール呼び出しや複数段階のワークフローにも対応するため、明確に定義された作業を大規模に繰り返す実行モデルとして活用できる。
代表的な適用業務は次のとおりである。
· 大量の文書および顧客問い合わせの分類 · 構造化されたデータの抽出 · 反復的なコード修正 · テストの作成と実行 · ルールが明確な文書生成 · 大規模なコンテンツレビュー · バックグラウンドエージェントの自動化 · 反復的なリサーチ支援
OpenAIは、Lunaが1年前に最先端クラスと評価されていたモデルと同程度の性能を、推定される作業当たり約6%のコストと、ほぼ9倍の速度で提供すると主張している。ここでの6%はトークン単価の直接比較ではなく、同じ作業結果を得るために必要な推定コストを比較した値である。
Sol Fast modeの特徴
GPT-5.6 Solには、API向けのFast modeが導入された。これは従来のPriority Processingに代わるもので、Codexの/fast機能に対応する概念である。
項目 | Fast mode 速度 | Standard処理より最大2.5倍高速 モデルの知能 | OpenAIの発表基準でStandardと同一 価格 | Standard処理価格の2倍 既存の互換性 | priorityタグのリクエストをFast modeで自動処理
Fast modeの最大2.5倍という表現は、すべてのリクエストのレイテンシが正確に同じ割合で短縮されることを保証するものではない。プロンプトの長さ、出力の長さ、サービス負荷、ツール呼び出し回数によって、実際に体感する速度は異なる可能性がある。
Fast modeが適している場合
· ユーザーが応答を待つリアルタイムサービス · コードの修正と確認を迅速に繰り返す開発環境 · Solの呼び出しがエージェント全体のレイテンシを決める作業 · インシデント対応や障害分析のように、数分の遅延も重要となる状況 · 処理遅延によって発生するコストが追加のAPIコストを上回る業務
バックグラウンドバッチ、夜間分析、非同期処理のように、完了時点を急がない作業ではStandard処理の方が経済的な場合がある。
結果重視のモデル選択基準
モデル選択は、ランキング表で最上位のモデルを選ぶ問題ではない。次の質問を作業ごとに検討する必要がある。
判断要素 | 確認する質問 失敗の影響 | エラーが顧客、売上、セキュリティ、または規制遵守にどのような影響を与えるか? エラー許容度 | 人がレビューするか、自動ルールでエラーを検出できるか? レイテンシ | ユーザーがリアルタイムで待っているか、非同期で処理してもよいか? 処理量 | 1日または1か月に何件処理する必要があるか? 問題の明確性 | 入力、ルール、期待される出力が十分に定義されているか? 推論の価値 | より強力な推論が実際の結果品質を有意に高めるか? 検証可能性 | テスト、スキーマ、クロスチェックによって結果を判定できるか?
明確で自動検証が可能な作業は、Lunaに適している可能性が高い。一定の判断力が必要ならTerraを検討できる。曖昧さの解消、高リスクの判断、または失敗結果の最終レビューにはSolが適している。
Solで計画しLunaで実行する構成
1つのエージェント作業内でも、段階ごとに異なるモデルを配置できる。たとえば、コーディングエージェントは次のように構成できる。
· Solが要件の曖昧さを見つけ、質問を整理する。 · Solが実装計画、変更範囲、リスク要因を決定する。 · Lunaが明確になった変更内容をコードとして実装する。 · Lunaがテストを作成して実行する。 · LunaまたはTerraがテスト結果とコードの差分を評価する。 · 失敗の可能性が高い、または重要な結論のみをSolが再検討する。
この構成では、すべての段階でSolを使う方式よりコストを抑えながら、重要な判断に高い推論能力を集中できる。ただし、モデルを分ける場合は、ルーティングルール、エラー処理、ログ追跡、評価体系を別途設計する必要がある。
価格引き下げを支えた3つの効率階層
OpenAIは、コスト削減が単なる価格政策ではなく、3つの階層における技術的改善から生まれたと説明している。
· モデル自体のトークン効率 · 推論システムのハードウェア効率 · モデル・ツール・コンテキストを接続するエージェントハーネスの効率
この説明はOpenAIが公開した技術資料に基づくものであり、詳細なコスト構造のすべてが外部に公開されたわけではない。したがって、価格引き下げに対して技術効率と戦略的な価格政策がそれぞれどの程度寄与したかを、外部から確定することは難しい。
モデルと推論システムの最適化
トークン当たりの作業遂行量の改善
GPT-5.6は、作業成功率だけでなく処理効率も同時に最適化するよう訓練されたというのがOpenAIの説明である。不必要に長い推論や反復を減らし、より少ないトークンで必要な結果に到達するよう設計することで、トークン当たりの知能と作業遂行量を高めたという意味である。
負荷分散とリクエストルーティング
推論システムは、地域、利用可能な容量、アクセラレーターの種類に基づいて、リクエストをデータセンターとクラスターに分配する。クラスター内部では、現在の負荷、入力コンテキストの長さ、キャッシュの利用可能性、リクエストの特性などを考慮してモデルインスタンスを選択する。
OpenAIは、GPT-5.6 SolとCodexをプロダクショントラフィックの分析、負荷不均衡の原因調査、ルーティング戦略の試験、ヒューリスティクスの調整に活用したと明らかにした。
GPUカーネルの最適化
GPUカーネルは、モデルの数学演算をハードウェア上で実行する中核コードである。メモリ移動、同期、データ配列、並列化方式によって、同じGPUでも処理コストは異なる。
OpenAIによると、GPT-5.6 SolはCodex環境でTritonとGluonを使用し、プロダクションカーネルの作成と最適化に関与した。カーネルの改善と関連する最適化を合わせた結果、モデル提供のエンドツーエンドコストが20%削減されたと同社は明らかにした。
エンドツーエンドコストとは、特定の演算1つではなく、ルーティング、データ移動、モデル実行、出力生成など、実際のリクエスト処理全体にかかるコストを指す。
カーネルの正確性検証
高速なカーネルでも、数値的に誤った結果を生成すれば使用できない。OpenAIは、AIが作成したカーネルの正確性を確認するため、FpSanを含む検証ツールに投資したと説明している。FpSanはFloating-Point Sanitizerの略で、浮動小数点演算に関連するエラーを検出するオープンソースツールである。
これは、AIがプロダクションインフラのコードを生成する際、性能ベンチマークだけでなく、数値検証、回帰テスト、失敗時の復旧手順も必要であることを示している。
投機的デコーディングとKVキャッシュ
投機的デコーディング
投機的デコーディングは、小さなドラフトモデルが今後生成されるトークンを先に提案し、大きなメインモデルが複数の候補を並列に検証する方式である。提案が受け入れられれば、メインモデルによる高コストな逐次計算の回数を減らせる。
OpenAIは、GPT-5.6 Solがドラフトモデルのサイズと構造を変更する数百件の実験を設計・実行し、学習をモニタリングしたと明らかにした。その結果、トークン生成効率が15%以上向上したという説明である。
KVキャッシュとワークロード別の設定
モデルは入力を処理しながらKey-Valueキャッシュ、すなわちKVキャッシュを作成する。最適な設定は、入力と出力の長さ、バッチサイズ、キャッシュヒット率、同時リクエスト数、メモリ容量、モデルのシャーディング方式によって異なる。
OpenAIは、SolとCodexで実際のワークロードを分析し、設定候補を評価して、作業タイプ別のエンジン構成を細かく調整したと説明している。目的は、同じハードウェアでより多くのリクエストを処理することである。
エージェントハーネスとコンテキストコスト
エージェントは、1回のユーザーリクエストを解決するために、モデルとツールを複数回呼び出す。モデル呼び出しが30回必要な作業で、各呼び出しに1秒の不要な遅延が発生すると、全体の遅延は約30秒増える可能性がある。
OpenAIは、モデル、ツール、ユーザー環境を接続するRustベースのオーケストレーション階層を、エージェントハーネスと説明している。
必要なツールのみを遅延公開
ツール、プラグイン、スキル、MCP統合情報を最初からすべてプロンプトに入れると、入力トークンとレイテンシが増加する。ハーネスは、必要な時点でのみ関連するツール情報を公開する遅延探索方式を使用する。ツール出力は、モデルが別途上限を要求しない限り、デフォルトで1万トークンに制限されるとOpenAIは明らかにした。
正確なプレフィックスの保持とプロンプトキャッシュ
プロンプトキャッシングは、以前に処理した入力と同一の冒頭部分を再利用し、重複演算を減らす。キャッシュを再利用するには、プロンプトのプレフィックスが正確に一致する必要がある。
OpenAIのハーネスは、履歴を追記専用構造で管理し、新しいメッセージとツール結果を末尾に追加する。ツールは決定論的な順序で提示し、承認ポリシーのような実行設定はツール定義自体を変更せず、ランタイムに適用する。この方式は、反復的なエージェントループのキャッシュヒット率を高めるうえで有利である。
企業事例の数値の読み方
OpenAIの公式発表には、Replit、Notion、Ramp、Blitzy、Cognition、Dustなどの評価が含まれている。
· Notionは自社評価において、TerraがGPT-5.5と同程度の品質を、作業当たり半分のコストと60%短い時間で提供したと明らかにした。 · Blitzyは、Lunaの適用後、プロンプトキャッシュの再利用率が24%から90%に上昇し、従来のデフォルトモデルよりコストが87%低かったと説明した。 · Dustは、同じエージェント業務において、Lunaが従来のデフォルトモデルより40%高速で、40%低コストだったと明らかにした。 · Rampは、Lunaをバックグラウンドエージェント自動化のデフォルトモデルとして使用していると明らかにした。
これらの数値は、各企業の内部作業、プロンプト、評価基準、システム構造で測定された事例である。独立した共通ベンチマークではないため、他の組織の業務にそのまま適用すべきではない。導入前には、実際のデータとエラーコストを反映した独自評価が必要である。
導入前の検証チェックリスト
· 代表的な作業サンプルと正解または評価基準を用意する。 · Luna、Terra、Solの成功率と再試行率を同じ条件で比較する。 · トークンコストだけでなく、ツール呼び出し、レビュー要員、失敗からの復旧コストを含める。 · 平均レイテンシとともに、上位95%または99%のレイテンシを測定する。 · 自動テストやスキーマ検証が可能な段階を、低価格モデルの候補として分類する。 · 個人情報、セキュリティ、規制に関連する作業には、別途承認と記録のポリシーを適用する。 · 信頼度の低い結果をTerraまたはSolにエスカレーションするルーティング基準を定める。 · Fast modeの追加コストよりレイテンシ短縮の価値が大きいか、実際のトラフィックで検証する。
意義と限界
今回の再編は、AIモデル競争の基準が最高スコア1つから結果当たりのコストへ移行していることを示している。大規模な反復作業にはLuna、日常的な知識業務にはTerra、曖昧で重要な判断にはSolを配置することで、知能・速度・コストを業務ごとに組み合わせられる。
ただし、80%の価格引き下げが技術効率の改善と市場戦略にそれぞれどの程度由来するのかは、公開情報だけでは切り分けることが難しい。また、低価格モデルの経済性はトークン価格だけで決まるものではない。エラー率が高くなり、再試行や人によるレビューが増えれば、作業全体のコストが上昇する可能性がある。
したがって、重要な指標はモデル呼び出し1回の価格ではなく、検証を通過した結果1件を生み出すためにかかった総コストである。モデル別の成功率、再試行回数、レイテンシ、レビューコストを合わせて測定してこそ、GPT-5.6の価格引き下げが実際の事業価値につながるかを判断できる。
0:00 0:00
1 / 87

テキストのダウンロード

ファイル名
openai-gpt-5-6-price-performance-model-routing-ja.txt
形式
TXT (text/plain)
段落数
87

画面に表示されている内容をそのままテキストファイルで保存します。引用の際は出典を明記してください。

AIモデルのタスク振り分け、コスト削減、検証の流れを表した概念図。

要点

  • GPT-5.6 LunaのAPI価格は、入力100万トークン当たり0.20ドル、出力100万トークン当たり1.20ドルに引き下げられた。
  • GPT-5.6 TerraのAPI価格は、入力100万トークン当たり2ドル、出力100万トークン当たり12ドルに引き下げられた。
  • GPT-5.6 SolのFast modeは、発表時点でStandard処理より最大2.5倍高速で、価格は2倍となり、モデルの知能水準は維持される。
  • 企業はSolで複雑な判断と計画を行い、LunaまたはTerraで反復実行と検証を処理する階層型構成を適用できる。
  • OpenAIは、モデル、推論インフラ、エージェントハーネスの共同最適化により、価格引き下げと処理量の改善が可能になったと説明している。

OpenAIは、GPT-5.6製品群の実行効率の改善を、API価格の引き下げと処理速度の向上につなげた。重要なのは、最も強力なモデル1つをすべての作業に適用することではなく、作業のリスク・複雑さ・レイテンシ・検証可能性に応じてSol、Terra、Lunaを組み合わせ、結果当たりのコストを下げることである。

価格と性能の数値は、OpenAIが2026年7月30日に発表した内容に基づく。顧客企業のベンチマークと効率改善の数値は、OpenAIまたは発表内で引用された企業による測定結果であるため、すべての環境で同様に再現されるとは限らない。

2026年7月30日のAPI価格変更

GPT-5.6 LunaとTerraの変更後のAPI価格は次のとおりである。

モデル 入力100万トークン 出力100万トークン 引き下げ幅 主な役割
GPT-5.6 Luna 0.20ドル 1.20ドル 80% 大量処理、反復作業、明確な実行業務
GPT-5.6 Terra 2ドル 12ドル 20% 品質・コスト・速度のバランスが必要な日常業務
GPT-5.6 Sol 発表上の変更なし 発表上の変更なし なし 複雑な推論、計画、重要な意思決定

ChatGPTとCodexの有料サブスクリプション価格や全体の割り当て予算は、今回の発表では変更されない。ただし、TerraとLunaを使用する際に差し引かれるクレジットは減少する。AWS経由の価格変更は、7月30日遅くから順次適用されるとOpenAIは案内した。

APIコストの計算例

トークンコストは次のように計算できる。

総コスト = 入力トークン数 ÷ 1,000,000 × 入力単価 + 出力トークン数 ÷ 1,000,000 × 出力単価

たとえば、入力1,000万トークンと出力200万トークンを処理する場合、単純なトークン単価に基づくコストは次のとおりである。

モデル 入力コスト 出力コスト 合計
Luna 2ドル 2.40ドル 4.40ドル
Terra 20ドル 24ドル 44ドル

実際の請求額には、キャッシュの適用有無、選択した処理方式、ツール呼び出し構造など、サービスごとの条件が影響する可能性がある。

GPT-5.6製品群の役割

GPT-5.6は単一モデルではなく、コストと性能が異なる階層型の製品群で構成される。

GPT-5.6 Sol

Solは、最高水準の推論と複雑な問題解決を担う。要件が曖昧な場合や失敗コストが大きい判断、長期計画、重要な結果のレビューに適している。

GPT-5.6 Terra

Terraは、性能、コスト、応答速度のバランスを目標とする。組織内の質疑応答、範囲が定められたエージェント業務、一般的な分析やコーディングなど、Lunaより高い判断力が必要だが、常にSolを使用する必要はない作業に適している。

GPT-5.6 Luna

Lunaは最も高速で低価格な階層である。単純な短文生成だけでなく、ツール呼び出しや複数段階のワークフローにも対応するため、明確に定義された作業を大規模に繰り返す実行モデルとして活用できる。

代表的な適用業務は次のとおりである。

  • 大量の文書および顧客問い合わせの分類
  • 構造化されたデータの抽出
  • 反復的なコード修正
  • テストの作成と実行
  • ルールが明確な文書生成
  • 大規模なコンテンツレビュー
  • バックグラウンドエージェントの自動化
  • 反復的なリサーチ支援

OpenAIは、Lunaが1年前に最先端クラスと評価されていたモデルと同程度の性能を、推定される作業当たり約6%のコストと、ほぼ9倍の速度で提供すると主張している。ここでの6%はトークン単価の直接比較ではなく、同じ作業結果を得るために必要な推定コストを比較した値である。

Sol Fast modeの特徴

GPT-5.6 Solには、API向けのFast modeが導入された。これは従来のPriority Processingに代わるもので、Codexの/fast機能に対応する概念である。

項目 Fast mode
速度 Standard処理より最大2.5倍高速
モデルの知能 OpenAIの発表基準でStandardと同一
価格 Standard処理価格の2倍
既存の互換性 priorityタグのリクエストをFast modeで自動処理

Fast modeの最大2.5倍という表現は、すべてのリクエストのレイテンシが正確に同じ割合で短縮されることを保証するものではない。プロンプトの長さ、出力の長さ、サービス負荷、ツール呼び出し回数によって、実際に体感する速度は異なる可能性がある。

Fast modeが適している場合

  • ユーザーが応答を待つリアルタイムサービス
  • コードの修正と確認を迅速に繰り返す開発環境
  • Solの呼び出しがエージェント全体のレイテンシを決める作業
  • インシデント対応や障害分析のように、数分の遅延も重要となる状況
  • 処理遅延によって発生するコストが追加のAPIコストを上回る業務

バックグラウンドバッチ、夜間分析、非同期処理のように、完了時点を急がない作業ではStandard処理の方が経済的な場合がある。

結果重視のモデル選択基準

モデル選択は、ランキング表で最上位のモデルを選ぶ問題ではない。次の質問を作業ごとに検討する必要がある。

判断要素 確認する質問
失敗の影響 エラーが顧客、売上、セキュリティ、または規制遵守にどのような影響を与えるか?
エラー許容度 人がレビューするか、自動ルールでエラーを検出できるか?
レイテンシ ユーザーがリアルタイムで待っているか、非同期で処理してもよいか?
処理量 1日または1か月に何件処理する必要があるか?
問題の明確性 入力、ルール、期待される出力が十分に定義されているか?
推論の価値 より強力な推論が実際の結果品質を有意に高めるか?
検証可能性 テスト、スキーマ、クロスチェックによって結果を判定できるか?

明確で自動検証が可能な作業は、Lunaに適している可能性が高い。一定の判断力が必要ならTerraを検討できる。曖昧さの解消、高リスクの判断、または失敗結果の最終レビューにはSolが適している。

Solで計画しLunaで実行する構成

1つのエージェント作業内でも、段階ごとに異なるモデルを配置できる。たとえば、コーディングエージェントは次のように構成できる。

  1. Solが要件の曖昧さを見つけ、質問を整理する。
  2. Solが実装計画、変更範囲、リスク要因を決定する。
  3. Lunaが明確になった変更内容をコードとして実装する。
  4. Lunaがテストを作成して実行する。
  5. LunaまたはTerraがテスト結果とコードの差分を評価する。
  6. 失敗の可能性が高い、または重要な結論のみをSolが再検討する。

この構成では、すべての段階でSolを使う方式よりコストを抑えながら、重要な判断に高い推論能力を集中できる。ただし、モデルを分ける場合は、ルーティングルール、エラー処理、ログ追跡、評価体系を別途設計する必要がある。

価格引き下げを支えた3つの効率階層

OpenAIは、コスト削減が単なる価格政策ではなく、3つの階層における技術的改善から生まれたと説明している。

  1. モデル自体のトークン効率
  2. 推論システムのハードウェア効率
  3. モデル・ツール・コンテキストを接続するエージェントハーネスの効率

この説明はOpenAIが公開した技術資料に基づくものであり、詳細なコスト構造のすべてが外部に公開されたわけではない。したがって、価格引き下げに対して技術効率と戦略的な価格政策がそれぞれどの程度寄与したかを、外部から確定することは難しい。

モデルと推論システムの最適化

トークン当たりの作業遂行量の改善

GPT-5.6は、作業成功率だけでなく処理効率も同時に最適化するよう訓練されたというのがOpenAIの説明である。不必要に長い推論や反復を減らし、より少ないトークンで必要な結果に到達するよう設計することで、トークン当たりの知能と作業遂行量を高めたという意味である。

負荷分散とリクエストルーティング

推論システムは、地域、利用可能な容量、アクセラレーターの種類に基づいて、リクエストをデータセンターとクラスターに分配する。クラスター内部では、現在の負荷、入力コンテキストの長さ、キャッシュの利用可能性、リクエストの特性などを考慮してモデルインスタンスを選択する。

OpenAIは、GPT-5.6 SolとCodexをプロダクショントラフィックの分析、負荷不均衡の原因調査、ルーティング戦略の試験、ヒューリスティクスの調整に活用したと明らかにした。

GPUカーネルの最適化

GPUカーネルは、モデルの数学演算をハードウェア上で実行する中核コードである。メモリ移動、同期、データ配列、並列化方式によって、同じGPUでも処理コストは異なる。

OpenAIによると、GPT-5.6 SolはCodex環境でTritonとGluonを使用し、プロダクションカーネルの作成と最適化に関与した。カーネルの改善と関連する最適化を合わせた結果、モデル提供のエンドツーエンドコストが20%削減されたと同社は明らかにした。

エンドツーエンドコストとは、特定の演算1つではなく、ルーティング、データ移動、モデル実行、出力生成など、実際のリクエスト処理全体にかかるコストを指す。

カーネルの正確性検証

高速なカーネルでも、数値的に誤った結果を生成すれば使用できない。OpenAIは、AIが作成したカーネルの正確性を確認するため、FpSanを含む検証ツールに投資したと説明している。FpSanはFloating-Point Sanitizerの略で、浮動小数点演算に関連するエラーを検出するオープンソースツールである。

これは、AIがプロダクションインフラのコードを生成する際、性能ベンチマークだけでなく、数値検証、回帰テスト、失敗時の復旧手順も必要であることを示している。

投機的デコーディングとKVキャッシュ

投機的デコーディング

投機的デコーディングは、小さなドラフトモデルが今後生成されるトークンを先に提案し、大きなメインモデルが複数の候補を並列に検証する方式である。提案が受け入れられれば、メインモデルによる高コストな逐次計算の回数を減らせる。

OpenAIは、GPT-5.6 Solがドラフトモデルのサイズと構造を変更する数百件の実験を設計・実行し、学習をモニタリングしたと明らかにした。その結果、トークン生成効率が15%以上向上したという説明である。

KVキャッシュとワークロード別の設定

モデルは入力を処理しながらKey-Valueキャッシュ、すなわちKVキャッシュを作成する。最適な設定は、入力と出力の長さ、バッチサイズ、キャッシュヒット率、同時リクエスト数、メモリ容量、モデルのシャーディング方式によって異なる。

OpenAIは、SolとCodexで実際のワークロードを分析し、設定候補を評価して、作業タイプ別のエンジン構成を細かく調整したと説明している。目的は、同じハードウェアでより多くのリクエストを処理することである。

エージェントハーネスとコンテキストコスト

エージェントは、1回のユーザーリクエストを解決するために、モデルとツールを複数回呼び出す。モデル呼び出しが30回必要な作業で、各呼び出しに1秒の不要な遅延が発生すると、全体の遅延は約30秒増える可能性がある。

OpenAIは、モデル、ツール、ユーザー環境を接続するRustベースのオーケストレーション階層を、エージェントハーネスと説明している。

必要なツールのみを遅延公開

ツール、プラグイン、スキル、MCP統合情報を最初からすべてプロンプトに入れると、入力トークンとレイテンシが増加する。ハーネスは、必要な時点でのみ関連するツール情報を公開する遅延探索方式を使用する。ツール出力は、モデルが別途上限を要求しない限り、デフォルトで1万トークンに制限されるとOpenAIは明らかにした。

正確なプレフィックスの保持とプロンプトキャッシュ

プロンプトキャッシングは、以前に処理した入力と同一の冒頭部分を再利用し、重複演算を減らす。キャッシュを再利用するには、プロンプトのプレフィックスが正確に一致する必要がある。

OpenAIのハーネスは、履歴を追記専用構造で管理し、新しいメッセージとツール結果を末尾に追加する。ツールは決定論的な順序で提示し、承認ポリシーのような実行設定はツール定義自体を変更せず、ランタイムに適用する。この方式は、反復的なエージェントループのキャッシュヒット率を高めるうえで有利である。

企業事例の数値の読み方

OpenAIの公式発表には、Replit、Notion、Ramp、Blitzy、Cognition、Dustなどの評価が含まれている。

  • Notionは自社評価において、TerraがGPT-5.5と同程度の品質を、作業当たり半分のコストと60%短い時間で提供したと明らかにした。
  • Blitzyは、Lunaの適用後、プロンプトキャッシュの再利用率が24%から90%に上昇し、従来のデフォルトモデルよりコストが87%低かったと説明した。
  • Dustは、同じエージェント業務において、Lunaが従来のデフォルトモデルより40%高速で、40%低コストだったと明らかにした。
  • Rampは、Lunaをバックグラウンドエージェント自動化のデフォルトモデルとして使用していると明らかにした。

これらの数値は、各企業の内部作業、プロンプト、評価基準、システム構造で測定された事例である。独立した共通ベンチマークではないため、他の組織の業務にそのまま適用すべきではない。導入前には、実際のデータとエラーコストを反映した独自評価が必要である。

導入前の検証チェックリスト

  1. 代表的な作業サンプルと正解または評価基準を用意する。
  2. Luna、Terra、Solの成功率と再試行率を同じ条件で比較する。
  3. トークンコストだけでなく、ツール呼び出し、レビュー要員、失敗からの復旧コストを含める。
  4. 平均レイテンシとともに、上位95%または99%のレイテンシを測定する。
  5. 自動テストやスキーマ検証が可能な段階を、低価格モデルの候補として分類する。
  6. 個人情報、セキュリティ、規制に関連する作業には、別途承認と記録のポリシーを適用する。
  7. 信頼度の低い結果をTerraまたはSolにエスカレーションするルーティング基準を定める。
  8. Fast modeの追加コストよりレイテンシ短縮の価値が大きいか、実際のトラフィックで検証する。

意義と限界

今回の再編は、AIモデル競争の基準が最高スコア1つから結果当たりのコストへ移行していることを示している。大規模な反復作業にはLuna、日常的な知識業務にはTerra、曖昧で重要な判断にはSolを配置することで、知能・速度・コストを業務ごとに組み合わせられる。

ただし、80%の価格引き下げが技術効率の改善と市場戦略にそれぞれどの程度由来するのかは、公開情報だけでは切り分けることが難しい。また、低価格モデルの経済性はトークン価格だけで決まるものではない。エラー率が高くなり、再試行や人によるレビューが増えれば、作業全体のコストが上昇する可能性がある。

したがって、重要な指標はモデル呼び出し1回の価格ではなく、検証を通過した結果1件を生み出すためにかかった総コストである。モデル別の成功率、再試行回数、レイテンシ、レビューコストを合わせて測定してこそ、GPT-5.6の価格引き下げが実際の事業価値につながるかを判断できる。

画像

AIモデルのタスク振り分け、コスト削減、検証の流れを表した概念図。
3つのAI処理経路について、性能とコスト、接続インフラの違いを可視化している。

よくある質問

GPT-5.6 Lunaの変更後のAPI価格はいくらですか?

2026年7月30日時点で、Lunaは入力100万トークン当たり0.20ドル、出力100万トークン当たり1.20ドルです。OpenAIが発表した従来価格からの値下げ幅は80%です。

GPT-5.6 Terraの変更後のAPI価格はいくらですか?

Terraは入力100万トークン当たり2ドル、出力100万トークン当たり12ドルです。OpenAIが発表した値下げ幅は20%です。

GPT-5.6 Solの価格も引き下げられましたか?

いいえ。OpenAIの今回の発表では、SolのStandard処理の価格は変更されていません。その代わり、Standardより最大2.5倍高速で、価格が2倍のFast modeが追加されました。

Fast modeを使用すると、モデルの回答品質が低下しますか?

OpenAIは、Fast modeはSolの知能レベルを下げることなく処理速度を高めると説明しています。ただし、最大2.5倍という速度は上限を示す表現であり、実際のレイテンシーはリクエストの長さ、出力量、ツール呼び出し、システム負荷によって異なる場合があります。

既存のPriority Processingリクエストを修正する必要がありますか?

OpenAIの発表によると、既存のAPIリクエストの`priority`タグは引き続き機能し、自動的にFast mode処理へ接続されます。運用環境では、適用時期と実際の請求内容を別途確認するのが安全です。

どのような作業にLunaを使用するのが適していますか?

ルールと期待される出力が明確で、自動検証できる大量・反復作業に適しています。文書分類、データ抽出、反復的なコード修正、テスト実行、コンテンツレビュー、バックグラウンド自動化が代表的な例です。

TerraとLunaのうち、どちらのモデルを選ぶべきですか?

低コストと高スループットを優先し、作業が明確であれば、まずLunaから評価できます。より多くの文脈理解と判断力が必要であるものの、Solレベルの高度な推論までは必要ない場合は、Terraが適している可能性があります。

すべてのエージェント工程でSolを使用してはいけませんか?

使用できますが、コスト効率が低下する可能性があります。Solが計画と高リスクの判断を担い、LunaやTerraが明確な実行・テストを処理するように分ければ、重要な工程の品質を維持しながら全体のコストを削減できる可能性があります。

Lunaの6%という作業コストは、トークン単価の比較ですか?

いいえ。OpenAIが述べた約6%とは、比較対象と同様の作業結果を得るために必要な、推定される作業1件当たりのコストです。トークン単価だけを直接割って算出した数値ではなく、評価タスクと成功率を含む比較として理解する必要があります。

APIモデルの実際の経済性はどのように評価すべきですか?

トークン価格だけでなく、成功率、再試行回数、ツール呼び出しコスト、応答遅延、人によるレビュー時間、エラー復旧コストを含める必要があります。最も有用な指標は、検証に合格した結果1件当たりの総コストです。

出典

データフォーマット

このコンテンツを複数の機械フレンドリーなフォーマットで提供します。

データ専用言語 (機械翻訳、ファイルのみ提供)

インドネシア語 JSON MD ポルトガル語 JSON MD 中国語(繁体) JSON MD ドイツ語 JSON MD

再利用およびAI活用

出典表記を伴う検索インデックスとAI引用を歓迎します。詳しくはライセンスポリシーをご確認ください。

CC BY · ライセンス

訂正・改善・フィードバック 誤りや改善点をお知らせいただければ確認します。ログイン不要で送信できます。

コメント (0)

ログインが必要です

いいねやコメントには Google アカウントでのログインが必要です。

最初のコメントを残しましょう。

関連コンテンツ

法廷の天秤に設計図とデバイス、AIチップとネットワークが載るイラスト
レポート 🇺🇸 アメリカ

AppleがOpenAIを法廷に呼んだ営業秘密の争点

Appleは、元・現職従業員の経路を通じて、未公開の製品設計と製造工程に関する営業秘密がOpenAIに渡ったと主張し、使用禁止と損害賠償を求めたと伝えられている。OpenAIは主張を否定しており、核心的な争点は、そ...

公開日 2026-07-21 閲覧数 272

幾何学図形を動かしながら、AIロボットや分析・天秤の記号がある迷路を進む人物
AIデータ

AI時代に繁栄する人々:生産性と思考力をともに高める方法

AIが知的作業を速く、低コストにするほど、重要な差は知能よりも、難しい問題を探究し続け、結果を検証しようとする意志から生まれる可能性がある。AIを下書きの代行者ではなく、指導役・批評家・研究助手として活用すれば、生...

公開日 2026-07-31 閲覧数 102

企業データがAIネットワーク、セキュリティ検証、自動化を経て収益成長につながるフロー図
AIデータ

企業AXでROIを生み出すビジネスワールドモデル設計

企業AXの成否は、最新LLMの導入量よりも、業務ルール・状態・権限・行動・成果をAIが処理できるようにモデル化する能力にかかっている。ニューラルモデルによる柔軟な提案、シンボリック層による制約の検証、実行結果のフィ...

公開日 2026-07-29 閲覧数 138

文書やデータのアイコンが漏斗を通って中央のAIネットワークに集まる図
AIデータ

Claude 5モデルのためのコンテキストエンジニアリング規則

判断能力が向上したClaudeモデルでは、多数の詳細なルールよりも、明確な目的、適切に設計されたツール、タスクに合った参照資料が重要である。本稿では、重複する指示を減らし、必要な情報を適切なタイミングで提供するため...

公開日 2026-07-27 閲覧数 180