GPT-5.6 Sol API料金値下げで、Standardのinputは20%、outputは約33%安くなりました。
- 要点1: 短いコンテキストはinput $4、output $20
- 要点2: 272,000 token超はinput $8、output $30
- 要点3: プロモーション価格は少なくとも2026-11-21まで
対象: OpenAI APIの予算を管理するDX推進、開発、情報システム担当者
今日やること: 利用量をコンテキスト長と処理モード別に再集計する
この記事の目次
OpenAIは2026年8月21日、GPT-5.6 SolのAPI料金を更新しました。短いコンテキストをStandardで使う場合、100万tokenあたりのinputは$5から$4へ20%減、outputは$30から$20へ約33%減です。
企業にとって支出を見直す好機ですが、全リクエストが一律に同じ単価になるわけではありません。入力が272,000 tokenを超える処理やFast modeには別の料金が適用されます。本記事では、公式情報を基に新料金と企業の再見積もり手順を整理します。
GPT-5.6 Sol API料金値下げの概要
今回の変更で最も効果が大きいのは、Standardにおける短いコンテキストのoutputです。生成した回答に当たるoutputの単価が、100万tokenあたり$30から$20へ下がりました。
tokenとは、AIが文章を処理する際の細かな単位です。日本語では文字数とtoken数が一致しないため、見積もりには文字数ではなくAPIの利用記録にあるtoken数を使います。
| Standardの項目 | 新価格 | 旧価格 | 変更 |
|---|---|---|---|
| input | $4 | $5 | 20%減 |
| cached input | $0.40 | - | 現行単価 |
| cache write | $5 | - | 現行単価 |
| output | $20 | $30 | 約33%減 |
金額はすべて100万tokenあたりです。cached inputは、以前に保存した共通の入力を再利用するときの読込分を指します。cache writeは、その共通入力をキャッシュへ新たに書き込む分です。読込と書込は単価が異なるため、同じ「キャッシュ利用」として合算すると見積もりが崩れます。
新料金はプロモーション価格であり、少なくとも2026年11月21日まで続くと公式に案内されています。「少なくとも」という表現なので、同日直後に必ず旧価格へ戻るという意味ではありません。期間後の単価は公式発表を待って判断します。
出典はOpenAI API ChangelogとOpenAI API Pricingです。請求を確定する際は、公式料金ページの最新表示も確認してください。
実務での活用ポイント直近30日分の利用記録からinput、cached input、cache write、outputを分け、現行単価を適用した試算表を作成します。
272,000 token超は長いコンテキスト料金になる
値下げ後の$4と$20だけで予算を組むと、長文処理の費用を過小評価するおそれがあります。入力が272,000 tokenを超える場合は、長いコンテキスト向けの料金が適用されるためです。
コンテキストとは、モデルが一度の処理で参照する指示、資料、会話履歴などの情報範囲です。大量の文書を一つのリクエストへ詰め込むと、この境界を超えやすくなります。
| 長いコンテキストの項目 | 100万tokenあたり |
|---|---|
| input | $8 |
| cached input | $0.80 |
| cache write | $10 |
| output | $30 |
契約書群の照合、長いコードベースの分析、大量資料を使う調査では、272,000 tokenを超える処理が混ざり得ます。短い処理と長い処理を月間平均だけでまとめると、どちらが費用を押し上げたのか追えません。
対策は単純です。APIゲートウェイや利用台帳に「272,000 token以下」と「272,000 token超」の区分を持たせます。長い入力が続く場合は、文書検索で必要箇所だけを渡す方法や、処理を分割する方法も比較します。ただし、分割によって精度が落ちる業務では費用だけを理由に変更しません。
実務での活用ポイント長いコンテキストの件数、token数、業務名を週次で集計し、Standard短コンテキストとは別の予算枠で管理します。
\ Claude Codeの導入、何から始めればいいかわかります /
法人様のAI導入に関するご相談はこちらBatch・Flex・Standard・Fast modeの使い分け
処理モードは、安いものを一律に選ぶのではなく、業務が許容できる待ち時間で決めます。短いコンテキストのinputとoutputは、モードによって次のように変わります。
| モード | input | output | 適する業務 |
|---|---|---|---|
| Batch | $2 | $10 | 夜間の分類、要約、評価などの一括処理 |
| Flex | $2 | $10 | 遅延や可用性の変動を許容できる処理 |
| Standard | $4 | $20 | 通常の業務アプリ、社内ツール |
| Fast mode | $8 | $40 | 応答速度が業務価値へ直結する対話処理 |
金額は100万tokenあたりです。Batchは、複数の依頼をまとめて非同期で処理する方式です。結果をその場で返す必要がない集計やデータ整備に向きます。
Flexは、通常より低い料金と引き換えに、遅延やリソースの変動を受け入れる処理向けです。締切に余裕のあるバックグラウンド処理が候補になります。Batchと単価が同じでも、実行方法と許容条件を確認して選ぶ必要があります。
Fast modeは速度を優先します。顧客対応や操作支援など、数秒の差が離脱や作業停滞につながる場面では候補です。一方、夜間集計に使うと速度の価値を回収しにくく、単価だけが上がります。
実務での活用ポイント各API処理に「即時」「数分以内」「当日中」の期限を付け、期限に合う最も低コストなモードを選びます。
企業はAPI予算をどう再見積もりするか
新料金の反映は、単価表の差し替えだけでは終わりません。コンテキスト長と処理モードが混在するため、利用量を分けてから計算する必要があります。
利用量を四つの課金項目へ分ける
最初に、利用記録をinput、cached input、cache write、outputの四つへ分解します。そのうえで、各行へコンテキスト区分と処理モードを付けます。
最低限必要な列は次のとおりです。
- 利用日と業務名
- モデルの正式名称
- input、cached input、cache write、outputのtoken数
- 272,000 tokenを超えたか
- Batch、Flex、Standard、Fast modeの別
- 適用単価と費用
モデル名を「GPT系」のようにまとめると、別モデルの利用が混ざります。利用台帳と請求確認では「GPT-5.6 Sol」と正式名称で記録します。
100万token単位の式を予算シートへ入れる
基本式は「各項目のtoken数 ÷ 1,000,000 × 各項目の単価」です。inputだけで総額を見積もらず、四項目の結果を合計します。長いコンテキストと各モードは単価が異なるため、行を分けます。
ドル建て費用を社内予算へ変換するときは、会社が定める想定為替レートを適用します。消費税、API管理基盤、監視、ログ保管、開発保守などの費用はtoken料金と混ぜず、別の行に置くと差異を説明しやすくなります。
値下げ分を利用拡大へ直結させない
単価が下がっても、利用量が増えれば支出は上がります。値下げで生まれた余地を新機能へ振り向ける場合は、月間token上限と業務単位の上限を先に設定します。
品質評価も必要です。同じ業務を安いモードへ移した結果、処理遅延や再実行が増えれば、token以外の運用費が上がります。試験期間を設け、費用、応答時間、成功率を同じ表で比較するのが安全です。
実務での活用ポイント旧単価、新単価、実績利用量の三列を残し、値下げ効果と利用量増加の影響を分けて説明できるようにします。
\ 業務自動化のお悩み、プロが30分で整理します /
法人様のAI導入に関するご相談はこちら予算アラートと期間後の再見積もり
プロモーション価格には期間があります。予算管理では、月次請求を待つのではなく、利用増加と単価変更の両方を検知する仕組みが必要です。
まず、日次では急増を検知します。週次では業務別の傾向を確認し、月次では予算と実績の差を承認者へ報告します。アラートには少なくとも次の条件を含めます。
- 月間予算の50%、80%、100%へ到達したとき
- 272,000 token超のリクエストが急増したとき
- Fast modeの利用比率が想定を超えたとき
- cache writeがcached inputに比べて増え続けたとき
- outputが業務別の上限を超えたとき
そして、2026年11月21日の直前に再見積もり日を置きます。例えば、調達、開発、経理が確認できるよう、11月上旬に公式料金を再確認する運用です。期間後の価格を先回りして断定せず、変更が確認された時点で単価表と予算アラートを更新します。
実務での活用ポイントカレンダーに公式料金の再確認日を登録し、価格変更時の担当者、承認者、反映期限を決めておきます。
GPT-5.6 Sol値下げのよくある質問
Q. GPT-5.6 Solの新しいStandard料金はいくらですか?
短いコンテキストでは、100万tokenあたりinput $4、cached input $0.40、cache write $5、output $20です。入力が272,000 tokenを超える処理には別料金が適用されます。
Q. GPT-5.6 Solの値下げはいつまでですか?
公式案内では、プロモーション価格は少なくとも2026年11月21日までです。その後の料金は確定情報を確認し、予算を再計算してください。
Q. 272,000 tokenを超えると料金はどうなりますか?
長いコンテキスト料金となり、100万tokenあたりinput $8、cached input $0.80、cache write $10、output $30です。大量資料を扱う処理は短い処理と分けて集計します。
Q. cached inputとcache writeの違いは何ですか?
cached inputは、保存済みの共通入力を再利用する読込分です。cache writeは、再利用する入力をキャッシュへ新たに保存する書込分です。単価が異なるため、利用記録でも分けて管理します。
Q. BatchとFlexはどちらを使うべきですか?
一括処理としてまとめられる定型業務はBatchが候補です。遅延や可用性変動を許容できるバックグラウンド処理ではFlexを検討します。料金だけでなく、処理方式と完了期限を基準に選びます。
\ AI活用の「次の一手」を一緒に考えませんか /
法人様のAI導入に関するご相談はこちらまとめ
GPT-5.6 SolのStandard短コンテキスト料金は、inputが$5から$4へ20%減、outputが$30から$20へ約33%減となりました。ただし、272,000 token超の入力、キャッシュの書込、Fast modeには異なる単価があります。
企業は直近の利用量を課金項目、コンテキスト長、処理モード別に分けて再見積もりしてください。同時に予算アラートを設定し、2026年11月21日より前に公式料金を再確認できる日程を組みます。
生成AIのAPI費用と運用設計を見直しませんか?
株式会社Nexaでは、企業の業務要件に合わせたAIモデル選定、API費用の見積もり、導入後の運用設計を支援しています。


