1. GPT-6 Prompt Cachingで変わったこと
OpenAIは2026年9月22日、GPT-6向けPrompt Cachingの改善を発表しました。Prompt Cachingは、複数のAPIリクエストで共通する冒頭部分を再利用し、同じ計算を繰り返さない仕組みです。今回、GPT-6では既定のキャッシュヒット率が改善され、キャッシュ入力トークンには最大90%の割引が適用されると案内されました。出典:OpenAI公式発表(2026年9月22日)。
新しく加わった中心機能は、Prompt Caching Dashboard、キャッシュミスの診断、明示的なcache breakpoint、事前に共通部分を準備するprewarmingです。長時間動くAIエージェントでは、社内ルール、ツール定義、過去の会話を何度も送ります。これらが再利用されれば、入力処理の費用と回答開始までの待ち時間を抑えられます。
ただし、発表された「最大90%割引」は請求総額が必ず90%下がるという意味ではありません。割引対象は再利用された入力トークンです。毎回変わる入力、モデルが生成する出力、外部ツールの利用料などは別に考えます。経営判断では「モデル単価」だけでなく、「入力のうち何%がキャッシュから読まれたか」を見る必要があります。
2. キャッシュが効く仕組みと料金
キャッシュの対象は、プロンプト全体ではなく先頭から一致する共通部分です。たとえば、毎回同じ業務ルールを最初に置き、その後へ顧客ごとの質問を追加する設計なら、共通ルールを再利用しやすくなります。反対に、冒頭へ現在時刻や顧客名を入れると、その後に同じ説明が続いていても一致部分が短くなります。
| 入力の位置 | 置く内容 | 設計の考え方 |
|---|---|---|
| 先頭 | 社内ルール、出力形式、共通資料 | 変えない情報をまとめる |
| 中盤 | ツール定義、会話履歴 | 順番と定義を安定させる |
| 末尾 | 顧客名、日付、今回の依頼 | 毎回変わる情報を後ろへ置く |
OpenAI APIの公式ガイドによると、GPT-5.6以降は1,024トークン以上の共通部分がキャッシュ対象になり、再利用できる既定の期間は直近の書き込みまたは利用から30分です。キャッシュ書き込みは通常入力の1.25倍、読み取りは0.1倍の料金と説明されています。そのため、一度しか使わない長文を何でもキャッシュするのではなく、繰り返し使う共通部分を選ぶことが重要です。
OpenAIが紹介した利用事例では、ある開発チームがキャッシュヒット率を83%から91%へ改善し、キャッシュ書き込みを約3分の2、推論コストを36%削減しました。これはOpenAI掲載の個別事例であり、すべての企業で同じ効果が出る保証ではありません。自社のリクエスト量、入力の長さ、再利用頻度で検証してください。
3. Dashboardと診断で見る指標
Prompt Caching Dashboardでは、入力のどれだけがキャッシュから提供されたかを時系列で確認できます。まず見るのはキャッシュヒット率と、cached・uncached input tokenの内訳です。システム更新後にヒット率が落ちたら、プロンプトの冒頭、ツール定義、モデル設定を変更していないかを確認します。
キャッシュミス診断は、現在のリクエストと直前の基準レスポンスを比べ、モデル、ツール、設定、入力のどこが変わったかを示します。公式診断ガイドでは、比較機能のために生のプロンプトやモデル出力を保存しないと説明されています。一方で、キャッシュ自体の保持や組織のデータ設定は別論点です。機密情報を扱う場合は、自社契約の保持条件も併せて確認します。
週次レポートで確認する項目
対象期間:[開始日〜終了日]
対象モデル:[モデル名]
総入力トークン:[数値]
キャッシュ読み取り:[数値・比率]
キャッシュ書き込み:[数値・比率]
主なキャッシュミス理由:[tools_changed など]
変更前後の入力費用:[同じ処理件数で比較]
次回の改善対象:[1項目だけ記載]請求額だけを比べると、処理件数の増減と設計改善を区別できません。同じ種類の業務100件あたりの入力費用や、1処理あたりのキャッシュ読み取り率で比べると、改善効果を説明しやすくなります。
4. APIコストを抑える4つの設計
中小企業が開発担当者や外部ベンダーへ確認したい設計は、次の4つです。
- 共通部分を先頭へ置く:変わらない指示、社内ルール、参照資料を先にまとめ、日付や顧客固有情報は後ろへ置く。
- ツール定義を削除しない:使わないたびにツール一覧を消すのではなく、定義と順番を保ったまま
allowed_toolsやtool_choiceで利用範囲を変える。 - 会話履歴を追記する:過去の入力を毎回書き直さず、新しいメッセージを末尾へ追加する。要約や圧縮で先頭が変わる場合は、ヒット率への影響を測る。
- よく使う共通情報を事前準備する:始業前やアプリ起動時にprewarmingを行い、最初の利用者が待つ時間を減らす。ただし再利用されない処理を増やさない。
たとえば社内FAQなら、就業規則と回答形式を共通部分にし、社員ごとの質問を末尾に置きます。営業提案エージェントなら、商品説明と禁止表現を固定し、顧客情報と今回の目的だけを変えます。こうすると単にプロンプトを短くするのではなく、長い共通情報を安全に使い回す設計になります。
MIRAINAの視点:Prompt Cachingは、APIの裏側だけの技術ではありません。社内ルールを共通化し、顧客ごとの変数を分離できているかを可視化する指標でもあります。ヒット率が低い場合、プロンプトだけでなく業務手順そのものが毎回変わっていないかを確認してください。AIエージェントの実装を始める前は、OpenAI Agents APIで決める4項目も参考になります。
5. 導入前に確認する注意点
第一に、キャッシュヒットは保証されません。同じ先頭部分でも、保持期間を過ぎた場合、処理する地域が変わった場合、モデルやツール設定に互換性がない場合は再利用されないことがあります。OpenAIはキャッシュを組織間で共有せず、地域の処理境界も越えて共有しないと説明しています。
第二に、コストだけで品質を落とさないことです。キャッシュを維持するため古い社内ルールを残すと、誤った回答が速く安く繰り返されます。料金表や規約の更新日は共通資料の中に明記し、変更時は意図的にキャッシュが切り替わる設計にします。利用額の上限設定はOpenAI hard spend limitsの解説も併せて確認してください。
第三に、データ保持要件を確認します。OpenAIはキャッシュで生のトークンそのものではなく、計算済みの状態を保持すると説明していますが、Zero Data Retentionや地域処理の適用条件はモデルと契約で異なります。個人情報や機密資料を扱う場合は、キャッシュ機能だけで安全と判断せず、入力可否、ログ、削除、権限を含めて審査します。
6. まとめ:まず再利用率を測る
GPT-6 Prompt Cachingの改善では、最大90%のキャッシュ入力割引、Dashboard、キャッシュミス診断、明示的なbreakpoint、prewarmingが案内されました。最初に行うことは、全面的な作り直しではありません。対象業務を一つ選び、共通情報と毎回変わる情報を分け、現在のキャッシュ読み取り率と1処理あたりの費用を記録してください。
MIRAINAのAI開発と生成AI活用支援では、AIエージェントの要件整理からAPIコスト、権限、運用ルールの設計まで支援しています。既存システムの利用明細や処理フローをもとに、どこを共通化すべきか整理したい場合はご相談ください。




