OpenAI prompt_cache_retentionとは
OpenAI prompt_cache_retentionとは、OpenAI APIでプロンプトキャッシュをどれくらい残すかを指定する設定です。同じ長い前置きや資料を何度も送る場合に、前半部分を再利用しやすくし、応答時間や入力コストを抑える考え方と関係します。
英語表記:prompt_cache_retention
同じ前置きを再利用しやすくする
プロンプトキャッシュは、毎回同じ長い指示や資料を送るAPI利用で効く仕組みです。たとえば、社内ルールや長い商品仕様を先頭に置いてから質問を変える場合、共通する前半部分を毎回一から処理しないようにできます。
OpenAI prompt_cache_retentionは、そのキャッシュの保持方法を指定するつまみです。公式Docsでは、拡張保持によりキャッシュ済みの前半部分を最大24時間まで有効にできると説明されています。同じ資料を何度も読む担当者に、しおりを残しておく感覚に近いでしょう。
プロンプトキャッシュとの違い
プロンプトキャッシュは仕組み全体の名前で、OpenAI prompt_cache_retentionは保持方法を指定するパラメータ名です。キャッシュが効くかどうかは、同じprefix、つまり先頭から続く共通部分がどれだけあるかにも左右されます。
また、キャッシュしてもAIの回答が自動的に正しくなるわけではありません。公式Docsでは、キャッシュは出力内容を変えるものではなく、同じ入力部分の処理を効率化するものとして説明されています。品質改善ではなく、速度とコストの設計に近い領域です。
導入時の注意点
2026年6月30日時点の公式Docsでは、gpt-5.5などでは保持期間「24h(24時間)」のみに対応すると説明されています。旧モデルでは組織のデータ保持ポリシーにより既定が変わるため、社内の契約や設定と合わせて確認する必要があります。
特に個人情報や機密情報を含むプロンプトでは、キャッシュの有無だけでなく、そもそもAPIへ渡すべき情報かを先に判断するべきです。長期保持を使う場合は、費用削減だけでなくデータ管理の説明責任もセットになります。
Topic保存されるのは元文章そのものとは限らない
OpenAI公式Docsでは、拡張プロンプトキャッシュで保持されるものを、モデル内部の注意層が作るキー/バリューの中間データとして説明しています。非エンジニア向けには、原文コピーを棚にしまうというより、AIが読み終えた後の作業メモを一時的に残すイメージです。
OpenAI prompt_cache_retentionに関するよくある質問
- キャッシュが効きにくい使い方はありますか?
- 毎回先頭から違う資料や指示を送る使い方では効きにくくなります。共通する前半部分を安定させ、変わる質問だけを後ろに置く設計が向いています。
- 短い質問だけのチャットにも必要ですか?
- 短い質問だけなら効果は小さくなります。長いシステム指示、社内ルール、商品仕様などを何度も使うAPI処理で検討する設定です。