LLM APIのキャッシュで料金はいくら減る?exact/prompt/semanticの違い
生成キャッシュ研究とprovider公式prompt caching仕様をもとに、LLM APIのキャッシュ(exact/prompt/semantic)によるコスト・レイテンシへの影響を整理します。無効化・プライバシー・provider単価差と研究の違いを明記。
まず結論
キャッシュは同一・類似プロンプトの再処理を避けてコストとレイテンシを減らす仕組み。exact(完全一致)・prompt caching(provider公式の prefix キャッシュ)・semantic(意味的類似でヒット)の3種があり、削減幅と前提条件が異なる。
exact cache
同一入力の再計算をスキップ。同じプロンプトを繰り返すバッチ処理で効果が大きい。
prompt caching
provider公式の仕様(Anthropic/OpenAI/Google等)で、長い prefix や繰り返す文脈をキャッシュし入力単価を下げる。各providerの条件・単価差が前提。
semantic cache
意味的に類似したプロンプトでもヒットさせる研究手法(A Generative Caching System, arXiv:2503.17603)。ヒット率は課題とembedding品質に依存し、公式仕組みと仕組みが異なる。
レイテンシ
キャッシュヒットで生成待ちが短縮。ユーザー体験とAPI料金の両面で恩恵。
コスト
入力トークン単価の削減が主。ただしキャッシュ保管の前提(最小トークン長・TTL)やヒット率で実効削減は変動。当サイトは公式単価からの再計算であり、キャッシュ効果は个別評価が必要。
無効化(invalidation)
文脈やモデルが変わるとキャッシュは無効化される。キャッシュ前提でだけ見積もると実請求とずれる。
プライバシー
キャッシュされた入力に機密情報を含めない運用が前提。中国系API等への入力方針と同様に、公開予定の一般情報と分けて扱う。
provider単価差
prompt caching の適用条件と単価はproviderごとに異なる。公式料金ページで確認し、当サイトの比較機能で単価差を確認。
研究と公式仕様の違い
生成キャッシュ研究は仕組みの知見。provider公式prompt cachingは実際の単価差を伴う運用仕様。混同せず、研究結果を当サイト実測として表示しない。
よくある質問
関連記事
AI APIの請求が想定より高くなる原因を、出力トークン、会話履歴、エージェント、リトライ、追加料金に分けて整理します。
失敗回避個人開発でAI APIを使う前に決める予算上限・アラート・最大出力個人開発でAI APIを安全に使うために、予算上限、請求アラート、最大出力、ユーザー制限、ログ確認を整理します。
モデル比較安いAI APIを比較|用途別料金と月額見積もりDeepSeek、Qwen、Gemini、Mistral、Kimiなどの確認済みAI APIを、入力・出力・cache・用途・本番比較対象の違いから見比べます。
OpenRouterOpenRouter Fusionとは?複数モデルで回答を比較する仕組みと料金面の注意点OpenRouter Fusionは複数モデルの回答をjudge modelで比較する仕組みです。2つの入口、使いどころ、料金面の注意点を解説します。
API代回収個人サイト運営でAPI代を無駄にしないプロンプト例AI APIで記事・比較表・FAQ・リライト案を作るときに、無駄な長文出力ややり直しを減らすプロンプト例を整理します。