本文へ移動
Telemetry
AIとLLM SQL レシピ

LLM キャッシュの節約と再試行コストを測定する

キャッシュされたリクエスト、再試行量、推定費用をモデルごとに比較して、回避可能な AI コストを見つけます。

中級者llm_requestsレビュー済み 2026-07-27テスト済み アパッチ DataFusion 45.2.0

レビュー者 Telemetry 製品チーム . SQL の互換性、イベント コントラクト、合成出力、および操作上の注意事項. 基準と所有権を確認する

質問に回答しました

再試行とキャッシュミスに関連するモデルコストはどれくらいですか?

モデルの合計支出額には、変更の理由が隠されています。 キャッシュ結果と試行回数を記録すれば、プロンプトや生成結果を保存せずに、回避可能な繰り返し処理を把握できます.

イベント契約

クエリが期待するフィールド

フィールド種類なぜ存在するのか
timestamp_utcTimestampモデルリクエストの完了時間。
modelUtf8モデル識別子。
cache_outcomeUtf8ヒット、ミス、または利用不可。
attemptInt641 から始まる試行番号。
estimated_cost_usdFloat64推定リクエスト費用。
DataFusion SQL

クエリをコピーする

sql
SELECT
  model,
  COUNT(*) AS requests,
  SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END) AS cache_hits,
  SUM(CASE WHEN attempt > 1 THEN 1 ELSE 0 END) AS retries,
  100.0 * SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS cache_hit_rate_pct,
  SUM(CASE WHEN attempt > 1 THEN estimated_cost_usd ELSE 0 END) AS retry_cost_usd,
  SUM(estimated_cost_usd) AS total_cost_usd
FROM llm_requests
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY model
ORDER BY retry_cost_usd DESC;

この読み取り専用クエリは、空の型付きテーブルに対して計画され、実行されます。 アパッチ DataFusion 45.2.0。決定論的なサンプル出力は合成され、個別にレビューされます。フィールド タイプ、しきい値、ビジネス定義を独自のデータと照合して検証します。 テスト方法を読んでください。

クエリ結果

モデル総コスト内の再試行コスト

モデルが大きいほど、キャッシュ ヒット率が低くなり、再試行コストの負担が大きくなります。

modelrequestscache_hitsretriescache_hit_rate_pctretry_cost_usdtotal_cost_usd
gpt-5.118,4006,62074035.9892.41,480.2
gpt-5.1-mini49,20023,81038048.3911.8604.6

合成出力例。運用上の決定に使用する前に、独自のイベント スキーマとしきい値に対してクエリを実行します。

Retry cost within total model cost: Measure LLM Cache Savings and Retry Cost 結果例からの合成 retry_cost_usd 値の静的チャート
決定論的な出力例のインデックス可能な SVG。記事、ランブック、または出典を明示した設計レビューのためにダウンロードしてください。

例を再現する

パブリックフィクスチャをダウンロードする

JSON バンドルには、型付きイベント コントラクトが含まれています。 illustrative 入力行、正確な SQL、予想される出力、レビューメモ、およびエンジンのバージョン。 CSV には、表示された結果が含まれます。

SQL の仕組み

  1. 1キャッシュ ヒット率は、記録されたすべてのリクエスト内の明示的なキャッシュ ヒットをカウントします。
  2. 2複数の試行を行うと、繰り返されるモデル作業が最初の試行コストから切り離されます。
  3. 3この結果はコストの仕組みを説明しています。純粋に支出だけを最適化する前に、受け入れられた成果や維持された成果に結び付けてください。

決定すべきエッジケース

  • プロバイダー側のプロンプト キャッシュとアプリケーション応答キャッシュは異なるメカニズムです。
  • 1 つの論理リクエストが試行イベントと概要イベントの両方を発行する場合、コストの二重カウントを回避します。
  • コストの見積もりでは、リクエストの実行時にアクティブだった価格とトークンのルールを使用する必要があります。

推奨されるダッシュボード

  • 積み上げバー: モデルごとの再試行と総コスト
  • 傾向: キャッシュヒット率
  • 表: 負荷の高い再試行ループを伴う機能

アラートガイダンス

再試行コストのスパイクや、最小リクエスト量後の突然のキャッシュヒットの崩壊についてアラートを送信します。

アラート設定を読む

レシピを活用する

関連する機器とガイド

分析を続ける

実際のイベントで実行する

テーブルを作成し、フィールドを調整して、結果を保存します

無料で始めて、構造化されたイベントを送信し、クエリ結果をグラフ、共有ダッシュボード ウィジェット、またはアラート入力として使用します。

API キーを取得する