本文へ移動
Telemetry
AIとLLM SQL レシピ

最初のトークンまでの LLM 時間を測定する

ストリーミングの応答性と総生成遅延をモデルと機能ごとに比較します。

中級者llm_requestsレビュー済み 2026-07-27テスト済み アパッチ DataFusion 45.2.0

レビュー者 Telemetry 製品チーム . SQL の互換性、イベント コントラクト、合成出力、および操作上の注意事項. 基準と所有権を確認する

質問に回答しました

出力が開始される前に速度が遅いと感じるモデルと機能の組み合わせはどれですか?

ユーザーは、総完了時間とは別に、ストリーミング前の一時停止を経験します。両方を測定すると、レイテンシがリクエストの開始に起因するのか、リクエストの生成に起因するのかが明らかになります。

イベント契約

クエリが期待するフィールド

フィールド種類なぜ存在するのか
timestamp_utcTimestampモデルリクエストの完了時間。
modelUtf8プロバイダーモデルの識別子。
featureUtf8リクエストを行う製品の機能。
statusUtf8最終的なリクエストの結果。
time_to_first_token_msFloat64最初のトークンがストリーミングされるまでのミリ秒。
latency_msFloat64合計リクエスト期間 (ミリ秒単位)。
DataFusion SQL

クエリをコピーする

sql
SELECT
  feature,
  model,
  COUNT(*) AS requests,
  approx_percentile_cont(time_to_first_token_ms, 0.50) AS p50_ttft_ms,
  approx_percentile_cont(time_to_first_token_ms, 0.95) AS p95_ttft_ms,
  approx_percentile_cont(latency_ms, 0.95) AS p95_total_latency_ms
FROM llm_requests
WHERE timestamp_utc >= now() - INTERVAL '7 days'
  AND status = 'success'
  AND time_to_first_token_ms IS NOT NULL
GROUP BY feature, model
HAVING COUNT(*) >= 30
ORDER BY p95_ttft_ms DESC;

この読み取り専用クエリは、空の型付きテーブルに対して計画され、実行されます。 アパッチ DataFusion 45.2.0。決定論的なサンプル出力は合成され、個別にレビューされます。フィールド タイプ、しきい値、ビジネス定義を独自のデータと照合して検証します。 テスト方法を読んでください。

クエリ結果

p95 最初のトークンまでの時間

レポート生成では、起動時の一時停止が最も長く、全体の完了が最も遅くなります。

featuremodelrequestsp50_ttft_msp95_ttft_msp95_total_latency_ms
report_generationlarge-reasoning8421,2804,62018,400
draft_replysmall-fast6,8103109203,840
search_summarybalanced2,4204801,3806,210

合成出力例。運用上の決定に使用する前に、独自のイベント スキーマとしきい値に対してクエリを実行します。

p95 time to first token: Measure LLM Time to First Token 結果例からの合成 p95_ttft_ms 値の静的チャート
決定論的な出力例のインデックス可能な SVG。記事、ランブック、または出典を明示した設計レビューのためにダウンロードしてください。

例を再現する

パブリックフィクスチャをダウンロードする

JSON バンドルには、型付きイベント コントラクトが含まれています。 illustrative 入力行、正確な SQL、予想される出力、レビューメモ、およびエンジンのバージョン。 CSV には、表示された結果が含まれます。

SQL の仕組み

  1. 1成功したストリーミング リクエストは、製品の決定とモデルによってグループ化されます。
  2. 2p50 は典型的な一時停止を説明し、p95 はユーザーが不満を抱いているテールを明らかにします。
  3. 3p95 の合計レイテンシは TTFT を超えたままであるため、最適化によって起動は改善されず、完了は悪化します。

決定すべきエッジケース

  • 非ストリーミング要求には、意味のある最初のトークンの測定がありません。
  • プロバイダーが報告するタイミングとクライアントが観測するタイミングは異なる場合があります。測定境界を文書化します。
  • プロンプトのサイズと要求された出力の長さが両方のメトリックに影響するため、機能内のモデルを比較します。

推奨されるダッシュボード

  • グループ化されたバー: p50_ttft_ms および p95_ttft_ms
  • トレンド: モデルおよび機能別の p95 TTFT
  • 表: 遅いリクエストとトークン数および再試行コンテキスト

アラートガイダンス

大容量機能の p95 TTFT が連続バケットのユーザー エクスペリエンス目標を超えた場合にアラートを送信します。

アラート設定を読む

レシピを活用する

関連する機器とガイド

分析を続ける

実際のイベントで実行する

テーブルを作成し、フィールドを調整して、結果を保存します

無料で始めて、構造化されたイベントを送信し、クエリ結果をグラフ、共有ダッシュボード ウィジェット、またはアラート入力として使用します。

API キーを取得する