本文へ移動
Telemetry
ルートレベルの遅延、エラー、トラフィックの可視性を必要とするチーム向け

API 信頼性監視

API リクエストの量、ステータス コード、レイテンシー、タイムアウト、顧客への影響、障害が発生したエンドポイントを SQL で追跡します。

レビュー者 Telemetry 製品チーム . イベント項目、推奨クエリ、除外するデータを確認しました. このページのレビュー担当

なぜこれが機能するのか
  • カスタム メトリクス システムを構築せずに、ルート レベルの p50 および p95 レイテンシーを実現します。
  • エンドポイント、メソッド、ステータス コード、機能、アカウントごとの障害分析。
  • 5xx の急増、遅いルート、突然のトラフィックの減少についてアラートを発します。
ユースケースの証拠パス

API reliability monitoring: 実装から決定まで

完全な api reliability monitoring 測定ループは、1 つの所有ワークフロー、制限されたイベント コントラクト、制御されたフィクスチャ、および誰かが行動できる質問を接続します。

  1. 1

    境界を設定する

    サーバー ハンドラーからの完了および失敗した API リクエストをログに記録します。

  2. 2

    結果を把握する

    Begin with api_request_started, api_request_completed, api_request_failed and document the grain of each event.

  3. 3

    行を証明する

    ダッシュボードを作成し、エラー率、p95 レイテンシ、および最も失敗したルートのアラートを作成します。

  4. 4

    決断を下す

    p95 レイテンシで最も遅いルートはどれですか?

ユースケースとテンプレートの比較

測定するものを選ぶ

ユースケース ガイドを使用して、結果、イベントの境界、分析の質問を選択します。短いコピーアンドペースト実装の概要の準備ができたら、一致するテンプレートを開きます。

開く API エラーと遅延モニター

エージェントプロンプト

これをコーディングエージェントに貼り付けます

交換する YOUR_API_KEY サインアップ後、エージェントに製品フローを実行して最初のイベントを確認するように依頼します。

エージェントプロンプト

API reliability monitoring セットアップ プロンプト

text
API の信頼性を高めるために、Telemetry 計測器を追加します。

/skill.md とこの Telemetry API キーを使用します: YOUR_API_KEY

重要な各 API エンドポイントを、route_template、method、status_code、status、latency_ms、user_id、または可能な場合は team_id、request_size_bytes、で記録してください。 response_size_bytes、error_type。

作成:
1. API リクエスト イベントのテーブル。
2. リクエスト量、エラー率、p50 および p95 レイテンシー、および上位に障害が発生したエンドポイントのグラフ。
3. 5xx レートの上昇、p95 遅延の遅延、およびトラフィックの突然の低下に関するアラート。

リクエスト本文、認証ヘッダー、Cookie、シークレット、または生のユーザー コンテンツをログに記録しないでください。

セットアップ手順

  1. 1サーバー ハンドラーからの完了および失敗した API リクエストをログに記録します。
  2. 2カーディナリティをクリーンに保つために、生の URL の代わりにルート テンプレートを使用します。
  3. 3ステータス、レイテンシ、メソッド、機能、チーム、エラーの種類をキャプチャします。
  4. 4ダッシュボードを作成し、エラー率、p95 レイテンシ、および最も失敗したルートのアラートを作成します。

キャプチャするイベント

api_request_startedapi_request_completedapi_request_failedapi_timeoutapi_rate_limitedcustomer_impact_detected

これにより解き明かされる質問

  • p95 レイテンシで最も遅いルートはどれですか?
  • どの顧客アカウントがエラーの影響を受けますか?
  • トラフィックが突然減少または急増した場所はどこですか?

イベントスキーマの例

クエリまたはスニペットを運用環境に適用する前に、行粒度、出力境界、必要なタイプ、プライバシー クラス、サンプル ペイロード、および検証チェックリストを確認してください。

関連製品の機能

このワークフローを続行します アラート

レビューされた信頼性クエリを、所有するしきい値と応答のワークフローにプロモートします。

関連する SQL レシピ

その他のSQL例

このワークフローの構造化フィールドに対してクエリを実行し、結果の例を検査して、有用な回答をダッシュボードまたはアラートに変換します。

すべてのレシピを参照する
API の信頼性初心者

ルートごとの API リクエスト スループットの計算

1 分あたり最も多くのリクエストを処理している API ルートはどれですか?

レシピを開く
API の信頼性中級者

API 429 レート制限回復の測定

HTTP 429 を受信したリクエストは、再試行後に正常に回復しますか?

レシピを開く
インフラストラクチャー上級者向け

インシデントの検出と復旧時間を計算する

各サービスがインシデントを検出して回復するまでにどれくらいの時間がかかりますか?

レシピを開く
API の信頼性初心者

ルート別のAPIエラー率の計算

リクエストが 20 件以上ある API ルートのうち、5xx エラー率が最も高いのはどれですか?

レシピを開く
API の信頼性中級者

p50、p95、p99 API レイテンシの計算

テール レイテンシが最も悪いエンドポイントはどれですか?

レシピを開く
API の信頼性初心者

ルートごとの API タイムアウト率の計算

ユーザーに影響を与えるほど頻繁にタイムアウトになる API ルートはどれですか?

レシピを開く
API の信頼性中級者

依存関係の比較 p95 レイテンシー

テール レイテンシーと失敗率が最も悪いダウンストリームの依存関係はどれですか?

レシピを開く
API の信頼性中級者

SLO に対する API の可用性の測定

各サービスは 1 日あたりの可用性目標を達成しましたか?

レシピを開く
API の信頼性中級者

API エラーバジェット燃焼率の計算

API は 99.9% の可用性予算をどれくらいの速さで消費していますか?

レシピを開く
API の信頼性中級者

リリースごとの API 信頼性の比較

どのリリースで、より悪い API エラーまたはテール レイテンシーが発生しますか?

レシピを開く
API の信頼性初心者

顧客の影響によるエラーのフィンガープリントのランク付け

最も多くの顧客アカウントに影響を与えるエラー グループはどれですか?

レシピを開く
API の信頼性初心者

機能ロールアウトエラー率の比較

機能フラグのロールアウトは、コントロール コホートよりも信頼性が低いですか?

レシピを開く
API の信頼性中級者

インシデントの顧客への影響を計画ごとに測定する

各計画でインシデントの影響を受けたアカウントの数は何ですか?

レシピを開く

顧客の証拠

関連する顧客事例

次のステップ

エージェントが使用する API キーを作成します

プロンプトの実行、テスト イベントの送信、最初のダッシュボードの確認には無料プランで十分です。

関連ページ