Sidekiq Job Telemetry: 境界から検証された行まで
制御されたアプリケーション境界で Sidekiq Job Telemetry を使用し、イベント コントラクトを小さく保ち、集約ビューを構築する前に既知の結果を検証します。
- 1
結果を選択してください
Sidekiq 再試行監視
- 2
契約を定義する
job_id、job_name、queue_name、ステータス、および試行
- 3
境界を計測する
サーバーミドルウェアで yield をラップすると、実行試行ごとに 1 つの結果が得られます。論理識別子として jid を使用し、試行として retry_count プラス 1 を使用します。
- 4
証拠を検証する
Exercise a known fixture, then inspect job_attempt_completed for one correctly typed terminal row.
始める前に
前提条件と境界
- 明示的なオープンおよび読み取りタイムアウトを備えた再利用可能な Ruby HTTP ラッパー
- すべてのワーカー プロセスに登録された Sidekiq サーバー ミドルウェア
- 安定したジョブ クラスとキュー名、および承認されたエラー分類
配信設定
サーバー側のインストールと初期化
サーバー側キーと明示的なオープンおよび読み取りタイムアウトを備えた小さな Net::HTTP ラッパーを使用します。 ブラウザ バンドル、クライアントに表示される環境変数、ソース管理、ログ、および例外メッセージに取り込み資格情報が含まれないようにします。
- 1制限されたネットワーク動作を持つ再利用可能なサーバー側配信クライアントを 1 つ準備します。
- 2成功、失敗、再試行、またはタイムアウトの境界に結果イベントを追加します。
- 3アラートを有効にする前に、制御されたフィクスチャを送信し、保存されている行を検査します。
スニペット
1 つの構造化されたイベントから始める
ワークフローが完了、失敗、または再試行される場所にこの図形を追加します。次に、実際のフィールドからダッシュボードを構築します。
Sidekiq Job Telemetryイベント
class TelemetryOutcomeMiddleware
include Sidekiq::ServerMiddleware
def call(_job_instance, job, queue)
started_at = Process.clock_gettime(Process::CLOCK_MONOTONIC)
status = "success"
error_type = nil
begin
yield
rescue => error
status = "failed"
error_type = classify_error(error)
raise
ensure
TelemetryHttp.log(
table: "job_attempt_completed",
data: {
job_id: job["jid"],
job_name: job["class"],
queue_name: queue,
attempt: job.fetch("retry_count", -1) + 2,
status: status,
duration_ms: ((Process.clock_gettime(Process::CLOCK_MONOTONIC) - started_at) * 1000).round,
error_type: error_type,
release: ENV["APP_RELEASE"]
}
)
end
end
endイベント契約
job_id、job_name、queue_name、ステータス、および試行
queue_wait_ms、duration_ms、error_type、retry_exhausted、およびリリース
item_count またはジョブによって派生された承認済みアカウント コンテキスト。引数がシリアル化されていない
実装のチェックポイント
チェックポイント 1
サーバーミドルウェアで yield をラップすると、実行試行ごとに 1 つの結果が得られます。論理識別子として jid を使用し、試行として retry_count プラス 1 を使用します。
チェックポイント 2
Sidekiq は再試行ポリシーを適用するために例外を監視する必要があるため、再発生せずにレスキューしないでください。
チェックポイント 3
イベントが試行ごとに発行される場合は、再試行によってジョブの合計が膨らまないよう、ターミナル成功メトリクスと再試行枯渇メトリクスを明示的に構築します。
検証
イベントが到着したことを証明する
既知の成功例と失敗例を実行した後、これを実行します。最終的なイベント コントラクトがスニペットと異なる場合は、フォールバック テーブル名を置き換えます。
Sidekiq Job Telemetry 検証クエリ
SELECT *
FROM job_attempt_completed
ORDER BY timestamp_utc DESC
LIMIT 20;実装の参考資料
新しい運用パスを有効にする前に、イベント契約、データ安全性に関するガイダンス、上流の主要ドキュメントを確認してください。
生産境界
結果イベントを小さく、回復可能なものに保つ
このパターンが提供するのは、
- 上流のワークフローの横にある、制限付きの SQL 対応の結果。
- ダッシュボード、アラート、およびイベント間の相関関係の安定したフィールド。
- 成功、失敗、再試行、タイムアウトの動作を検証するためのフィクスチャ駆動のパス。
このパターンでは提供されません
- OTLP エクスポーター、自動収集パイプライン、または詳細なトレースと診断ログの代替。
- ペイロードにイベント ID が含まれているという理由だけで、1 回だけ配信されます。
- 生のプロバイダー ペイロード、ユーザー コンテンツ、資格情報、または規制されたデータを収集する許可。
イベントスキーマの開始点
このワークフローのイベント コントラクト
クエリまたはスニペットを運用環境に適用する前に、行粒度、出力境界、必要なタイプ、プライバシー クラス、サンプル ペイロード、および検証チェックリストを確認してください。
関連製品の機能
このワークフローを続行します アラート
レビューされた信頼性クエリを、所有するしきい値と応答のワークフローにプロモートします。
関連する SQL レシピ
SQL で次の質問に答えてください
このワークフローの構造化フィールドに対してクエリを実行し、結果の例を検査して、有用な回答をダッシュボードまたはアラートに変換します。
バックグラウンドジョブの再試行と失敗率を測定する
どのバックグラウンド ジョブが再試行を最も多く消費するか、または依然として失敗するのはどれですか?
レシピを開くジョブごとのキュー待ち時間の測定
ワーカーが開始するまでに最も長く待機するジョブはどれですか?
レシピを開くSQL で停止したバックグラウンド ジョブを見つける
開始されたが、最終イベントを生成しなかったジョブはどれですか?
レシピを開く配信不能キューの増加を測定する
デッドレター ジョブを解決するよりも早く追加しているキューはどれですか?
レシピを開くバックグラウンドジョブの再試行ストームを検出する
現在、再試行に最も多くの時間を費やしている職種はどれですか?
レシピを開く実装ファミリーごとに参照する
関連する統合パターンを比較する
この統合と組み合わせるテンプレート
さらなる統合