本文へ移動
Telemetry
インフラストラクチャー SQL レシピ

ワークロードごとに Kubernetes 再起動を検索する

コンテナーの再起動イベント、準備エラー、および観測された累積再起動数によって、Kubernetes ワークロードをランク付けします。

初心者kubernetes_workload_eventsレビュー済み 2026-07-28テスト済み アパッチ DataFusion 45.2.0

レビュー者 Telemetry 製品チーム . SQL の互換性、イベント コントラクト、合成出力、および操作上の注意事項. 基準と所有権を確認する

質問に回答しました

どの Kubernetes ワークロードが再起動され、準備チェックに失敗していますか?

再起動カウンターだけでは、変更がいつ発生したか、ユーザーが影響を受けたかどうかはわかりません。このイベント パターンは、再起動の移行と準備サンプルをワークロード境界でまとめて保持するため、レビュー担当者は持続的な不安定性を特定できます。

イベント契約

クエリが期待するフィールド

フィールド種類なぜ存在するのか
timestamp_utcTimestampUTC でのサンプル時間または遷移時間。
clusterUtf8制御対象のクラスター名。
namespaceUtf8Kubernetes 名前空間。
workloadUtf8デプロイメント、StatefulSet、またはジョブの所有者名。
podUtf8制限付きドリルダウンのポッド識別子。
event_nameUtf8制御されたサンプリング イベントまたは container_restarted イベント。
restart_countInt64観測されたコンテナーの累積再起動数。
readyBooleanポッドがサンプル時に準備ができているかどうか。
environmentUtf8導入環境。
DataFusion SQL

クエリをコピーする

sql
SELECT
  cluster,
  namespace,
  workload,
  COUNT(*) AS observations,
  SUM(CASE WHEN event_name = 'container_restarted' THEN 1 ELSE 0 END) AS restart_events,
  MAX(restart_count) AS max_restart_count,
  SUM(CASE WHEN ready THEN 0 ELSE 1 END) AS not_ready_observations,
  100.0 * SUM(CASE WHEN ready THEN 0 ELSE 1 END)
    / NULLIF(COUNT(*), 0) AS not_ready_rate_pct
FROM kubernetes_workload_events
WHERE timestamp_utc >= now() - INTERVAL '24 hours'
  AND environment = 'production'
GROUP BY cluster, namespace, workload
ORDER BY restart_events DESC, not_ready_rate_pct DESC, workload;

この読み取り専用クエリは、空の型付きテーブルに対して計画され、実行されます。 アパッチ DataFusion 45.2.0。決定論的なサンプル出力は合成され、個別にレビューされます。フィールド タイプ、しきい値、ビジネス定義を独自のデータと照合して検証します。 テスト方法を読んでください。

クエリ結果

ワークロードごとの再起動と準備完了のシグナル

チェックアウトには、請求ワーカーよりも多くの再起動遷移と準備ができていない観察が含まれます。

clusternamespaceworkloadobservationsrestart_eventsmax_restart_countnot_ready_observationsnot_ready_rate_pct
production-usapplicationcheckout-api524240
production-usapplicationbilling-worker412125

合成出力例。運用上の決定に使用する前に、独自のイベント スキーマとしきい値に対してクエリを実行します。

Restart and readiness signals by workload: Find Kubernetes Restarts by Workload 結果例からの合成 restart_events 値の静的チャート
決定論的な出力例のインデックス可能な SVG。記事、ランブック、または出典を明示した設計レビューのためにダウンロードしてください。

例を再現する

パブリックフィクスチャをダウンロードする

JSON バンドルには、型付きイベント コントラクトが含まれています。 reproducible 入力行、正確な SQL、予想される出力、レビューメモ、およびエンジンのバージョン。 CSV には、表示された結果が含まれます。

SQL の仕組み

  1. 1ワークロードの所有権はポッド名よりも安定しており、結果をデプロイ可能なユニットにマップします。
  2. 2ゲージの合計を避けるために、再起動遷移は累積カウンターとは別にカウントされます。
  3. 3準備状況の観察により、潜在的なサービス提供への影響と並行して運用上の症状が抑えられます。

決定すべきエッジケース

  • ロールアウトは当然ポッドを置き換えます。計画された交換と、繰り返されるコンテナの再起動を区別します。
  • ポッドが再作成されるとカウンターがリセットされる可能性があるため、レートには遷移イベントを使用します。
  • 再起動がコード変更によるものであると考える前に、デプロイメントとアプリケーションのリリースのコンテキストを結合してください。

推奨されるダッシュボード

  • 積み上げバー: ワークロード別の restart_events および not_ready_observations
  • 傾向: クラスターと名前空間ごとに移行を再開する
  • 表: 影響を受ける最新のポッドとリリースおよび制御された理由

アラートガイダンス

個別のロールアウト交換ではなく、繰り返しの再起動移行と継続的な準備の喪失についてアラートを発します。

アラート設定を読む

レシピを活用する

関連する機器とガイド

ソースデータを定義する

この分析のイベント スキーマ

分析を続ける

実際のイベントで実行する

テーブルを作成し、フィールドを調整して、結果を保存します

無料で始めて、構造化されたイベントを送信し、クエリ結果をグラフ、共有ダッシュボード ウィジェット、またはアラート入力として使用します。

API キーを取得する