Saltar al contenido
Telemetry
Infraestructura receta SQL

Encuentre reinicios de Kubernetes por carga de trabajo

Clasifique las cargas de trabajo de Kubernetes por eventos de reinicio de contenedores, fallas de preparación y recuento de reinicios acumulados observados.

Principiantekubernetes_workload_eventsRevisado 2026-07-28Probado con Apache DataFusion 45.2.0

Revisado por el equipo de producto Telemetry en . Compatibilidad con SQL, contrato de eventos, resultados sintéticos y advertencias operativas. Revisar los estándares y la propiedad

Pregunta respondida

¿Qué cargas de trabajo de Kubernetes se reinician y no superan las comprobaciones de preparación?

Un contador de reinicio por sí solo no muestra cuándo se produjo el cambio ni si los usuarios se vieron afectados. Este patrón de eventos mantiene juntas las transiciones de reinicio y las muestras de preparación en el límite de la carga de trabajo para que un revisor pueda identificar una inestabilidad sostenida.

Contrato de evento

Campos que espera la consulta

CampoTipoPor que existe
timestamp_utcTimestampHora de muestra o transición en UTC.
clusterUtf8Nombre del clúster controlado.
namespaceUtf8Espacio de nombres de Kubernetes.
workloadUtf8Nombre del propietario de la implementación, StatefulSet o trabajo.
podUtf8Identificador de pod para desgloses restringidos.
event_nameUtf8Evento muestreado controlado o container_restarted.
restart_countInt64Recuento acumulado de reinicios de contenedores observado.
readyBooleanSi la cápsula estaba lista en la muestra.
environmentUtf8Entorno de implementación.
DataFusionSQL

Copiar la consulta

sql
SELECT
  cluster,
  namespace,
  workload,
  COUNT(*) AS observations,
  SUM(CASE WHEN event_name = 'container_restarted' THEN 1 ELSE 0 END) AS restart_events,
  MAX(restart_count) AS max_restart_count,
  SUM(CASE WHEN ready THEN 0 ELSE 1 END) AS not_ready_observations,
  100.0 * SUM(CASE WHEN ready THEN 0 ELSE 1 END)
    / NULLIF(COUNT(*), 0) AS not_ready_rate_pct
FROM kubernetes_workload_events
WHERE timestamp_utc >= now() - INTERVAL '24 hours'
  AND environment = 'production'
GROUP BY cluster, namespace, workload
ORDER BY restart_events DESC, not_ready_rate_pct DESC, workload;

Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.

Resultado de la consulta

Señales de reinicio y preparación por carga de trabajo

El proceso de pago tiene más transiciones de reinicio y observaciones de no estar listo que el trabajador de facturación.

clusternamespaceworkloadobservationsrestart_eventsmax_restart_countnot_ready_observationsnot_ready_rate_pct
production-usapplicationcheckout-api524240
production-usapplicationbilling-worker412125

Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.

Restart and readiness signals by workload: gráfico estático de valores sintéticos de restart_events del resultado del ejemplo Find Kubernetes Restarts by Workload
SVG indexable de la salida del ejemplo determinista. Descárguelo para ver un artículo, un runbook o una revisión de diseño con atribución.

Reproducir el ejemplo

Descargar el accesorio público

El paquete JSON incluye el contrato de evento escrito, reproducible filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.

Cómo funciona el SQL

  1. 1La propiedad de la carga de trabajo es más estable que los nombres de los pods y asigna el resultado a una unidad implementable.
  2. 2Las transiciones de reinicio se cuentan por separado del contador acumulativo para evitar la suma de indicadores.
  3. 3Las observaciones de preparación mantienen el síntoma operativo junto a un posible impacto en el servicio.

Casos extremos para decidir

  • Una implementación reemplaza naturalmente los pods; distinguir el reemplazo planificado del reinicio repetido del contenedor.
  • Los contadores se pueden restablecer cuando se recrean los pods, así que utilice eventos de transición para las tarifas.
  • Únase al contexto de implementación y lanzamiento de la aplicación antes de atribuir un reinicio a un cambio de código.

Panel recomendado

  • Barras apiladas: restart_events y not_ready_observations por carga de trabajo
  • Tendencia: reiniciar transiciones por clúster y espacio de nombres
  • Tabla: últimas vainas afectadas con liberación y motivo controlado

Guía de alerta

Alerta sobre transiciones de reinicio repetidas más pérdida sostenida de preparación, no sobre un reemplazo de implementación aislado.

Leer configuración de alerta

Pon la receta a trabajar

Instrumentación y guías relacionadas.

Definir los datos de origen

Esquemas de eventos para este análisis.

Continuar el análisis

Ejecútelo en eventos reales.

Crea una tabla, adapta los campos y guarda el resultado.

Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.

Obtén una clave API