Contrato de evento
Campos que espera la consulta
| Campo | Tipo | Por que existe |
|---|---|---|
| timestamp_utc | Timestamp | Hora de muestra o transición en UTC. |
| cluster | Utf8 | Nombre del clúster controlado. |
| namespace | Utf8 | Espacio de nombres de Kubernetes. |
| workload | Utf8 | Nombre del propietario de la implementación, StatefulSet o trabajo. |
| pod | Utf8 | Identificador de pod para desgloses restringidos. |
| event_name | Utf8 | Evento muestreado controlado o container_restarted. |
| restart_count | Int64 | Recuento acumulado de reinicios de contenedores observado. |
| ready | Boolean | Si la cápsula estaba lista en la muestra. |
| environment | Utf8 | Entorno de implementación. |
Copiar la consulta
SELECT
cluster,
namespace,
workload,
COUNT(*) AS observations,
SUM(CASE WHEN event_name = 'container_restarted' THEN 1 ELSE 0 END) AS restart_events,
MAX(restart_count) AS max_restart_count,
SUM(CASE WHEN ready THEN 0 ELSE 1 END) AS not_ready_observations,
100.0 * SUM(CASE WHEN ready THEN 0 ELSE 1 END)
/ NULLIF(COUNT(*), 0) AS not_ready_rate_pct
FROM kubernetes_workload_events
WHERE timestamp_utc >= now() - INTERVAL '24 hours'
AND environment = 'production'
GROUP BY cluster, namespace, workload
ORDER BY restart_events DESC, not_ready_rate_pct DESC, workload;Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.
Resultado de la consulta
Señales de reinicio y preparación por carga de trabajo
El proceso de pago tiene más transiciones de reinicio y observaciones de no estar listo que el trabajador de facturación.
| cluster | namespace | workload | observations | restart_events | max_restart_count | not_ready_observations | not_ready_rate_pct |
|---|---|---|---|---|---|---|---|
| production-us | application | checkout-api | 5 | 2 | 4 | 2 | 40 |
| production-us | application | billing-worker | 4 | 1 | 2 | 1 | 25 |
Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.
Reproducir el ejemplo
Descargar el accesorio público
El paquete JSON incluye el contrato de evento escrito, reproducible filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.
Cómo funciona el SQL
- 1La propiedad de la carga de trabajo es más estable que los nombres de los pods y asigna el resultado a una unidad implementable.
- 2Las transiciones de reinicio se cuentan por separado del contador acumulativo para evitar la suma de indicadores.
- 3Las observaciones de preparación mantienen el síntoma operativo junto a un posible impacto en el servicio.
Casos extremos para decidir
- Una implementación reemplaza naturalmente los pods; distinguir el reemplazo planificado del reinicio repetido del contenedor.
- Los contadores se pueden restablecer cuando se recrean los pods, así que utilice eventos de transición para las tarifas.
- Únase al contexto de implementación y lanzamiento de la aplicación antes de atribuir un reinicio a un cambio de código.
Panel recomendado
- Barras apiladas: restart_events y not_ready_observations por carga de trabajo
- Tendencia: reiniciar transiciones por clúster y espacio de nombres
- Tabla: últimas vainas afectadas con liberación y motivo controlado
Guía de alerta
Alerta sobre transiciones de reinicio repetidas más pérdida sostenida de preparación, no sobre un reemplazo de implementación aislado.
Leer configuración de alertaPon la receta a trabajar
Instrumentación y guías relacionadas.
Definir los datos de origen
Esquemas de eventos para este análisis.
Continuar el análisis
Encuentre la saturación de recursos de host y contenedor
Clasifique las fuentes de infraestructura según la utilización sostenida de CPU, memoria y disco, preservando al mismo tiempo el volumen de muestra.
Receta abiertaEncuentre errores de caché y riesgo de estampida
Compare la tasa de aciertos, el costo de backend y los errores simultáneos mediante un patrón de clave de caché limitado.
Receta abiertaCalcular el tiempo de detección y recuperación de incidentes
Calcule el tiempo de detección y el tiempo de recuperación de eventos estructurados del ciclo de vida de incidentes.
Receta abiertaEjecútelo en eventos reales.
Crea una tabla, adapta los campos y guarda el resultado.
Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.