Contrato de evento
Campos que espera la consulta
| Campo | Tipo | Por que existe |
|---|---|---|
| timestamp_utc | Timestamp | Cuando la ejecución se completó o falló. |
| job_name | Utf8 | Nombre de trabajo lógico estable. |
| status | Utf8 | éxito o fracaso. |
| attempt | Int64 | Intento de ejecución basado en uno. |
| duration_ms | Float64 | Duración del intento. |
Copiar la consulta
SELECT
job_name,
COUNT(*) AS attempts,
SUM(CASE WHEN attempt > 1 THEN 1 ELSE 0 END) AS retries,
SUM(CASE WHEN status = 'failed' THEN 1 ELSE 0 END) AS failures,
100.0 * SUM(CASE WHEN attempt > 1 THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS retry_rate_pct,
approx_percentile_cont(duration_ms, 0.95) AS p95_duration_ms
FROM job_runs
WHERE timestamp_utc >= now() - INTERVAL '7 days'
GROUP BY job_name
ORDER BY retry_rate_pct DESC, failures DESC;Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.
Resultado de la consulta
Tasa de reintentos por trabajo
Las sincronizaciones de suscripciones merecen atención a pesar de que el correo electrónico tiene reintentos más absolutos.
| job_name | attempts | retries | failures | retry_rate_pct | p95_duration_ms |
|---|---|---|---|---|---|
| sync_subscription | 10 | 3 | 2 | 30 | 8000 |
| generate_report | 8 | 1 | 1 | 12,5 | 12.000 |
| send_email | 10 | 0 | 0 | 0 | 900 |
Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.
Reproducir el ejemplo
Descargar el accesorio público
El paquete JSON incluye el contrato de evento escrito, reproducible filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.
Cómo funciona el SQL
- 1Contar intentos en lugar de trabajos lógicos expone intencionalmente la carga de ejecución adicional causada por los reintentos.
- 2El denominador de la tasa de reintentos son todos los intentos. Si prefiere un denominador de trabajo lógico, incluya un job_id y cuente distintos ID de trabajo.
- 3La duración de p95 ayuda a distinguir los reintentos transitorios rápidos de ejecuciones costosas que también consumen capacidad de los trabajadores.
Casos extremos para decidir
- Se puede esperar un reintento programado; segmento por error_type antes de cambiar la política de reintento.
- Utilice un job_id estable si varios intentos pertenecen a una unidad lógica de trabajo.
- Los casos de letra muerta deben informarse por separado porque representan recuperación agotada.
Panel recomendado
- Gráfico de barras: retry_rate_pct por job_name
- Gráfico de líneas: fallas por día y job_name
- Tabla: últimos fallos finales con cliente y contexto de error
Guía de alerta
Alerta cuando la tasa de reintentos se duplica en relación con la línea base de los siete días anteriores o cuando una falla final afecta un flujo de trabajo crítico.
Leer configuración de alertaPon la receta a trabajar
Instrumentación y guías relacionadas.
Continuar el análisis
Encuentre trabajos en segundo plano estancados con SQL
Únase a los eventos de inicio y finalización del trabajo para identificar el trabajo que excedió su ventana de finalización esperada.
Receta abiertaMedir el tiempo de espera de la cola por trabajo
Separe el tiempo de espera en una cola de la duración de la ejecución y compare el retraso de p50 y p95 por nombre de trabajo.
Receta abiertaMedir el crecimiento de la cola de mensajes fallidos
Compare la creación y resolución de mensajes fallidos para encontrar colas que acumulen trabajo irrecuperable.
Receta abiertaEjecútelo en eventos reales.
Crea una tabla, adapta los campos y guarda el resultado.
Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.