Grano en hilera
Un resultado terminal por trabajo lógico.
Decisión apoyada
Elija si desea inspeccionar la capacidad, reintentar la política, el código de trabajo o una dependencia.
Contrato métrico
Pon el denominador y las unidades al lado del gráfico.
Adapte estas denominaciones a su contrato conservando el grano declarado. Inspeccione el esquema de eventos vinculados antes de asignar campos de los productores de producción.
- Trabajos completados
- Tasa de falla terminal
- Tasa de reintentos
- duración p95
% de tasa de fracaso
Datos de demostración, no un resultado o punto de referencia del cliente
Revisar la consulta antes de adaptar los campos.
Esta consulta pública es una definición inicial. Agregue un filtro de tiempo limitado, una política de segmento completo, un entorno y un volumen mínimo apropiados para su contrato de evento de producción.
SELECT
job_name,
COUNT(*) AS completed_jobs,
ROUND(
100.0 * SUM(CASE WHEN status = 'error' THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0),
2
) AS terminal_failure_rate_pct,
ROUND(AVG(attempt_count), 2) AS average_attempts,
approx_percentile_cont(duration_ms, 0.95) AS p95_duration_ms
FROM job_runs
GROUP BY job_name
ORDER BY terminal_failure_rate_pct DESC, completed_jobs DESC;Pruébelos antes de publicar el resultado.
- Un identificador de trabajo estable conecta intentos sin exponer la carga útil del trabajo.
- El recuento de intentos incluye el intento terminal.
- La espera de la cola y la duración de la ejecución utilizan campos de milisegundos separados.
Comprobaciones que mantienen el panel confiable
- Utilice datos a nivel de intento sólo cuando el denominador sea intentos explícitos.
- Agregue percentiles de espera de cola junto a la duración de ejecución.
- Utilice eventos de ciclo de vida de inicio y terminal para detectar trabajadores desaparecidos.
Límite de interpretación
Lo que este resultado no puede probar por sí solo
Cuente un resultado terminal por trabajo. Los registros a nivel de intento aumentan el volumen y pueden hacer que un reintento recuperado parezca un flujo de trabajo de cliente fallido.
Ejemplos de paneles relacionados
Descripción general del estado de SaaS
¿La adopción de la cuenta, la confiabilidad de la aplicación o los ingresos representados cambiaron lo suficiente como para requerir una revisión más profunda?
Inspeccionar ejemploConfiabilidad y latencia de API
¿Qué punto final suficientemente ocupado tiene el error más amplio o la regresión de latencia de cola?
Inspeccionar ejemploImpacto del incidente en el cliente
¿Qué cuentas y operaciones estuvieron representadas directamente en una ventana de incidente declarado?
Inspeccionar ejemploValidar la definición con datos conocidos.
Ejecute un dispositivo con casos conocidos de éxito, error, faltantes, duplicados y límites antes de conectar la consulta a un panel de producción o alerta.