contrato de evento común
Campos que mantienen estas consultas reutilizables
- timestamp_utc, route_template, método y status_code
- latency_ms, request_id, versión, entorno y dependencia
- team_id o account_id cuando se apruebe el análisis de impacto en el cliente
Definiciones antes de SQL
Decisiones que la consulta no puede tomar por usted
- 1Defina qué respuestas cuentan como fallas antes de calcular una tasa.
- 2Establezca un volumen mínimo de solicitudes para que las rutas silenciosas no dominen los porcentajes.
- 3Mantenga las plantillas de ruta y las versiones lo suficientemente estables para poder compararlas a lo largo del tiempo.
Secuencia recomendada
Primero la detección de compilación, luego el diagnóstico
Patrones de análisis
Hacer que el resultado explique una decisión.
Normalizar por volumen de solicitudes
El fallo del par cuenta con tasas y un umbral de volumen mínimo, por lo que una ruta silenciosa no puede superar a un punto final genuinamente riesgoso.
Comparar dimensiones estables
Agrupe por plantilla de ruta, versión, dependencia o entorno en lugar de URL sin formato y otros valores ilimitados.
Conecte la detección al impacto
Comience con un cambio en el nivel de servicio y luego identifique los clientes, las versiones y las dependencias que contribuyeron al mismo.
recetas completas
Copie la consulta y luego valide las suposiciones.
Calcular la tasa de errores de API por ruta
Utilice SQL para clasificar las rutas API según una tasa de error 5xx mientras protege el resultado del ruido de bajo volumen.
¿Qué rutas API tienen la tasa de error 5xx significativa más alta?
Ver SQL y resultadoCalcule la latencia API p50, p95 y p99
Compare la latencia media y de cola por punto final con SQL percentil compatible con DataFusion.
¿Qué puntos finales tienen la peor latencia de cola?
Ver SQL y resultadoCalcular la tasa de consumo de presupuesto de errores de API
Convierta los errores de solicitud por hora en una serie de tasa de quemado de SLO que muestre qué tan rápido se consume el presupuesto de errores permitido.
¿Con qué rapidez está consumiendo la API su presupuesto de disponibilidad del 99,9 %?
Ver SQL y resultadoCompare la confiabilidad de API por versión
Compare el tráfico, la tasa 5xx y la latencia p95 entre versiones de aplicaciones sin atribuir cada cambio posterior a la implementación a la implementación.
¿Qué versiones coinciden con peores errores de API o latencia de cola?
Ver SQL y resultadoClasificación de huellas dactilares de error por impacto en el cliente
Clasifique los errores de aplicaciones normalizados por ocurrencias y cuentas afectadas en lugar de permitir que un bucle de reintento domine la vista del incidente.
¿Qué grupos de errores afectan a la mayoría de las cuentas de clientes?
Ver SQL y resultadoCalcular la tasa de tiempo de espera de API por ruta
Clasifique las rutas por tasa de tiempo de espera mientras conserva el volumen de solicitudes y los límites de tiempo de espera configurados.
¿Qué rutas API caducan con suficiente frecuencia como para afectar a los usuarios?
Ver SQL y resultadoComparar dependencia p95 Latencia
Encuentre bases de datos, API, cachés y colas que contribuyan con la mayor latencia final a las solicitudes.
¿Qué dependencias posteriores tienen la peor latencia de cola y tasa de fallas?
Ver SQL y resultadoMedir la disponibilidad de API frente a un SLO
Calcular la disponibilidad diaria y mostrar si un servicio cumplió con su objetivo explícito.
¿Cada servicio cumplió con su objetivo de disponibilidad diaria?
Ver SQL y resultadoCalcular el rendimiento de las solicitudes de API por ruta
Calcule las solicitudes observadas por minuto mediante una ruta API estable y mantenga el volumen de errores junto con el rendimiento.
¿Qué rutas API procesan la mayor cantidad de solicitudes por minuto?
Ver SQL y resultadoMedir la recuperación del límite de velocidad API 429
Mida la frecuencia con la que las solicitudes de velocidad limitada se recuperan en un intento posterior sin tratar cada reintento como una nueva solicitud.
¿Las solicitudes que reciben HTTP 429 se recuperan correctamente después de volver a intentarlo?
Ver SQL y resultadoComparar la tasa de errores de implementación de funciones
Compare los errores de solicitud y la latencia promedio entre la implementación de indicadores de funciones y las cohortes de control para una versión.
¿Es el lanzamiento de banderas de características menos confiable que su cohorte de control?
Ver SQL y resultadoMedir el impacto del incidente en el cliente por plan
Cuente las cuentas afectadas y la duración promedio del impacto por plan sin exponer los nombres de los clientes ni los datos de solicitudes sin procesar.
¿Cuántas cuentas se vieron afectadas por el incidente en cada plan?
Ver SQL y resultadoAdaptar el contrato del evento antes del umbral.
Mantenga el patrón de análisis, pero valide los nombres de las tablas, los tipos de campos, las definiciones comerciales, las ventanas de tiempo y las reglas de volumen mínimo con respecto a sus propios eventos. Cada consulta publicada también se planifica y ejecuta en una tabla escrita vacía con el motor fijado.