Saltar al contenido
Telemetry
colección de recetas SQL

Fiabilidad de la API Recetas SQL

Calcule tasas de error de solicitudes, percentiles de latencia, regresiones de versiones, presupuestos de errores e impacto en el cliente a partir de eventos de API estructurados.

contrato de evento común

Campos que mantienen estas consultas reutilizables

  • timestamp_utc, route_template, método y status_code
  • latency_ms, request_id, versión, entorno y dependencia
  • team_id o account_id cuando se apruebe el análisis de impacto en el cliente

Definiciones antes de SQL

Decisiones que la consulta no puede tomar por usted

  1. 1Defina qué respuestas cuentan como fallas antes de calcular una tasa.
  2. 2Establezca un volumen mínimo de solicitudes para que las rutas silenciosas no dominen los porcentajes.
  3. 3Mantenga las plantillas de ruta y las versiones lo suficientemente estables para poder compararlas a lo largo del tiempo.

Secuencia recomendada

Primero la detección de compilación, luego el diagnóstico

Patrones de análisis

Hacer que el resultado explique una decisión.

Normalizar por volumen de solicitudes

El fallo del par cuenta con tasas y un umbral de volumen mínimo, por lo que una ruta silenciosa no puede superar a un punto final genuinamente riesgoso.

Comparar dimensiones estables

Agrupe por plantilla de ruta, versión, dependencia o entorno en lugar de URL sin formato y otros valores ilimitados.

Conecte la detección al impacto

Comience con un cambio en el nivel de servicio y luego identifique los clientes, las versiones y las dependencias que contribuyeron al mismo.

recetas completas

Copie la consulta y luego valide las suposiciones.

Principianteapi_requests

Calcular la tasa de errores de API por ruta

Utilice SQL para clasificar las rutas API según una tasa de error 5xx mientras protege el resultado del ruido de bajo volumen.

¿Qué rutas API tienen la tasa de error 5xx significativa más alta?

Ver SQL y resultado
Intermedioapi_requests

Calcule la latencia API p50, p95 y p99

Compare la latencia media y de cola por punto final con SQL percentil compatible con DataFusion.

¿Qué puntos finales tienen la peor latencia de cola?

Ver SQL y resultado
Intermedioapi_requests

Calcular la tasa de consumo de presupuesto de errores de API

Convierta los errores de solicitud por hora en una serie de tasa de quemado de SLO que muestre qué tan rápido se consume el presupuesto de errores permitido.

¿Con qué rapidez está consumiendo la API su presupuesto de disponibilidad del 99,9 %?

Ver SQL y resultado
Intermedioapi_requests

Compare la confiabilidad de API por versión

Compare el tráfico, la tasa 5xx y la latencia p95 entre versiones de aplicaciones sin atribuir cada cambio posterior a la implementación a la implementación.

¿Qué versiones coinciden con peores errores de API o latencia de cola?

Ver SQL y resultado
Principianteapi_requests

Clasificación de huellas dactilares de error por impacto en el cliente

Clasifique los errores de aplicaciones normalizados por ocurrencias y cuentas afectadas en lugar de permitir que un bucle de reintento domine la vista del incidente.

¿Qué grupos de errores afectan a la mayoría de las cuentas de clientes?

Ver SQL y resultado
Principianteapi_requests

Calcular la tasa de tiempo de espera de API por ruta

Clasifique las rutas por tasa de tiempo de espera mientras conserva el volumen de solicitudes y los límites de tiempo de espera configurados.

¿Qué rutas API caducan con suficiente frecuencia como para afectar a los usuarios?

Ver SQL y resultado
Intermediodependency_calls

Comparar dependencia p95 Latencia

Encuentre bases de datos, API, cachés y colas que contribuyan con la mayor latencia final a las solicitudes.

¿Qué dependencias posteriores tienen la peor latencia de cola y tasa de fallas?

Ver SQL y resultado
Intermedioapi_requests

Medir la disponibilidad de API frente a un SLO

Calcular la disponibilidad diaria y mostrar si un servicio cumplió con su objetivo explícito.

¿Cada servicio cumplió con su objetivo de disponibilidad diaria?

Ver SQL y resultado
Principianteapi_throughput_events

Calcular el rendimiento de las solicitudes de API por ruta

Calcule las solicitudes observadas por minuto mediante una ruta API estable y mantenga el volumen de errores junto con el rendimiento.

¿Qué rutas API procesan la mayor cantidad de solicitudes por minuto?

Ver SQL y resultado
Intermedioapi_attempt_events

Medir la recuperación del límite de velocidad API 429

Mida la frecuencia con la que las solicitudes de velocidad limitada se recuperan en un intento posterior sin tratar cada reintento como una nueva solicitud.

¿Las solicitudes que reciben HTTP 429 se recuperan correctamente después de volver a intentarlo?

Ver SQL y resultado
Principiantefeature_rollout_events

Comparar la tasa de errores de implementación de funciones

Compare los errores de solicitud y la latencia promedio entre la implementación de indicadores de funciones y las cohortes de control para una versión.

¿Es el lanzamiento de banderas de características menos confiable que su cohorte de control?

Ver SQL y resultado
Intermedioincident_account_impact_events

Medir el impacto del incidente en el cliente por plan

Cuente las cuentas afectadas y la duración promedio del impacto por plan sin exponer los nombres de los clientes ni los datos de solicitudes sin procesar.

¿Cuántas cuentas se vieron afectadas por el incidente en cada plan?

Ver SQL y resultado

Adaptar el contrato del evento antes del umbral.

Mantenga el patrón de análisis, pero valide los nombres de las tablas, los tipos de campos, las definiciones comerciales, las ventanas de tiempo y las reglas de volumen mínimo con respecto a sus propios eventos. Cada consulta publicada también se planifica y ejecuta en una tabla escrita vacía con el motor fijado.