API reliability monitoring: de la implementación a la decisión
Un bucle de medición completo api reliability monitoring conecta un flujo de trabajo propio, un contrato de evento limitado, un dispositivo controlado y una pregunta sobre la que alguien puede actuar.
- 1
Establecer el límite
Registre las solicitudes de API completadas y fallidas de los controladores del servidor.
- 2
Captura el resultado
Begin with api_request_started, api_request_completed, api_request_failed and document the grain of each event.
- 3
probar las filas
Cree paneles y alertas para la tasa de error, la latencia p95 y las principales rutas fallidas.
- 4
Toma la decisión
¿Qué rutas son más lentas según la latencia p95?
Caso de uso versus plantilla
Elige qué medir
Utilice la guía de casos de uso para elegir resultados, límites de eventos y preguntas de análisis. Abra la plantilla correspondiente cuando esté listo para un breve resumen de implementación de copiar y pegar.
Mensaje del agente
Pega esto en tu agente de codificación
Reemplazar YOUR_API_KEY después del registro, solicite al agente que ejecute el flujo del producto y verifique los primeros eventos.
Mensaje de configuración API reliability monitoring
Agregue instrumentación Telemetry para confiabilidad API.
Utilice /skill.md y esta clave API Telemetry: YOUR_API_KEY
Registre cada punto final de API importante con route_template, method, status_code, status, latency_ms, user_id o team_id cuando estén disponibles, request_size_bytes, response_size_bytes y error_type.
Crear:
1. Una tabla para eventos de solicitud de API.
2. Gráficos de volumen de solicitudes, tasa de error, latencia p50 y p95 y principales puntos finales fallidos.
3. Alertas de velocidad 5xx elevada, latencia p95 lenta y caídas repentinas de tráfico.
No registre cuerpos de solicitudes, encabezados de autenticación, cookies, secretos ni contenido de usuario sin procesar.Pasos de configuración
- 1Registre las solicitudes de API completadas y fallidas de los controladores del servidor.
- 2Utilice plantillas de ruta en lugar de URL sin formato para mantener limpia la cardinalidad.
- 3Estado de captura, latencia, método, función, equipo y tipo de error.
- 4Cree paneles y alertas para la tasa de error, la latencia p95 y las principales rutas fallidas.
Eventos para capturar
Preguntas que esto desbloquea
- ¿Qué rutas son más lentas según la latencia p95?
- ¿Qué cuentas de clientes se ven afectadas por errores?
- ¿Dónde disminuyó o aumentó repentinamente el tráfico?
Ejemplos de esquemas de eventos
Esquemas de eventos para este flujo de trabajo
Revise el detalle de la fila, el límite de emisión, los tipos requeridos, las clases de privacidad, la carga útil de ejemplo y la lista de verificación de validación antes de adaptar una consulta o fragmento a producción.
Función relacionada del producto
Continúe este flujo de trabajo en Alertas
Promueva la consulta de confiabilidad revisada a un umbral propio y un flujo de trabajo de respuesta.
Recetas SQL relacionadas
Más ejemplos de SQL
Ejecute la consulta en los campos estructurados de este flujo de trabajo, inspeccione el resultado del ejemplo y convierta una respuesta útil en un panel o alerta.
Calcular el rendimiento de las solicitudes de API por ruta
¿Qué rutas API procesan la mayor cantidad de solicitudes por minuto?
Receta abiertaMedir la recuperación del límite de velocidad API 429
¿Las solicitudes que reciben HTTP 429 se recuperan correctamente después de volver a intentarlo?
Receta abiertaCalcular el tiempo de detección y recuperación de incidentes
¿Cuánto tiempo tarda cada servicio en detectar y recuperarse de incidentes?
Receta abiertaCalcular la tasa de errores de API por ruta
¿Qué rutas de API tienen la mayor tasa de errores 5xx con al menos 20 solicitudes?
Receta abiertaCalcule la latencia API p50, p95 y p99
¿Qué puntos finales tienen la peor latencia de cola?
Receta abiertaCalcular la tasa de tiempo de espera de API por ruta
¿Qué rutas API caducan con suficiente frecuencia como para afectar a los usuarios?
Receta abiertaComparar dependencia p95 Latencia
¿Qué dependencias posteriores tienen la peor latencia de cola y tasa de fallas?
Receta abiertaMedir la disponibilidad de API frente a un SLO
¿Cada servicio cumplió con su objetivo de disponibilidad diaria?
Receta abiertaCalcular la tasa de consumo de presupuesto de errores de API
¿Con qué rapidez está consumiendo la API su presupuesto de disponibilidad del 99,9 %?
Receta abiertaCompare la confiabilidad de API por versión
¿Qué versiones coinciden con peores errores de API o latencia de cola?
Receta abiertaClasificación de huellas dactilares de error por impacto en el cliente
¿Qué grupos de errores afectan a la mayoría de las cuentas de clientes?
Receta abiertaComparar la tasa de errores de implementación de funciones
¿Es el lanzamiento de banderas de características menos confiable que su cohorte de control?
Receta abiertaMedir el impacto del incidente en el cliente por plan
¿Cuántas cuentas se vieron afectadas por el incidente en cada plan?
Receta abiertaCasos de clientes
Historias de clientes relacionadas
Siguiente paso
Cree la clave API que utilizará su agente
El plan gratuito es suficiente para ejecutar el mensaje, enviar eventos de prueba y revisar el primer panel.
Páginas relacionadas
Métricas de infraestructura con SQL
Envíe eventos de infraestructura estructurados cuando necesite consultar el historial de hosts y contenedores sin una gran implementación de monitoreo.
Abrir páginaObservabilidad Claude Code
Proporcione a Claude Code un mensaje que haga que la telemetría forme parte del paso de implementación en lugar de un proyecto de limpieza separado.
Abrir páginaAviso de instrumentación Codex
Un mensaje enfocado que solicita a Codex que instrumente el resto del producto, verifique eventos y resuma las brechas de cobertura.
Abrir página