Django and Celery Structured Event Monitoring: del límite a la fila verificada
Utilice Django and Celery Structured Event Monitoring en un límite de aplicación controlado, mantenga el contrato de evento pequeño y verifique un resultado conocido antes de crear vistas agregadas.
- 1
Elige el resultado
Monitoreo de la API de Django
- 2
Definir el contrato
task_name, task_id, queue_name y estado
- 3
Instrumentar el límite
Emita un evento de terminal desde los controladores de éxito y error de Celery en lugar de registrar la carga útil completa de la tarea.
- 4
Verificar la evidencia
Exercise a known fixture, then inspect job_completed for one correctly typed terminal row.
Antes de empezar
Requisitos previos y límites
- Un TELEMETRY_API_KEY del lado del servidor
- telemetry-sh inicializado una vez por proceso
- Una solicitud propagada o un identificador de flujo de trabajo
Configuración de entrega
Instalar e inicializar el lado del servidor
Inicialice Telemetry para código síncrono o TelemetryAsync para código asíncrono una vez por proceso con una clave del lado del servidor. Mantenga las credenciales de ingesta fuera de los paquetes de navegador, las variables de entorno visibles para el cliente, el control de fuente, los registros y los mensajes de excepción.
Instalación pip
python -m pip install telemetry-sh- 1Prepare un cliente de entrega del lado del servidor reutilizable con comportamiento de red limitado.
- 2Agregue el evento de resultado en el límite de éxito, error, reintento o tiempo de espera.
- 3Envíe accesorios controlados e inspeccione las filas almacenadas antes de habilitar una alerta.
Fragmento
Comience con un evento estructurado
Agregue esta forma donde el flujo de trabajo se completa, falla o se vuelve a intentar. Luego cree el panel a partir de campos reales.
Evento Django and Celery Structured Event Monitoring
@task_postrun.connect
def record_task(sender, task_id, state, retval, **kwargs):
telemetry.log("job_completed", {
"job_name": sender.name,
"job_id": task_id,
"queue_name": sender.request.delivery_info.get("routing_key"),
"status": "success" if state == "SUCCESS" else "failed",
"attempt": sender.request.retries + 1,
"duration_ms": task_duration_ms(task_id),
"error_type": categorize_error(retval) if state != "SUCCESS" else None,
})Contrato de evento
task_name, task_id, queue_name y estado
intento, duration_ms, error_type y item_count
request_id, account_id, entorno y lanzamiento
Puntos de control de implementación
Punto de control 1
Emita un evento de terminal desde los controladores de éxito y error de Celery en lugar de registrar la carga útil completa de la tarea.
Punto de control 2
Conserve el mismo ID de tarea en todos los reintentos y registre el intento por separado.
Punto de control 3
Mantenga la instrumentación de solicitudes de Django independiente de la finalización de la tarea para que la latencia asíncrona permanezca visible.
Verificación
Demuestra que el evento llegó
Ejecute esto después de ejercitar casos conocidos de éxito y fracaso. Reemplace el nombre de la tabla alternativa si su contrato de evento final difiere del fragmento.
Consulta de verificación Django and Celery Structured Event Monitoring
SELECT *
FROM job_completed
ORDER BY timestamp_utc DESC
LIMIT 20;Referencias de implementación
Revise el contrato del evento, la guía de seguridad de los datos y la documentación primaria previa antes de habilitar una nueva ruta de producción.
Límite de producción
Mantenga el evento de resultado pequeño y recuperable
Este patrón proporciona
- Un resultado limitado y listo para SQL junto al flujo de trabajo ascendente.
- Campos estables para paneles, alertas y correlación entre eventos.
- Una ruta basada en dispositivos para validar el comportamiento de éxito, fracaso, reintento y tiempo de espera.
Este patrón no proporciona
- Un exportador de OTLP, un canal de recopilación automática o un reemplazo para seguimientos detallados y registros de diagnóstico.
- Entrega exactamente una vez simplemente porque la carga útil contiene un ID de evento.
- Permiso para recopilar cargas útiles sin procesar del proveedor, contenido de usuario, credenciales o datos regulados.
Puntos de partida del esquema de eventos
Contratos de eventos para este flujo de trabajo
Revise el detalle de la fila, el límite de emisión, los tipos requeridos, las clases de privacidad, la carga útil de ejemplo y la lista de verificación de validación antes de adaptar una consulta o fragmento a producción.
Función relacionada del producto
Continúe este flujo de trabajo en Alertas
Promueva la consulta de confiabilidad revisada a un umbral propio y un flujo de trabajo de respuesta.
Recetas SQL relacionadas
Responde la siguiente pregunta con SQL
Ejecute la consulta en los campos estructurados de este flujo de trabajo, inspeccione el resultado del ejemplo y convierta una respuesta útil en un panel o alerta.
Medir el reintento del trabajo en segundo plano y la tasa de fallas
¿Qué trabajos en segundo plano consumen más reintentos o aún fallan?
Receta abiertaMedir el tiempo de espera de la cola por trabajo
¿Qué trabajos esperan más tiempo antes de que un trabajador los inicie?
Receta abiertaMedir el crecimiento de la cola de mensajes fallidos
¿Qué colas agregan trabajos fallidos más rápido de lo que los resuelven?
Receta abiertaCalcular la tasa de errores de API por ruta
¿Qué rutas API tienen la tasa de error 5xx significativa más alta?
Receta abiertaDetectar tormentas de reintentos de trabajos en segundo plano
¿Qué tipos de trabajos dedican más trabajo a los reintentos en este momento?
Receta abiertaExplorar por familia de implementación
Comparar patrones de integración relacionados
Plantillas para combinar con esta integración
Monitor de fallas en el trabajo en segundo plano
Capture el estado de los trabajos de cola, cron, importación, sincronización de facturación y webhook desde la primera ejecución hasta los reintentos y fallas.
Abrir plantillaMonitor de latencia y errores de API
Observe el volumen de solicitudes, los códigos de estado, la latencia de ruta, los puntos finales fallidos y los incidentes de API que afectan al cliente.
Abrir plantillaMás integraciones
Monitoreo de cola BullMQ
Mida la espera de la cola de BullMQ, la duración de la ejecución, los reintentos, los fallos y el crecimiento de los mensajes no entregados con eventos del ciclo de vida preparados para SQL.
abrir guiaCola RabbitMQ Telemetry
Realice un seguimiento de la confirmación de publicación, entrega, acuse de recibo, reenvío, espera en cola, reintentos y resultados de mensajes fallidos de RabbitMQ con eventos estructurados.
abrir guiaBus de servicio de Azure Telemetry
Realice un seguimiento de los envíos, recepciones, renovación de bloqueos, liquidación, reenvío, aplazamiento y resultados de mensajes fallidos de Azure Service Bus sin recopilar cuerpos de mensajes.
abrir guia