LiteLLM Gateway and SDK Telemetry: del límite a la fila verificada
Utilice LiteLLM Gateway and SDK Telemetry en un límite de aplicación controlado, mantenga el contrato de evento pequeño y verifique un resultado conocido antes de crear vistas agregadas.
- 1
Elige el resultado
Fiabilidad de LLM entre proveedores
- 2
Definir el contrato
operation_id, característica, requested_model, response_model, proveedor, ruta y versión
- 3
Instrumentar el límite
Un contenedor otorga a la aplicación la propiedad del resultado final del producto; una devolución de llamada LiteLLM puede complementarlo con el costo informado por la puerta de enlace y el contexto de enrutamiento.
- 4
Verificar la evidencia
Exercise a known fixture, then inspect litellm_request_completed for one correctly typed terminal row.
Antes de empezar
Requisitos previos y límites
- LiteLLM y telemetry-sh inicializados en un servicio Python confiable
- Características estables, ruta, alias de modelo, proveedor, equipo y dimensiones de lanzamiento
- Una devolución de llamada revisada o un límite contenedor que excluye el contenido del modelo
Configuración de entrega
Instalar e inicializar el lado del servidor
Inicialice Telemetry para código síncrono o TelemetryAsync para código asíncrono una vez por proceso con una clave del lado del servidor. Mantenga las credenciales de ingesta fuera de los paquetes de navegador, las variables de entorno visibles para el cliente, el control de fuente, los registros y los mensajes de excepción.
Instalación pip
python -m pip install telemetry-sh- 1Prepare un cliente de entrega del lado del servidor reutilizable con comportamiento de red limitado.
- 2Agregue el evento de resultado en el límite de éxito, error, reintento o tiempo de espera.
- 3Envíe accesorios controlados e inspeccione las filas almacenadas antes de habilitar una alerta.
Fragmento
Comience con un evento estructurado
Agregue esta forma donde el flujo de trabajo se completa, falla o se vuelve a intentar. Luego cree el panel a partir de campos reales.
Evento LiteLLM Gateway and SDK Telemetry
from time import perf_counter
from litellm import completion
def complete_with_outcome(messages, operation_id: str):
started_at = perf_counter()
status = "success"
error_type = None
response = None
try:
response = completion(
model="openai/gpt-5.6",
messages=messages,
)
return response
except Exception as error:
status = "failed"
error_type = classify_gateway_error(error)
raise
finally:
usage = getattr(response, "usage", None)
telemetry.log("litellm_request_completed", {
"operation_id": operation_id,
"feature": "support_draft",
"requested_model": "openai/gpt-5.6",
"response_model": getattr(response, "model", None),
"status": status,
"error_type": error_type,
"duration_ms": round((perf_counter() - started_at) * 1000),
"input_tokens": getattr(usage, "prompt_tokens", 0),
"output_tokens": getattr(usage, "completion_tokens", 0),
"release": APP_RELEASE,
})Contrato de evento
operation_id, característica, requested_model, response_model, proveedor, ruta y versión
estado, duration_ms, input_tokens, output_tokens, retry_count, fallback_used y error_type
estimated_cost_usd, pricing_version, aceptado, cache_hit, account_id y entorno cuando esté aprobado
Puntos de control de implementación
Punto de control 1
Un contenedor otorga a la aplicación la propiedad del resultado final del producto; una devolución de llamada LiteLLM puede complementarlo con el costo informado por la puerta de enlace y el contexto de enrutamiento.
Punto de control 2
Separe el alias del modelo solicitado del modelo de respuesta del proveedor para que el comportamiento alternativo siga siendo consultable.
Punto de control 3
No copie mensajes, respuestas, cargas útiles de herramientas, claves virtuales, credenciales de proveedores ni excepciones sin restricciones en Telemetry.
Verificación
Demuestra que el evento llegó
Ejecute esto después de ejercitar casos conocidos de éxito y fracaso. Reemplace el nombre de la tabla alternativa si su contrato de evento final difiere del fragmento.
Consulta de verificación LiteLLM Gateway and SDK Telemetry
SELECT *
FROM litellm_request_completed
ORDER BY timestamp_utc DESC
LIMIT 20;Referencias de implementación
Revise el contrato del evento, la guía de seguridad de los datos y la documentación primaria previa antes de habilitar una nueva ruta de producción.
Límite de producción
Mantenga el evento de resultado pequeño y recuperable
Este patrón proporciona
- Un resultado limitado y listo para SQL junto al flujo de trabajo ascendente.
- Campos estables para paneles, alertas y correlación entre eventos.
- Una ruta basada en dispositivos para validar el comportamiento de éxito, fracaso, reintento y tiempo de espera.
Este patrón no proporciona
- Un exportador de OTLP, un canal de recopilación automática o un reemplazo para seguimientos detallados y registros de diagnóstico.
- Entrega exactamente una vez simplemente porque la carga útil contiene un ID de evento.
- Permiso para recopilar cargas útiles sin procesar del proveedor, contenido de usuario, credenciales o datos regulados.
Puntos de partida del esquema de eventos
Contratos de eventos para este flujo de trabajo
Revise el detalle de la fila, el límite de emisión, los tipos requeridos, las clases de privacidad, la carga útil de ejemplo y la lista de verificación de validación antes de adaptar una consulta o fragmento a producción.
Función relacionada del producto
Continúe este flujo de trabajo en Monitoreo de agentes de IA
Conecte las ejecuciones de agentes, el uso de herramientas, el costo del modelo, la calidad y los resultados del producto con SQL revisable.
Recetas SQL relacionadas
Responde la siguiente pregunta con SQL
Ejecute la consulta en los campos estructurados de este flujo de trabajo, inspeccione el resultado del ejemplo y convierta una respuesta útil en un panel o alerta.
Calcular el costo de LLM por característica y modelo
¿Qué características y modelos de productos impulsan el gasto en LLM?
Receta abiertaMedir el ahorro de caché de LLM y el costo de reintento
¿Cuánto costo del modelo está asociado con los reintentos y los errores de caché?
Receta abiertaMedir el tiempo de LLM hasta el primer token
¿Qué combinaciones de modelos y características se sienten lentas antes de que comience la producción?
Receta abiertaMedir las producciones de IA aceptadas por dólar
¿Qué combinación de modelo y características produce los resultados por dólar más aceptados?
Receta abiertaDetecte picos en la tasa de errores con una línea de base móvil
¿Qué segmentos de tasa de error por hora están muy por encima de su línea de base reciente?
Receta abiertaExplorar por familia de implementación
Comparar patrones de integración relacionados
Plantillas para combinar con esta integración
Rastreador de costos de LLM
Mida el gasto del modelo, el uso de tokens, la latencia, la tasa de fallas y las señales de valor por función, usuario y cuenta.
Abrir plantillaPlantilla de observabilidad de agentes de IA
Realice un seguimiento de las ejecuciones de agentes, llamadas de herramientas, reintentos, latencia de modelos, errores y resultados aceptados con eventos estructurados listos para SQL.
Abrir plantillaMás integraciones
API de respuestas OpenAI Telemetry
Mida la latencia de la API de OpenAI Responses, el uso de tokens, la actividad de las herramientas, las fallas y los resultados posteriores sin recopilar indicaciones ni contenido generado.
abrir guiaAntrópico Claude API Telemetry
Realice un seguimiento del uso del token de Claude API, el modelo, la latencia, el motivo de la detención, los errores, el contexto de costos y los resultados de los productos revisados sin almacenar mensajes.
abrir guiaVercel SDK de IA Telemetry
Realice un seguimiento de las finalizaciones de transmisión, el uso de tokens, los reintentos, la latencia y los resultados aceptados de los flujos de trabajo del SDK de AI.
abrir guia