Contrato de evento
Campos que espera la consulta
| Campo | Tipo | Por que existe |
|---|---|---|
| timestamp_utc | Timestamp | Tiempo de finalización de la solicitud del modelo. |
| model | Utf8 | Identificador de modelo. |
| cache_outcome | Utf8 | acertar, fallar o no disponible. |
| attempt | Int64 | Número de intento basado en uno. |
| estimated_cost_usd | Float64 | Costo estimado de la solicitud. |
Copiar la consulta
SELECT
model,
COUNT(*) AS requests,
SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END) AS cache_hits,
SUM(CASE WHEN attempt > 1 THEN 1 ELSE 0 END) AS retries,
100.0 * SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END)
/ NULLIF(COUNT(*), 0) AS cache_hit_rate_pct,
SUM(CASE WHEN attempt > 1 THEN estimated_cost_usd ELSE 0 END) AS retry_cost_usd,
SUM(estimated_cost_usd) AS total_cost_usd
FROM llm_requests
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY model
ORDER BY retry_cost_usd DESC;Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.
Resultado de la consulta
Costo de reintento dentro del costo total del modelo
El modelo más grande tiene tanto una menor tasa de aciertos de caché como una mayor carga de costo de reintento.
| model | requests | cache_hits | retries | cache_hit_rate_pct | retry_cost_usd | total_cost_usd |
|---|---|---|---|---|---|---|
| gpt-5.1 | 18.400 | 6620 | 740 | 35,98 | 92,4 | 1480,2 |
| gpt-5.1-mini | 49.200 | 23.810 | 380 | 48,39 | 11,8 | 604,6 |
Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.
Reproducir el ejemplo
Descargar el accesorio público
El paquete JSON incluye el contrato de evento escrito, illustrative filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.
Cómo funciona el SQL
- 1La tasa de aciertos de caché cuenta los aciertos de caché explícitos dentro de todas las solicitudes registradas.
- 2Un intento mayor a uno aísla el trabajo repetido del modelo del costo del primer intento.
- 3El resultado explica la mecánica de costos; conéctelo a los resultados aceptados o retenidos antes de optimizarlo únicamente para el gasto.
Casos extremos para decidir
- Una caché de avisos del lado del proveedor y una caché de respuestas de la aplicación son mecanismos diferentes.
- Evite el costo de conteo doble cuando una solicitud lógica emite eventos de intento y de resumen.
- Las estimaciones de costos deben utilizar las reglas de precio y token activas cuando se ejecutó la solicitud.
Panel recomendado
- Barras apiladas: reintento y coste total por modelo
- Tendencia: tasa de aciertos de caché
- Tabla: características con costosos ciclos de reintento
Guía de alerta
Alerta sobre picos de costos de reintento o colapso repentino de visitas de caché después de un volumen mínimo de solicitudes.
Leer configuración de alertaPon la receta a trabajar
Instrumentación y guías relacionadas.
Continuar el análisis
Calcular el costo de LLM por característica y modelo
Atribuya el gasto del modelo, los tokens, el volumen de solicitudes y el costo por solicitud a las características del producto.
Receta abiertaMedir las producciones de IA aceptadas por dólar
Conecte el gasto modelo con resultados de productos aceptados, ahorrados o útiles.
Receta abiertaMedir el tiempo de LLM hasta el primer token
Compare la capacidad de respuesta de la transmisión y la latencia total de generación por modelo y característica.
Receta abiertaEjecútelo en eventos reales.
Crea una tabla, adapta los campos y guarda el resultado.
Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.