Saltar al contenido
Telemetry
IA y LLM receta SQL

Medir el ahorro de caché de LLM y el costo de reintento

Compare las solicitudes almacenadas en caché, el volumen de reintentos y el gasto estimado por modelo para encontrar costos de IA evitables.

Intermediollm_requestsRevisado 2026-07-27Probado con Apache DataFusion 45.2.0

Revisado por el equipo de producto Telemetry en . Compatibilidad con SQL, contrato de eventos, resultados sintéticos y advertencias operativas. Revisar los estándares y la propiedad

Pregunta respondida

¿Cuánto costo del modelo está asociado con los reintentos y los errores de caché?

El gasto total del modelo oculta por qué cambió. Los resultados e intentos de caché hacen visible el trabajo repetido evitable sin almacenar indicaciones ni finalizaciones.

Contrato de evento

Campos que espera la consulta

CampoTipoPor que existe
timestamp_utcTimestampTiempo de finalización de la solicitud del modelo.
modelUtf8Identificador de modelo.
cache_outcomeUtf8acertar, fallar o no disponible.
attemptInt64Número de intento basado en uno.
estimated_cost_usdFloat64Costo estimado de la solicitud.
DataFusionSQL

Copiar la consulta

sql
SELECT
  model,
  COUNT(*) AS requests,
  SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END) AS cache_hits,
  SUM(CASE WHEN attempt > 1 THEN 1 ELSE 0 END) AS retries,
  100.0 * SUM(CASE WHEN cache_outcome = 'hit' THEN 1 ELSE 0 END)
    / NULLIF(COUNT(*), 0) AS cache_hit_rate_pct,
  SUM(CASE WHEN attempt > 1 THEN estimated_cost_usd ELSE 0 END) AS retry_cost_usd,
  SUM(estimated_cost_usd) AS total_cost_usd
FROM llm_requests
WHERE timestamp_utc >= now() - INTERVAL '30 days'
GROUP BY model
ORDER BY retry_cost_usd DESC;

Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.

Resultado de la consulta

Costo de reintento dentro del costo total del modelo

El modelo más grande tiene tanto una menor tasa de aciertos de caché como una mayor carga de costo de reintento.

modelrequestscache_hitsretriescache_hit_rate_pctretry_cost_usdtotal_cost_usd
gpt-5.118.400662074035,9892,41480,2
gpt-5.1-mini49.20023.81038048,3911,8604,6

Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.

Retry cost within total model cost: gráfico estático de valores sintéticos de retry_cost_usd del resultado del ejemplo Measure LLM Cache Savings and Retry Cost
SVG indexable de la salida del ejemplo determinista. Descárguelo para ver un artículo, un runbook o una revisión de diseño con atribución.

Reproducir el ejemplo

Descargar el accesorio público

El paquete JSON incluye el contrato de evento escrito, illustrative filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.

Cómo funciona el SQL

  1. 1La tasa de aciertos de caché cuenta los aciertos de caché explícitos dentro de todas las solicitudes registradas.
  2. 2Un intento mayor a uno aísla el trabajo repetido del modelo del costo del primer intento.
  3. 3El resultado explica la mecánica de costos; conéctelo a los resultados aceptados o retenidos antes de optimizarlo únicamente para el gasto.

Casos extremos para decidir

  • Una caché de avisos del lado del proveedor y una caché de respuestas de la aplicación son mecanismos diferentes.
  • Evite el costo de conteo doble cuando una solicitud lógica emite eventos de intento y de resumen.
  • Las estimaciones de costos deben utilizar las reglas de precio y token activas cuando se ejecutó la solicitud.

Panel recomendado

  • Barras apiladas: reintento y coste total por modelo
  • Tendencia: tasa de aciertos de caché
  • Tabla: características con costosos ciclos de reintento

Guía de alerta

Alerta sobre picos de costos de reintento o colapso repentino de visitas de caché después de un volumen mínimo de solicitudes.

Leer configuración de alerta

Pon la receta a trabajar

Instrumentación y guías relacionadas.

Continuar el análisis

Ejecútelo en eventos reales.

Crea una tabla, adapta los campos y guarda el resultado.

Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.

Obtén una clave API