Contrato de evento
Campos que espera la consulta
| Campo | Tipo | Por que existe |
|---|---|---|
| timestamp_utc | Timestamp | Cuando se completó la solicitud del modelo. |
| feature | Utf8 | Flujo de trabajo del producto estable o nombre de la característica. |
| model | Utf8 | Identificador del modelo de proveedor. |
| input_tokens | Int64 | Tokens de entrada informados por el proveedor. |
| output_tokens | Int64 | Tokens de salida informados por el proveedor. |
| estimated_cost_usd | Float64 | Costo de la solicitud calculado a partir del precio del modelo versionado. |
| status | Utf8 | éxito o fracaso. |
Copiar la consulta
SELECT
feature,
model,
COUNT(*) AS requests,
SUM(input_tokens + output_tokens) AS total_tokens,
ROUND(SUM(estimated_cost_usd), 4) AS cost_usd,
ROUND(SUM(estimated_cost_usd) / NULLIF(COUNT(*), 0), 4) AS cost_per_request_usd
FROM llm_request_completed
WHERE timestamp_utc >= now() - INTERVAL '30 days'
AND feature IS NOT NULL
GROUP BY feature, model
ORDER BY cost_usd DESC;Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.
Resultado de la consulta
Costo del modelo de treinta días por característica
Los informes de investigación cuestan más en general a pesar de muchas menos solicitudes, lo que apunta a una optimización del costo unitario en lugar de un problema de adopción.
| feature | model | requests | total_tokens | cost_usd | cost_per_request_usd |
|---|---|---|---|---|---|
| research_report | reasoning-large | 4 | 8000 | 0,8 | 0,2 |
| document_summary | balanced-medium | 3 | 4500 | 0,15 | 0,05 |
| support_draft | fast-small | 5 | 5000 | 0,1 | 0,02 |
Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.
Reproducir el ejemplo
Descargar el accesorio público
El paquete JSON incluye el contrato de evento escrito, reproducible filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.
Cómo funciona el SQL
- 1La agrupación tanto por característica como por modelo preserva el contexto necesario para explicar las migraciones de modelos.
- 2El costo por solicitud distingue un flujo de trabajo económico de gran volumen de uno costoso de bajo volumen.
- 3Almacene el costo de la solicitud calculado en el momento del evento utilizando una tabla de precios versionada para que los informes históricos no cambien cuando cambien los precios del proveedor.
Casos extremos para decidir
- No multiplique el total de tokens por una tasa cuando los tokens de entrada, de entrada en caché y de salida tengan precios diferentes.
- Incluir solicitudes fallidas si el proveedor les factura; de lo contrario, agregue un campo billing_status.
- Utilice identificadores de cuenta o equipo cuando los márgenes varíen materialmente según el cliente.
Panel recomendado
- Gráfico de barras: cost_usd por característica
- Gráfico de líneas: costo diario dividido por modelo
- Tabla: solicitudes individuales de mayor costo sin contenido de aviso sin procesar
Guía de alerta
Alerte cuando el costo diario de una función o el costo por resultado exitoso exceda un presupuesto acordado, no solo cuando aumente el volumen de solicitudes.
Leer configuración de alertaPon la receta a trabajar
Instrumentación y guías relacionadas.
Definir los datos de origen
Esquemas de eventos para este análisis.
Continuar el análisis
Medir las producciones de IA aceptadas por dólar
Conecte el gasto modelo con resultados de productos aceptados, ahorrados o útiles.
Receta abiertaMedir el ahorro de caché de LLM y el costo de reintento
Compare las solicitudes almacenadas en caché, el volumen de reintentos y el gasto estimado por modelo para encontrar costos de IA evitables.
Receta abiertaMedir el tiempo de LLM hasta el primer token
Compare la capacidad de respuesta de la transmisión y la latencia total de generación por modelo y característica.
Receta abiertaEjecútelo en eventos reales.
Crea una tabla, adapta los campos y guarda el resultado.
Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.