Contrato de evento
Campos que espera la consulta
| Campo | Tipo | Por que existe |
|---|---|---|
| timestamp_utc | Timestamp | Tiempo de finalización de la solicitud del modelo. |
| model | Utf8 | Identificador del modelo de proveedor. |
| feature | Utf8 | Característica del producto que realiza la solicitud. |
| status | Utf8 | Resultado final de la solicitud. |
| time_to_first_token_ms | Float64 | Milisegundos hasta el primer token transmitido. |
| latency_ms | Float64 | Duración total de la solicitud en milisegundos. |
Copiar la consulta
SELECT
feature,
model,
COUNT(*) AS requests,
approx_percentile_cont(time_to_first_token_ms, 0.50) AS p50_ttft_ms,
approx_percentile_cont(time_to_first_token_ms, 0.95) AS p95_ttft_ms,
approx_percentile_cont(latency_ms, 0.95) AS p95_total_latency_ms
FROM llm_requests
WHERE timestamp_utc >= now() - INTERVAL '7 days'
AND status = 'success'
AND time_to_first_token_ms IS NOT NULL
GROUP BY feature, model
HAVING COUNT(*) >= 30
ORDER BY p95_ttft_ms DESC;Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.
Resultado de la consulta
p95 tiempo hasta la primera ficha
La generación de informes tiene la pausa de inicio más larga y la finalización total más lenta.
| feature | model | requests | p50_ttft_ms | p95_ttft_ms | p95_total_latency_ms |
|---|---|---|---|---|---|
| report_generation | large-reasoning | 842 | 1280 | 4620 | 18.400 |
| draft_reply | small-fast | 6810 | 310 | 920 | 3840 |
| search_summary | balanced | 2420 | 480 | 1380 | 6210 |
Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.
Reproducir el ejemplo
Descargar el accesorio público
El paquete JSON incluye el contrato de evento escrito, illustrative filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.
Cómo funciona el SQL
- 1Las solicitudes de transmisión exitosas se agrupan por decisión y modelo de producto.
- 2La página 50 describe la pausa típica, mientras que la página 95 expone la cola de la que se quejan los usuarios.
- 3La latencia total de p95 permanece junto a TTFT, por lo que la optimización no mejora el inicio y empeora la finalización.
Casos extremos para decidir
- Las solicitudes que no son de transmisión no tienen una medición de primer token significativa.
- Los tiempos informados por el proveedor y los tiempos observados por el cliente pueden diferir; documentar el límite de medición.
- Compare modelos dentro de funciones porque el tamaño del mensaje y la longitud de salida solicitada afectan ambas métricas.
Panel recomendado
- Barras agrupadas: p50_ttft_ms y p95_ttft_ms
- Tendencia: p95 TTFT por modelo y característica
- Tabla: solicitudes lentas con recuentos de tokens y contexto de reintento
Guía de alerta
Alerta cuando el TTFT p95 de una función de gran volumen excede su objetivo de experiencia de usuario en segmentos consecutivos.
Leer configuración de alertaPon la receta a trabajar
Instrumentación y guías relacionadas.
Continuar el análisis
Calcular el costo de LLM por característica y modelo
Atribuya el gasto del modelo, los tokens, el volumen de solicitudes y el costo por solicitud a las características del producto.
Receta abiertaMedir las producciones de IA aceptadas por dólar
Conecte el gasto modelo con resultados de productos aceptados, ahorrados o útiles.
Receta abiertaMedir el ahorro de caché de LLM y el costo de reintento
Compare las solicitudes almacenadas en caché, el volumen de reintentos y el gasto estimado por modelo para encontrar costos de IA evitables.
Receta abiertaEjecútelo en eventos reales.
Crea una tabla, adapta los campos y guarda el resultado.
Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.