Saltar al contenido
Telemetry
IA y LLM receta SQL

Medir el tiempo de LLM hasta el primer token

Compare la capacidad de respuesta de la transmisión y la latencia total de generación por modelo y característica.

Intermediollm_requestsRevisado 2026-07-27Probado con Apache DataFusion 45.2.0

Revisado por el equipo de producto Telemetry en . Compatibilidad con SQL, contrato de eventos, resultados sintéticos y advertencias operativas. Revisar los estándares y la propiedad

Pregunta respondida

¿Qué combinaciones de modelos y características se sienten lentas antes de que comience la producción?

Los usuarios experimentan la pausa antes de transmitir por separado del tiempo total de finalización. La medición de ambos revela si la latencia proviene del inicio o de la generación de la solicitud.

Contrato de evento

Campos que espera la consulta

CampoTipoPor que existe
timestamp_utcTimestampTiempo de finalización de la solicitud del modelo.
modelUtf8Identificador del modelo de proveedor.
featureUtf8Característica del producto que realiza la solicitud.
statusUtf8Resultado final de la solicitud.
time_to_first_token_msFloat64Milisegundos hasta el primer token transmitido.
latency_msFloat64Duración total de la solicitud en milisegundos.
DataFusionSQL

Copiar la consulta

sql
SELECT
  feature,
  model,
  COUNT(*) AS requests,
  approx_percentile_cont(time_to_first_token_ms, 0.50) AS p50_ttft_ms,
  approx_percentile_cont(time_to_first_token_ms, 0.95) AS p95_ttft_ms,
  approx_percentile_cont(latency_ms, 0.95) AS p95_total_latency_ms
FROM llm_requests
WHERE timestamp_utc >= now() - INTERVAL '7 days'
  AND status = 'success'
  AND time_to_first_token_ms IS NOT NULL
GROUP BY feature, model
HAVING COUNT(*) >= 30
ORDER BY p95_ttft_ms DESC;

Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.

Resultado de la consulta

p95 tiempo hasta la primera ficha

La generación de informes tiene la pausa de inicio más larga y la finalización total más lenta.

featuremodelrequestsp50_ttft_msp95_ttft_msp95_total_latency_ms
report_generationlarge-reasoning8421280462018.400
draft_replysmall-fast68103109203840
search_summarybalanced242048013806210

Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.

p95 time to first token: gráfico estático de valores sintéticos de p95_ttft_ms del resultado del ejemplo Measure LLM Time to First Token
SVG indexable de la salida del ejemplo determinista. Descárguelo para ver un artículo, un runbook o una revisión de diseño con atribución.

Reproducir el ejemplo

Descargar el accesorio público

El paquete JSON incluye el contrato de evento escrito, illustrative filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.

Cómo funciona el SQL

  1. 1Las solicitudes de transmisión exitosas se agrupan por decisión y modelo de producto.
  2. 2La página 50 describe la pausa típica, mientras que la página 95 expone la cola de la que se quejan los usuarios.
  3. 3La latencia total de p95 permanece junto a TTFT, por lo que la optimización no mejora el inicio y empeora la finalización.

Casos extremos para decidir

  • Las solicitudes que no son de transmisión no tienen una medición de primer token significativa.
  • Los tiempos informados por el proveedor y los tiempos observados por el cliente pueden diferir; documentar el límite de medición.
  • Compare modelos dentro de funciones porque el tamaño del mensaje y la longitud de salida solicitada afectan ambas métricas.

Panel recomendado

  • Barras agrupadas: p50_ttft_ms y p95_ttft_ms
  • Tendencia: p95 TTFT por modelo y característica
  • Tabla: solicitudes lentas con recuentos de tokens y contexto de reintento

Guía de alerta

Alerta cuando el TTFT p95 de una función de gran volumen excede su objetivo de experiencia de usuario en segmentos consecutivos.

Leer configuración de alerta

Pon la receta a trabajar

Instrumentación y guías relacionadas.

Continuar el análisis

Ejecútelo en eventos reales.

Crea una tabla, adapta los campos y guarda el resultado.

Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.

Obtén una clave API