Saltar al contenido
Telemetry
Infraestructura receta SQL

Encuentre la saturación de recursos de host y contenedor

Clasifique las fuentes de infraestructura según la utilización sostenida de CPU, memoria y disco, preservando al mismo tiempo el volumen de muestra.

Principiantesystem_metricsRevisado 2026-07-28Probado con Apache DataFusion 45.2.0

Revisado por el equipo de producto Telemetry en . Compatibilidad con SQL, contrato de eventos, resultados sintéticos y advertencias operativas. Revisar los estándares y la propiedad

Pregunta respondida

¿Qué fuentes de infraestructura tienen recursos persistentemente limitados?

Un único pico de utilización suele ser ruido. Los promedios y máximos por hora muestran si un host o contenedor permaneció saturado el tiempo suficiente como para afectar el trabajo de la aplicación.

Contrato de evento

Campos que espera la consulta

CampoTipoPor que existe
timestamp_utcTimestampHora de muestra de métrica en UTC.
sourceUtf8Identificador de host, servicio o contenedor estable.
environmentUtf8Entorno de implementación.
cpu_utilization_pctFloat64Utilización de CPU de 0 a 100.
memory_utilization_pctFloat64Utilización de la memoria de 0 a 100.
disk_utilization_pctFloat64Utilización del disco de 0 a 100.
DataFusionSQL

Copiar la consulta

sql
SELECT
  date_trunc('hour', timestamp_utc) AS hour,
  source,
  COUNT(*) AS samples,
  AVG(cpu_utilization_pct) AS average_cpu_pct,
  MAX(cpu_utilization_pct) AS maximum_cpu_pct,
  AVG(memory_utilization_pct) AS average_memory_pct,
  MAX(memory_utilization_pct) AS maximum_memory_pct,
  MAX(disk_utilization_pct) AS maximum_disk_pct
FROM system_metrics
WHERE timestamp_utc >= now() - INTERVAL '24 hours'
  AND environment = 'production'
GROUP BY date_trunc('hour', timestamp_utc), source
HAVING COUNT(*) >= 6
  AND (
    AVG(cpu_utilization_pct) >= 80.0
    OR AVG(memory_utilization_pct) >= 85.0
    OR MAX(disk_utilization_pct) >= 90.0
  )
ORDER BY average_cpu_pct DESC, average_memory_pct DESC;

Esta consulta de solo lectura se planifica y ejecuta en una tabla escrita vacía con Apache DataFusion 45.2.0. El resultado de la muestra determinista es sintético y se revisa por separado; valide tipos de campos, umbrales y definiciones comerciales con sus propios datos. Lea la metodología de prueba.

Resultado de la consulta

Utilización promedio de CPU para fuentes saturadas

El trabajador de importación tiene limitaciones de CPU, mientras que la fuente API ingresó el resultado debido a la presión sostenida de la memoria.

hoursourcesamplesaverage_cpu_pctmaximum_cpu_pctaverage_memory_pctmaximum_memory_pctmaximum_disk_pct
2026-07-27 14:00worker-imports-036091,499,278,884,166,2
2026-07-27 14:00api-primary-026062,188,489,393,672,5

Salida de ejemplo sintético. Ejecute la consulta con su propio esquema de eventos y umbrales antes de utilizarla para decisiones operativas.

Average CPU utilization for saturated sources: gráfico estático de valores sintéticos de average_cpu_pct del resultado del ejemplo Find Host and Container Resource Saturation
SVG indexable de la salida del ejemplo determinista. Descárguelo para ver un artículo, un runbook o una revisión de diseño con atribución.

Reproducir el ejemplo

Descargar el accesorio público

El paquete JSON incluye el contrato de evento escrito, illustrative filas de entrada, SQL exacto, resultado esperado, notas de revisión y versión del motor. El CSV contiene el resultado mostrado.

Cómo funciona el SQL

  1. 1La agrupación horaria reduce el ruido de las muestras individuales y al mismo tiempo mantiene visible la ventana de tiempo afectada.
  2. 2La CPU y la memoria promedio identifican una presión sostenida; La utilización máxima del disco alcanza un límite de capacidad que no debe promediarse.
  3. 3Un mínimo de muestra evita que una fuente que informa parcialmente parezca saludable o saturada debido a muy pocos datos.

Casos extremos para decidir

  • Los porcentajes de CPU del contenedor pueden exceder 100 cuando el origen informa la utilización en varios núcleos; normalizar el contrato primero.
  • La presión de la memoria depende del caché recuperable y del comportamiento de la carga de trabajo, no solo de un porcentaje universal.
  • Las muestras faltantes requieren una vista separada de los latidos del corazón o de la frescura de la ingestión.

Panel recomendado

  • Barras: CPU y memoria promedio por fuente
  • Tendencia: utilización máxima del disco
  • Tabla: fuentes saturadas con recuento de muestra y servicio propietario

Guía de alerta

Alerte solo cuando la utilización sostenida y un síntoma que enfrenta el usuario, como latencia, antigüedad de la cola o errores, incumplen sus objetivos juntos.

Leer configuración de alerta

Pon la receta a trabajar

Instrumentación y guías relacionadas.

Continuar el análisis

Ejecútelo en eventos reales.

Crea una tabla, adapta los campos y guarda el resultado.

Comience gratis, envíe eventos estructurados y utilice el resultado de la consulta como un gráfico, un widget de panel compartido o una entrada de alerta.

Obtén una clave API