콘텐츠로 건너뛰기
Telemetry
SQL 레시피 모음

인프라 SQL 레시피

서비스 수요와 함께 CPU, 메모리, 디스크, 네트워크 및 리소스 포화도를 측정하여 용량 결정이 사용자에게 표시되는 작업과 연계되도록 합니다.

공통 이벤트 계약

이러한 쿼리를 재사용 가능하게 유지하는 필드

  • timestamp_utc, 서비스, 호스트, 지역, 환경 및 리소스
  • cpu_utilization_pct, memory_utilization_pct, disk_utilization_pct 및 request_rate
  • instance_type, replica_count, 배포 및 capacity_limit

SQL 이전의 정의

쿼리가 대신 내릴 수 없는 결정

  1. 1단일 스파이크에 대해 알림하는 대신 여러 개의 전체 버킷에 대해 지속적인 포화 상태를 정의합니다.
  2. 2리소스 유형 전반에 걸쳐 단위와 활용 분모를 일관되게 유지합니다.
  3. 3더 많은 용량을 권장하기 전에 리소스 압박을 서비스 수요에 연결하세요.

권장 순서

먼저 탐지를 구축한 다음 진단을 구축하세요.

분석 패턴

결과를 통해 결정을 설명

수요와 활용도 결합

인프라 변경이 일반적인 워크로드 증가와 분리될 수 있도록 리소스 사용 외에 요청 또는 작업 볼륨을 표시합니다.

지속적인 압력 찾기

완전한 시간 버킷과 연속적인 임계값 위반을 사용하여 단기 버스트와 용량 위험을 구별합니다.

배포 경계 비교

서비스, 지역, 호스트 클래스 또는 배포별로 포화도를 분석하여 고르지 않은 로드 및 롤아웃 회귀를 찾습니다.

완전한 레시피

쿼리를 복사한 다음 가정 검증

초보자system_metrics

호스트 및 컨테이너 리소스 포화도 찾기

샘플 볼륨을 유지하면서 지속적인 CPU, 메모리 및 디스크 활용도를 기준으로 인프라 소스의 순위를 매깁니다.

지속적으로 리소스가 제한되는 인프라 소스는 무엇입니까?

SQL 및 결과를 참조하세요.
중급cache_request_events

캐시 누락 및 스탬피드 위험 찾기

제한된 캐시 키 패턴을 통해 적중률, 백엔드 비용, 동시 실패를 비교합니다.

낮은 적중률과 동시 백엔드 작업을 결합한 캐시 키 패턴은 무엇입니까?

SQL 및 결과를 참조하세요.
고급incident_lifecycle_events

사고 감지 및 복구 시간 계산

구조화된 사고 수명주기 이벤트를 감지하는 데 걸리는 시간과 복구하는 데 걸리는 시간을 계산합니다.

각 서비스가 사고를 감지하고 복구하는 데 얼마나 걸리나요?

SQL 및 결과를 참조하세요.
초보자kubernetes_workload_events

워크로드별 Kubernetes 재시작 찾기

컨테이너 다시 시작 이벤트, 준비 실패, 관찰된 누적 다시 시작 횟수를 기준으로 Kubernetes 워크로드의 순위를 매깁니다.

어떤 Kubernetes 워크로드가 다시 시작되고 준비 상태 확인에 실패합니까?

SQL 및 결과를 참조하세요.

임계값 이전에 이벤트 계약을 조정하세요.

분석 패턴을 유지하되 자신의 이벤트에 대해 테이블 이름, 필드 유형, 비즈니스 정의, 기간 및 최소 볼륨 규칙을 검증하세요. 게시된 모든 쿼리는 고정된 엔진을 사용하여 빈 형식의 테이블에 대해 계획되고 실행됩니다.