Skip to content

Chương 39: Cloud Monitoring — Metrics, Alerting, SLOs

Cloud Monitoring là nơi toàn bộ telemetry của GCP hội tụ — từ infrastructure metrics của Compute Engine đến custom metrics của ứng dụng, từ uptime checks đơn giản đến SLO error budget burn rate alerts phức tạp. Hiểu đúng cơ chế bên trong của Cloud Monitoring không chỉ giúp bạn alert ít noise hơn, mà còn giúp bạn thiết kế observability strategy có khả năng scale mà không làm vỡ budget.

Chương này đi sâu vào cơ chế thực sự: tại sao GAUGE khác DELTA khác CUMULATIVE ảnh hưởng đến cách query, tại sao multi-window alerting là bắt buộc cho SLO, và tại sao notification channel reliability là yếu tố thường bị bỏ qua nhất trong alerting design.

Điều kiện tiên quyết

  • Chương 14: GKE Observability — Metrics, Logs, Traces
  • SRE fundamentals: khái niệm SLI, SLO, error budget
  • Prometheus cơ bản: label model, PromQL syntax

Cấu trúc chương

1. Metrics Data Model — GAUGE, DELTA, CUMULATIVE

Hiểu sâu time series data model của Cloud Monitoring: metric kinds, value types, cách alignment và reduction hoạt động, và tại sao chọn sai metric kind dẫn đến query sai. Đây là nền tảng để hiểu mọi thứ phía trên.

2. Monitored Resources & Billing Model

Kiến trúc monitored resource types — cầu nối giữa metric descriptor và resource cụ thể. Bao gồm phân biệt rõ free vs chargeable metrics, cơ chế tính phí, và chiến lược kiểm soát cost metric ingestion.

3. Managed Service for Prometheus

Kiến trúc thu thập metrics của GMP: collector DaemonSet, luồng dữ liệu từ scrape đến Monarch, PodMonitoring/ClusterPodMonitoring CRDs, Rule Evaluator, và giao diện PromQL. So sánh với self-hosted Prometheus về trade-offs và giới hạn.

4. Alerting Architecture — Policies, Conditions & Notification Channels

Cơ chế bên trong của alerting engine: cách condition evaluation hoạt động, alignment period và retest window, incident lifecycle, missing data handling, và notification channel reliability. Phần này giải thích tại sao alert "trễ" và cách thiết kế để giảm false positives.

5. SLO Framework — SLI, Error Budget & Burn Rate Alerting

Framework SLO của Cloud Monitoring: SLI types (request-based vs window-based), compliance periods (rolling vs calendar), cơ chế tính error budget, và toán học đằng sau multi-window burn rate alerting. Đây là phần phức tạp nhất và quan trọng nhất cho production reliability.

6. Dashboards, Phương Pháp Observability & Alert Best Practices

USE method, RED method, Four Golden Signals — framework tư duy để quyết định metric nào cần monitor. Dashboards as code với Terraform. Chiến lược giảm alert fatigue.

Tư duy quan trọng

Một sai lầm phổ biến là treat Cloud Monitoring như một tool "cấu hình và quên" — tạo vài alert đơn giản, build dashboard, rồi move on. Nhưng monitoring thực sự là một hệ thống có cơ chế riêng, có failure modes riêng, và có cost implications quan trọng. Một alerting policy được thiết kế kém không chỉ gây alert fatigue mà còn bỏ lỡ outage thật. Một metrics strategy sai có thể sinh cost metric ingestion vượt cả cost của service đang monitor.

Mục tiêu của chương này là xây dựng mental model chính xác để bạn có thể reason về trade-offs và thiết kế observability stack phù hợp với hệ thống production thực tế.

Tham khảo chính thức