Chương 39: Cloud Monitoring — Metrics, Alerting, SLOs
Cloud Monitoring là nơi toàn bộ telemetry của GCP hội tụ — từ infrastructure metrics của Compute Engine đến custom metrics của ứng dụng, từ uptime checks đơn giản đến SLO error budget burn rate alerts phức tạp. Hiểu đúng cơ chế bên trong của Cloud Monitoring không chỉ giúp bạn alert ít noise hơn, mà còn giúp bạn thiết kế observability strategy có khả năng scale mà không làm vỡ budget.
Chương này đi sâu vào cơ chế thực sự: tại sao GAUGE khác DELTA khác CUMULATIVE ảnh hưởng đến cách query, tại sao multi-window alerting là bắt buộc cho SLO, và tại sao notification channel reliability là yếu tố thường bị bỏ qua nhất trong alerting design.
Điều kiện tiên quyết
- Chương 14: GKE Observability — Metrics, Logs, Traces
- SRE fundamentals: khái niệm SLI, SLO, error budget
- Prometheus cơ bản: label model, PromQL syntax
Cấu trúc chương
1. Metrics Data Model — GAUGE, DELTA, CUMULATIVE
Hiểu sâu time series data model của Cloud Monitoring: metric kinds, value types, cách alignment và reduction hoạt động, và tại sao chọn sai metric kind dẫn đến query sai. Đây là nền tảng để hiểu mọi thứ phía trên.
2. Monitored Resources & Billing Model
Kiến trúc monitored resource types — cầu nối giữa metric descriptor và resource cụ thể. Bao gồm phân biệt rõ free vs chargeable metrics, cơ chế tính phí, và chiến lược kiểm soát cost metric ingestion.
3. Managed Service for Prometheus
Kiến trúc thu thập metrics của GMP: collector DaemonSet, luồng dữ liệu từ scrape đến Monarch, PodMonitoring/ClusterPodMonitoring CRDs, Rule Evaluator, và giao diện PromQL. So sánh với self-hosted Prometheus về trade-offs và giới hạn.
4. Alerting Architecture — Policies, Conditions & Notification Channels
Cơ chế bên trong của alerting engine: cách condition evaluation hoạt động, alignment period và retest window, incident lifecycle, missing data handling, và notification channel reliability. Phần này giải thích tại sao alert "trễ" và cách thiết kế để giảm false positives.
5. SLO Framework — SLI, Error Budget & Burn Rate Alerting
Framework SLO của Cloud Monitoring: SLI types (request-based vs window-based), compliance periods (rolling vs calendar), cơ chế tính error budget, và toán học đằng sau multi-window burn rate alerting. Đây là phần phức tạp nhất và quan trọng nhất cho production reliability.
6. Dashboards, Phương Pháp Observability & Alert Best Practices
USE method, RED method, Four Golden Signals — framework tư duy để quyết định metric nào cần monitor. Dashboards as code với Terraform. Chiến lược giảm alert fatigue.
Tư duy quan trọng
Một sai lầm phổ biến là treat Cloud Monitoring như một tool "cấu hình và quên" — tạo vài alert đơn giản, build dashboard, rồi move on. Nhưng monitoring thực sự là một hệ thống có cơ chế riêng, có failure modes riêng, và có cost implications quan trọng. Một alerting policy được thiết kế kém không chỉ gây alert fatigue mà còn bỏ lỡ outage thật. Một metrics strategy sai có thể sinh cost metric ingestion vượt cả cost của service đang monitor.
Mục tiêu của chương này là xây dựng mental model chính xác để bạn có thể reason về trade-offs và thiết kế observability stack phù hợp với hệ thống production thực tế.