Module 9 Advanced Observability, SRE & Incident Self-Healing

Observability, Monitoring & Reliability

The 3 Pillars of Telemetry: Metrics, Logs, Traces & Automated Self-Healing

Estimated Time 6 Hours
Primary Services
Amazon CloudWatch (Metrics & Logs)AWS X-RayAWS CloudTrailAWS ConfigAWS Fault Injection Simulator (FIS)
Module 9 သင်ရိုးမာတိကာ Full-Stack Observability, SLI/SLO Monitoring & Automated Remediation

Cloud Observability & Self-Healing Telemetry

Amazon CloudWatch, OpenSearch, AWS X-Ray Distributed Tracing နှင့် Self-Healing EventBridge

ရှုပ်ထွေးသော Cloud စနစ်များတွင် ပြဿနာဖြစ်ပွားပါက မည်သည့်နေရာတွင် မည်သည့်အတွက် ချို့ယွင်းသွားသည်ကို သိရှိနိုင်သော Observability မဏ္ဍိုင် ၃ ရပ် (Metrics, Logs, Traces) နှင့် စနစ်ချို့ယွင်းချက်ကို အလိုအလျောက် ပြင်ဆင်ပေးသော Self-Healing Architecture။

ရရှိမည့် အဓိက ဗိသုကာဆိုင်ရာ ကျွမ်းကျင်မှုများ (Learning Outcomes)

1

Metrics, Logs နှင့် Distributed Traces (The 3 Pillars of Observability) ကို စနစ်တကျ ချိတ်ဆက်နိုင်ခြင်း။

2

AWS X-Ray သုံး၍ Microservices များအကြား Request ပျောက်ဆုံးမှုနှင့် Bottleneck Latency များကို Pinpoint ရှာဖွေနိုင်ခြင်း။

3

CloudWatch Metric Alarms နှင့် Composite Alarms များ ဖန်တီး၍ Alarm Fatigue (အချက်ပေးသံများလွန်း၍ မေ့လျော့ခြင်း) ကို လျှော့ချနိုင်ခြင်း။

4

Amazon EventBridge + Lambda ဖြင့် EC2/RDS ပျက်စီးမှုများကို လူမပါဘဲ အလိုအလျောက် ကုစားပေးသော Self-Healing စနစ် တည်ဆောက်နိုင်ခြင်း။

အခြေခံ သဘောတရားနှင့် စဉ်းစားပုံ Mental Models

စနစ်ကြီးမားလာသည်နှင့်အမျှ "ကျွနု်ပ်တို့ Server ပျက်နေသလား" ဟု ကြည့်ရုံဖြင့် မလုံလောက်တော့ဘဲ "User များထဲမှ 0.1% သည် ဘာကြောင့် 500 Error ကြုံနေရသလဲ" ကို ချက်ချင်း ဖြေရှင်းနိုင်ရပါမည်။

Observability သည် စနစ်၏ အခြေအနေကို အချိန်နှင့်တပြေးညီ မြင်သာစေပြီး စီးပွားရေးဆုံးရှုံးမှုကို အနည်းဆုံးဖြစ်အောင် ကာကွယ်ပေးပါသည်။

အဓိက ဗိသုကာ သဘောတရားများနှင့် မဏ္ဍိုင်များ (Key Architecture Concepts)

Distributed Tracing (X-Ray)

User Request တစ်ခုသည် API Gateway -> Lambda -> DynamoDB -> 3rd-party API သို့ သွားသော ခရီးစဉ်တစ်ခုလုံးကို ID တစ်ခုတည်းဖြင့် ခြေရာခံခြင်း။

SLI / SLO / SLA

Service Level Indicator (လက်ရှိ အခြေအနေ), Service Level Objective (အတွင်းပိုင်း ပစ်မှတ်), Service Level Agreement (သုံးစွဲသူနှင့် ချုပ်ဆိုထားသော ကတိကဝတ်)။

Self-Healing Automated Runbooks

Disk Space ပြည့်သွားပါက သို့မဟုတ် Memory Leak ဖြစ်ပါက Lambda က အလိုအလျောက် သန့်ရှင်းရေးလုပ်ပေးသော စနစ်။

Production စနစ်များတွင် မဖြစ်မနေ လိုက်နာရမည့် Golden Rules

  • Log များကို Plaintext အဖြစ် မသိမ်းဘဲ JSON Structured Logs အဖြစ် အမြဲထုတ်ပါ (CloudWatch Logs Insights ဖြင့် Query လုပ်ရလွယ်ကူစေရန်)။
  • CPU Usage တစ်ခုတည်းကို ကြည့်၍ Alarm မတင်ပါနှင့်၊ Business-critical Metrics (ဥပမာ 5xx Error Rate, Order Processing Latency) ကိုပါ Alarm ချိတ်ပါ။

Hands-On Case Studies

လက်တွေ့ လေ့လာနိုင်သော Case Studies များ

2 Case Studies
Intermediate FinOps & Cloud Economics
7 min read

Cloud Cost Anomaly Sentinel: Autonomous FinOps Waste Hunting

Automatically identifying and remediating orphan EBS volumes, unattached Elastic IPs, and idle development RDS instances using AWS Config and EventBridge.

Monthly Waste Eliminated: $4,200/mo
Orphaned Disks: 0