關於
關於我
我是 Will,Site Reliability Engineer。2020 年從維運入行,目前專注在 AWS 與 GCP 上的 Kubernetes 平台、IaC 與 observability,也為 ML 團隊建置過 GPU 基礎設施。
我關心的是系統如何在變更中保持穩定:變更能不能被 review、故障能不能追到 root cause、同一類問題會不會再發生第二次。這個網站把這些案例整理出來,包含量測方式、取捨,以及事後回頭看會怎麼做,讓經驗可以被別人重用。
工作原則
- 先有證據,再下結論:判斷建立在量測上,而不是印象。
- 一次只改一件事:每個變更的效果才能被歸因。
- 變更走 Git 與 pipeline:可 review、可重現、可回滾。
- 數字附上量測方式:讓讀者可以自行驗證。
主題目錄
Reliability 與 Incident Response
- Zero-downtime rollout:probe、readiness gate、preStop、graceful shutdown
- Incident response 與 root cause analysis
- 線上資料庫變更:partition 與 CDC
- CPU 不是問題:自架 PostHog 怎麼在沒人發現的情況下丟了四分之一的事件寫作中
- Why Kubernetes rollouts behind an ALB drop requests, and what fixed it寫作中
Kubernetes 平台
- EKS / GKE 版本升級
- Cluster Autoscaler、PodDisruptionBudget 與 node pool 規劃
- NetworkPolicy 與 admission policy
- GPU 節點與 GPU 共用:MIG、time-slicing
- Three ways to share an H100 on GKE: MIG, MPS and time-slicing寫作中
IaC 與交付
- Terraform / OpenTofu:import 既有資源、MR plan、drift 偵測
- GitOps:Argo CD 與 ApplicationSet
- 以 CI 檢查在 merge 前擋下錯誤設定
Observability
- Prometheus cardinality 與 recording rules
- Logs 與 traces 串接:Loki、Tempo、OpenTelemetry
- Meta-monitoring:監控系統本身的監控
- One unbounded label was enough to run Prometheus out of memory寫作中
聯絡
歡迎指正與交流。對內容有補充或不同做法,可以透過以下管道聯繫。