經歷

工作經歷

2020 年至今的維運與 SRE 工作,由近到遠。

  1. 2025 – 至今

    TRON DAO

    Senior Site Reliability Engineer

    負責兩條產品線的 SRE:直播平台,以及執行在 EKS 上的 AI API 與 chat 平台。

    • API 每次發版,ALB 都會出現 2,000–3,000 個 5XX。補上 probe、readiness gate、preStop hook 與 graceful shutdown 後,一般一次發版降到十個上下。
    • 將 50 多個既有的 AWS component 以 import 納入 OpenTofu,production 不受影響;並建立每個 MR 自動執行 plan、每日 drift 偵測,以及 security scan 未通過即擋下 merge 的流程。
    • Prometheus 被 OOM kill,根因是一個沒有上限的 label(約 200 萬條 series);改為有上限的 label,並加上 recording rules。
    • Production 的 Node.js 服務發生 memory leak:從 HPA alert 追到上游回 HTTP 429 之後的無限重試;事故中 p99 升到 4.4 s,處理後回到 0.65 s。
    • 兩張計費表(1.46 TB、6.9 億筆)在 production 流量不中斷的情況下改為按時間 partition,我負責資料庫這一側的執行。
    • 共用的 production PostgreSQL 無法重啟,因此以 trigger 實作 CDC,將 staging 資料庫遷出:不停寫,每張表以 checksum 驗證。
    • 導入 Cluster Autoscaler 與 18 個 production PodDisruptionBudget,並將 node group 整併為 workload、CI、platform 三個 node pool,釋放閒置節點、降低 node churn。
    • 以 Terraform 另建一座 EKS 1.34 叢集,作為 staging 的升級路徑;Argo CD、Loki、kube-state-metrics 採 in-place 升級,並在線上環境驗證。
    • 以 Argo CD 維運 20 多個平台 Helm chart(kube-prometheus-stack、Loki、Tempo、OpenTelemetry Collector、cluster-autoscaler),每個 MR 都先經過 CI render 檢查。
    • 以 Python 在 AWS Lambda 上建立不依賴 Prometheus 與 Grafana 的 meta-monitor,專門監控監控系統本身;並上線 Tempo,讓工程師能從 Loki 的 log 直接跳到對應的 trace。
    • ISP 層的 DNS 干擾使使用者無法連上直播網站的主網域,我提出多網域方案並完成上線:CloudFront distribution、憑證與 DNS 皆以 Terraform 建置,先 staging 再 production。
    • 一個直播平台有序下線時,負責基礎設施這一側(EKS、RDS、ElastiCache、MongoDB、OpenSearch、MSK):先 staging 後 production,每次刪除前先保留 snapshot 或冷備份。
  2. 2024 – 2025

    DBS Bank

    Site Reliability Engineer

    • 在受監管的銀行環境中,穩定以 Shell 為主的部署流程,並補上版本可追溯性。
    • 導入符合規範的 Nginx gateway 設定,用於串接第三方 API。
  3. 2023 – 2024

    Palup.ai

    Site Reliability Engineer

    在 GKE 上負責 AI 產品的基礎設施,與 ML 團隊直接合作。

    • 以 Terraform 為 ML 團隊建置 GKE 叢集與 GPU node pool,包含執行在 Spot VM 上的 NVIDIA H100(每個節點 8 顆 H100 80 GB)。
    • 與 ML 團隊合作處理 GPU 共用(先採 MIG,後改 time-slicing),模型儲存則透過 Cloud Storage FUSE CSI driver。
    • 以 Argo CD ApplicationSet 將平台元件部署到新叢集,並建立 GPU 服務共用的 CUDA base image。
    • 分兩步將 production 的 n2-standard-32 node pool 替換為 n2-standard-8 與 n1-standard-4。
  4. 2022 – 2023

    Zuopin Technology

    Operations Engineer

    • 維護 GitLab、Jenkins pipeline 與 Shell 自動化,服務以 binary 方式部署。
    • 建置 Prometheus 與 ELK 的監控與 log 收集。
  5. 2020 – 2022

    Hexiang Digital Technology

    Operations Engineer

    • 維運 200 多台分布在 AWS、GCP、阿里雲、騰訊雲等多家雲端的 Linux VM:Nginx、憑證與主機監控。