워크로드·정책·GitOps·업그레이드·복구 실전
SeniorLab을 배포하며 probe, RBAC, NetworkPolicy, rollout, node·zone 장애와 복구를 훈련한다.
상태: 출간 후보 웹교정쇄 · 자동 QA 통과 · 플랫폼·EKS 현장 감수 대기 · 34개 장
이 책은 YAML 문법집이 아니다. FieldPass를 프로덕션 Kubernetes에 올리고 node 장애, rollout 실패, DNS 지연, quota, 인증서, storage 복구를 증거로 다룬다. 관리형 EKS를 주 경로로 설명하지만 원리는 upstream Kubernetes 문서에 맞춘다. 실제 cloud 계정·요금·정책은 시점과 조직에 따라 다시 확인한다.
목차
- 1장. Kubernetes가 해결하지 않는 문제부터 적는다
- 2장. Cluster와 workload 책임 경계를 그린다
- 3장. Manifest보다 container 계약을 먼저 만든다
- 4장. Request와 limit은 예약이자 격리다
- 5장. Probe는 건강이 아니라 traffic 계약이다
- 6장. 정상 종료와 drain을 시간으로 설계한다
- 7장. Deployment rollout을 상태 머신으로 본다
- 8장. PodDisruptionBudget을 가용성 보증으로 오해하지 않는다
- 9장. Autoscaling은 신호 지연과 비용을 가진다
- 10장. Service·Ingress·DNS 경로를 증거로 추적한다
- 11장. NetworkPolicy는 allowlist 설계다
- 12장. RBAC와 workload identity를 최소화한다
- 13장. Secret을 YAML과 log에 남기지 않는다
- 14장. Config 변경도 release다
- 15장. Stateful workload는 복구를 먼저 증명한다
- 16장. GitOps는 reconciliation과 승인 경계다
- 17장. Upgrade를 호환성 프로젝트로 운영한다
- 18장. 관측과 SLO를 workload에 연결한다
- 19장. Cluster 게임데이와 복구 훈련
- 20장. 8주 Kubernetes 운영 캡스톤
- 21장. Namespace 온보딩 워크숍
- 22장. Rollout 실패 진단 10분
- 23장. Node drain과 PDB 실습
- 24장. GitOps drift와 긴급 변경
- 25장. Multi-tenant 클러스터 위협 리뷰
- 26장. Backup에서 새 Cluster 복구까지
- 27장. Platform 비용 리뷰
- 28장. 최종 Production Readiness Review
- 29장. DNS 장애 Runbook
- 30장. 인증서 교체와 Ingress 검증
- 31장. Admission policy 설계
- 32장. 90분 클러스터 운영 시험
- 33장. 운영 당번 한 장 카드
- 33장. 배포 대상의 업무 Probe를 만든다