WEBBOOK CHAPTER

Kubernetes, 배포보다 운영이 어렵다: 18장. 관측과 SLO를 workload에 연결한다

18장. 관측과 SLO를 workload에 연결한다

pod CPU보다 예약 성공률, 중복 0, 상태 전파 지연, queue age를 SLI로 둔다. trace에는 service·namespace·pod·deployment version을 resource attribute로 붙이되 user ID 같은 high-cardinality 값을 metric label로 쓰지 않는다.

alert는 원인 후보보다 사용자 증상과 행동 가능성을 우선한다. PodRestarting만 page하지 않고 오류 예산과 업무 실패를 연결한다. dashboard·runbook·owner가 없는 alert는 출시 전에 정리한다.