18장. 관측과 SLO를 workload에 연결한다
pod CPU보다 예약 성공률, 중복 0, 상태 전파 지연, queue age를 SLI로 둔다. trace에는 service·namespace·pod·deployment version을 resource attribute로 붙이되 user ID 같은 high-cardinality 값을 metric label로 쓰지 않는다.
alert는 원인 후보보다 사용자 증상과 행동 가능성을 우선한다. PodRestarting만 page하지 않고 오류 예산과 업무 실패를 연결한다. dashboard·runbook·owner가 없는 alert는 출시 전에 정리한다.