5장. Probe는 건강이 아니라 traffic 계약이다
startup probe는 느린 시작을, readiness는 새 traffic 수신 가능성을, liveness는 재시작이 회복에 도움이 되는 상태를 판단한다. 외부 DB 장애를 liveness에 묶어 모든 pod를 재시작하지 않는다.
readiness가 green이어도 업무가 틀릴 수 있다. 최소한 dependency와 내부 queue 상태를 제한 시간 안에 검사하고 과도한 비용을 피한다. probe timeout·period·failureThreshold가 실제 회복 시간과 맞는지 장애 실험한다.