WEBBOOK CHAPTER

느린 이유를 숫자로 설명하는 성능 엔지니어링: 29장. 성능 Incident 15분 분류

29장. 성능 Incident 15분 분류

사용자 증상과 시작 시각을 고정하고 최근 deploy·config·traffic·dependency 변경을 겹쳐 본다. 전체 평균이 아니라 영향 route·region·tenant 범위를 찾는다. 오류율, p95·p99, saturation, queue, DB pool, external latency를 같은 시간축에 둔다.

처음부터 원인을 확정하지 않고 traffic 증가, service demand 증가, capacity 감소, dependency 지연, 측정 오류 가설을 병렬로 검토한다. 안전한 완화는 rollback, rate limit, degrade, scale 중 blast radius와 되돌림을 비교한다. profile이나 query plan 수집이 시스템을 더 압박하지 않게 한다. 완화 뒤 업무 성공과 대사까지 확인한다.