WEBBOOK CHAPTER

관측 가능성에서 SRE까지: 9장. Sampling은 비용과 탐지율의 거래다

9장. Sampling은 비용과 탐지율의 거래다

head sampling은 단순하지만 희귀 오류를 놓칠 수 있고 tail sampling은 collector 자원과 결정 지연이 든다. 오류, 느린 요청, 중요한 업무를 보존할 규칙과 전체 baseline 표본을 둔다. 변경 전후 탐지율을 측정한다.

손쉽게 따라 하기

정상 1%, 오류 100%, 느린 요청 100% fixture로 예상 저장량을 계산한다. 입력에는 실제 고객·계정·도메인 대신 tenant-demo, example.invalid와 저장소 fixture만 사용한다. 시작 전 기대 결과와 바꾸지 않을 불변식을 한 줄로 적는다.

같은 화면에서 확인할 증거

lab/public/index.html의 공통 FieldPass Evidence Board에서 책 slug observability-sre-practical, 장 번호 9, run ID를 선택한다. 입력, 판정, 관측값, rollback을 채우고 명령 결과와 같은지 확인한다. 성공 화면만 캡처하지 않고 의도한 실패 하나와 다음 안전 행동을 함께 남긴다.

막혔을 때

비용만 줄고 incident 재현이 끊기면 game day로 정책을 되돌린다. 원인을 확정하기 전 최근 변경, 환경, 권한, 시간 범위와 실제 오류를 고정한다. 외부 서비스를 반복 호출하지 않고 로컬 fixture로 최소 재현한 뒤 한 변수만 바꾼다. 복구는 process 상태가 아니라 FieldPass 예약·결제·정산의 업무 결과로 선언한다.