WEBBOOK CHAPTER

관측 가능성에서 SRE까지: 1장. 관측 가능성은 dashboard 수가 아니다

1장. 관측 가능성은 dashboard 수가 아니다

monitoring은 알려진 조건을 감시하고 observability는 새 질문을 기존 signal로 답할 수 있게 한다. 먼저 사용자가 기대한 결과와 상관관계 ID를 설계하고 vendor 화면은 나중에 고른다. telemetry가 없어서 장애 중 코드를 다시 배포하면 준비가 부족한 것이다.

손쉽게 따라 하기

예약 한 건을 browser에서 DB·queue까지 추적할 질문 열 개로 적는다. 입력에는 실제 고객·계정·도메인 대신 tenant-demo, example.invalid와 저장소 fixture만 사용한다. 시작 전 기대 결과와 바꾸지 않을 불변식을 한 줄로 적는다.

같은 화면에서 확인할 증거

lab/public/index.html의 공통 FieldPass Evidence Board에서 책 slug observability-sre-practical, 장 번호 1, run ID를 선택한다. 입력, 판정, 관측값, rollback을 채우고 명령 결과와 같은지 확인한다. 성공 화면만 캡처하지 않고 의도한 실패 하나와 다음 안전 행동을 함께 남긴다.

막혔을 때

CPU와 로그 검색만 있다면 업무 ID와 경계 span부터 추가한다. 원인을 확정하기 전 최근 변경, 환경, 권한, 시간 범위와 실제 오류를 고정한다. 외부 서비스를 반복 호출하지 않고 로컬 fixture로 최소 재현한 뒤 한 변수만 바꾼다. 복구는 process 상태가 아니라 FieldPass 예약·결제·정산의 업무 결과로 선언한다.