18장. 관측과 용량 계획을 연결한다
under-replicated partition, ISR, controller, disk, network, produce/fetch latency, consumer lag·age와 업무 처리 성공을 함께 본다. cardinality와 broker metric 비용을 관리한다. forecast는 partition·storage·replay 시간을 포함한다.
손쉽게 따라 하기
campaign 10배 traffic의 정상·장애 용량을 계산한다. 입력에는 실제 고객·계정·도메인 대신 tenant-demo, example.invalid와 저장소 fixture만 사용한다. 시작 전 기대 결과와 바꾸지 않을 불변식을 한 줄로 적는다.
같은 화면에서 확인할 증거
lab/public/index.html의 공통 FieldPass Evidence Board에서 책 slug kafka-event-streaming-operations, 장 번호 18, run ID를 선택한다. 입력, 판정, 관측값, rollback을 채우고 명령 결과와 같은지 확인한다. 성공 화면만 캡처하지 않고 의도한 실패 하나와 다음 안전 행동을 함께 남긴다.
막혔을 때
lag 0만 보고 handler가 잘못 처리한 사건을 놓치지 않는다. 원인을 확정하기 전 최근 변경, 환경, 권한, 시간 범위와 실제 오류를 고정한다. 외부 서비스를 반복 호출하지 않고 로컬 fixture로 최소 재현한 뒤 한 변수만 바꾼다. 복구는 process 상태가 아니라 FieldPass 예약·결제·정산의 업무 결과로 선언한다.