33장. 관측 대시보드와 Alert 설계
대시보드 첫 줄은 오늘 반드시 끝나야 하는 job의 업무 상태다. 예정 시작, 실제 시작, deadline, 마지막 정상 영업일, 입력 도착, 현재 read/write/filter/skip, 예상 완료와 대사 상태를 보여 준다.
기술 metric에는 chunk duration, read/process/write timer, rollback·retry·skip, pool wait, DB latency, CPU·heap·GC를 둔다. label에 order ID나 seller ID 전체를 넣어 cardinality와 개인정보를 만들지 않는다. trace는 job/step/chunk와 외부 호출·DB query를 연결하되 item마다 무제한 span을 만들지 않는다.
alert는 FAILED뿐 아니라 시작 안 함, deadline 위험, 느린 성공, skip 증가, 대사 불일치, 입력 checksum 재사용, repository 정체를 포함한다. 한시적 retry 하나마다 깨우지 않고 업무 마감 위험으로 묶는다. alert에는 dashboard, runbook, owner와 즉시 확인 query 링크가 있어야 한다.