WEBBOOK CHAPTER

혼자 일하지만 혼자 하지 않는다: 22장 AI 비용과 품질을 같은 실험으로 측정한다

22장 AI 비용과 품질을 같은 실험으로 측정한다

모델 가격표의 token 단가만 보면 검색, tool call, retry, 사람 review, 실패 재작업과 observability 비용이 빠진다. 한 고객 deliverable의 입력·출력 token, 호출 수, cache, 외부 API, 실행 시간, 사람 승인 분을 기록한다. 공급자 가격은 바뀌므로 계산일과 model/version을 남긴다. 무료 credit은 정상 원가에서 분리한다.

baseline prompt와 새 prompt를 같은 고정 eval에 실행하고 source coverage, 사실 오류, format, 위험한 외부 행동, latency, 비용을 비교한다. 품질이 조금 좋아져도 비용·시간이 납기와 margin을 깨면 업무별로 다른 model과 escalation을 쓴다. 더 싼 모델이 실패를 반복하면 총비용은 커진다.

budget은 요청당 상한, 고객·일별 상한, 전체 월 상한과 anomaly alert로 둔다. 상한 도달 시 조용히 품질을 낮추지 않고 queue·사람 처리·명시적 중단 중 계약된 경로를 선택한다. 비용 dashboard에 고객 prompt나 개인정보를 label로 넣지 않는다.

실습은 정상, 긴 입력, tool loop, 잘못된 schema retry를 주입해 최악 비용을 측정한다. 개선 전후에는 성공 작업당 비용과 사람 분, 첫 시도 통과율을 함께 본다. 효율은 가장 싼 호출이 아니라 승인 가능한 결과 하나를 안전하게 전달하는 총자원이다.