WEBBOOK CHAPTER

AI 비용 폭탄을 막는 법: 14장 GPU와 자체 호스팅의 비용을 같은 언어로 본다

14장 GPU와 자체 호스팅의 비용을 같은 언어로 본다

API는 token 단가가 보이지만 자체 GPU는 유휴 시간, reservation, 전력, 운영 인력, model loading, 실패 재처리까지 포함해야 한다. “GPU를 샀으니 inference는 공짜”가 아니다.


시간당 유효 원가 = compute + storage + network + platform labor + idle allocation
요청당 원가 = 시간당 유효 원가 / 시간당 성공 요청 수
해결당 원가 = 요청당 원가 / 해결률

GPU utilization 90%만 목표로 하면 queue latency가 길어질 수 있다. throughput, p95 latency, error, energy·cost를 함께 본다. Kubernetes request와 limit을 잘못 잡아 GPU가 예약만 되고 사용되지 않는 경우도 있다. model 크기와 batch size, quantization은 정확도 평가와 함께 조정한다.

API와 자체 호스팅 비교는 평균 트래픽이 아니라 peak, 데이터 경계, 필요한 운영 역량을 포함한다. 초기에는 API가 비싸 보여도 당직과 보안 운영을 포함하면 총비용이 낮을 수 있다.