WEBBOOK CHAPTER

AI 활용 바이블: 33장. 비용과 속도는 품질을 통과한 뒤 최적화한다

33장. 비용과 속도는 품질을 통과한 뒤 최적화한다

토큰을 줄여도 결과가 실패하면 절약이 아니다. 반대로 가장 비싼 모델을 모든 단계에 쓰는 것도 낭비다. 먼저 최소 품질 기준을 정하고 통과하는 구성끼리 비용과 지연을 비교한다.

비용은 모델 호출만이 아니다.


총비용 = 모델 입력·출력 + 검색·저장·도구 + 재시도
       + 사람 검토 + 실패 복구 + 공급자·운영 인프라

긴 공통 지시와 자료는 중복을 제거하고 안정적인 앞부분에 둔다. 그러나 캐시 정책과 비용은 공급자별로 다르므로 실제 사용량 필드를 확인한다. 출력 길이를 줄일 때 결론, 근거, 위험, 다음 행동 같은 필수 정보를 먼저 보존한다.

모델 라우팅 예:


간단 분류 → 빠르고 경제적인 모델
근거 종합 → 중간 모델 + 검색
고가치 복잡 검토 → 강한 추론 구성 + 사람 검토
정확 계산 → 코드·SQL
금지·형식 검사 → 규칙 기반 검사

지연 예산을 단계별로 나눈다. 검색 1초, 생성 5초, 후처리 1초처럼 목표를 두고 p50뿐 아니라 p95와 timeout을 본다. 무제한 재시도는 비용 폭주와 중복 행동을 만든다.

비용 알림에는 요청 수, 입력·출력 토큰, 캐시, 도구 호출, 오류율, 재시도, 사용자·팀별 상한을 넣는다. 한 번의 큰 입력과 수많은 작은 반복 중 무엇이 문제인지 구분한다.

비용 회귀를 품질과 함께 본다

프롬프트를 줄여 비용이 낮아졌어도 근거 누락이 늘면 배포하지 않는다. 품질이 조금 좋아졌지만 비용과 지연이 세 배라면 고가치 요청에만 라우팅한다. 승격 조건을 품질 baseline 이상, 안전 hard fail 0, p95 지연 상한, 건당 비용 예산, 사람 수정 시간으로 함께 둔다.

월말 청구서만 보지 말고 run 단위 추정과 실제 사용량을 대사한다. 비용 급증 시 비핵심 도구 중단, 출력 축소, 승인된 저비용 경로, rate limit 순서의 degradation plan을 준비한다.