13장. 비용 SLO는 토큰 합계보다 성공 비용이다
싼 호출이 비싼 업무가 될 수 있다
작은 모델이 한 번 호출할 때는 싸더라도 재시도를 세 번 하고 결국 사람이 처리한다면 전체 비용은 더 크다. 반대로 비싼 모델이 첫 시도에 정확한 구조를 만들고 도구 호출을 줄이면 성공 건당 비용이 낮을 수 있다. 모델 단가가 아니라 업무 완료 비용을 비교해야 한다.
agent_cost = model_tokens + retrieval + tool_calls + observability
operation_cost = agent_cost + human_review + incident_loss
cost_per_success = operation_cost / safe_success_count
관측 저장비도 0이 아니다. 긴 프롬프트와 도구 전문을 모든 스팬에 복제하면 모델 비용을 줄이고 관측 비용을 늘릴 수 있다. 보존 기간과 샘플링을 함께 설계한다.
예산을 요청 단계에 배분한다
ClaimOps 한 건의 예산을 입력 구조화, 정책 검색, 설명 생성으로 나눈다. 필수 근거가 이미 없으면 추가 모델 호출 전에 need_evidence로 멈춘다. 핵심 요청을 답할 수 있게 된 뒤 문장을 다듬으려고 다시 검색하거나 모델을 호출하지 않는다.
집필 시점의 GPT-5.6 프롬프트 지침도 결과와 중단 조건을 명확히 하고 불필요한 반복 지시와 도구를 줄인 뒤 대표 평가로 확인하라고 권한다. 이 원칙은 비용과 품질을 동시에 다룬다. 짧은 프롬프트가 항상 싸거나 좋은 것은 아니지만, 행동을 바꾸지 않는 중복은 측정 없이 유지할 이유가 없다.
캐시를 품질과 분리해 측정한다
정책 설명처럼 재사용되는 앞부분은 안정적으로 유지하면 프롬프트 캐시의 이점을 얻을 수 있다. 그러나 캐시 적중률이 올라갔다고 품질이 좋아진 것은 아니다. 캐시 변경 실험에서도 같은 평가를 통과해야 한다. 개인정보가 포함된 가변 입력을 재사용 접두부에 섞지 않는다.
비용 알람의 세 수준
- 요청 수준: 한 건이 토큰·도구 호출 상한을 넘으면 중단
- 릴리스 수준: 후보의 성공 건당 비용이 기준보다 허용 폭 이상 증가하면 승격 보류
- 서비스 수준: 일·월 예산 소진 속도가 한도를 넘으면 저위험 기능 축소 또는 사람 큐 전환
예산 초과 때 무조건 더 싼 모델로 내리면 위험 업무 품질이 떨어질 수 있다. 기능 축소 순서를 미리 정한다. 예컨대 답변 문장 다듬기를 먼저 끄고, 정책 판정은 유지한다.
완료 기준
- 모델 단가와 성공 건당 운영 비용의 차이를 계산했다.
- 요청·릴리스·서비스 수준 비용 한도를 정했다.
- 예산 초과 시 안전하게 줄일 기능 순서를 적었다.