4장. 최고의 모델보다 맞는 모델을 고른다
모델 선택을 스포츠 순위처럼 보면 자주 실패한다. 어떤 모델이 “최고”인지는 과제, 언어, 입력 길이, 이미지·음성 지원, 도구, 지연 시간, 비용, 데이터 정책에 따라 달라진다. 같은 모델도 제품 UI와 API, 표준 모드와 깊은 추론 모드에서 경험이 달라질 수 있다.
선택 순서는 단순하다.
1. 과제와 성공 기준을 고정한다.
2. 필요한 모달리티와 도구를 적는다.
3. 개인정보·지역·보존 조건을 확인한다.
4. 후보 둘 또는 셋을 같은 사례로 실행한다.
5. 품질·최악 사례·지연·비용을 함께 비교한다.
6. 통과하는 가장 단순하고 경제적인 구성을 선택한다.
OpenAI 모델 가이드는 목표, 맥락, 제약, 필요한 증거, 성공 기준, 출력 형식을 중심으로 요청하고 대표 과제로 구성을 평가하도록 안내한다. Google Cloud 생성형 AI 애플리케이션 가이드도 품질, 지연, 비용, 기능을 함께 보고 실제 평가 데이터로 선택하라고 설명한다. 제품 이름이 달라도 실무 원칙은 같다.
모델 비교표에는 평균 점수만 쓰지 않는다.
| 후보 | 과제 성공 | 최악 실패 | 중앙 지연 | 건당 추정 비용 | 데이터 조건 |
|---|---|---|---|---|---|
| A | 18/20 | 출처 충돌 누락 | 4.2초 | 가정값 기록 | 계약 확인 |
| B | 17/20 | 표 계산 오류 | 1.1초 | 가정값 기록 | 계약 확인 |
중요한 보고서에는 A, 대량 분류에는 B를 쓸 수 있다. 하나의 모델로 모든 업무를 통일하는 것이 관리에는 편해도 비용과 품질에는 최선이 아닐 수 있다. 반대로 모델을 너무 많이 쓰면 데이터 정책과 평가가 복잡해진다. 팀이 감당할 수 있는 소수의 승인된 경로를 만든다.
모델 이름과 가격은 책에 고정된 진리가 아니다. last_verified, 평가 세트 버전, 실제 사용 가능한 모델 ID를 운영 문서에 기록한다.
작은 벤치마크를 직접 만든다
공개 벤치마크 점수는 모델의 일반 능력을 보여 주지만 내 업무를 대신 평가하지 않는다. 최근 실제 업무를 익명화한 20건을 고른다. 쉬운 10건, 경계 5건, 실패·악성 5건으로 나눈다. 모든 후보에 같은 자료와 출력 계약을 주고 순서를 가린 채 평가한다.
case_id,required_facts,forbidden,quality_weight,safety_weight,max_latency_ms
normal-01,SRC-01|SRC-02,unsupported number,60,40,8000
attack-01,quarantine WEB-99,secret disclosure,30,70,8000
평가자가 모델 이름을 알고 있으면 기대가 점수에 영향을 줄 수 있다. 가능하면 결과를 익명화한다. 표본 20건으로 전체 우월성을 주장하지 않고 이 업무에서의 선택 근거로만 쓴다. 한 달 뒤 실제 실패를 추가해 벤치마크를 갱신한다.