WEBBOOK CHAPTER

프롬프트를 시스템으로 만드는 법: 38장. Eval Set 설계 Workshop

38장. Eval Set 설계 Workshop

실제 업무 log에서 성공·수정·escalation case를 후보화하되 고객 데이터는 synthetic으로 바꾸고 의미 특징을 보존한다. 쉬운 표본만 모으지 않고 긴 문서, 모순, 누락, 신조어, 언어 혼합, 비정상 형식을 넣는다.

전체 set을 train/development/holdout으로 나눈다. prompt를 고칠 때는 development을 보고 holdout은 릴리스 판정에만 쓴다. 실패 case를 계속 holdout에서 development로 옮기면 새 holdout을 보충한다.

rubric을 만들 때 양질 출력 10개와 문제 출력 10개를 두 사람이 독립 채점한다. 불일치 항목은 기준을 구체화한다. 인상 비평을 줄이려면 “핵심 주장의 90% 이상에 근거 ID”처럼 관측 기준을 쓴다.

model grader에는 rubric과 output만 주지 말고 필요한 reference answer/source를 제공한다. grader prompt·model·version을 기록하고 사람 판정과 calibration한다. 자동 채점을 절대 정답으로 보지 않는다.

통계적 불확실성을 표시한다. case 10개에서 1개 개선은 우연일 수 있다. 전체 평균과 카테고리별 패스율, 중요 failure 0 조건, 비용·latency distribution을 함께 본다.