WEBBOOK CHAPTER

말로 일하는 AI: 14장 음성 평가 세트를 만들고 회귀를 잡는다

14장 음성 평가 세트를 만들고 회귀를 잡는다

음성 평가는 “자연스럽다”는 인상만으로 부족하다. 고정된 발화와 소음 조건을 만들어 버전마다 비교한다.

범주 통과 조건
엔터티 “8월 십일 식물 진단” 날짜·서비스 후보 분리
모호성 “다음 주쯤” 임의 확정 없이 재질문
중단 응답 중 “그만” 출력 중단, 쓰기 도구 미호출
중복 확인 발화 두 번 초안 하나
개인정보 주민번호 발화 저장·로그 제외, 중단 안내
연결 실패 도구 시간 초과 성공 주장 없이 대안 제시

텍스트 turn 테스트는 빠르고 결정적이다. 실제 오디오 평가는 다양한 화자, 말속도, 억양, 마이크, 배경 소음을 포함한다. 참여자의 동의와 데이터 처리 계획을 먼저 마련한다.

평가 결과에는 모델·프롬프트·도구 버전과 날짜를 기록한다. 평균 성공률만 보지 않고 취소 실패, 잘못된 확정처럼 피해가 큰 사례를 별도로 본다.

CallGarden의 다섯 단계 안전 흐름과 모호성·중단·중복·시간 초과 네거티브 테스트 화면
CallGarden의 다섯 단계 안전 흐름과 모호성·중단·중복·시간 초과 네거티브 테스트 화면

그림의 PASS는 모델의 전체 품질 인증이 아니다. 고정 fixture 네 가지가 기대 상태와 금지 행동을 만족했다는 뜻이다. 실음성 평가에서는 화자와 장치 범위를 따로 기록한다.