WEBBOOK CHAPTER

말로 일하는 AI: 2장 실시간 음성과 단계형 파이프라인을 선택한다

2장 실시간 음성과 단계형 파이프라인을 선택한다

음성 에이전트에는 두 가지 대표 구조가 있다.

구조 흐름 잘 맞는 경우
실시간 speech-to-speech 음성을 모델이 직접 듣고 말함 자연스러운 대화, 낮은 지연, 끼어들기
단계형 음성→텍스트→업무 로직→텍스트→음성 기록·승인·결정 규칙을 명확히 보고 싶을 때

OpenAI의 현재 공식 안내도 자연스러운 저지연 대화에는 실시간 세션을, 중간 텍스트 제어와 승인 중심 흐름에는 단계형 구성을 고려하도록 설명한다. 이 책은 단계형 사고로 도메인 규칙을 먼저 만들고, 13장에서 실시간 transport를 붙인다.

구조 선택 질문은 다음과 같다.

  • 사용자가 답을 끊고 바로 방향을 바꿔야 하는가.
  • 전사문을 검토하거나 저장해야 하는가.
  • 응답 전 정책 검사와 사람 승인이 필요한가.
  • 전화망 연결이 필요한가, 브라우저 안에서 충분한가.
  • 실패했을 때 텍스트 채널로 전환할 수 있는가.

한 서비스 안에서 두 구조를 섞을 수도 있다. 인사와 탐색은 실시간으로 하고, 결제·예약 확정은 화면에 요약을 보여 준 뒤 단계형 승인으로 넘긴다.