14장 성능·비용·자원을 함께 운영한다
로컬 모델은 호출료가 없더라도 무료가 아니다. 메모리, 전력, 저장 공간, 운영 시간, 장애 대응 비용이 든다. 첫 토큰 지연, 전체 응답 시간, 초당 토큰, 검색 시간, 동시 요청 수, 메모리 최고점을 같은 조건에서 측정한다.
긴 컨텍스트에 모든 문서를 넣는 방식은 느리고 권한 경계도 흐린다. 검색 결과의 필요한 구간만 넣고 최대 컨텍스트와 답변 길이를 제한한다. 요청이 몰리면 무한 대기시키지 말고 큐 길이, 제한 시간, 취소, 텍스트 검색 대안을 제공한다.
장치: 16GB 노트북, 전원 연결
모델/양자화: 배포 시 기록
질문 세트: eval-v1
동시 요청: 1 / 2 / 4
측정: 검색 p95, 첫 토큰 p95, 전체 p95, 메모리 최고점
중단: 메모리 압박 또는 30초 초과
실습 14 무모델과 모델 비교
같은 20문항을 결정적 검색, 작은 로컬 모델, 선택적 클라우드 경로로 실행한다. 유창함만 비교하지 말고 근거 정답률, 거절 정확성, 지연, 전송된 데이터 범위를 표로 만든다.