WEBBOOK CHAPTER

로컬 LLM으로 만드는 사내 문서 AI: 2장 내 컴퓨터에 맞는 크기를 고른다

2장 내 컴퓨터에 맞는 크기를 고른다

모델 매개변수만 보고 하드웨어를 고르면 실패한다. 가중치 형식, 양자화, 컨텍스트, KV 캐시, 동시 요청이 메모리를 함께 쓴다. 먼저 20개의 대표 질문으로 허용 지연과 품질을 정하고 작은 모델부터 측정한다.

llama.cpp는 CPU와 여러 GPU 백엔드, 양자화 모델, 로컬 HTTP 서버를 제공한다. Ollama는 설치와 모델 실행을 단순화한다. 어느 쪽도 “모든 PC에서 빠르다”는 뜻은 아니다. 가중치의 이론적 하한은 매개변수 수 × 양자화 비트 ÷ 8이지만 파일 메타데이터, KV 캐시와 런타임 버퍼가 더 필요하다. 대략 8GB 시스템은 1~3B급, 16GB는 7~8B급, 32GB는 14B급부터 시험하되 실제 모델 파일 크기와 llama-bench 측정을 우선한다. 긴 컨텍스트와 동시 요청은 같은 모델에서도 메모리를 크게 늘린다.

실습 2 무모델 기준선

제공 실습실의 로컬 문서 탭에서 ‘환불’을 검색한다. D1 근거가 나오는지 확인한다. 이 결정론적 검색이 이후 모델 답변의 최소 기준이다. 모델이 더 유창해도 근거를 잃으면 실패다.