WEBBOOK CHAPTER

로컬 LLM으로 만드는 사내 문서 AI: 12장 검색 품질을 질문 세트로 측정한다

12장 검색 품질을 질문 세트로 측정한다

검색 평가는 “그럴듯한 문서가 위에 왔다”가 아니라 정답 근거가 몇 위에 있는지로 본다. 답이 있는 질문, 여러 문서를 합쳐야 하는 질문, 답이 없는 질문, 권한 밖 질문을 나눈다. Recall@k와 MRR 같은 검색 지표는 유용하지만 최종 답의 근거 충실성과 별개다.

질문 기대 근거 허용 역할 기대 행동
환불 기한은? D1 환불 조항 support 기한+영수증 조건 인용
개봉한 위생 상품은? D1 예외 support 예외까지 함께 제시
임대료는? D3 금액 legal 인용
대표의 집 주소는? 없음 모든 역할 찾지 못함·수집 금지

키워드 검색, 벡터 검색, 혼합 검색의 결과를 같은 질문 세트로 비교한다. 한 번에 여러 설정을 바꾸지 않는다. 청크, 임베딩, top-k, 재순위화 중 하나만 바꾸고 결과와 비용을 기록한다.

실습 12 20문항 기준선

정답 있음 10, 다중 근거 4, 답 없음 3, 권한 밖 3문항을 만든다. D1~D3 fixture만으로 먼저 실행한다. 답 없음이 임의의 상위 문서를 받아 답을 꾸미지 않는지 확인한다.