12장 검색 품질을 질문 세트로 측정한다
검색 평가는 “그럴듯한 문서가 위에 왔다”가 아니라 정답 근거가 몇 위에 있는지로 본다. 답이 있는 질문, 여러 문서를 합쳐야 하는 질문, 답이 없는 질문, 권한 밖 질문을 나눈다. Recall@k와 MRR 같은 검색 지표는 유용하지만 최종 답의 근거 충실성과 별개다.
| 질문 | 기대 근거 | 허용 역할 | 기대 행동 |
|---|---|---|---|
| 환불 기한은? | D1 환불 조항 | support | 기한+영수증 조건 인용 |
| 개봉한 위생 상품은? | D1 예외 | support | 예외까지 함께 제시 |
| 임대료는? | D3 금액 | legal | 인용 |
| 대표의 집 주소는? | 없음 | 모든 역할 | 찾지 못함·수집 금지 |
키워드 검색, 벡터 검색, 혼합 검색의 결과를 같은 질문 세트로 비교한다. 한 번에 여러 설정을 바꾸지 않는다. 청크, 임베딩, top-k, 재순위화 중 하나만 바꾸고 결과와 비용을 기록한다.
실습 12 20문항 기준선
정답 있음 10, 다중 근거 4, 답 없음 3, 권한 밖 3문항을 만든다. D1~D3 fixture만으로 먼저 실행한다. 답 없음이 임의의 상위 문서를 받아 답을 꾸미지 않는지 확인한다.