평가 집합은 가장 값진 산출물이야
검색 개선은 측정하기 전까지 모두 추측이야. 실제 사용자를 반영한 쿼리와 문서 쌍 50–200개에 라벨을 붙여 평가 집합을 만들어. 각 쿼리마다 확실히 관련 있는 문서 ID를 적어 두면, 이 작은 집합이 앞으로 모든 조정의 근거가 돼.
알아둘 지표 네 가지
- Hit rate @ k — 상위 k개 안에 관련 문서가 하나라도 있는 쿼리의 비율이야.
- MRR(Mean Reciprocal Rank) — 첫 관련 문서가 나온 위치의 역수야. 맞는 답이 얼마나 위에 놓였는지 보여줘.
- nDCG @ k — 관련성의 정도와 결과 위치를 함께 반영하는 업계 표준 지표야.
- Recall @ k — 전체 관련 문서 가운데 실제로 검색한 비율이야. LLM이 관련 자료를 빠짐없이 봐야 하는 RAG에서 특히 중요해.
변경할 때마다 평가해
검색도 코드처럼 다뤄. 청크 크기, 모델, RRF의 k, 재순위화 모델을 바꿀 때마다 번호를 붙여 평가하고 지표를 시간순으로 그려. 작은 변경이 재현율을 망치는 날에는 사용자가 불평하기 전에 그래프가 먼저 알려 줄 거야.