싸고 빠르지만 편향돼
LLM으로 다른 LLM의 출력을 채점하면 평가를 가장 싸게 늘릴 수 있어. 그만큼 속이기도 쉬워. 조심해서 쓰면 작업을 빠르게 하지만, 대충 쓰면 실제 품질과 상관없는 안심용 숫자만 만들어.
잘하는 일
- JSON이 올바른지, 필수 필드가 모두 있는지 형식을 검사해.
- 분명한 기준표를 가지고 두 출력을 비교해.
- 환불, 불만, 기능 요청처럼 범주를 분류해.
- 기준 자료와 응답이 모순되는지 찾아 환각을 검사해.
약한 일
- 도움됨을 1~5점으로 매기는 식의 주관적 절대 점수.
- 판정기와 평가 대상 모델이 같은 사각지대를 가진 작업.
- 판정 모델 자체가 프롬프트 주입을 받을 수 있는 적대적 상황.
사람 판단에 맞춰 보정해
판정 결과의 20%는 사람이 표본 검사해. 사람과 일치하는 비율이 85%보다 낮다면 그 작업에는 판정기를 쓸 수 없어. 기준표를 더 또렷하게 하거나 사람 평가를 늘려.