판정 모델에는 편향이 있어. 직접 측정해
LLM 판정 모델은 알려진 체계적 오류가 있는 도구야. 실제보다 2도 높게 표시하는 온도계처럼 다뤄야 해. 보정값을 알고 적용한다면 충분히 쓸 수 있어.
중요한 네 가지 편향
- 위치 편향 — 쌍대 비교에서 판정 모델은 먼저 제시된 출력, 때로는 마지막에 제시된 출력을 선호해. 방어 방법: 두 순서로 모두 실행한 뒤 결과를 평균 내.
- 길이 편향 — 짧은 답이 더 나은데도 판정 모델이 긴 출력에 더 높은 점수를 주곤 해. 방어 방법: 평가 기준표에 "답변 길이는 판정에 영향을 주지 않아야 한다"라고 명시하고, 같은 답을 줄이거나 늘인 변형으로 표본 점검을 해.
- 자기 선호 — 판정 모델은 자신과 같은 모델 계열에서 생성된 듯한 출력을 선호해. 방어 방법: 다른 모델 계열을 판정 모델로 사용하거나 여러 판정 모델의 일치도를 확인해.
- 장황성 및 확신 편향 — 불확실성을 적절히 드러낸 출력보다 단정적이고 매끄러운 출력을 선호해. 방어 방법: 적절한 유보 표현을 긍정적으로 평가하는 조항을 평가 기준표에 명시해.
판정 모델을 보정하는 방법
- 100개 사례 표본을 준비해.
- 사람 평가자가 각 사례에 점수를 매기게 해.
- 같은 100개 사례를 판정 모델로 평가해.
- Cohen's kappa나 단순 일치도 비율을 계산해.
- 불일치 사례를 살펴보고 프롬프트를 수정한 뒤 다시 실행해.
- 사람 평가자 간 일치도와 비슷한 수준에 도달할 때까지 반복해서 개선해.
원칙: 구체적인 과제에서 사람의 평가를 기준으로 보정하지 않은 판정 모델은 추측에 불과해. 보정을 거쳐야 믿고 쓸 수 있는 도구가 돼.
여러 판정 모델을 앙상블로 활용하기
위험도가 높은 평가라면 서로 다른 모델 계열의 판정 모델 2~3개를 실행해 결과를 종합해. 판정 모델 간 불일치도 유용한 신호야. 그런 사례는 사람이 검토해야 해. 단일 판정 모델 파이프라인보다 비용은 더 들지만 신뢰성은 크게 높아져.