출력을 무엇과 비교할까?
참조 답안 기반 평가는 판정 모델에 검증된 정답이나 허용 가능한 답 목록을 제공해. 판정 모델의 역할은 출력을 참조 답안과 비교하는 거야. 참조 답안이 없는 평가는 질문과 출력만 제공해. 판정 모델은 보통 평가 기준표를 바탕으로 절대적인 기준에 따라 판단해야 해.
각 방식은 언제 쓸까?
| 참조 답안 기반 | 참조 답안 없음 |
|---|---|
| 번역, 분류, 정답이 있는 RAG | 개방형 생성, 요약, 대화 |
| 골든 데이터셋을 만들 수 있음 | 유효한 출력이 많아 하나의 골든 답안을 만들기 어려움 |
| 더 엄격하고 재현성이 높은 채점 | 더 유연하지만 평가 기준표의 영향을 크게 받는 채점 |
| 결정론적 채점기(BLEU, BERTScore)와 함께 사용할 수 있는 경우가 많음 | 거의 항상 LLM 판정 모델이 필요함 |
혼합형: 여러 참조 답안을 활용한 평가
여러 표현이 모두 정답일 수 있는 과제, 예를 들어 "이 아이디어를 어떻게 표현할까?" 같은 과제에는 허용 가능한 참조 답안 목록을 제공해. 판정 모델은 출력이 참조 답안 중 하나와 기능적으로 동등하면 정답으로 받아들이면 돼. 엄격한 참조 답안 기반 평가와 참조 답안이 전혀 없는 평가의 중간 방식이야.
원칙: 참조 답안 기반 평가는 더 엄격하고, 참조 답안이 없는 평가는 더 폭넓게 허용해. 과제에 확인 가능한 정답이 있는지, 아니면 명확한 평가 기준표만 만들 수 있는지에 따라 선택해.
평가 기준표가 참조 답안을 대신해
참조 답안이 없는 평가에서 판정 모델이 기준점으로 삼을 수 있는 것은 평가 기준표뿐이야. 그래서 정확한 기준과 경계 사례, 예시를 담은 엄격한 평가 기준표를 작성하는 일이 참조 답안 기반 방식보다 더 중요해. 평가 기준표가 모호하면 참조 답안이 없는 판정은 동전 던지기와 다를 바 없어.