오래됐지만 주의해서 쓰면 여전히 유용한 두 지표
BLEU와 ROUGE는 2000년대 초에 기계 번역과 요약을 평가하려고 만들어졌어. 불완전하고 비판도 자주 받지만, 처음 설계된 좁은 범위의 과제에서는 여전히 유용해. 참조 출력이 있고 빠르고 무료인 언어 독립적 유사도 점수가 필요할 때 사용할 수 있지.
BLEU — 번역용
BLEU (Bilingual Evaluation Understudy)는 후보 출력과 하나 이상의 참조 답안 사이에서 n-그램이 얼마나 겹치는지 측정하고, 지나치게 짧은 출력에는 길이 벌점을 적용해. 점수 범위는 0~1이며 일부 라이브러리에서는 0~100으로 표시해. 실제 번역 과제에서는 0.3이면 괜찮고, 0.5면 좋으며, 0.7 이상은 드물어.
ROUGE — 요약용
ROUGE (Recall-Oriented Understudy for Gisting Evaluation)는 요약을 평가하는 지표야. ROUGE-N은 n-그램 겹침을 측정하고, ROUGE-L은 최장 공통 부분 수열을 사용하며, ROUGE-W는 연속된 일치에 더 큰 가중치를 둬. 재현율이 높을수록 후보 출력이 참조 답안의 내용을 더 많이 담았다는 뜻이야.
원칙: BLEU와 ROUGE는 표면적인 단어 겹침을 측정할 뿐, 의미 자체를 측정하지는 않아. 참조 답안과 같은 단어를 쓴 출력에는 높은 점수를 주지만, 같은 의미를 다른 말로 표현하면 불이익을 줘.
쓰면 안 되는 곳
- 개방형 생성(창작, 브레인스토밍) — 올바른 출력이 다양해서 하나의 참조 답안과 겹치는 부분이 적을 수 있어.
- 코드 생성 — 기능이 같은 코드라도 사용한 어휘와 구조가 크게 다를 수 있어.
- 대화 — 좋은 답변이 참조 답안과 같은 단어를 하나도 쓰지 않을 수 있어.
- 표면적인 형태보다 의미가 더 중요한 모든 과제. 이런 경우에는 BERTScore나 LLM 판정 모델을 사용해.