단순하지만 충분히 활용되지 않는 채점기
LLM 판정 모델을 호출하기 전에 먼저 물어봐. '특정 문자열만 확인해도 이 평가를 끝낼 수 있을까?' 많은 팀이 완전 일치와 포함 여부 검사를 지나치게 단순하다는 이유로 건너뛰지만, 그건 실수야. 이 채점기들은 무료이고 결정론적이며 즉시 실행돼. 게다가 생각보다 훨씬 많은 실제 회귀를 잡아내지.
완전 일치가 잘 맞는 곳
- 예/아니요, 참/거짓, A/B/C/D 분류처럼 답이 하나의 토큰으로 정해지는 과제.
- 형식이 고정된 수치형 답.
- 특정 함수 이름을 요구하는 코드 생성.
- JSON 출력의 구조화된 필드.
포함 여부 검사가 주력인 이유
자연어 과제에서는 완전 일치가 대개 너무 엄격해. "Paris"와 "Paris is the capital of France"는 표현이 달라도 같은 정답을 담고 있지. 포함 여부 채점기는 참조 답안이 출력 어딘가에 나타나는지 확인하고, 필요하면 대소문자 차이도 무시해. 내용에는 엄격하면서 장황하거나 간결한 표현의 차이는 허용할 수 있어.
원칙: LLM 판정 모델에 비용을 쓰기 전에 결정론적 채점기를 최대한 활용해. 비용은 약 1,000분의 1이고, 생각보다 훨씬 많은 회귀를 잡아내.
여러 참조 답안으로 포함 여부 검사하기
실제 질문에는 허용할 수 있는 표현이 여러 개일 때가 많아. '남수단의 수도는?'이라는 질문에는 "Juba", "Juba is the capital", "South Sudan's capital is Juba"를 모두 정답으로 인정할 수 있어. 허용할 참조 답안 목록을 저장하고 그중 하나라도 일치하는지 확인하면, 내용에는 엄격하고 문체에는 너그러운 채점기가 돼.