그냥 모은 표본이 아니라 손질한 기준이야
골든 세트는 정답이 확인된 사례를 사람이 골라 다듬은 모음이야. 실제 요청에서 가장 작지만 신중하게 고른 부분집합으로 모든 변경을 검증해. 보통 프롬프트에는 쉰 사례면 충분하고, 위험이 큰 시스템은 200~500개가 필요할 수 있어.
만드는 순서
- 출처 — 실제 요청을 의도와 범주별로 나눠 뽑아.
- 기준 출력 — 가장 믿을 만한 사람 검토자나 현재 가장 좋은 모델이 작성해.
- 설명 — 왜 맞는 출력인지, 다른 정답은 어떤 모습일 수 있는지 적어.
- 버전 — 세트도 진화하므로 버전을 붙이고 프롬프트가 어느 버전에서 평가됐는지 남겨.
계속 가꾸는 법
- 운영에서 새 실패가 나오면 사례를 더해.
- 기반 행동이 사라지면 해당 사례도 은퇴시켜.
- 해마다 기준 출력을 다시 봐. 작년 정답이 올해는 틀릴 수 있어.
- 세트의 분포가 실제 요청을 여전히 대표하는지 감사해.