평가 모음도 낡아
2025년에 만든 골든 세트가 2026년 요청을 대표한다는 보장은 없어. 범주와 언어가 바뀌고 사용자층이 넓어지며 정책도 갱신돼. 옛 세트에서 95%를 받은 프롬프트가 지금의 실제 요청에서는 더 나쁠 수 있어.
표류의 신호
- 프롬프트를 바꾸지 않았는데 골든 세트 통과율이 시간에 따라 올라가. 모델이 옛 질문에 익숙해진 셈이야.
- 평가 통과율은 그대로인데 운영 불만 비율이 늘어.
- 평가에 없는 새 의도가 운영에서 나타나.
- 정책이 바뀌어 기준 출력의 ‘정답’ 자체가 낡아.
분기마다 손질해
- 운영 사례 백 개를 뽑아 분류하고 평가 모음의 분포와 비교해.
- 새 의도에서 사례를 더해.
- 더 이상 대표하지 못하는 사례는 은퇴시켜.
- 기준 출력이 지금도 맞는지 다시 검토해.