평가 모음은 실제 사용자가 아니야
골든 세트는 대리 지표일 뿐이야. 프롬프트 품질의 마지막 판정자는 실제 요청을 보내는 실제 사용자야. 운영 A/B 시험은 평가가 예고한 개선이 현실에서도 나타나는지 확인하는 방법이야.
A/B 시험을 연결하는 법
- user_id나 request_id의 해시로 사용자를 두 집단에 일관되게 나눠.
- 집단마다 성공률, 후단 전환, 불만 비율, 비용을 추적해.
- 통계적으로 의미 있는 결과가 나올 만큼 오래 돌려. 요청량이 적다면 보통 1~2주가 필요해.
- “새 버전의 성공률이 옛 버전 이상이고 p < 0.05면 배포”처럼 지표와 판단 규칙을 미리 등록해.
흔한 함정
- 고르게 분포하지 않는 값을 해시해 두 집단이 불균형해져.
- 새 프롬프트가 처음 사흘만 좋아 보이다 평균으로 돌아와.
- 같은 사용자가 세션마다 다른 집단에 들어가 결과가 섞여.
- 결과 지표가 늦게 나타나는데 끝까지 기다리지 않아.