본문 바로가기
C.W.K.
Stream
Lesson 09 of 10 · published

평가 표류 — 시험 모음이 거짓말할 때

~12 min · evaluation, drift

Level 0수련생
0 XP0/100 lessons0/14 achievements
0/120 XP to next level120 XP to go0% complete

평가 모음도 낡아

2025년에 만든 골든 세트가 2026년 요청을 대표한다는 보장은 없어. 범주와 언어가 바뀌고 사용자층이 넓어지며 정책도 갱신돼. 옛 세트에서 95%를 받은 프롬프트가 지금의 실제 요청에서는 더 나쁠 수 있어.

표류의 신호

  • 프롬프트를 바꾸지 않았는데 골든 세트 통과율이 시간에 따라 올라가. 모델이 옛 질문에 익숙해진 셈이야.
  • 평가 통과율은 그대로인데 운영 불만 비율이 늘어.
  • 평가에 없는 새 의도가 운영에서 나타나.
  • 정책이 바뀌어 기준 출력의 ‘정답’ 자체가 낡아.

분기마다 손질해

  • 운영 사례 백 개를 뽑아 분류하고 평가 모음의 분포와 비교해.
  • 새 의도에서 사례를 더해.
  • 더 이상 대표하지 못하는 사례는 은퇴시켜.
  • 기준 출력이 지금도 맞는지 다시 검토해.

Code

표류 감지 개요·python
from collections import Counter

def intent_distribution(cases):
    return Counter(c["category"] for c in cases)

eval_dist = intent_distribution(load_golden_set())
prod_dist = intent_distribution(sample_production(n=200))

# Symmetric KL or just diff per category
for cat in set(eval_dist) | set(prod_dist):
    e = eval_dist.get(cat, 0) / sum(eval_dist.values())
    p = prod_dist.get(cat, 0) / sum(prod_dist.values())
    if abs(e - p) > 0.05:
        print(f"drift: {cat} eval={e:.2%} prod={p:.2%}")

External links

Exercise

골든 세트의 범주 분포를 지난 30일 운영 요청과 비교해봐. 세트에서 덜 대표된 범주 세 개를 찾아 사례를 추가해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.