본문 바로가기
C.W.K.
Stream
Lesson 05 of 06 · published

메타 평가와 평가 문화 만들기

~18 min · safety, meta-eval, culture, team

Level 0추측자
0 XP0/55 lessons0/10 achievements
0/150 XP to next level150 XP to go0% complete

평가가 실제로 품질을 측정하고 있을까?

평가에서 가장 어려운 질문은 "지금 보고 있는 지표가 정말 봐야 할 지표일까?"야. 메타 평가는 평가 자체를 평가하는 실천이야.

메타 평가의 세 가지 질문

  1. 인간 평가와의 상관관계 — 사람이 평가한 품질이 변할 때 지표도 함께 변할까? 같은 평가 모음에서 자동 점수와 인간 평점의 상관관계를 계산해.
  2. 사용자 신호와의 상관관계 — 사용자가 체감하는 품질이 변할 때 지표도 함께 변할까? 자동 점수와 좋아요, 유지율, 완료율 같은 후속 사용자 신호의 상관관계를 계산해.
  3. 지표 악용에 대한 견고성 — 모델이 지표에 맞춰 최적화되면 실제 품질도 좋아질까, 아니면 점수만 오를까?

상관관계가 약하다면 그 지표는 보여주기용일 뿐이야. 교체해.

평가 문화 만들기 — 팀의 실천 방법

  1. 쉽게 만들어 — 평가 실행이 30단계짜리 의례가 아니라 명령 하나로 끝나게 해.
  2. 눈에 보이게 만들어 — 팀 공간에 대시보드를 두고 PR 설명에 평가 점수를 적어.
  3. 필수로 만들어 — 평가 결과가 없는 PR은 병합하지 말고, 평가 통과를 확인하지 않은 채 출시하지도 마.
  4. 공동으로 만들어 — 모든 팀원이 평가 사례를 추가할 수 있게 하고, 평가 데이터셋을 공동 자산으로 만들어.
  5. 기여를 인정해 — 누군가 평가를 통해 회귀를 발견하면 그 기여를 인정해. 평가 덕분에 공개되면 곤란했을 실수를 처음 막아 내는 순간, 평가 문화를 계속 지켜야 할 이유가 분명해져.
원칙: 평가는 팀이 그 가치를 체감할 때 정착해. 아무도 열어 보지 않는 대시보드의 지표는 진짜 지표가 아니야.

운영 환경과 연결된 평가 파이프라인

성숙한 구성은 다음과 같아. Git의 JSONL 데이터셋 → Python 또는 YAML 평가 실행기 → Braintrust 또는 자체 호스팅 대시보드 → CI/CD 관문 → 데이터셋으로 되돌아가는 운영 표본 → 인간 평가와 비교하는 분기별 메타 평가. 각 요소는 작지만, 이 순환을 반복하는 과정에서 가치가 생겨.

Code

메타 평가 — 지표와 인간 평점의 상관관계 계산·python
from scipy.stats import spearmanr

# 100 outputs, each with: (automated_metric_score, human_rating_1_to_5)
automated = [...]   # list of floats from your metric
human = [...]       # list of integers from human rater

rho, pval = spearmanr(automated, human)
print(f"Spearman correlation: {rho:.3f} (p={pval:.4f})")

# rho > 0.7 → metric tracks human judgment well
# rho 0.4-0.7 → useful but noisy; treat with care
# rho < 0.4 → metric is theatre; replace it
종단 간 평가 환경 구성도·text
Test data        +   Metrics       +   Runner          +   Dashboard       +   CI/CD
   |                  |                  |                    |                    |
   └── JSONL files    └── Python /       └── promptfoo /      └── Braintrust /     └── GitHub Actions
       in git             scoring             pytest /             custom              blocks bad PRs
                          functions           DeepEval /           webapp
                                              hand-rolled

External links

Exercise

팀에서 가장 자주 보는 평가 지표를 골라. 사례 50개의 인간 평점과 해당 지표 사이의 Spearman 상관계수를 계산해. 0.6보다 낮다면 그 지표가 팀의 판단을 흐리고 있는 거야. 차이를 문서화하고 지표를 고치거나 팀이 확인하는 지표를 바꿔.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.