본문 바로가기
C.W.K.
Stream
Lesson 03 of 10 · published

쌍대 비교 — 절대 점수가 흔들릴 때

~14 min · evaluation, pairwise

Level 0수련생
0 XP0/100 lessons0/14 achievements
0/120 XP to next level120 XP to go0% complete

사람과 판정 모델은 점수보다 비교를 잘해

“이 출력이 좋은가?”라고 물으면 흔들리는 1~5점이 나오지만 “A와 B 가운데 무엇이 나은가?”라고 물으면 판단이 더 또렷해져. 글 품질, 도움됨, 말투처럼 주관적인 작업에서는 쌍대 비교가 강해.

쌍대 평가의 순서

  1. 같은 N개 입력에 옛 프롬프트와 새 프롬프트를 실행해.
  2. 사람이나 LLM 판정기에게 두 출력을 나란히 보여줘.
  3. A, B, 동률 가운데 하나를 고르게 해.
  4. 새 버전의 승률을 모아 50%보다 의미 있게 높은지 봐.

편향을 조심해

  • 위치 편향 — 첫 보기를 선호할 수 있으니 순서를 무작위로 바꿔.
  • 길이 편향 — 긴 답을 좋아할 수 있으니 길이를 판단 기준에서 분리해.
  • 장황함 편향 — 말이 많으면 더 사려 깊어 보이므로 기준을 명시해.
  • 자기 선호 — LLM 판정기는 같은 모델 계열의 출력을 선호할 수 있어.

Code

쌍대 비교 판정 프롬프트·markdown
## Task
You are comparing two answers (A and B) to the same support question. Pick the one that better satisfies the rubric.

## Rubric
- Accuracy: cites correct policy.
- Clarity: opens with the verdict.
- Tone: warm but terse, no apology preamble.
- Length: ≤ 100 words.

## Output
{"winner": "A" | "B" | "tie", "reason": "<one sentence>"}

## Question
{{q}}

## A
{{out_a}}

## B
{{out_b}}

External links

Exercise

현재 프롬프트와 후보 버전을 입력 쉰 개에서 쌍대 비교해봐. 분명한 기준표를 가진 LLM 판정기를 쓰고 순서를 섞은 뒤 승률을 보고해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.