본문 바로가기
C.W.K.
Stream
Lesson 04 of 07 · published

참조 답안 기반 평가와 참조 답안이 없는 평가

~18 min · judges, reference

Level 0추측자
0 XP0/55 lessons0/10 achievements
0/150 XP to next level150 XP to go0% complete

출력을 무엇과 비교할까?

참조 답안 기반 평가는 판정 모델에 검증된 정답이나 허용 가능한 답 목록을 제공해. 판정 모델의 역할은 출력을 참조 답안과 비교하는 거야. 참조 답안이 없는 평가는 질문과 출력만 제공해. 판정 모델은 보통 평가 기준표를 바탕으로 절대적인 기준에 따라 판단해야 해.

각 방식은 언제 쓸까?

참조 답안 기반참조 답안 없음
번역, 분류, 정답이 있는 RAG개방형 생성, 요약, 대화
골든 데이터셋을 만들 수 있음유효한 출력이 많아 하나의 골든 답안을 만들기 어려움
더 엄격하고 재현성이 높은 채점더 유연하지만 평가 기준표의 영향을 크게 받는 채점
결정론적 채점기(BLEU, BERTScore)와 함께 사용할 수 있는 경우가 많음거의 항상 LLM 판정 모델이 필요함

혼합형: 여러 참조 답안을 활용한 평가

여러 표현이 모두 정답일 수 있는 과제, 예를 들어 "이 아이디어를 어떻게 표현할까?" 같은 과제에는 허용 가능한 참조 답안 목록을 제공해. 판정 모델은 출력이 참조 답안 중 하나와 기능적으로 동등하면 정답으로 받아들이면 돼. 엄격한 참조 답안 기반 평가와 참조 답안이 전혀 없는 평가의 중간 방식이야.

원칙: 참조 답안 기반 평가는 더 엄격하고, 참조 답안이 없는 평가는 더 폭넓게 허용해. 과제에 확인 가능한 정답이 있는지, 아니면 명확한 평가 기준표만 만들 수 있는지에 따라 선택해.

평가 기준표가 참조 답안을 대신해

참조 답안이 없는 평가에서 판정 모델이 기준점으로 삼을 수 있는 것은 평가 기준표뿐이야. 그래서 정확한 기준과 경계 사례, 예시를 담은 엄격한 평가 기준표를 작성하는 일이 참조 답안 기반 방식보다 더 중요해. 평가 기준표가 모호하면 참조 답안이 없는 판정은 동전 던지기와 다를 바 없어.

Code

참조 답안 기반 판정 모델·python
REF_PROMPT = """
Question: {question}
Reference answer: {reference}
Candidate answer: {candidate}

Is the candidate factually equivalent to the reference?
- PASS if it conveys the same key facts (paraphrasing is fine)
- FAIL if it changes, omits, or adds facts

Reply: {{\"reasoning\": \"...\", \"verdict\": \"PASS\"|\"FAIL\"}}
"""
엄격한 평가 기준표를 활용한 참조 답안이 없는 평가용 판정 모델·python
FREE_PROMPT = """
You are evaluating a customer-support response.

## Rubric (all must hold for PASS)
- Addresses the customer's specific question
- Is factually correct given general knowledge of our product (laptops, 1-year warranty)
- Maintains a professional, empathetic tone
- Provides at least one concrete next step the customer can take
- Does NOT make up policies that don't exist (e.g., 'we don't offer 5-year warranties — saying yes is a fail')

Question: {question}
Response: {response}

Reply: {{\"reasoning\": \"...\", \"verdict\": \"PASS\"|\"FAIL\", \"failed_criteria\": [\"...\"]}}
"""

External links

Exercise

한 과제를 골라 참조 답안 기반 판정 모델 프롬프트와 참조 답안이 없는 판정 모델 프롬프트를 모두 작성해. 같은 사례 20개에 두 프롬프트를 실행해 봐. 판정이 엇갈린 사례에서는 어느 판단이 옳은지 결정하고, 그 결과를 바탕으로 두 프롬프트 중 더 느슨한 쪽을 다듬어.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.