본문 바로가기
C.W.K.
Stream
← C.W.K. Quests
📏

평가 퀘스트

최근 수정: 2026-08-07

AI 시스템에서 정말 중요한 것을 측정하기

프롬프트, 모델, RAG, 도구, 에이전트, 안전성, 운영 환경까지 AI 작업 과정 전반을 평가하는 법을 배워. 감에 의존한 점검에서 벗어나 출시 판단을 뒷받침할 측정 원칙을 세우는 과정이야.

8 tracks · 55 lessons · ~32h · difficulty: beginner-to-advanced

Level 0추측자
0 XP0/55 lessons0/10 achievements
0/150 XP to next level150 XP to go0% complete
평가 퀘스트는 프롬프트를 잘 만드는 단계에서 측정 가능한 AI 개발로 나아가는 다리야. 감에 의존한 점검이 왜 실패하는지 살펴보고, 데이터셋과 채점기를 설계하고, 프레임워크와 벤치마크를 고르고, 시스템과 에이전트를 평가하는 법을 익혀. 시간이 지나도 평가가 정직하고 믿을 만한 신호를 내도록 운영하는 방법도 다뤄. 챗봇, RAG 파이프라인, 코딩 에이전트, 내부 도구 중 무엇을 출시하든 변경 후 시스템이 좋아졌는지 나빠졌는지를 추측이 아니라 측정으로 판단하는 규율을 갖추게 될 거야.

Tracks

  1. 01🎯왜 평가가 중요한가

    0/9 lessons

    감에 의존한 확인에서 재현 가능한 증거로

    ‘느낌상 괜찮네’에서 ‘이 동작을 보호하는 측정값이 여기 있어’로 사고방식을 전환해. 이후 모든 트랙은 이 원칙이 자리 잡았다고 전제하고 시작해.

    Lesson list (9)퀴즈 · 5 문제
  2. 02🗃️데이터셋과 골든 사례

    0/7 lessons

    데이터셋이 이후 모든 평가의 성능 상한을 결정해

    실제 업무를 대표하는 입력을 엄선해야 해. 채점기나 프레임워크, 판정 모델이 아무리 뛰어나도 잘못된 데이터로 만든 평가 모음은 살릴 수 없어.

    Lesson list (7)퀴즈 · 5 문제
  3. 03📊결정론적 지표

    0/6 lessons

    가장 먼저 실행해야 할 저렴하고 빠르며 재현 가능한 측정

    완전 일치, BLEU, ROUGE, BERTScore, 정규식, 형식 검증, 종합 점수 같은 지표야. 비용이 많이 드는 LLM 판정 모델을 호출하기 전에 최대한 활용해야 해.

    Lesson list (6)퀴즈 · 5 문제
  4. 04⚖️LLM 판정 모델

    0/7 lessons

    AI로 AI를 평가하는 힘과 함정

    결정론적 채점기로는 답하기 어려운 질문도 LLM 판정 모델은 평가할 수 있어. 하지만 판정 모델에는 편향, 비용, 보정 문제가 따라와. 이 트랙에서는 판정 모델을 제대로 활용하면서도 그 판단에 휘둘리지 않는 법을 배워.

    Lesson list (7)퀴즈 · 5 문제
  5. 05🔧프레임워크와 플랫폼

    0/7 lessons

    promptfoo, DeepEval, Braintrust, lm-evaluation-harness, RAGAS, Inspect AI

    운영 환경에서 실제로 활용할 도구들이야. 저마다 잘 맞는 상황이 있으니 브랜드가 아니라 해결할 일에 맞춰 골라.

    Lesson list (7)퀴즈 · 5 문제
  6. 06🏆공개 벤치마크

    0/7 lessons

    순위표를 맹신하지 않고 읽는 법

    MMLU, HumanEval, GSM8K, HellaSwag, 챗봇 Arena, MTEB, ARC-AGI를 살펴봐. 각 벤치마크가 무엇을 측정하고 언제 오해를 부르는지, 제품 평가와 혼동하지 않으면서 모델 선택에 어떻게 활용할지 알아보자.

    Lesson list (7)퀴즈 · 5 문제
  7. 07🔬시스템과 에이전트 평가

    0/6 lessons

    단일 호출을 넘어 전체 파이프라인 평가하기

    RAG, 에이전트, 챗봇, 코드 도우미, 운영 환경 A/B 테스트, 회귀 평가 모음을 다뤄. 실제 시스템은 파이프라인이니 평가도 그래야 해.

    Lesson list (6)퀴즈 · 5 문제
  8. 08🛡️안전성과 운영

    0/6 lessons

    레드팀 평가, 보정, 비용 대비 품질, 평가 문화 정착시키기

    평가가 보안, 신뢰성, 비용 규율 같은 회사의 다른 영역과 만나는 지점, 그리고 이 모든 관행을 팀에 정착시키는 방법을 다뤄.

    Lesson list (6)퀴즈 · 5 문제
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.