본문 바로가기
C.W.K.
Stream
Lesson 07 of 07 · published

프레임워크 선택 가이드

~18 min · frameworks, selection, decision

Level 0추측자
0 XP0/55 lessons0/10 achievements
0/150 XP to next level150 XP to go0% complete

상황에 맞는 프레임워크 고르기

제대로 운영하는 LLM 프로젝트라면 생애 주기 동안 두세 가지 프레임워크를 함께 쓰게 될 거야. 잘못 선택하면 몇 달을 허비할 수 있으니 아래 표를 활용해.

선택 표

필요한 기능선택할 도구
CLI와 YAML로 프롬프트 × 제공업체 조합 평가promptfoo
다양한 지표를 제공하는 pytest 기반 Python 평가DeepEval
팀 공유 작업 공간 + 운영 환경 관측 기능Braintrust
표준 자연어 처리 벤치마크(MMLU, HumanEval, GSM8K)lm-evaluation-harness
RAG에 특화된 세부 지표RAGAS
에이전트, 도구 사용, 코드 실행, 안전성 평가Inspect AI
프레임워크 없이 빠르게 맞춤형 간이 평가 만들기직접 만든 Python + JSONL

프레임워크를 함께 써도 괜찮아

실제 팀은 보통 promptfoo로 프롬프트를 반복 개선하고, DeepEval로 CI에서 단위 수준의 RAG 지표를 확인하고, Braintrust로 팀 전체의 운영 환경을 관측해. 기반 모델을 비교할 때는 lm-evaluation-harness를 실행하지. 어느 도구도 이 모든 일을 다 잘할 필요는 없어.

원칙: 프레임워크는 도구이지 종교가 아니야. 당장 닥친 문제를 해결할 수 있는 가장 작은 도구를 고르고, 다음 문제에 맞지 않으면 다른 도구를 추가해.

전환 비용은 들지만 충분히 감당할 수 있어

JSONL 데이터셋과 OpenAI 호환 API 규격은 프레임워크가 달라도 공통으로 활용할 수 있는 기반이야. 데이터를 JSONL에 저장하고 제공업체를 설정으로 바꿀 수 있게 해 두면, 프레임워크를 전환할 때 한 주가 걸리는 재구축 대신 연결부 일부를 다시 쓰는 정도로 끝낼 수 있어.

Code

공통 JSONL로 쉽게 옮기기·json
{"input": "...", "reference": "...", "tags": ["qa", "easy"], "metadata": {}}

# This shape feeds:
#   promptfoo via vars
#   DeepEval via LLMTestCase
#   Braintrust via dataset import
#   lm-eval-harness via custom YAML task
#   RAGAS via Hugging Face Dataset
# A migration is 'rewrite the runner.' The data does not move.

External links

Exercise

프로젝트에 실제로 필요한 평가 항목을 목록으로 만들어: 프롬프트 반복 개선, RAG 지표, 관측 기능, 에이전트 평가, 벤치마크가 있을 수 있어. 표를 참고해 각 항목을 알맞은 프레임워크에 연결해 봐. 두 개 이상을 쓰게 되어도 정상이야. 가장 시급한 두 가지부터 시작해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.