상황에 맞는 프레임워크 고르기
제대로 운영하는 LLM 프로젝트라면 생애 주기 동안 두세 가지 프레임워크를 함께 쓰게 될 거야. 잘못 선택하면 몇 달을 허비할 수 있으니 아래 표를 활용해.
선택 표
| 필요한 기능 | 선택할 도구 |
|---|---|
| CLI와 YAML로 프롬프트 × 제공업체 조합 평가 | promptfoo |
| 다양한 지표를 제공하는 pytest 기반 Python 평가 | DeepEval |
| 팀 공유 작업 공간 + 운영 환경 관측 기능 | Braintrust |
| 표준 자연어 처리 벤치마크(MMLU, HumanEval, GSM8K) | lm-evaluation-harness |
| RAG에 특화된 세부 지표 | RAGAS |
| 에이전트, 도구 사용, 코드 실행, 안전성 평가 | Inspect AI |
| 프레임워크 없이 빠르게 맞춤형 간이 평가 만들기 | 직접 만든 Python + JSONL |
프레임워크를 함께 써도 괜찮아
실제 팀은 보통 promptfoo로 프롬프트를 반복 개선하고, DeepEval로 CI에서 단위 수준의 RAG 지표를 확인하고, Braintrust로 팀 전체의 운영 환경을 관측해. 기반 모델을 비교할 때는 lm-evaluation-harness를 실행하지. 어느 도구도 이 모든 일을 다 잘할 필요는 없어.
원칙: 프레임워크는 도구이지 종교가 아니야. 당장 닥친 문제를 해결할 수 있는 가장 작은 도구를 고르고, 다음 문제에 맞지 않으면 다른 도구를 추가해.
전환 비용은 들지만 충분히 감당할 수 있어
JSONL 데이터셋과 OpenAI 호환 API 규격은 프레임워크가 달라도 공통으로 활용할 수 있는 기반이야. 데이터를 JSONL에 저장하고 제공업체를 설정으로 바꿀 수 있게 해 두면, 프레임워크를 전환할 때 한 주가 걸리는 재구축 대신 연결부 일부를 다시 쓰는 정도로 끝낼 수 있어.