Python 테스트처럼 작성하는 평가
DeepEval(2026년 중반 기준 v3.x)은 Python 기반 평가 프레임워크야. pytest와 통합되며 RAG·에이전트·안전성 지표와 사용자 정의 지표를 포함해 30종 이상의 지표를 제공하고, Confident AI의 클라우드 대시보드도 선택적으로 사용할 수 있어. 평가 로직을 Python으로 작성하고 이미 pytest를 쓰고 있다면 특히 잘 맞아.
기본으로 제공하는 기능
- pytest 통합 — assert_test를 사용해 평가를 일반 pytest 테스트처럼 작성해.
- 내장 지표 — 충실성, AnswerRelevancy, 환각, Toxicity, 편향, 문맥 정밀도·문맥 재현율·문맥 관련성, ToolCallAccuracy, AgentGoalAccuracy, GEval 같은 지표를 제공해.
- 종단 간 평가와 추적 모드 — 최종 출력만 보는 블랙박스 평가와 파이프라인의 실행 과정을 살펴보는 화이트박스 평가를 모두 지원해.
- deepeval login으로 로그인하면 실험 기록을 공유할 수 있는 클라우드 대시보드를 사용할 수 있어.
- 평가 데이터를 생성하는 합성기를 제공해.
특히 잘 맞는 경우
DeepEval은 Python 코드베이스에 자연스럽게 어울려. 평가 모음을 tests/eval/ 디렉터리에 두면 pytest가 수집하고 CI가 실행할 수 있어. GEval을 사용하면 평가 프롬프트를 일일이 직접 작성하지 않고도 선언형 기준으로 사용자 정의 LLM 판정 로직을 만들 수 있어.
잘 맞지 않는 경우
팀에서 Python을 사용하지 않는다면 도입 과정에서 상당한 마찰이 생겨. 코드를 작성하지 않고 사용할 수 있는 시각적 화면이 필요하다면 Braintrust나 Confident AI의 호스팅형 화면을 살펴봐.
원칙: 평가 코드를 Python 애플리케이션 옆에 두고 다른 테스트와 똑같이 다루고 싶다면 DeepEval이 올바른 선택이야.