세 종류의 평가가 서로 다른 구멍을 막아
단위 평가는 프롬프트 하나가 예상 패턴을 내는지 보고, 통합 평가는 도구 루프 전체가 기대한 행동을 하는지 확인해. 품질 평가는 별도 자료 집합을 사람이 점검하거나 LLM 심사로 비교해. 하나를 빼면 그 층의 회귀는 그대로 빠져나가.
측정 도구의 조건을 고정해
평가에는 날짜가 붙은 모델 ID를 쓰고, 프롬프트는 Git에 넣으며, 자료 집합도 버전으로 관리해. 모델·프롬프트·문제가 함께 바뀌면 점수 상승이 실제 개선인지 알 수 없어. 평가 자체의 재현성이 먼저야.
프롬프트 변경마다 자동으로 돌려
프롬프트도 코드처럼 변경 검토를 받고 CI에서 평가를 통과하게 해. cwk-site의 콘텐츠 생성 프롬프트와 cwkPippa의 페르소나 시스템 프롬프트도 같은 규율을 써. 회귀가 병합 뒤가 아니라 변경 경계에서 멈추게 만드는 장치야.
원칙: Git에 든 프롬프트라도 평가 문이 없으면 안전하게 버전 관리되는 게 아니야. 둘을 함께 고정하고 함께 검사해.