문턱을 움직이며 순위 품질을 본다
분류 점수에 높은 문턱을 두면 적은 사례만 양성으로 고르고, 문턱을 낮추면 더 많은 양성을 찾는 대신 거짓양성도 늘어. ROC 곡선과 정밀도-재현율 곡선은 가능한 문턱을 훑으며 이 교환 관계를 보여줘. 둘 다 최종 범주가 아니라 연속 점수에 의존하고 특정 운영 문턱 하나를 고르지는 않아.
ROC 곡선이 묻는 것
ROC 곡선의 세로축은 참양성률, 즉 재현율이고 가로축은 거짓양성률이야. ROC-AUC는 무작위로 고른 양성 하나가 무작위 음성 하나보다 높은 점수를 받을 확률로도 해석할 수 있어. 1이면 완벽한 순위, 0.5면 무작위 순위와 비슷해. 범주 비율이 비교적 균형이고 전체 순위 능력을 비교할 때 편리하지.
음성이 많으면 거짓양성률이 부담을 숨겨
음성 백만 건 중 1%를 잘못 양성으로 부르면 거짓양성률은 0.01로 작아 보여도 경보는 만 건이야. 드문 양성 문제에서는 ROC-AUC가 좋아 보이는 동안 실제 정밀도가 형편없을 수 있어. 사기, 해지, 이상 탐지처럼 양성이 드물고 경보 건수가 중요한 일에서는 ROC만으로 운영 품질을 판단하면 안 돼.
PR 곡선은 양성 예측의 순도를 본다
정밀도-재현율 곡선은 문턱마다 얼마나 많은 실제 양성을 찾았는지와 고른 사례 중 진짜 양성이 얼마나 되는지를 함께 보여줘. PR-AUC나 average precision은 이 곡선을 한 숫자로 요약해. 드문 양성의 순위 품질과 검토 부담을 더 직접 드러내므로 사기, 해지, 이상 탐지에 대개 더 정직해.
PR-AUC의 기준선은 양성 비율이야
ROC-AUC의 무작위 기준은 0.5지만 PR-AUC의 무작위 기준은 자료의 양성 비율이야. 양성이 1%라면 무작위 PR-AUC는 약 0.01이지 0.5가 아니야. PR-AUC 0.30은 절대값만 보면 낮아 보여도 무작위보다 30배 높은 순위일 수 있어. 그래서 PR-AUC는 양성 비율과 같은 분할에서의 단순 기준선을 함께 보고해야 해.
두 AUC 모두 운영점을 대신하지 않아
AUC는 모든 문턱을 평균하므로 팀이 실제로 쓰지 않을 구간의 성능도 포함해. ROC-AUC나 PR-AUC가 더 높은 모델이 관심 정밀도나 하루 200건 제한에서는 더 나쁠 수 있어. 곡선으로 후보를 비교한 뒤 비용과 처리 능력에 맞는 구간을 확대해 실제 정밀도, 재현율, 건수, 기대 비용을 계산해야 해.
자료 비율이 바뀌면 다시 읽어
ROC-AUC는 범주 비율 변화에 비교적 덜 민감하지만 정밀도와 PR-AUC는 양성 비율에 직접 영향을 받아. 학습 자료를 재표본했거나 운영 지역의 양성 비율이 다르면 원래 운영 비율의 검증 자료에서 다시 평가해. 시간에 따라 양성 비율과 곡선을 함께 감시해야 모델 순위 문제와 환경 변화를 구분할 수 있어.