비전 과제 4가지
- 이미지 분류: 이미지 한 장마다 레이블 하나를 예측해. 출력은 클래스 로짓 벡터, 손실 함수는 교차 엔트로피야.
- 객체 탐지: 여러 경계 상자를 찾고, 각 box의 클래스를 예측해. 출력은 (box, 클래스, score) 목록이야. 대표 모델은 YOLO family, DETR, Faster R-CNN이야.
- 의미론적 분할: 픽셀마다 클래스 레이블을 예측해. 출력은 입력 이미지와 같은 크기의 클래스 마스크야. 대표 모델은 U-Net, DeepLab, SegFormer야.
- 인스턴스 분할: 인스턴스마다 픽셀 마스크를 만들어. 출력은 탐지된 객체별 마스크야. 대표 모델은 Mask R-CNN, SAM, YOLO-seg야.
과제마다 표준 지표가 있어. 분류는 Top-K 정확도, 객체 탐지는 mAP (IoU 임계값 이상에서 계산한 평균 정밀도), 분할은 mIoU, 결합 과제는 panoptic quality를 써.
팁: 이걸 처음부터 다시 만들지 마.
torchvision.models.detection, ultralytics, segformer, SAM에는 각각 과제 코드를 50줄 안에 맞출 수 있는 API가 있어. 지연 시간과 정확도 예산에 맞는 걸 하나 골라서 돌려.학습에서 끝나지 않는 배포 lifecycle
운영 환경의 비전 모델에는 도메인에 맞는 데이터 labelling (CVAT, Roboflow), 실제 데이터 분포에 맞춘 증강, 클래스별 지표 평가, 배포 후 drift 모니터링이 필요해. 집계 지표만 봐서는 안 돼. 모델은 전체 파이프라인에서 작은 일부일 뿐이야.
2026년 새 비전 프로젝트의 기본값
파운데이션 모델 백본 (DINOv2, SAM, CLIP) → 작은 과제별 헤드 → 작은 레이블된 세트 → 배포. 애플리케이션 작업에서 백만 이미지로 비전 모델을 처음부터 학습하던 시대는 거의 끝났어.
원칙: 이제 비전 과제는 대부분 레이블링, 파운데이션 모델 선택, 지표 설계 문제야. Modeling이 차지하는 비중은 점점 작아지고 있어.