per-box 가 아니라 per-pixel
detection 은 객체마다 box 를 그렸어. segmentation 은 더 정밀해 — 모든 pixel 에 class 를 매겨서, 출력이 입력이랑 같은 H×W 의 label map 이야. shape 자체가 중요할 때 필요한 거 — 종양의 정확한 경계, 차 앞의 주행 가능 영역, 피사체를 배경에서 떼어내는 matte.
문제가 다른 두 갈래
- Semantic segmentation (예: DeepLabV3Plus, SegFormer) — 모든 pixel 에 class label. DeepLab 은 atrous (dilated) convolution 으로 해상도 안 잃고 여러 scale 을 한 번에 보고, SegFormer 는 transformer 시대 버전. 신경 쓰는 class 집합이 고정돼 있을 때.
- Salient / boundary-aware (예: BASNet) — class 정체성보다 깔끔한 edge 를 최적화하면서 전경/배경 분리. matting / cut-out 용도.
전부 같은 from_preset 문으로 로드되고, pretrained backbone 타고, 아무 backend 에서 돌아. 내재화할 건 출력 규약: channel 축으로 argmax 하면 pixel 당 단일 label 나오는 class map.