Detection = box + label, label 만 아냐
classification 은 '이 이미지에 뭐가 있냐' 에 답해. detection 은 '뭐가 있고, *어디에* 있냐' 에 답해 — 찾은 객체마다 bounding box + class 를 반환, 한 frame 에 수십 개일 수도. 더 어려운 문제고, 옛날엔 TensorFlow Object Detection API 나 서드파티 YOLO repo 랑 씨름하는 일이었어. KerasCV 는 이걸 네가 이미 아는 from_preset 관용구 안에 접어 넣었어.
여기 일꾼은 YOLOV8 — single-stage real-time detector 로 production detection 의 기본값이 됐어. model = YOLOV8Detector.from_preset('yolo_v8_xs_pascalvoc') 한 줄로 사전학습 weight 로드, predict 하면 box / class ID / confidence 의 dict 반환. Non-max suppression (같은 객체의 겹친 box 합치기) 은 자동.
size 고르기
YOLOV8 은 5 size — xs (제일 빠름) / s / m / l / xl (제일 정확) — 앞 lesson backbone 이랑 똑같은 latency/accuracy 다이얼. 변변찮은 하드웨어의 real-time video 면 xs/s, offline batch 정확도면 l/xl. 자기 class 로 fine-tune 하려면 backbone freeze 하고 detection head 만 학습 — 그게 다음 lesson 의 pipeline.