객체 탐지는 레이블과 위치를 함께 찾아
분류는 이미지에 무엇이 있는지 답하고, 객체 탐지는 무엇이 어디에 있는지 답해. 발견한 객체마다 경계 상자와 클래스를 반환하며 한 프레임에 수십 개가 나올 수도 있어. 예전에는 TensorFlow Object Detection API나 별도 YOLO 저장소를 직접 엮어야 했지만, KerasCV는 이 과정을 익숙한 from_preset 방식으로 묶어 줘.
대표 모델인 YOLOV8은 단일 단계 실시간 탐지기로 운영 환경에서 널리 쓰여. model = YOLOV8Detector.from_preset('yolo_v8_xs_pascalvoc') 한 줄로 사전 학습 가중치를 불러오고 predict()를 호출하면 경계 상자, 클래스 ID, 신뢰도를 담은 딕셔너리를 반환해. 같은 객체의 겹친 상자를 합치는 비최대 억제도 자동으로 처리해.
실행 환경에 맞는 크기 고르기
YOLOV8에는 xs, s, m, l, xl의 5가지 크기가 있어. xs가 가장 빠르고 xl이 가장 정확하며 백본과 마찬가지로 지연 시간과 정확도를 조절하는 선택지야. 제한된 하드웨어의 실시간 영상에는 xs나 s, 오프라인 일괄 처리에서 정확도가 중요하면 l이나 xl을 고려해. 사용자 클래스에 미세 조정할 때는 백본을 고정하고 탐지 출력 헤드부터 학습해.