backbone 은 feature extractor
backbone 은 model 에서 마지막 task layer 를 뺀 부분 — raw pixel 을 풍부한 feature map 으로 바꿔주는 convolution (또는 transformer block) 스택이야. ImageNet 으로 사전학습돼서 edge, texture, shape, 객체 부분까지 이미 알아. downstream task 는 그 feature 를 *어떻게 읽을지*만 배우면 돼. 이게 transfer learning 의 레버리지 전부고, 2026 년에 vision model 을 random weight 부터 학습하는 사람이 거의 없는 이유야.
로드는 한 줄: backbone = ResNetBackbone.from_preset('resnet_50_imagenet'). preset 이 weight + config 한 번에 다운로드. CNN, mobile, dense, ViT 계열까지 메뉴가 깊어.
size 고르기
size suffix (B0 vs B7, ResNet18 vs ResNet152) 는 latency-vs-accuracy 다이얼 그 자체야. 큰 backbone 이 더 많이 보지만 inference 당 비용도 커. 작은 걸로 시작해. ResNet50 이나 EfficientNetV2-S 가 일꾼 기본값 — 대부분 문제에 충분한 capacity, iterate 하기 충분히 빠름. 거대 model 은 작은 게 진짜 capacity 부족인지 (data 부족 아니라) 확인한 다음에만 손 뻗어.