2단계: 위쪽 레이어를 풀고 아주 낮은 학습률로 조정해
출력 헤드의 정확도가 안정되면 미세 조정으로 남은 성능을 끌어낼 수 있어. base_model.trainable = True로 백본을 푼 다음 마지막 몇 레이어를 제외한 나머지는 다시 고정해. 초기 레이어에는 보존할 가치가 큰 보편적인 모서리와 질감 감지기가 있고, 후반 레이어에는 내 과제에 맞게 조금 바꿀 수 있는 ImageNet 특화 개념이 있기 때문이야.
핵심은 학습률이야
학습률은 1e-5 정도로, 일반 학습보다 약 100배 낮게 잡아. 사전 학습된 가중치는 이미 좋은 해 근처에 있으므로 큰 학습률을 쓰면 유용한 표현을 한꺼번에 잊는 파국적 망각이 생겨. 낮은 학습률은 기존 지식을 지우지 않고 과제에 맞게 조금씩 움직여. 10~20에포크 동안 검증 정확도를 보고, 개선이 멈추거나 과적합이 시작되면 종료해. 아래 코드는 고정 범위 변경 → 재컴파일 → 학습 순서를 보여 줘.