학습 자료에는 완벽한데 새 자료에는 약할 때
학습 손실은 계속 낮아지는데 검증 손실이 다시 오르기 시작한다면 모델이 학습 자료의 우연한 잡음까지 맞추고 있을 수 있어. 이게 과적합이야. 학습셋과 별도 자료 사이의 성능 차이가 중요한 신호지만, 차이 하나만으로 원인을 확정하진 않아. 분포가 달라졌거나 라벨 품질이 다른 경우도 살펴야 해.
용량과 데이터, 학습 절차의 상호작용
표현력이 큰 모델은 유용한 규칙도, 표본에만 있는 세부사항도 함께 맞출 수 있어. 파라미터 수만 많다고 자동으로 과적합하는 건 아니고 데이터 양, 규제, 최적화, 사전학습이 함께 일반화를 결정해.
대응 방법
- 자료를 더 잘 모으기: 단순히 수만 늘리지 말고 배포 환경을 대표하는 사례와 깨끗한 라벨을 늘려.
- 규제: weight decay, dropout, 조기종료처럼 표본의 세부사항을 과하게 맞추는 경향을 줄여.
- 자료 증강: 의미를 보존하는 변형으로 모델이 불변이어야 할 요소를 가르쳐.
- 모형과 특징 단순화: 자료 규모에 비해 필요 이상으로 자유로운 모형인지 확인해.
- 평가 설계: 사람·시간·장치 단위의 중복이 분할을 가로지르지 않게 해.
학습 성능만으로 일반화를 판단하지 마. 검증셋은 개발 결정을 돕는 추정치이지 절대적인 진실이 아니야. 반복해서 맞추면 검증셋에도 과적합할 수 있으므로 마지막 시험셋과 실제 배포 자료로 다시 확인해.