기울기를 실제 갱신으로 바꾸는 규칙
손실 함수가 얼마나 틀렸는지 알려주면 옵티마이저는 기울기를 보고 각 가중치를 어느 방향으로 얼마나 움직일지 정해. 같은 모델과 데이터도 옵티마이저에 따라 빠르게 수렴하거나 헤맬 수 있어. 기울기가 원시 신호라면 옵티마이저는 그 신호를 사용하는 정책이야.
| 옵티마이저 | 특징 | 알맞은 때 |
|---|---|---|
Adam | 적응형 학습률 | 기본 시작점 |
AdamW | 가중치 감쇠를 분리한 Adam | 사전 학습 모델 미세 조정 |
SGD | 단순하고 모멘텀 사용 | 스케줄을 잘 조정한 학습 |
RMSprop | 매개변수별 적응형 갱신 | RNN, 비정상 목적 함수 |
Muon | Newton 방식 갱신 | Keras 3.10의 실험적 선택 |
잘 모르겠다면 Adam으로 시작해. 학습률이 완벽하지 않아도 비교적 안정적이야. 사전 학습 모델을 미세 조정할 때는 가중치 감쇠를 분리해 큰 기존 가중치의 표류를 막는 AdamW가 좋은 선택이야.
학습률은 고정 숫자보다 시간에 따른 곡선이야
고정 학습률은 초반 속도와 후반 정밀도 사이의 타협이야. Warmup이 있는 cosine decay는 처음 몇백 단계 동안 학습률을 천천히 올려 불안정한 초기 기울기를 견디고, 이후 부드럽게 낮춰 마지막에 세밀하게 수렴하게 해. 스케줄 객체를 옵티마이저의 learning_rate에 넘기면 Keras가 단계마다 갱신해. 성능이 정체될 때 ReduceLROnPlateau 콜백으로 추가 조정할 수도 있어.