Layer 는 원자. Dense, Conv2D, MultiHeadAttention, LayerNormalization, Dropout, 그리고 *모델 안에* normalization / tokenization 박는 preprocessing layer — 배포할 때 같이 따라가게 만드는 그 발상. 이 track 은 Keras 기본 카탈로그 훑기.
layer 가 뭐냐면
Keras layer 는 두 가지를 들고 있는 callable 객체야 — state (학습되는 weight) 랑 transformation (call 메서드). 레고처럼 끼우면 돼. 한 layer 의 출력 tensor 가 다음 layer 의 입력이 되고, weight·shape·gradient 경로는 Keras 가 알아서 추적해. 아래 core layer 몇 개만 손에 익으면 웬만한 논문 model 구조는 다 읽혀.
핵심 5 종
Dense (fully-connected) — 가장 흔함, output = activation(W·input + b). Embedding (token → vector) — NLP 첫 layer. Activation (non-linearity) — layer 안에 박혀있을 때 많지만 분리해도 OK. Dropout (regularization) — 학습 시만 켜지고 eval 시 자동으로 꺼져. Reshape (shape 변환) — data 안 건드리고 view 만 바꿈. 거의 모든 model 이 이 위에서 빌드돼.
Embedding 이 헷갈리는 포인트
나머지는 이름만 봐도 감 오는데 Embedding 은 한 번 짚을 만해. 학습되는 lookup table 이야 — 정수 token ID 넣으면 dense float vector 나오고, 그 table 자체가 나머지 model 이랑 같이 gradient descent 로 학습돼. 인자 두 개가 전부 — input_dim 은 vocab 크기 (distinct token 몇 개냐), output_dim 은 vector 폭. mask_zero=True 면 token 0 을 padding 으로 취급해서 뒤따르는 recurrent / attention layer 가 무시하게 돼.