선형층 사이에 굽힘을 넣기
편향을 포함한 affine 층을 여러 개 이어도 중간에 비선형 연산이 없으면 전체는 affine 변환 하나로 합쳐져. 깊이만 늘고 표현할 함수 종류는 안 늘어. 활성함수가 그 합성을 꺾어서 복잡한 경계를 표현하게 해.
용도에 따라 다른 활성
| 활성 | 성질 | 자주 쓰는 자리 |
|---|---|---|
| ReLU | . 싸고 빠르지만 음수 구간 기울기가 0. | 합성곱망과 MLP 은닉층. 죽은 뉴런이 생길 수 있어. |
| GELU | 입력 크기에 따라 부드럽게 게이트. | Transformer feed-forward 블록. |
| SiLU | . 매끈하고 음수도 조금 통과. | 현대 비전·언어 구조. |
| sigmoid | (0,1) 범위. 큰 절댓값에서 포화. | 적절한 목적함수와 짝지은 이진 확률 출력이나 게이트. |
| tanh | (-1,1) 범위. 이것도 큰 절댓값에서 포화. | 중심이 0인 게이트와 순환 상태 변환. |
| softmax | 벡터 전체를 합 1인 분포로 정규화. | 범주형 logits와 어텐션 가중치. 은닉층의 원소별 활성은 아님. |
출력이 확률 모양이라고 자동으로 calibration 되는 건 아니야. 활성함수는 수학적 범위나 정규화를 정하고, calibration은 학습된 시스템에서 따로 측정하는 성질. 손실이 logits를 기대하는지도 확인하고 적용 위치를 골라.
현대 기본값은 하나가 아니다
ReLU는 싸고 양수 쪽 포화를 피해서 깊은 합성곱망을 실용적으로 만드는 데 한몫했어. Transformer와 다른 현대 구조에서는 GELU와 SiLU도 흔해. 2012년 ImageNet 돌파도 ReLU 혼자 만든 영웅담이 아님. 아키텍처, GPU, 더 큰 데이터, ReLU, 최적화, 증강, 정규화가 함께 맞물린 결과야.
활성함수는 아키텍처 안에서 골라. 표현력, 기울기 흐름, 하드웨어 비용, 출력 의미, 실제 측정값을 같이 봐야 해.