무엇을 고정하고 무엇을 바꿀까
확률과 우도는 같은 모형식에서 출발하지만 질문이 달라.
| 질문 | 고정하는 것 | |
|---|---|---|
| 확률 | 매개변수 가 주어졌을 때 어떤 데이터 가 나올까? | 매개변수를 고정하고 가능한 데이터를 비교 |
| 우도 | 데이터 를 관측했을 때 어느 가 그 데이터를 더 잘 설명할까? | 데이터를 고정하고 매개변수를 비교 |
우도는 를 의 함수로 다시 읽은 값이야. 그래서 매개변수 전체에 대해 합이나 적분이 1일 필요가 없고, 그 자체를 의 확률분포로 읽으면 안 돼. 매개변수의 확률을 말하려면 사전분포와 베이즈 규칙이 더 필요해.
최대우도추정과 손실
최대우도추정은 관측 데이터의 우도를 가장 크게 만드는 매개변수를 골라.
독립이라고 가정한 관측의 우도는 곱으로 나타나기 쉬워서 로그를 취해 합으로 바꿔. 로그는 단조증가하므로 최댓값 위치가 같고, 음수를 붙이면 음의 로그우도를 최소화하는 문제가 돼.
범주형 조건부 모형에서 one-hot 정답과 함께 쓰는 교차엔트로피는 음의 로그우도와 같아. 하지만 모든 손실과 모든 모델 학습이 MLE인 것은 아니야. 규제, 대조학습, 강화학습 목적처럼 다른 해석이 필요한 경우도 있어.
logits를 범주형 분포로
분류기의 원시 점수인 logits를 음수가 없고 합이 1인 값으로 바꾸는 함수가 softmax야.
모든 logit에 같은 상수를 더해도 결과는 같아. 구현에서는 가장 큰 logit을 먼저 빼 지수의 오버플로를 줄이고, 손실 계산에는 보통 안정적인 cross_entropy나 log_softmax를 바로 써.
확률은 매개변수를 고정해 가능한 데이터를 비교하고, 우도는 관측 데이터를 고정해 매개변수를 비교해. 같은 식을 어느 변수의 함수로 읽는지 표시하면 둘을 섞지 않을 수 있어.