본문 바로가기
C.W.K.
Stream
Lesson 03 of 08 · published

매개변수 수와 규모 확장

~16 min · scaling, parameter-count, compute

Level 0호기심
0 XP0/73 lessons0/11 achievements
0/120 XP to next level120 XP to go0% complete

경험적 규모 확장 법칙

Kaplan et al. (2020)와 Chinchilla (Hoffmann et al., 2022)는 Language 모델의 손실이 매개변수와 토큰 수에 따라 매끄러운 거듭제곱 법칙으로 감소한다는 사실을 보여줬어. 대략적으로 최적의 학습 연산량은 매개변수 규모 확장과 토큰 규모 확장에 균등하게 나눠야 해. 1.4 trillion 토큰으로 학습한 70B-매개변수 모델 (Chinchilla-optimal)은 300 billion 토큰으로 학습한 175B-매개변수 모델보다 성능이 뛰어났어. 심지어 더 적은 연산량을 사용하고도 말이야.

여기서 얻을 교훈은 분명해. 데이터도 비례해서 늘리지 않으면 모델만 키워 봐야 도움이 되지 않아. Chinchilla 이전에 시도된 수많은 '초대형 모델, 적당한 데이터' 방식은 사실 학습이 덜 된 상태였어.

팁: '내 모델은 얼마나 커야 할까?'는 잘못된 질문이야. 올바른 질문은 '주어진 연산 예산에서 매개변수와 토큰을 어떻게 나눠야 손실을 최소화할까?'야. Chinchilla 방식의 규모 확장 법칙은 놀랄 만큼 정확한 답을 제시해.

규모 확장으로 실제 얻는 것

  • 더 낮은 학습 손실 — 거듭제곱 법칙에 따라 예측할 수 있게 감소해.
  • 창발적 능력 — 다단계 추론이나 코드 생성 같은 일부 능력은 일정 규모를 넘으면 갑자기 나타나.
  • 더 나은 few-shot / zero-shot 성능 — 큰 모델은 적은 예시만 보고도 더 잘 일반화해.
  • 최상위 구간의 수익 체감 — 현재 대부분의 설정에서는 매개변수를 100B에서 200B로 늘리는 비용이 정확도 향상보다 훨씬 커.

응용 작업에서는

최전선 규모의 모델을 직접 학습할 일은 거의 없어. 보통은 사전학습 모델 선택지 (3B, 7B, 13B, 32B, 70B,...)에서 하나를 골라 미세 조정해. 규모 확장 법칙에 대한 직관이 중요한 이유도 여기에 있어. 어느 모델 크기부터 시작해야 할지 판단할 수 있거든. 보통은 정확도 요구사항을 만족하는 가장 작은 모델을 선택해. 추론 비용은 매개변수 수에 따라 커지니까.

원칙: 더 크다고 항상 더 좋은 건 아니야. 정확도 목표를 달성하는 가장 작은 모델을 골라. 추론 비용은 요청을 처리할 때마다 누적돼. 한 번만 내는 비용이 아니라 계속 감당해야 할 비용이야.

Code

모델 크기 지표로 보는 매개변수 수·python
def count_params(model):
    total = sum(p.numel() for p in model.parameters())
    trainable = sum(p.numel() for p in model.parameters() if p.requires_grad)
    return total, trainable

# Common LLM sizes (parameters):
# 1.5B   - small chat / on-device
# 3B     - small with reasoning
# 7B     - sweet spot for most local fine-tuning
# 13B    - middle ground
# 32B-70B - serious fine-tune capacity
# 100B+  - frontier; usually only inference

total, trainable = count_params(model)
print(f"params: {total/1e9:.2f}B total, {trainable/1e9:.2f}B trainable")

External links

Exercise

오픈 소스 LLM 크기 3개 (1.5B, 7B, 32B 등)를 골라. 본인 과제에서 같은 프롬프트 세트로 추론을 실행하고 응답을 평가해. 정확도/지연 시간/비용의 tradeoff를 비교해 봐. 가장 큰 모델이 정답인 경우는 드물어.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.