본문 바로가기
C.W.K.
Stream
Lesson 05 of 05 · published

파라미터 수가 비슷한데 왜 체감은 다를까

~10 min · intuition, parameters, performance

Level 0정찰자
0 XP0/41 lessons0/12 achievements
0/100 XP to next level100 XP to go0% complete

같은 70B, 다른 체감

70B Dense와 토큰당 12B가 활성화되는 70B MoE는 모두 “70B”라고 불리지만 같은 하드웨어에서 다르게 움직여.

  • Dense는 토큰마다 모든 파라미터를 써서 비용을 예측하기 쉬워.
  • MoE의 토큰당 연산량은 12B Dense에 가깝지만, 전체 70B는 VRAM에 올려야 해.
  • MoE는 서로 다른 전문가를 활용하므로 더 높은 능력의 상한을 노릴 수 있어.
  • 라우팅 때문에 가중치의 역할이 복잡해져 LoRA 미세 조정은 Dense보다 까다로울 수 있어.

차이를 찾을 세 자리

전체 파라미터 수가 비슷한데 사용감이 다르다면 다음 세 가지부터 확인해.

  1. 활성 파라미터: 전체가 같아도 활성이 다르면 토큰당 비용과 속도가 달라.
  2. 후속 학습: 같은 백본도 RL이나 SFT 레시피가 다르면 행동이 크게 달라져.
  3. 추론 전략: 같은 체크포인트라도 확장 사고를 켜면 지연 시간과 비용이 몇 배로 늘 수 있어.

Qwen3를 예로 들면

Qwen3 235B-A22B가 30B Dense처럼 빠르게 느껴지면서 더 큰 모델처럼 답하는 이유는 두 숫자에 있어. 토큰당 22B 활성 파라미터가 연산 비용을 낮추고, 235B 전체 용량과 폭넓은 후속 학습이 더 넓은 지식 표면을 만들어. “235B”라는 숫자 하나만 보면 이 두 효과를 놓쳐.

기억할 문장

같은 숫자, 다른 모양. 파라미터 수가 비슷한 두 모델의 비용이나 행동이 다르면 어느 축이 차이를 만드는지 물어. 숫자가 틀린 게 아니라 숫자 하나만으로 모델을 다 설명할 수 없는 거야.

Code

같은 70B, 다른 비용 구조·python
models = [
    {"name": "Llama 3 70B (dense)",    "total": 70,  "active": 70},
    {"name": "Hypothetical 70B-A12B",  "total": 70,  "active": 12},
]

for m in models:
    # Memory: similar (both ~140 GB BF16)
    mem_gb = m["total"] * 2
    # Per-token compute: very different
    rel_cost = m["active"] / 70
    print(f"{m['name']:24s}  mem ~{mem_gb} GB   rel-FLOP/tok {rel_cost:.2f}")

External links

Exercise

평소 쓰는 모델 가운데 공개된 파라미터 수는 비슷하지만 체감이 다른 두 개를 골라. 어느 한쪽이 더 싸거나 느리거나 똑똑하거나 수다스러워도 좋아. 자료를 찾기 전에 어느 축이 차이를 만들었을지 추측하고, 그다음 모델 카드를 읽어 확인해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.