같은 70B, 다른 체감
70B Dense와 토큰당 12B가 활성화되는 70B MoE는 모두 “70B”라고 불리지만 같은 하드웨어에서 다르게 움직여.
- Dense는 토큰마다 모든 파라미터를 써서 비용을 예측하기 쉬워.
- MoE의 토큰당 연산량은 12B Dense에 가깝지만, 전체 70B는 VRAM에 올려야 해.
- MoE는 서로 다른 전문가를 활용하므로 더 높은 능력의 상한을 노릴 수 있어.
- 라우팅 때문에 가중치의 역할이 복잡해져 LoRA 미세 조정은 Dense보다 까다로울 수 있어.
차이를 찾을 세 자리
전체 파라미터 수가 비슷한데 사용감이 다르다면 다음 세 가지부터 확인해.
- 활성 파라미터: 전체가 같아도 활성이 다르면 토큰당 비용과 속도가 달라.
- 후속 학습: 같은 백본도 RL이나 SFT 레시피가 다르면 행동이 크게 달라져.
- 추론 전략: 같은 체크포인트라도 확장 사고를 켜면 지연 시간과 비용이 몇 배로 늘 수 있어.
Qwen3를 예로 들면
Qwen3 235B-A22B가 30B Dense처럼 빠르게 느껴지면서 더 큰 모델처럼 답하는 이유는 두 숫자에 있어. 토큰당 22B 활성 파라미터가 연산 비용을 낮추고, 235B 전체 용량과 폭넓은 후속 학습이 더 넓은 지식 표면을 만들어. “235B”라는 숫자 하나만 보면 이 두 효과를 놓쳐.
기억할 문장
같은 숫자, 다른 모양. 파라미터 수가 비슷한 두 모델의 비용이나 행동이 다르면 어느 축이 차이를 만드는지 물어. 숫자가 틀린 게 아니라 숫자 하나만으로 모델을 다 설명할 수 없는 거야.