마케팅 슬라이드의 숫자는 모양을 숨겨
예전에는 “200B 파라미터”라는 숫자 하나로 모델의 크기를 대충 읽을 수 있었어. MoE가 널리 쓰이는 지금은 숫자가 둘 필요해. 전체 파라미터는 메모리에 올려야 하는 모든 가중치의 수이고, 토큰당 활성 파라미터는 토큰 하나를 처리할 때 실제 계산에 참여하는 가중치의 수야. 둘의 비율이 비용 구조를 좌우해.
표기법: 235B-A22B
2025~2026년 MoE에서 XB-AYB는 X가 전체, Y가 토큰당 활성 파라미터라는 뜻이야. Qwen3 235B-A22B는 235B를 메모리에 올리고 토큰마다 약 22B를 계산해. DeepSeek-V3 671B-A37B는 671B를 올리고 약 37B를 계산하지. “70B”처럼 숫자가 하나뿐인 Dense 모델은 전체와 활성이 같아.
두 숫자가 갈라놓는 것
- 메모리: 전체 파라미터를 따라가. 토큰당 37B만 쓰더라도 DeepSeek-V3의 671B 가중치를 모두 GPU 메모리에 올려야 해.
- 토큰당 FLOPs: 활성 파라미터를 따라가. DeepSeek-V3는 약 37B Dense 모델에 가까운 연산량으로 토큰을 만들어.
- 품질의 상한: 전체 용량의 도움을 받아. 토큰마다 다른 전문가가 켜지므로 671B 전체가 모델이 배울 수 있는 지식의 폭에 기여해.
책상보다 도서관을 떠올려
Dense는 책상 위의 모든 종이를 질문마다 펼쳐 보는 방식과 닮았어. MoE는 큰 도서관에서 질문에 맞는 책 몇 권만 책상으로 가져오는 방식에 가까워. 읽는 책은 적어도 도서관 전체를 담을 건물은 여전히 필요해.