Mixtral이 문을 열었어
2023년 12월의 Mixtral 8×7B는 넓은 오픈 가중치 커뮤니티가 실제로 돌릴 수 있었던 첫 강력한 MoE 가운데 하나야. 전체 46.7B, 활성 12.9B, 전문가 여덟 명 가운데 둘을 고르고 공유 전문가는 없어. Llama 2 70B와 경쟁하면서 토큰당 연산량은 훨씬 낮췄어. 뒤이은 Mixtral 8×22B는 전체 141B, 활성 39B로 더 큰 Dense 모델에 도전했지.
DeepSeek는 전문가를 잘게 나눴어
DeepSeek는 큰 전문가 몇 명 대신 작은 전문가를 많이 두는 세분화 설계를 밀었어. Mixtral의 전문가는 8명이라 두 명을 고르는 조합이 28개지만, DeepSeek-V2는 160명 가운데 여섯 명을 골라 조합의 폭이 크게 늘어. 전문가가 더 좁은 패턴을 맡을 여지가 생긴 거야.
| 모델 | 전체 | 활성 | 전문가 | Top-K | 핵심 변화 |
|---|---|---|---|---|---|
| DeepSeek-V2 | 236B | 21B | 160 + 공유 2 | top-6 | 세분화, MLA 어텐션 |
| DeepSeek-V3 | 671B | 37B | 256 + 공유 1 | top-8 | 보조 손실 없는 균형화, FP8, sigmoid 라우팅 |
| DeepSeek-R1 | 671B | 37B | 256 + 공유 1 | top-8 | V3 백본에 GRPO 추론 학습 |
Llama 4는 top-1을 골랐어
2025년 4월의 Llama 4는 Meta의 첫 MoE 패밀리야. 각 토큰이 전문가를 하나만 고르는 top-1로 토큰당 연산량을 공격적으로 줄였어.
| 모델 | 전체 | 활성 | 전문가 | Top-K | 컨텍스트 |
|---|---|---|---|---|---|
| Llama 4 Scout | 109B | 17B | 16 | top-1 | 10M |
| Llama 4 Maverick | 400B | 17B | 128 | top-1 | 1M |
| Llama 4 Behemoth | 약 2T | 288B | 공개 전 | 공개 전 | 교사 모델 미리보기 |
Qwen3 MoE는 공유 전문가를 두지 않아
Qwen3는 128명 가운데 여덟 명을 고르는 30B-A3B와 235B-A22B를 내놨어. 두 모델 모두 공유 전문가가 없고, 같은 체크포인트에서 빠른 모드와 사고 모드를 지원해. Qwen3 235B-A22B는 자체 호스팅을 노릴 때 강력한 오픈 가중치 MoE 선택지야.
설계의 정답은 아직 움직여
전문가는 더 많고 작아지는 흐름이 보이고, top-K는 1~2와 6~8 사이에서 서로 다른 베팅을 해. sigmoid가 softmax를 대신하기도 하고 공유 전문가를 넣거나 빼기도 하지. MoE 설계는 아직 빠르게 진화하므로 2026년의 관행을 영구 법칙처럼 외우면 안 돼.