기술 보고서 전에도 단서는 보여
표기와 어휘, 설정 파일만 살펴도 모델이 Dense인지 MoE인지 대개 구분할 수 있어.
파라미터 표기
- 70B, 405B처럼 숫자가 하나면 대개 Dense야. 전체와 활성이 같아서 두 번째 숫자가 필요하지 않아.
- 235B-A22B, 671B-A37B는 전체와 토큰당 활성을 함께 적는 현대 MoE 표기야.
- 8×7B, 8×22B는 전문가 수와 크기를 앞세운 초기 MoE 표기야. Mixtral이 대표적으로 썼어.
어휘
- 전문가, 라우터, 게이트, top-K, 전문가 붕괴, 부하 균형이 나오면 MoE야.
- 세분화된 전문가, 공유 전문가, 보조 손실 없는 균형화는 DeepSeek 계열의 현대 MoE를 가리켜.
비용을 설명하는 방식
- 크기에 비해 연산 효율이 좋고 토큰당 비용이 낮다고 강조하면 MoE일 가능성이 커.
- 가볍고 빠르며 미세 조정과 양자화가 쉽다고 강조하면 Dense일 가능성이 커.
설정 파일로 확정해
Hugging Face 저장소가 있다면 config.json에서 num_experts, num_experts_per_tok, num_local_experts, router_aux_loss_coef를 찾아. 이런 필드가 있으면 MoE이고, 없다면 대개 Dense야.