분류표가 아니라 세 개의 렌즈
이제부터 현대 LLM을 Dense, MoE, 추론이라는 세 렌즈로 볼 거야. 셋은 서로 밀어내는 분류가 아니야. DeepSeek-R1은 MoE이면서 추론 중심 모델이야. RGB 색상 채널처럼 독립된 특성을 겹쳐 볼 수 있어.
렌즈 1: Dense
모든 토큰이 모든 파라미터를 활성화해. Llama, Gemma, Qwen Dense, Mistral, Phi-4가 여기에 들어가. 구조가 잘 알려져 있고 미세 조정, 서빙, 디버깅 도구도 성숙했어. 다만 수백B 규모로 커지면 토큰당 연산 비용이 가파르게 올라.
렌즈 2: Mixture of Experts
레이어마다 여러 전문가 FFN을 두고 토큰마다 일부만 골라 써. Mixtral, DeepSeek-V2·V3·R1, Llama 4, Qwen3 MoE, Gemma 4 MoE, Mistral Large 3가 대표적이야. 메모리 요구량과 서빙 복잡성을 떠안는 대신, 감당할 만한 연산량으로 더 큰 모델 용량을 얻어.
렌즈 3: 추론 중심
답을 내기 전에 생각 토큰을 만들며 추론 연산을 더 써. OpenAI o 계열, Claude 확장 사고, Gemini 사고 모드, DeepSeek-R1, Qwen3 사고 모드가 여기에 속해. 대부분 Dense나 MoE 백본 위에 올라가며, 추론은 배선보다 후속 학습과 실행 방식에 있어.
서로 겹쳐 보면
| 조합 | 예시 | 동작 |
|---|---|---|
| Dense + 일반 추론 | Llama 3.3 70B | 예측하기 쉽고 빠르며 대화용 기준선으로 쓰기 좋아 |
| Dense + 확장 추론 | Qwen3 32B(사고 모드) | 같은 체크포인트로 더 오래 생각해 어려운 과제를 잘 풀어 |
| MoE + 일반 추론 | DeepSeek-V3 | 프런티어급 지식을 약 30B급 토큰당 연산으로 제공해 |
| MoE + 확장 추론 | DeepSeek-R1 | 큰 용량과 신중한 사고를 함께 얻는 현재의 대표 조합이야 |