본문 바로가기
C.W.K.
Stream
Lesson 04 of 05 · published

세 개의 렌즈: Dense, MoE, 추론

~10 min · overview, lenses, framework

Level 0정찰자
0 XP0/41 lessons0/12 achievements
0/100 XP to next level100 XP to go0% complete

분류표가 아니라 세 개의 렌즈

이제부터 현대 LLM을 Dense, MoE, 추론이라는 세 렌즈로 볼 거야. 셋은 서로 밀어내는 분류가 아니야. DeepSeek-R1은 MoE이면서 추론 중심 모델이야. RGB 색상 채널처럼 독립된 특성을 겹쳐 볼 수 있어.

렌즈 1: Dense

모든 토큰이 모든 파라미터를 활성화해. Llama, Gemma, Qwen Dense, Mistral, Phi-4가 여기에 들어가. 구조가 잘 알려져 있고 미세 조정, 서빙, 디버깅 도구도 성숙했어. 다만 수백B 규모로 커지면 토큰당 연산 비용이 가파르게 올라.

렌즈 2: Mixture of Experts

레이어마다 여러 전문가 FFN을 두고 토큰마다 일부만 골라 써. Mixtral, DeepSeek-V2·V3·R1, Llama 4, Qwen3 MoE, Gemma 4 MoE, Mistral Large 3가 대표적이야. 메모리 요구량과 서빙 복잡성을 떠안는 대신, 감당할 만한 연산량으로 더 큰 모델 용량을 얻어.

렌즈 3: 추론 중심

답을 내기 전에 생각 토큰을 만들며 추론 연산을 더 써. OpenAI o 계열, Claude 확장 사고, Gemini 사고 모드, DeepSeek-R1, Qwen3 사고 모드가 여기에 속해. 대부분 Dense나 MoE 백본 위에 올라가며, 추론은 배선보다 후속 학습과 실행 방식에 있어.

서로 겹쳐 보면

조합예시동작
Dense + 일반 추론Llama 3.3 70B예측하기 쉽고 빠르며 대화용 기준선으로 쓰기 좋아
Dense + 확장 추론Qwen3 32B(사고 모드)같은 체크포인트로 더 오래 생각해 어려운 과제를 잘 풀어
MoE + 일반 추론DeepSeek-V3프런티어급 지식을 약 30B급 토큰당 연산으로 제공해
MoE + 확장 추론DeepSeek-R1큰 용량과 신중한 사고를 함께 얻는 현재의 대표 조합이야

Code

네 조합이 다 같은 코드 경로에 살아·python
def call_model(model, prompt, *, thinking=False):
    # Backbone (dense vs MoE) decides cost shape and engine config.
    # The thinking flag toggles inference strategy without touching weights.
    return model.generate(prompt, extended_thinking=thinking)

External links

Exercise

무료든 유료든 실제로 써 본 LLM 다섯 개를 적어. 각 모델의 백본이 Dense인지 MoE인지, 추론 방식이 일반 모드인지 사고 모드인지 표시해 봐. 적어도 하나는 백본을 모를 텐데, 그 빈칸이 다음에 찾아볼 과제야.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.