본문 바로가기
C.W.K.
Stream
Lesson 02 of 05 · published

Llama 패밀리: 오픈 가중치 시대의 기준 백본

~12 min · dense, llama, families

Level 0정찰자
0 XP0/41 lessons0/12 achievements
0/100 XP to next level100 XP to go0% complete

Llama가 차지한 자리

Meta의 Llama가 모든 벤치마크에서 늘 1등인 건 아니야. 그래도 오픈 가중치 생태계에서 가장 영향력 있는 Dense 백본 가운데 하나야. 2024~2026년에 나온 수많은 미세 조정 모델, RAG 시스템, 에이전트 스택이 Llama 계열 위에 세워졌어. 이 계보를 읽으면 Dense를 교과서가 아니라 실제 생태계로 이해할 수 있어.

Llama 3

2024년 4월 공개된 8B와 70B는 GQA(8 KV 헤드), 128K 어휘, RoPE 위치 인코딩, SwiGLU 활성화를 썼어. 특히 70B는 ‘쓸 만한 오픈 가중치 70B급 Dense’의 사실상 기준점이 됐고, 이후 작은 미세 조정 모델들이 넘으려는 표적이 됐지.

Llama 3.1

2024년 7월에는 공개 Dense 모델 가운데 손꼽히게 큰 405B가 더해졌고, 패밀리의 컨텍스트 창도 128K로 늘었어. 405B는 연산 비용 때문에 대규모 서빙이 쉽지 않지만, 프런티어 규모에서 Dense 확장이 얼마나 비싸지는지 선명하게 보여줬어.

Llama 3.2와 3.3

3.2는 1B·3B 소형 모델과 11B·90B 멀티모달 변형을 추가했어. 3.3은 70B-Instruct의 후속 학습을 다듬어 405B에 가까운 행동을 훨씬 적은 연산량으로 노렸지. 2025~2026년 실무에서 70B-Instruct가 높은 활용도를 보이는 이유야.

Llama 4의 MoE 전환

2025년 4월의 Llama 4 Scout, Maverick, Behemoth는 Meta의 첫 MoE 세대야. 그렇다고 Llama 3.x Dense가 사라진 건 아니야. 예측 가능한 서빙이 필요한 팀은 여전히 Llama 3.3 70B를 쓰고, 더 큰 용량이 필요한 자리를 Llama 4가 채워. Dense는 폐기된 게 아니라 역할이 또렷해졌어.

Code

Llama 3 Dense 라인업 한눈에·python
llama_3_dense = [
    # name,            params, layers, d_model, ctx,    attention
    ("Llama 3.2 1B",     1,    16,     2048,   "128K",  "GQA"),
    ("Llama 3.2 3B",     3,    28,     3072,   "128K",  "GQA"),
    ("Llama 3 8B",       8,    32,     4096,   "8K",    "GQA (8 KV)"),
    ("Llama 3.1 70B",    70,   80,     8192,   "128K",  "GQA (8 KV)"),
    ("Llama 3.1 405B",   405,  126,    16384,  "128K",  "GQA (8 KV)"),
    ("Llama 3.3 70B",    70,   80,     8192,   "128K",  "GQA (8 KV) + better post-training"),
]

External links

Exercise

Hugging Face에서 Llama 3.1 70B와 Llama 3.3 70B의 모델 카드를 함께 열어. 아키텍처 항목은 거의 같아. 3.3이 3.1과 어떻게 다른지 설명한 부분을 찾아 후속 학습의 구체적인 차이 하나를 자기 말로 적어 봐.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.