Qwen: 가장 촘촘한 크기 선택지
Alibaba의 Qwen은 오픈 가중치 Dense 시리즈 가운데 크기 선택 폭이 넓어. Qwen2.5는 0.5B부터 72B까지 일곱 등급을 내놨고, Qwen3는 0.6B·1.7B·4B·8B·14B·32B 변형을 제공해. Qwen3의 중요한 특징은 같은 체크포인트를 빠른 모드와 사고 모드로 쓸 수 있다는 점이야. 가중치는 하나지만 추론 동작은 둘이지.
Mistral: 효율을 먼저 보는 Dense
Mistral AI는 작지만 강한 Dense 모델로 이름을 알렸어. Mistral 7B는 2023년에 실전 LLM에 슬라이딩 윈도 어텐션을 도입했고, Mistral NeMo 12B는 40개 층과 5120 차원, Tekken 토크나이저를 써서 자원이 제한된 배포에 잘 맞아. Mistral Large 2는 123B 규모의 강한 Dense 모델이야.
Phi: 크기 대신 데이터 품질을 밀어
Microsoft의 Phi-3와 Phi-4는 학습 데이터의 품질을 핵심 지렛대로 삼아. MIT 라이선스의 Phi-4 14B는 잘 고른 합성 데이터가 작은 모델을 같은 크기 등급보다 훨씬 강하게 만들 수 있음을 보여줬어. 규모만 키우면 모든 문제가 풀린다는 주장에 좋은 반례야.
눈여겨볼 다른 패밀리
- Cohere Command A(111B): 기업용 작업과 에이전트 도구 사용에 초점을 둔 Dense 모델이야.
- Falcon 3: TII가 이어 가는 효율 중심 Dense 계열이야.
- InternLM, Yi: 중국 연구소가 각자 강점을 다듬는 Dense 패밀리야.
차이는 백본 밖에서 더 많이 생겨
비슷한 크기의 Qwen, Mistral, Phi는 백본이 놀랄 만큼 닮았어. 대부분 GQA, RoPE, SwiGLU를 쓰는 디코더 전용 모델이지. 체감 차이는 주로 학습 데이터와 후속 학습, 배포 정책과 라이선스에서 나와. 모델의 성격을 백본 하나로 설명하면 이 차이를 놓쳐.