본문 바로가기
C.W.K.
Stream
Lesson 05 of 10 · published

오픈 소스 모델 — Llama, Qwen, Mistral

~14 min · providers, oss

Level 0수련생
0 XP0/100 lessons0/14 achievements
0/120 XP to next level120 XP to go0% complete

오픈 소스가 중요한 까닭

  • 비용 — 자체 장비에서 늘 돌리면 규모가 커질수록 싸질 수 있어.
  • 개인정보 — 자료가 자신의 환경을 떠나지 않아.
  • 맞춤화 — 미세조정, 구조화 출력 후훈련, 전용 토크나이저를 쓸 수 있어.
  • 망 분리 배포 — 규제가 강한 산업에서도 운영할 수 있어.
  • 지연 시간 — 로컬 추론이 통신 호출보다 훨씬 빠를 수 있어.

알아둘 특성

  • 70B Llama와 7B Mistral의 능력은 같지 않아. 실제 작업으로 시험해.
  • 도구 호출은 전용 API보다 템플릿 프롬프트와 파서로 앱 계층에서 구현하는 경우가 많아.
  • JSON 강제에는 Outlines, jsonformer 같은 제약 디코딩이나 후검증이 필요해.
  • 맥락 창은 모델과 양자화 방식에 따라 크게 달라지니 가정하지 마.
  • 토크나이저는 모델 계열마다 다르고 비용은 토큰당 달러보다 연산량과 시간으로 계산해.

모델뿐 아니라 운영 기반도 소유해

오픈 소스를 택하면 vLLM, llama.cpp, MLX 서빙과 GPU·CPU·MPS 준비, 모델 갱신, 관찰도 맡아야 해. 공짜 모델이 아니라 시스템 하나를 더 운영한다고 봐. cwkPippa의 Ollama vessel이 이 코드베이스의 로컬 추론 사례야.

Code

Ollama로 로컬 Llama 실행하기·python
import ollama

resp = ollama.chat(
    model="llama4",
    messages=[{"role": "user", "content": question}],
    options={"temperature": 0.2, "num_predict": 1024},
    format="json",  # constrained decoding to JSON
)
Apple Silicon에 MLX·python
from mlx_lm import load, generate

model, tokenizer = load("mlx-community/Qwen3-7B-MLX")
out = generate(model, tokenizer, prompt=question, max_tokens=1024)

External links

Exercise

같은 프롬프트를 폐쇄형 모델과 자체 장비의 비슷한 오픈 소스 모델에 실행해봐. 출력, 지연 시간, 운영을 포함한 총비용을 비교해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.