본문 바로가기
C.W.K.
Stream
Lesson 01 of 04 · published

Ollama 너머 — engine map

~18 min · serving, engines

Level 0Downloader
0 XP0/41 lessons0/11 achievements
0/120 XP to next level120 XP to go0% complete

Ollama 너머 의미 있는 네 engine

Engine강점언제 잡아?
llama.cpp serverRaw GGUF를 그대로 돌리고, C/C++이라 어디든 옮겨지고, overhead가 낮아Embedded, edge, 커스텀 빌드, flag를 전부 쥐고 싶을 때
vLLMThroughput이 강점, continuous batching이랑 PagedAttention다중 사용자 serving, 높은 QPS, GPU 여러 장에 sharding
TGI (HF Text Generation Inference)HuggingFace-native하고 production 모양이야HF 모델 registry, GPU 여러 장에 sharding, HF telemetry
LM StudioGUI에 OpenAI-compat server가 내장탐색, 모델 비교, 데모

공통점

네 engine 다 어딘가에 (보통 /v1/chat/completions) OpenAI-compatible chat completion endpoint를 열어둬. streaming도 다 지원하고. 갈리는 건 운영 쪽이야. throughput 모델, 어떤 하드웨어를 노리냐, 손에 붙는 느낌. 모델 자체, 그러니까 weight는 넷 사이를 그냥 옮겨 다녀.

Ollama 떠나야 해?

대부분 프로젝트는 안 그래도 돼. Ollama가 가장 적은 setup 비용으로 local serving 수요의 90% 정도를 덮거든. llama.cpp server는 Ollama가 안 내주는 특정 GGUF가 필요할 때 꺼내. vLLM은 동시 사용자를 여럿 받아야 할 때, TGI는 팀이 이미 HuggingFace 생태계 안에서 굴러가고 있을 때고.

Code

Engine별 quick smoke test·bash
# Ollama (default)
curl -s http://localhost:11434/api/version

# llama.cpp server (8080에 띄웠다고 가정)
curl -s http://localhost:8080/v1/models | python3 -m json.tool

# vLLM (default port 8000)
curl -s http://localhost:8000/v1/models | python3 -m json.tool

# TGI (default port 8080)
curl -s http://localhost:8080/info | python3 -m json.tool

# 어디든 OpenAI client drop-in
python3 - <<'PY'
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
print(client.models.list())
PY

External links

Exercise

진짜 가진 모양에 맞는 alternative engine 하나 골라. 모델 하나로 띄워. OpenAI Python SDK를 그 engine의 OpenAI-compat endpoint에 가리켜서 hit. 한 질문 답을 Ollama 답이랑 비교. 답 어디서 갈리는지 메모 — 그 차이가 의미 있는지 결정.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.