vLLM이 하는 거
vLLM은 continuous batching이랑 PagedAttention 중심으로 만들어졌어. 핵심은 이거야. 동시 request가 많을 때 vLLM이 그걸 batch로 눌러 담아서 GPU compute랑 메모리를 request들끼리 나눠 쓰게 해. 그래서 single-request engine이랑은 자릿수가 다른 throughput이 나와.
vLLM 잡을 때
- 내부 API를 serving하는데 같은 모델에 사용자가 여럿 붙을 때.
- 천 단위 prompt에 batch job.
- 다중 GPU NVIDIA 하드웨어 가지고 카드 간 sharded inference.
Mac에서 혼자 쓰는 거면 vLLM은 과해. Ollama가 훨씬 깔끔하고.
잃는 거
- Apple Silicon 지원 부분적. vLLM은 NVIDIA-first. 일부 path가 Mac에서 동작 (CPU-only, 느림)하는데 production에선 절대 Mac에 vLLM 안 잡아.
- setup이 더 무거워. Python deps, CUDA 버전, 모델 path — Ollama보다 만질 손잡이가 많아.
- 메모리 모델이 달라. vLLM은 연속된 KV-cache pool을 미리 잡아둬. 대신 scheduling이 빨라지는 거고, 그 값으로 사이즈를 잘 잡아야 해.