왜 llama.cpp server?
llama.cpp는 이 바닥의 밑바탕이 되는 C/C++ inference engine이야. Ollama도 안에서 이걸 써. llama.cpp 트리에서 빌드하는 llama-server가 같은 engine을 standalone HTTP server로 열어줘. OpenAI-compatible chat completion 전체에 llama.cpp 전용 endpoint까지 딸려 오고.
직접 잡을 때
- Ollama가 ship 안 하는 특정 GGUF가 있고 Modelfile + repository 만들기 싫을 때.
- Flag 레벨 컨트롤 필요 — 정확한
num_ctx, batch size, GPU split, mmap 설정, KV cache type. - Engine을 자체 product에 embed하고 싶고 binary 하나, daemon 없음, 모델 registry 없음 원할 때.
- 다른 port에 여러 variant 돌리고 싶을 때 — 모델 하나당 server 하나, 공유 state 없음.
빌드, serve, hit
llama.cpp는 CMake 한 번으로 빌드돼. Server binary 이름은 llama-server고. GGUF 파일 아무거나 물려주면 네가 고른 port에서 listen하고, OpenAI-compat endpoint도 기본으로 열려.