의미 있는 다섯 환경변수
| 변수 | 하는 일 | Default |
|---|---|---|
OLLAMA_FLASH_ATTENTION | FlashAttention을 켜. 보통 한 방에 가장 크게 먹히는 성능 개선 | off (1로 설정) |
OLLAMA_KV_CACHE_TYPE | KV cache 양자화 (q8_0면 절반, q4_0면 1/4) | fp16 |
OLLAMA_NUM_PARALLEL | 모델당 동시 request | 1 |
OLLAMA_MAX_LOADED_MODELS | 동시에 메모리에 있을 수 있는 모델 수 | 3 |
OLLAMA_KEEP_ALIVE | Request 후 모델 로드 유지 시간 | 5m |
macOS에서 persist
macOS에서 Ollama는 launchd가 띄워. 그래서 shell에서 export한 건 안 보여. launchctl setenv로 env를 박아두고 Ollama service를 재시작해야 그걸 집어 가.
Context window 수학
동시 request가 늘면 KV cache도 그만큼 배로 불어나. num_ctx=8192에 NUM_PARALLEL=4면 실제로는 32K짜리 KV cache를 쓰는 거야. OLLAMA_KV_CACHE_TYPE=q8_0이 그걸 반으로 줄여주고. 대부분 모델 default num_ctx는 4096 — 실전엔 8192나 16384로 올려, 메모리 봐가면서.