양자화 형식은 목적과 런타임을 함께 담아
| 목적 | 형식 | 이유 |
|---|---|---|
| 메모리를 아낀 학습 | bnb-nf4 | 정규 분포 가중치와 QLoRA 학습에 맞아. |
| TGI·vLLM GPU 서빙 | AWQ, GPTQ | 전용 추론 커널을 사용해. |
| Hopper·Ada 서빙 | fp8 | GPU의 fp8 tensor core를 활용해. |
| 노트북 로컬 실행 | GGUF | CPU·Metal·가벼운 GPU 실행에 맞아. |
| Apple Silicon | MLX | Metal과 unified memory를 직접 활용해. |
| 엣지·모바일 | ONNX | 여러 런타임으로 옮기기 쉬워. |
형식에는 비트 수, 보정 방식, 예상 런타임이 함께 들어 있어. vLLM·TGI에는 지원하는 AWQ/GPTQ/bnb를, Ollama에는 GGUF를, MLX에는 MLX 변환본을 줘야 해. 맞지 않는 조합은 로드에 실패하거나 최적화 경로를 잃어 느려져.