양자화는 비트 수만 비교하면 틀려
| 형식 | 비트 | 속도 | 품질 | 용도 |
|---|---|---|---|---|
fp16 / bf16 | 16 | 기준 | 기준 | 양자화하지 않은 운영 기준선. |
fp8 | 8 | 1.3~1.5배 | 기준에 가까움 | Hopper·Ada GPU와 fp8 지원 엔진이 필요해. |
bitsandbytes | 8 / 4 | 1~1.5배 | 작은 저하 | 작은 GPU에 빠르게 맞추기 좋지만 전용 서빙 형식보다 덜 최적화돼. |
GPTQ | 4 / 3 | 약 2배 | 작은 저하 | 채널별 양자화이며 저장소 이름에 -GPTQ가 자주 붙어. |
AWQ | 4 | 2~3배 | 작은 저하 | activation을 반영한 강력한 4비트 서빙 선택지야. |
GGUF | 2~8 | 환경별 | 환경별 | llama.cpp·Ollama용이며 TGI·vLLM용 형식은 아니야. |
하드웨어와 엔진이 지원하는 조합을 골라
현대 GPU에서 AWQ 변형이 있으면 4비트 AWQ를 먼저 검토하고, GPU와 엔진이 fp8을 지원하면 fp8도 좋은 선택이야. 둘 다 맞지 않으면 bnb-nf4로 시작할 수 있어. 이미 검증한 GPTQ 자산이 없다면 새 배포에서는 AWQ와 비교한 뒤 결정해.