GGUF는 로컬 실행에 필요한 묶음을 한 파일에 담아
llama.cpp가 만든 GGUF는 CPU 중심 추론, Apple Silicon의 Metal 가속, 여러 운영체제에 배포하는 실행을 겨냥해. 가중치, tokenizer, 메타데이터가 .gguf 하나에 들어가므로 Ollama와 llama.cpp가 바로 읽기 좋아.
HF 체크포인트를 변환하고 양자화해
표준 경로는 llama.cpp의 convert_hf_to_gguf.py야. HF 저장소를 입력으로 주고 Q4_K_M·Q5_K_M·Q8_0·F16 같은 등급을 골라 배포할 파일을 만들어.
파일 이름에서 양자화 등급을 읽어
Hub에서는 보통 {model}-{params}-{quant}.gguf처럼 이름을 붙여. Llama-3.1-8B-Instruct-Q4_K_M.gguf의 마지막 부분이 비트 폭과 반올림 방식을 알려 주며, Q4_K_M은 크기와 품질을 절충하는 흔한 선택이야.