QLoRA는 4비트 base 위에 LoRA를 얹어
base 모델을 정규 분포 가중치에 맞춘 NF4로 양자화해 고정하고, fp16이나 bf16인 작은 LoRA adapter만 학습해. base가 차지하는 메모리를 크게 줄여 48GB GPU 한 장에서도 70B급 모델을 조정할 수 있는 길을 열어.
BitsAndBytesConfig로 4비트 방식을 선언해.prepare_model_for_kbit_training으로 base를 고정하고 필요한 형 변환과 checkpointing을 준비해.LoraConfig로 rank와 대상 계층을 정해.get_peft_model로 adapter가 붙은 모델을 만들어.
PEFT에는 IA3·LoHa·LoKr·OFT·X-LoRA·VeRA도 있지만 일반적인 SFT에서는 LoRA와 QLoRA가 검증된 출발점이야. 다른 방법은 메모리나 표현력의 구체적인 병목이 확인됐을 때 비교해.