LoRA는 전체 행렬 대신 작은 변화량을 학습해
가중치 행렬 W를 모두 바꾸는 대신 낮은 rank의 두 행렬 B와 A를 학습해 ΔW = BA를 만들어. 원본 W는 고정하고 작은 행렬만 갱신하므로 학습 파라미터가 전체 미세조정의 0.1~1%로 줄어. 추론에서는 adapter를 따로 적용하거나 W에 합칠 수 있어.
- 7B 모델도 24GB GPU 한 장에서 학습할 수 있는 경우가 많아.
- base 모델을 다시 읽지 않고 요청별 adapter를 바꿀 수 있어.
- adapter는 수십 MB 수준이라 전체 가중치보다 저장과 배포가 가벼워.
rank와 대상 계층이 학습 용량을 정해
r은 보통 8~64에서 고르고 lora_alpha는 변화량의 크기를 조절해. target_modules에는 attention의 q·k·v·o projection이나 MLP의 gate·up·down projection을 지정하며, all-linear로 모든 선형 계층을 고를 수도 있어. dropout은 흔히 0.05~0.1에서 시작해.