2026년에 직접 써볼 만한 가속기
- NVIDIA H100 / H200 / B100 — 클라우드 학습의 주력. BF16과 FP8을 지원하고, VRAM도 80GB+로 넉넉해.
- NVIDIA A100 — 조금 오래됐지만 여전히 널리 쓰이고, 클라우드에서도 쉽게 구할 수 있어.
- NVIDIA RTX 4090 / 5090 — 단일 GPU 데스크톱 학습용으로 적합하고, VRAM은 24-32GB야.
- Apple Silicon (M3 Ultra, M4 Max) — 통합 메모리 아키텍처를 사용해서 CPU와 GPU가 64-512GB 메모리를 공유해. MPS나 MLX를 활용한 추론과 중소 규모 학습에 빨라.
- Google TPU (v5e, v5p) — Google Cloud에서만 쓸 수 있어. 매우 큰 모델을 학습하는 데 뛰어나지만 JAX 또는 PyTorch/XLA가 필요해.
- AMD MI300X — H100의 새로운 대안으로 떠오르고 있고, PyTorch ROCm 지원도 계속 좋아지고 있어.
팁: 대부분의 학습과 운영 환경 추론은 가속기 하나로 충분해. 다중 GPU와 다중 노드 학습은 정말 필요해질 때까지 미뤄. 엔지니어링 부담이 만만치 않거든.
보통은 메모리가 제약 조건이야
현대 가속기는 FLOP 성능이 충분히 높아. 실제 제약은 모델, 활성화, 기울기, 옵티마이저 상태를 모두 VRAM에 넣을 수 있느냐야. 혼합 정밀도를 쓰면 모델과 활성화가 차지하는 메모리를 절반으로 줄일 수 있어. 기울기 체크포인트 저장은 연산량을 늘리는 대신 메모리를 아껴. ZeRO와 FSDP는 옵티마이저 상태를 여러 GPU에 나눠 저장해.
Apple Silicon도 진짜 선택지야
로컬 추론과 적당한 규모의 학습에서는 Apple Silicon도 충분히 경쟁력이 있어. 통합 메모리 덕분에 192GB Mac Studio 한 대로, x86 시스템이라면 여러 GPU가 있어야 담을 수 있는 모델 가중치를 올릴 수 있어. MLX는 Apple 네이티브 프레임워크고, PyTorch MPS 백엔드는 크로스 플랫폼 경로야. 둘 다 2026년에는 first-클래스 선택지야.
원칙: FLOPS가 아니라 메모리를 기준으로 가속기를 골라. 모델이 메모리에 들어가기만 한다면, LLM 미세 조정에서는 24GB 소비자용 GPU가 16GB 데이터센터 GPU보다 나은 경우가 많아.