Optimum은 하드웨어별 런타임을 한 모양으로 묶어
optimum에는 ONNX Runtime, Intel OpenVINO, Habana Gaudi, TPU, NVIDIA TensorRT-LLM용 패키지가 있어. ORTModelForCausalLM이나 OVModelForCausalLM처럼 Auto 클래스와 비슷한 인터페이스를 제공해 런타임 변경이 호출부 전체로 번지는 일을 줄여.
- 내보낼 때
from_pretrained(repo, export=True)로 그래프를 변환하고 저장해. - 실행 형식을 준비할 때 Optimum CLI로 INT8 동적 양자화 같은 최적화를 적용해.
NVIDIA GPU의 PyTorch 밖으로 배포한다면 Optimum에 대상 런타임이 있는지 먼저 확인해. 모바일, 임베디드, Intel CPU, TPU, Gaudi, TensorRT를 비슷한 작업 흐름으로 다룰 수 있지만 대상별 변환 단계와 의존성은 여전히 검증해야 해.