처리량보다 대기열을 먼저 봐
TGI와 vLLM은 Prometheus 지표를 제공해. 요청 수와 추론 시간뿐 아니라 tgi_queue_size나 vllm_num_requests_waiting처럼 대기열을 보여 주는 값을 함께 수집해. 대기열이 계속 0보다 크면 일시적 부하가 아니라 용량 부족 신호야. 배치 크기와 GPU 메모리는 TGI 지표, nvidia-smi exporter 또는 DCGM으로 보완해.
살아 있음과 준비됨을 구분해
GET /health가 200이면 가중치가 로드되어 요청을 받을 준비가 된 상태야. Kubernetes readiness probe에 사용하고, GET /info로 실제 모델 ID가 배포 설정과 같은지도 확인해.
재시작은 캐시까지 포함한 계획이야
Docker에는 --restart=unless-stopped, Kubernetes에는 restartPolicy: Always와 충분한 초기 지연을 둔 liveness probe를 설정해. 모델 로드는 분 단위가 걸릴 수 있으므로 가중치를 이미지나 영구 볼륨에 미리 넣어. 프로덕션 재시작을 첫 다운로드로 시작하면 복구 시간이 네트워크 상태에 종속돼.