TGI는 Docker로 빠르게 시작할 수 있어
모델을 정하고 가중치 캐시 볼륨을 연결한 뒤 8080 포트를 열고 --model-id를 넘겨. 첫 실행은 가중치를 받아 오래 걸리지만 같은 볼륨을 재사용하면 다음 시작은 캐시에서 읽어 빨라져.
처리량과 메모리를 함께 조정해
--model-id에는 HF 저장소 ID나 로컬 경로를 넣어.--quantize는 모델 변형에 맞춰 AWQ·GPTQ·bitsandbytes·NF4·fp8을 선택해.--max-concurrent-requests는 동시에 처리할 요청 수를 정해.--max-input-length와--max-total-tokens를 늘리면 요청 하나의 KV cache가 커져 동시성이 줄 수 있어.--num-shard는 여러 GPU에 tensor parallel로 모델을 나눠.
운영에 필요한 끝점도 함께 와
생성과 스트리밍, OpenAI 호환 chat completions뿐 아니라 /info, /health, Prometheus용 /metrics가 기본 제공돼.