pipeline()은 한 사람의 데모까지야
pipeline()은 요청마다 tokenize와 메모리 할당을 반복하고 요청 사이에서 KV cache를 함께 관리하지 못해. 한 사용자의 실험에는 충분하지만 동시 요청이 늘면 여러 호출이 GPU 하나를 비효율적으로 다투게 돼.
추론 서버는 요청들을 함께 운영해
- 연속 배치는 이전 요청이 끝나기 전에도 새 요청을 현재 배치에 넣어.
- PagedAttention과 KV cache 관리는 GPU 메모리 조각화를 줄여 더 많은 대화를 담아.
- 스트리밍은 SSE나 토큰 단위로 첫 결과를 빨리 전달해.
- 서빙 시점 양자화는 AWQ·GPTQ·bnb·fp8·int4 가운데 실행 형식을 고르게 해.
- 상태와 지표 끝점은
/health,/metrics,/info로 운영 상태를 보여 줘.
TGI와 vLLM을 기준점으로 잡아
HF의 공식 서버는 TGI이고, vLLM은 널리 쓰이는 커뮤니티 표준이야. 기능이 많이 겹치지만 배포 환경과 모델 지원이 달라 둘 다 알아둘 가치가 있어.