클라이언트 하나가 여러 추론 백엔드를 감싸
huggingface_hub.InferenceClient는 HF Inference API, HF가 연결한 외부 provider, 직접 운영하는 TGI 서버, OpenAI 호환 끝점과 대화하는 공통 클라이언트야. provider와 model을 정한 뒤 chat_completion, text_generation, image_generation 같은 작업 메서드를 호출해.
호출부와 운영 위치를 분리해
개발에서는 관리형 Hub 끝점을 쓰고 운영에서는 자체 TGI로 옮겨도 애플리케이션 호출 구조를 유지할 수 있어. 백엔드 주소와 provider 설정만 바꾸면 되므로 특정 서비스 SDK가 코드 전체에 퍼지는 일을 막아 줘.