비용은 모델 이름보다 운영 방식에서 갈려
같은 모델도 어느 provider와 지역, 어느 배치 환경에서 돌리느냐에 따라 비용과 응답성이 달라져.
- 입력·출력 100만 토큰당 가격은 provider와 모델 등급마다 달라.
- 0까지 축소되는 관리형 서비스는 첫 요청에 5~30초의 콜드 스타트가 생길 수 있어.
- 동시성은 초·분·일 단위 제한과 공유 또는 전용 용량에 좌우돼.
- 지연 시간은 지역, 네트워크 거리, 모델 크기, 배치 경쟁을 함께 반영해.
생성 요청의 재시도는 중복 실행과 같지 않아
sampling을 쓰면 같은 입력도 다른 답을 내므로 추론 호출은 멱등하지 않아. 429에는 jitter를 섞은 지수 backoff를 적용하고, 5xx는 같은 입력으로 제한된 횟수만 재시도해. 429가 아닌 4xx는 숨기지 말고 즉시 실패시켜. tenacity로 이 정책을 코드에 명시할 수 있어.