숫자는 움직여도 비용 항목은 남아
요금과 호출 한도는 바뀌지만 항목은 비슷해. 입력, 출력, 캐시 입력, 이미지, 오디오, 추론 토큰이 각각 청구되고, 한도는 분당 요청 수(RPM), 분당 토큰 수(TPM), 모델별 동시 실행 수로 나뉘어.
비용 감각의 출발점
인용하기 전에는 반드시 최신 숫자를 확인해.
- Opus, GPT-5.5, Gemini 2.5 Pro 같은 최상위 등급은 입력이 출력보다 약 5~15배 싸고 추론 토큰은 별도 청구돼.
- Sonnet, GPT-5.5-mini, Gemini Flash 같은 중간 등급은 비슷한 처리량에서 보통 3~10배 싸.
- 캐시 입력은 정상 입력 요금의 5~25% 수준이야.
- 오픈 소스 호출 비용은 토큰당 요금이 아니라 장비의 연산을 사용량에 나눠 계산해.
호출 한도의 함정
- 요청이 한꺼번에 몰리면 TPM을 다 쓰기 전에 RPM에 닿아. 요청을 고르게 흘려.
- 긴 맥락 호출은 예상보다 빠르게 TPM 예산을 먹어.
- 일부 제공업체는 높은 사용 등급을 충족해야 최상위 모델을 열어줘.