본문 바로가기
C.W.K.
Stream
Lesson 08 of 10 · published

요금과 호출 한도 — 실제 숫자 읽기

~12 min · providers, pricing

Level 0수련생
0 XP0/100 lessons0/14 achievements
0/120 XP to next level120 XP to go0% complete

숫자는 움직여도 비용 항목은 남아

요금과 호출 한도는 바뀌지만 항목은 비슷해. 입력, 출력, 캐시 입력, 이미지, 오디오, 추론 토큰이 각각 청구되고, 한도는 분당 요청 수(RPM), 분당 토큰 수(TPM), 모델별 동시 실행 수로 나뉘어.

비용 감각의 출발점

인용하기 전에는 반드시 최신 숫자를 확인해.

  • Opus, GPT-5.5, Gemini 2.5 Pro 같은 최상위 등급은 입력이 출력보다 약 5~15배 싸고 추론 토큰은 별도 청구돼.
  • Sonnet, GPT-5.5-mini, Gemini Flash 같은 중간 등급은 비슷한 처리량에서 보통 3~10배 싸.
  • 캐시 입력은 정상 입력 요금의 5~25% 수준이야.
  • 오픈 소스 호출 비용은 토큰당 요금이 아니라 장비의 연산을 사용량에 나눠 계산해.

호출 한도의 함정

  • 요청이 한꺼번에 몰리면 TPM을 다 쓰기 전에 RPM에 닿아. 요청을 고르게 흘려.
  • 긴 맥락 호출은 예상보다 빠르게 TPM 예산을 먹어.
  • 일부 제공업체는 높은 사용 등급을 충족해야 최상위 모델을 열어줘.

Code

비용 감시 개요·python
from collections import defaultdict

buckets = defaultdict(int)
for resp in stream_recent_responses():
    buckets[(resp.provider, resp.model, "input")] += resp.usage.input_tokens
    buckets[(resp.provider, resp.model, "output")] += resp.usage.output_tokens
    if resp.usage.cache_read_input_tokens:
        buckets[(resp.provider, resp.model, "cache_read")] += resp.usage.cache_read_input_tokens
    if resp.usage.thinking_tokens:
        buckets[(resp.provider, resp.model, "thinking")] += resp.usage.thinking_tokens

External links

Exercise

프롬프트 하나의 지난주 요청을 모아 입력, 출력, 캐시, 추론 토큰으로 나눠봐. 가장 큰 항목을 찾고 줄여볼 실험 하나를 정해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.