본문 바로가기
C.W.K.
Stream
Lesson 03 of 06 · published

토큰 경제학과 가격

~16 min · pricing, cost, optimization

Level 0불씨
0 XP0/35 lessons0/10 achievements
0/140 XP to next level140 XP to go0% complete

출력 토큰이 입력 토큰보다 비싸

Gemini도 주요 LLM 제공자와 마찬가지로 입력과 출력의 단가가 달라. 출력 토큰은 입력 토큰보다 대략 4–8배 비싸지. 생성은 자기회귀 방식이라 출력 토큰 하나를 만들 때마다 한 번씩 순전파를 해야 해. 그래서 500토큰짜리 답변을 만드는 일은 500토큰짜리 프롬프트를 읽는 것보다 계산량이 500배 더 커. 이 숫자를 기억하면 비용 감각이 현실에 가까워져.

Gemini 2.5 가격(1M 토큰당, 2026년 중반 기준)

모델입력 ≤ 200K입력 > 200K출력 ≤ 200K출력 > 200K캐시된 입력
2.5 Pro$1.25$2.50$10.00$15.00$0.125
2.5 Flash$0.30$0.30$2.50$2.50$0.03
2.5 Flash-Lite$0.10$0.10$0.40$0.40

이 표에서는 두 가지를 봐야 해. 첫째, Pro는 200K 토큰 경계에서 입력 단가가 두 배가 돼. 평균 요청이 195K 근처를 오간다면 PDF 하나를 더 넣는 순간 청구서가 2배로 뛸 수 있어. 둘째, Flash-Lite의 출력 토큰은 Pro보다 대략 22.5배 저렴해. 트래픽의 70%를 Pro에서 빼내는 게 가장 큰 비용 절감 수단이야.

무료 등급, Batch API, 컨텍스트 캐싱

기발한 묘수 없이도 청구서를 줄이는 도구가 세 가지 있어:

  • 무료 등급: 모델마다 5–15 RPM, 100–1,000 RPD, 250K TPM을 공유해. 시제품에는 충분하지만 운영 서비스에는 턱없이 부족하고, EU·UK·CH는 제외돼.
  • Batch API: 곧바로 답할 필요가 없는 오프라인 작업은 표시 가격에서 50% 할인돼. 번역, 임베딩 재구축, 요약 파이프라인에 맞아.
  • 컨텍스트 캐싱: 캐시한 콘텐츠의 입력 토큰 단가는 약 90% 줄어. 100K 토큰 문서를 한 번 캐시한 뒤 같은 문서에 여러 질문을 던지면 달러 단위 비용이 센트 단위로 내려가.

Code

호출당 비용 계산기·python
PRICES = {
    'gemini-2.5-pro':        {'in': 1.25, 'out': 10.00, 'in_long': 2.50, 'out_long': 15.00},
    'gemini-2.5-flash':      {'in': 0.30, 'out':  2.50, 'in_long': 0.30, 'out_long':  2.50},
    'gemini-2.5-flash-lite': {'in': 0.10, 'out':  0.40, 'in_long': 0.10, 'out_long':  0.40},
}

def estimate_cost_usd(model: str, prompt_tokens: int, completion_tokens: int) -> float:
    p = PRICES[model]
    in_rate  = p['in_long']  if prompt_tokens     > 200_000 else p['in']
    out_rate = p['out_long'] if completion_tokens > 200_000 else p['out']
    return (prompt_tokens / 1e6) * in_rate + (completion_tokens / 1e6) * out_rate

# Flash 에 50K doc + 1K 질문 + 800 답변:
# (51_000/1e6 * 0.30) + (800/1e6 * 2.50) = $0.0173
Batch API: 50% 할인, 비동기 반환·python
from google import genai
client = genai.Client()

# batch job 제출 (offline, 분~시간 후 반환)
job = client.batches.create(
    model='gemini-2.5-flash',
    requests=[
        {'contents': 'Summarize: ' + doc} for doc in big_doc_pile
    ],
)
# job.state 가 DONE 될 때까지 polling; 결과는 job.results.
# sync 호출의 절반 가격. 비대화형 파이프라인이면 무조건 가치 있어.

External links

Exercise

직장, 사이드 프로젝트, 학교 과제처럼 잘 아는 작업 하나를 골라. (a) 하루 Gemini 호출 횟수, (b) 평균 프롬프트와 응답 토큰 수, (c) 위 공식으로 계산한 Pro·Flash·Flash-Lite의 하루 비용을 추정해. 그다음 알맞은 모델을 고르고 이유를 한 문장으로 써. 사람들은 대개 Pro가 필요한 정도를 과대평가해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.