출력 토큰이 입력 토큰보다 비싸
Gemini도 주요 LLM 제공자와 마찬가지로 입력과 출력의 단가가 달라. 출력 토큰은 입력 토큰보다 대략 4–8배 비싸지. 생성은 자기회귀 방식이라 출력 토큰 하나를 만들 때마다 한 번씩 순전파를 해야 해. 그래서 500토큰짜리 답변을 만드는 일은 500토큰짜리 프롬프트를 읽는 것보다 계산량이 500배 더 커. 이 숫자를 기억하면 비용 감각이 현실에 가까워져.
Gemini 2.5 가격(1M 토큰당, 2026년 중반 기준)
| 모델 | 입력 ≤ 200K | 입력 > 200K | 출력 ≤ 200K | 출력 > 200K | 캐시된 입력 |
|---|---|---|---|---|---|
| 2.5 Pro | $1.25 | $2.50 | $10.00 | $15.00 | $0.125 |
| 2.5 Flash | $0.30 | $0.30 | $2.50 | $2.50 | $0.03 |
| 2.5 Flash-Lite | $0.10 | $0.10 | $0.40 | $0.40 | — |
이 표에서는 두 가지를 봐야 해. 첫째, Pro는 200K 토큰 경계에서 입력 단가가 두 배가 돼. 평균 요청이 195K 근처를 오간다면 PDF 하나를 더 넣는 순간 청구서가 2배로 뛸 수 있어. 둘째, Flash-Lite의 출력 토큰은 Pro보다 대략 22.5배 저렴해. 트래픽의 70%를 Pro에서 빼내는 게 가장 큰 비용 절감 수단이야.
무료 등급, Batch API, 컨텍스트 캐싱
기발한 묘수 없이도 청구서를 줄이는 도구가 세 가지 있어:
- 무료 등급: 모델마다 5–15 RPM, 100–1,000 RPD, 250K TPM을 공유해. 시제품에는 충분하지만 운영 서비스에는 턱없이 부족하고, EU·UK·CH는 제외돼.
- Batch API: 곧바로 답할 필요가 없는 오프라인 작업은 표시 가격에서 50% 할인돼. 번역, 임베딩 재구축, 요약 파이프라인에 맞아.
- 컨텍스트 캐싱: 캐시한 콘텐츠의 입력 토큰 단가는 약 90% 줄어. 100K 토큰 문서를 한 번 캐시한 뒤 같은 문서에 여러 질문을 던지면 달러 단위 비용이 센트 단위로 내려가.