본문 바로가기
C.W.K.
Stream
Lesson 02 of 04 · published

비용과 지연 시간의 냅킨 계산

~11 min · compare, cost, latency

Level 0정찰자
0 XP0/41 lessons0/12 achievements
0/100 XP to next level100 XP to go0% complete

세 숫자면 시작할 수 있어

LLM 비용을 거칠게 추정하는 데 복잡한 재무 모델은 필요 없어. 백만 입력 토큰 가격, 백만 출력 토큰 가격, 초당 생성 토큰 수를 준비해. 추론 모델이라면 생각 토큰도 과금되는지와 요율을 따로 확인해.

세 가지 계산

요청당 비용은 입력 토큰 × 입력 요율 + 출력 토큰 × 출력 요율이야. 추론 모델은 생각 토큰 × 생각 요율을 더해.

요청당 지연 시간은 대략 출력 토큰 ÷ 초당 토큰 수로 잡아. 추론 모델에서는 생각 시간이 대부분을 차지할 수 있어.

전체 처리량은 동시 요청 수와 초당 토큰 수를 함께 보되, 제공자의 용량 한계도 확인해야 해.

과제 하나에 50번 호출하는 에이전트

호출마다 입력 1K, 출력 500토큰을 쓰고 입력은 $1/M, 출력은 $3/M이라고 하자. 50번이면 약 $0.125야. 호출마다 4K 생각 토큰을 $15/M에 더하면 약 $3.13으로 스물다섯 배 가까이 뛰어. 많은 호출을 잇는 에이전트에서 사고 모드를 함부로 켜면 안 되는 이유야.

신중한 분석 한 번

한 질문에 생각 토큰 16K를 허용하면 $15/M 기준 생각 비용은 $0.24야. 입력 4K와 최종 답 2K를 더해도 약 $0.28이지. 사람이 열 분 넘게 할 분석을 대신한다면 받아들일 만할 수 있어.

가장 긴 다리부터 줄여

비용과 지연 시간은 입력 길이, 출력 길이, 생각 길이로 나눠 볼 수 있어. 보통 입력은 싸고 출력은 더 비싸며 생각 토큰은 특히 많이 쌓여. 추론 작업을 최적화할 때는 생각 길이부터 측정하고 줄여.

Code

추론 모델 호출 비용 계산기·python
def estimate_cost(input_tokens, output_tokens, thinking_tokens=0,
                  rate_in=1.0, rate_out=3.0, rate_think=15.0):
    # Rates per 1M tokens, all in dollars.
    return (input_tokens * rate_in
            + output_tokens * rate_out
            + thinking_tokens * rate_think) / 1e6
순차 단일 요청의 지연 시간 계산기·python
def estimate_latency_sec(output_tokens, thinking_tokens, tps=80):
    # Assumes thinking + output tokens are generated sequentially at TPS.
    return (thinking_tokens + output_tokens) / tps

External links

Exercise

프로젝트의 실제 LLM 작업 하나를 골라 입력, 출력, 생각 토큰으로 요청당 비용을 계산해. 같은 작업을 빠른 모드와 사고 모드로 돌릴 때 예산이 얼마나 달라지는지도 비교해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.