본문 바로가기
C.W.K.
Stream
Lesson 07 of 10 · published

추론 예산과 출력 예산

~12 min · reasoning, budget, max-tokens

Level 0수련생
0 XP0/100 lessons0/14 achievements
0/120 XP to next level120 XP to go0% complete

예산 두 개에는 고장도 두 가지야

추론 모델은 생각에 쓴 토큰과 최종 출력 토큰을 따로 청구해. 추론 예산은 사용자 눈에는 보이지 않아도 청구서에는 선명하게 보여. 반대로 출력의 max_tokens가 너무 작으면 답이 중간에서 잘려. 두 예산을 각각 의도적으로 정해야 해.

추론 예산의 출발점

  • 단순 분류 — 끄거나 low로 두고, 많아도 몇백 토큰이면 돼.
  • 다단계 계획 — 4천~1만 토큰으로 여러 갈래를 살필 공간을 줘.
  • 어려운 수학과 깊은 코드 분석 — 2만 토큰 이상도 시험해볼 수 있어. 다만 더 준 예산이 실제로 도움이 되는지 확인해야 해. 수확은 곧 줄어들어.

출력 예산은 결과의 모양에 맞춰

max_tokens는 예상 출력에 약간의 여유를 더해 잡아. 필드 다섯 개인 JSON 객체라면 512토큰으로 충분하고, 긴 글은 2천~4천 토큰이 필요할 수 있어. 잘린 출력은 운영에서 되풀이되는 장애 유형이야. 상한을 명시하고 응답이 상한에 닿으면 경고가 울리게 해.

Code

두 가지 예산을 둔 호출·python
client.messages.create(
    model="claude-opus-4-7",
    thinking={"type": "enabled", "budget_tokens": 8_000},
    max_tokens=1_024,  # output budget
    messages=[...],
)

External links

Exercise

운영 프롬프트의 추론 예산과 출력 예산을 함께 점검해봐. 표본 요청에서는 추론 예산을 절반으로 낮춰 품질을 재고, 출력이 max_tokens에 닿으면 경고하도록 만들어.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.