요청마다 생각의 양을 바꿔
테스트 시점 연산 확대(TTS)는 어려운 문제일수록 더 많은 중간 토큰을 만들어 추론 연산을 늘리는 방식이야. 모델의 가중치와 학습은 그대로지만 요청마다 쓰는 연산량이 달라져. 쉬운 질문에는 곧바로 답하고, 어려운 질문에는 최종 응답 전에 수천 개의 내부 생각 토큰을 쓸 수 있어.
왜 도움이 될까
생각 토큰 하나가 늘 때마다 모델은 은닉 상태를 갱신하고 중간 판단을 다듬고 오류를 고칠 기회를 얻어. 수학, 여러 단계의 코딩, 계획처럼 답을 바로 꺼낼 수 없는 문제에서는 실제 성능이 좋아질 수 있어. 반면 “프랑스의 수도는?”처럼 회상만 필요한 질문에는 대개 낭비야.
연산을 문제 풀이 과정으로 바꿔
사전 학습은 연산을 가중치 속 지식으로 바꾸고, TTS는 실행할 때의 연산을 답을 찾아가는 과정으로 바꿔. 같은 능력 구매가 아니라 비용 곡선이 다른 두 종류의 투자야.
효과는 계속 선형으로 늘지 않아
OpenAI o 계열, DeepSeek-R1, Claude 확장 사고는 비슷한 모양을 보여. 사고 예산을 늘리면 어려운 벤치마크 성능이 오르지만 이득은 점점 줄어. 어느 임계점 아래에서는 문제를 못 풀고, 포화점을 지나면 토큰을 더 써도 거의 나아지지 않아.
사고 예산은 제품의 조절 손잡이야
Claude의 budget_tokens, Gemini의 사고 예산, OpenAI의 추론 노력 단계처럼 현대 API는 예산 조절을 드러내. 개발자는 요청마다 지연 시간과 품질을 직접 맞바꿀 수 있어. 둘의 관계가 더는 모델에 고정된 속성만은 아니야.
없는 지식을 만들어 내지는 못해
기저 모델에 필요한 지식이나 기술이 없다면 생각 토큰을 늘려도 틀린 글만 길어질 수 있어. TTS는 이미 가진 능력을 더 잘 꺼내도록 돕지만 무에서 지식을 만들지는 않아.