OpenAI o 계열
OpenAI는 상용 추론 모델 범주를 널리 알렸어. o1은 숨은 생각의 사슬을 썼고, o3는 추론 연산을 늘려 Frontier Math와 ARC-AGI에서 큰 향상을 보였어. o4-mini는 생각하는 도중 도구를 부르는 기능을 더했지. 정확한 백본은 공개되지 않았지만 추론 행동은 학습과 실행 전략으로 설명할 수 있어.
Claude 확장 사고
Claude 3.7 Sonnet은 2025년 2월 확장 사고와 생각 블록을 도입했고, Claude 4 계열은 예산 조절을 다듬었어. 같은 체크포인트를 일반 모드와 확장 사고 모드로 쓸 수 있어. Anthropic은 기능과 함께 보이는 생각이 실제 원인에 얼마나 충실한지도 연구했어.
Gemini 사고 모드
Gemini 2.0 Flash Thinking은 2024년 말 보이는 추론을 선보였고, Gemini 2.5 Pro와 Flash는 사고 예산 조절을 더했어. 이후 Deep Think 모드는 어려운 과제에 더 큰 예산을 배정해. 생각 토큰 비용과 예산이 API 설계의 일부가 된 사례야.
DeepSeek-R1
2025년 1월의 DeepSeek-R1은 오픈 가중치 추론 모델의 중요한 기준점이야. V3와 같은 671B-A37B MoE 백본에 SFT 준비 단계, GRPO 강화학습, 거부 샘플링 정제를 거쳤고 보이는 <think> 블록을 써. SFT를 뺀 R1-Zero는 순수 강화학습에서 추론 행동이 나타날 수 있음을 보여줬어.
Qwen3의 이중 모드
Qwen3는 체크포인트 하나로 사고 모드와 일반 모드를 지원해. 같은 가중치가 빠른 대화와 복잡한 문제를 모두 맡으므로 빠른 모델과 추론 모델을 따로 배포할 필요가 줄어. 추론이 실행 축의 선택이라는 점을 특히 선명하게 보여줘.
패밀리를 가로지르는 공통점
이 모델들은 모두 Dense나 MoE 디코더 전용 트랜스포머 위에서 SFT와 검증 가능한 보상의 강화학습을 조합해 비슷한 능력에 접근해. 차이는 생각을 보여 주는 방식, 가격 정책, 후속 학습 데이터에 더 많이 있어. 백본만으로 패밀리의 성격을 설명하기 어려운 이유야.