본문 바로가기
C.W.K.
Stream
Lesson 05 of 05 · published

추론 모델 패밀리: o 계열, Claude, Gemini, R1, Qwen

~12 min · reasoning, families

Level 0정찰자
0 XP0/41 lessons0/12 achievements
0/100 XP to next level100 XP to go0% complete

OpenAI o 계열

OpenAI는 상용 추론 모델 범주를 널리 알렸어. o1은 숨은 생각의 사슬을 썼고, o3는 추론 연산을 늘려 Frontier Math와 ARC-AGI에서 큰 향상을 보였어. o4-mini는 생각하는 도중 도구를 부르는 기능을 더했지. 정확한 백본은 공개되지 않았지만 추론 행동은 학습과 실행 전략으로 설명할 수 있어.

Claude 확장 사고

Claude 3.7 Sonnet은 2025년 2월 확장 사고와 생각 블록을 도입했고, Claude 4 계열은 예산 조절을 다듬었어. 같은 체크포인트를 일반 모드와 확장 사고 모드로 쓸 수 있어. Anthropic은 기능과 함께 보이는 생각이 실제 원인에 얼마나 충실한지도 연구했어.

Gemini 사고 모드

Gemini 2.0 Flash Thinking은 2024년 말 보이는 추론을 선보였고, Gemini 2.5 Pro와 Flash는 사고 예산 조절을 더했어. 이후 Deep Think 모드는 어려운 과제에 더 큰 예산을 배정해. 생각 토큰 비용과 예산이 API 설계의 일부가 된 사례야.

DeepSeek-R1

2025년 1월의 DeepSeek-R1은 오픈 가중치 추론 모델의 중요한 기준점이야. V3와 같은 671B-A37B MoE 백본에 SFT 준비 단계, GRPO 강화학습, 거부 샘플링 정제를 거쳤고 보이는 <think> 블록을 써. SFT를 뺀 R1-Zero는 순수 강화학습에서 추론 행동이 나타날 수 있음을 보여줬어.

Qwen3의 이중 모드

Qwen3는 체크포인트 하나로 사고 모드와 일반 모드를 지원해. 같은 가중치가 빠른 대화와 복잡한 문제를 모두 맡으므로 빠른 모델과 추론 모델을 따로 배포할 필요가 줄어. 추론이 실행 축의 선택이라는 점을 특히 선명하게 보여줘.

패밀리를 가로지르는 공통점

이 모델들은 모두 Dense나 MoE 디코더 전용 트랜스포머 위에서 SFT와 검증 가능한 보상의 강화학습을 조합해 비슷한 능력에 접근해. 차이는 생각을 보여 주는 방식, 가격 정책, 후속 학습 데이터에 더 많이 있어. 백본만으로 패밀리의 성격을 설명하기 어려운 이유야.

External links

Exercise

o3, Claude Sonnet, DeepSeek-R1처럼 서로 다른 세 패밀리에서 추론 모델 하나씩 골라 공식 문서를 읽어. 생각의 표시 방식, 예산 조절 방법, 가격 패턴을 세 줄 표로 비교해. 마케팅 문구를 걷어 내면 실제 차이가 어디에 남는지 보일 거야.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.