퀴즈 · 4 questions
🔤 토큰화
텍스트가 정수가 되는 법
Level 0토큰 세는 사람
0 XP0/94 lessons0/10 achievements
0/120 XP to next level120 XP to go0% complete
Quiz
01GPT-4가 쓰는 subword 토큰화 알고리즘은?
Hint
GPT-2, GPT-3랑 같은 알고리즘이야. vocab만 더 커진 거고.
02왜 모델이 'strawberry'의 글자 수를 셀 때 틀릴 수 있나?
Hint
'strawberry'라고 치면 모델이 실제로 보는 건 뭘까?
03Gemma 3가 쓰는 vocab 크기는 대략?
Hint
주요 open-weight 모델 중에 vocab이 제일 커 — 여러 언어를 노리고 만든 거니까.
04왜 출력 토큰이 보통 입력 토큰보다 4-10배 비싸나?
Hint
prefill이랑 decode를 갈라서 생각해 봐 — 하나는 큰 matmul 한 방, 다른 하나는 작은 matmul 여러 번이야.
댓글 0
🔔 답글 알림 (로그인 필요)로그인 — 댓글을 남기려면 로그인해 주세요.
아직 댓글이 없어요. 첫 댓글을 남겨보세요.