본문 바로가기
C.W.K.
Stream
퀴즈 · 4 questions

🔤 토큰화

텍스트가 정수가 되는 법

Level 0토큰 세는 사람
0 XP0/94 lessons0/10 achievements
0/120 XP to next level120 XP to go0% complete

Quiz

01GPT-4가 쓰는 subword 토큰화 알고리즘은?
Hint
GPT-2, GPT-3랑 같은 알고리즘이야. vocab만 더 커진 거고.
02왜 모델이 'strawberry'의 글자 수를 셀 때 틀릴 수 있나?
Hint
'strawberry'라고 치면 모델이 실제로 보는 건 뭘까?
03Gemma 3가 쓰는 vocab 크기는 대략?
Hint
주요 open-weight 모델 중에 vocab이 제일 커 — 여러 언어를 노리고 만든 거니까.
04왜 출력 토큰이 보통 입력 토큰보다 4-10배 비싸나?
Hint
prefill이랑 decode를 갈라서 생각해 봐 — 하나는 큰 matmul 한 방, 다른 하나는 작은 matmul 여러 번이야.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.