퀴즈 · 4 questions
📐 Embedding과 위치
토큰 ID에서 순서 있는 dense 벡터로
Level 0토큰 세는 사람
0 XP0/94 lessons0/10 achievements
0/120 XP to next level120 XP to go0% complete
Quiz
01vocab=128,000, d_model=4,096인 Transformer에서 embedding 행렬의 shape는?
Hint
행은 vocab을 훑고, 열은 hidden 차원을 훑어.
02Llama 3, Mistral, Qwen이 공통으로 쓰는 위치 인코딩 스킴은?
Hint
입력에서 더하는 게 아니라 attention 안에서 회전으로 들어가.
03왜 위치 인코딩 없는 self-attention은 순열에 동변(equivariant)인가?
Hint
dot-product 공식에서 위치가 들어갈 자리가 어딘지 찾아봐.
04Llama 3가 컨텍스트 윈도우를 8K에서 128K로 확장하는 데 쓴 기법은?
Hint
새 아키텍처가 아니라 RoPE 주파수를 영리하게 다시 스케일한 거야.
댓글 0
🔔 답글 알림 (로그인 필요)로그인 — 댓글을 남기려면 로그인해 주세요.
아직 댓글이 없어요. 첫 댓글을 남겨보세요.