퀴즈 · 5 questions
🎯 Attention 메커니즘
Q, K, V — 그리고 그걸 스케일하는 엔지니어링
Level 0토큰 세는 사람
0 XP0/94 lessons0/10 achievements
0/120 XP to next level120 XP to go0% complete
Quiz
01attention의 √d_k 스케일링 인자는 뭘 방지하나?
Hint
x의 크기가 1보다 훨씬 커지면 softmax(x)는 어떻게 될까?
02KV-cache는 뭐에 쓰이나?
Hint
한 번 계산해 두면 다시 안 변하는 게 뭘까?
03Llama 3.3 70B의 KV head 수는?
Hint
요즘 open-weight 모델 대부분이 쓰는 표준 GQA 그룹 크기야.
04Flash Attention의 핵심 혁신은?
Hint
수학은 그대로, 메모리 전략만 달라.
05decoder-only 학습에 causal masking이 왜 필요한가?
Hint
병렬로 학습하는 거랑 순차로 생성하는 거, 뭐가 다를까?
댓글 0
🔔 답글 알림 (로그인 필요)로그인 — 댓글을 남기려면 로그인해 주세요.
아직 댓글이 없어요. 첫 댓글을 남겨보세요.