본문 바로가기
C.W.K.
Stream
퀴즈 · 6 questions

🔀 Mixture of Experts (MoE)

레이어에는 전문가가 여럿, 토큰마다 쓰는 건 일부

Level 0정찰자
0 XP0/41 lessons0/12 achievements
0/100 XP to next level100 XP to go0% complete

Quiz

01DeepSeek-V3가 전체 671B, 토큰당 활성 37B라는 건 무슨 뜻일까?
Hint
메모리는 닿을 수 있는 모든 것이고, 연산은 실제로 닿은 것이야.
02Dense 트랜스포머와 MoE 트랜스포머의 핵심 구조 차이는?
Hint
두 구조를 나란히 그리면 FFN 상자 하나만 달라.
03MoE 학습에서 전문가 붕괴가 왜 문제일까?
Hint
부자가 더 부자 되는 실패 모드.
04같은 671B-A37B, 256+1개 전문가(top-8) MoE 백본을 쓰는 DeepSeek-R1을 추론 모델로 만드는 것은?
Hint
배선은 같고, 배운 방식만 달라.
05DeepSeek-V3가 표준 보조 부하 균형 손실 대신 도입한 것은?
Hint
덜 쓰인 전문가의 점수를 자연스럽게 올리는 편향을 생각해.
06참일까? MoE의 전문가는 과학, 코드처럼 주제별로 나뉜다.
Hint
현실이 마케팅 다이어그램보다 더 평범.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.