퀴즈 · 5 questions
⚛️ LLM이 하드웨어한테 요구하는 것
두 워크로드, 디코드 상한, 대화하는 동안 자라는 캐시, 정직한 벤치마크, 전문가들, 배치 1, 그리고 양자화
Level 0스펙 시트 훑는 사람
0 XP0/91 lessons0/19 achievements
0/100 XP to next level100 XP to go0% complete
Quiz
01같은 기계, 같은 모델인데 왜 디코드는 대역폭에 묶이고 프리필은 연산에 묶여?
02Qwen3.5 4비트 체크포인트의 디코드에서 '토큰당 바이트'에 세는 바이트는?
03Llama-3.2-1B와 Qwen3.5-9B는 둘 다 토큰당 KV 캐시가 32 KB인데, 32K 윈도우의 10%에서 90%로 가면서 1B는 디코드 속도의 39%를, 9B는 17%를 잃었어. 왜?
0435B-A3B 전문가 혼합 모델은 토큰당 1.66 GB쯤 읽어서 커널이 스트림하는 638 GB/s 기준으로 office에서 초당 385토큰 근처의 상한이 나와. 함대 실측은 89–110이었어. 트랙은 뭐라고 결론 내려?
0527B 모델의 4비트 체크포인트는 토큰당 14.4 GB를 읽어. 양자화가 뭘 사줬고, 품질 비용의 라벨은 뭐라고 해?
댓글 0
🔔 답글 알림 (로그인 필요)로그인 — 댓글을 남기려면 로그인해 주세요.
아직 댓글이 없어요. 첫 댓글을 남겨보세요.