"들어감은 숫자 셋이야. 네 비트에서의 가중치, 네 컨텍스트에서의 캐시, 그리고 OS가 실제로 줄 작업 집합. 속도는 넷째야. 토큰이 건드리는 바이트. 혼합 모델에선 파일의 10분의 1."
산수
코드 블록은 물리 트랙을 저장소의 파일 다섯에 적용해. 4비트에서의 가중치: 총 파라미터 곱하기 0.6바이트. 실험실은 스케일과 양자화 안 된 텐서를 세면 진짜 4비트 MLX 체크포인트에서 가중치당 4.5에서 5.1비트를 쟀으니 0.6이 정직한 계수야. 128K 토큰에서의 캐시: 각 아키텍처의 config에서 유도한 토큰당 KV 바이트 곱하기 131,072. 상자의 상한: 512 GB가 아니라 GPU 트랙에서 잰, office에서 OS가 GPU에 권장하는 498 GB. 그리고 디코드 상한: 819 GB/s를 활성 토큰당 바이트로 나눈 것. 다섯 전부 혼합 모델이고 전문가 레슨의 규칙이 적용되니까. 토큰은 라우팅된 전문가와 공유 몸통을 읽지, 파일을 읽지 않아.
| 체크포인트 | 출하 형태 | 4비트 | 128K 캐시 | 498 GB에 들어가나? | 활성 GB/토큰 | 디코드 상한 | 증거 |
|---|---|---|---|---|---|---|---|
| GLM-5.3(753B, 활성 40B) | 1,507 GB BF16 | 452 GB | 12.5 GB | 들어감, 34 GB 여유 | 24 | 34 tok/s | 카드와 config에서 유도 |
| GLM-5.3-Flash(320B, 활성 18B) | 643 GB BF16 | 192 GB | 1.6 GB | 들어감. 192 GB Studio엔 안 들어가. 가중치 192 GB 대 작업 집합 173 GB | 10.8 | 76 | 유도 |
| DeepSeek-V4.1-Flash(748B, 활성 16B) | 510 GB FP4/FP8 | 출하 그대로 510 | 0.1 GB | 안 들어감. 12 GB 초과. FP8 부분을 양자화하거나 맥 둘 | 9.6 | 85 | 유도 |
| Kimi K3(2.8T, 활성 104B) | 1,561 GB MXFP4+BF16 | 1.4–1.7 TB | 3.6 GB | 안 들어감, 둘로도 | 62 | 13 | 유도 |
| Qwen3.8-Flash-Next(180B, 활성 6B) | 360 GB BF16 | 108 GB | 3.3 GB | 들어감. 어떤 128 GB 맥이든 | 3.6 | 228 | 유도 |
표가 바꾸는 판정 셋
GLM-5.3은 들어가. 쥐 트랙의 어림셈, 상자의 85%는 744B(카드의 수. API의 753B는 MTP 헤드를 포함해) 혼합 모델이 안 들어간다고 했고, 512 × 0.85 = 435 GB에선 안 들어갔을 거야. 실측 작업 집합은 498이고, 가중치 452 GB에 캐시 12.5면 34가 남아. 측정 전엔 어림이 정직한 도구였어. 이젠 측정이 그래. DeepSeek-V4.1-Flash는 아깝게 놓친 쪽이야. 출하 그대로 작업 집합보다 12 GB 많고, 전문가는 이미 4비트니, 맥 하나와의 사이에 선 건 FP8 어텐션, 공유 전문가, 메모리 모듈이야. 그것들을 양자화하면 여유 있게 들어가. 그리고 Kimi K3는 아무 데도 안 들어가. 4비트로 2.8조 파라미터는 498에 대해 1.4에서 1.7 TB고, 맥 둘의 996도 거기 안 닿아. 저장소는 없는 기계를 위해 보관해. Qwen3.8-Flash-Next는 108 GB로 집의 모든 128 GB 맥에 들어가고(24 GB Air와 64 GB mini는 아니야) 활성 파라미터 6B가 표에서 가장 빠른 상한 초당 228토큰을 줘. 전문가 레슨의 약속을, 이 집이 실제로 든 체크포인트에서.
상한 칸의 가치
상한은 물리 트랙의 상계고, 실험실은 자기 혼합 모델이 배치 1에서 맥 세 대에 걸쳐 스펙 기준 상한의 18–44%에 닿는 걸 찾았어. 256 중 여덟 전문가를 건드리는 토큰이 각각에 커널을 띄우니까. GLM-5.3의 34는 실제론 6에서 15쯤, Qwen3.8-Flash-Next의 228은 40에서 100쯤이 될 거야. 다른 혼합 모델에서 나온 실험실 비율로 한 추정이지 이 파일들의 측정이 아니고, 카드는 그렇게 말해야 해. 칸이 재지 않고 결정하는 건 순서와 모양이야. 가장 큰 풀에 들어가는 모델은 가장 빨리 디코드하는 모델이 아니고, 가장 빨리 디코드하는 모델은 노트북에 들어가. 다음에 어느 체크포인트를 양자화할지 고르는 집은 이 표를 읽고, 다음 레슨이 양자화를 해.