본문 바로가기
C.W.K.
Stream
Lesson 07 of 08 · published

스케일아웃은 스케일업이 아니야

~11 min · homework, scale-out, thunderbolt, ultrafusion, mac-mini, our-judgment

Level 0스펙 시트 훑는 사람
0 XP0/91 lessons0/19 achievements
0/100 XP to next level100 XP to go0% complete
"맥 하나 더는 풀 하나와 벽 하나를 더해. 벽은 풀보다 250배 좁아. 그 비율이 기계 여럿과 더 큰 기계 하나의 차이 전부야."

자라는 두 방식

풀은 위로 자라거나(더 넓은 버스, 더 밀도 높은 다이, 배선과 밀도 레슨) 밖으로 자라. 케이블 위의 기계 하나 더. 함대의 선들 레슨은 케이블을 UltraFusion의 2.5 TB/s에 대해 Thunderbolt 5의 10 GB/s로 값 매겼고, 큰 모델 트랙은 공개 결과를 읽었어. 이미 하나에 들어가는 모델에서 맥 둘에 1.3배, 넷에 1.6배. 그리고 다른 모델로 맥 다섯 파이프라인을 돌린 별개의 실행에선 다섯째가 아무것도 못 샀어. 코드 블록이 두 성장을 나란히 놓아. 스케일업은 들어가는 모든 모델의 상한을 올려. 1,229 GB/s의 M5 Ultra는 M3 Ultra가 57로 디코드하는 27B를 85로, 케이블 없이. 스케일아웃은 안 들어가던 모델의 상한만 올리고, 모든 토큰의 모든 레이어에 좁은 선의 횡단을 청구해. Studio 둘은 작업 집합 996 GB와 두 절반 사이의 250 대 1 벽이야. 1,024 GB Studio 하나가 아니고, 애플이 출하하는 어떤 케이블도 그걸 하나로 만들지 않아.

애플 자신의 스케일아웃, 그리고 그 인구

애플은 macOS 26.2에 Thunderbolt 위의 RDMA를 출하하며 "distributed AI inference using MLX"를 용례로 이름 댔고, MLX의 분산 백엔드가 일주일 안에 뒤따랐어. 이 집의 독트린은 그 움직임을 보도가 아니라 인구로 읽어. mini와 Studio는 애플 데스크톱 라인의 양 끝이고, mini 구매자가 시장의 몸통이고 Studio 구매자는 꼬리고, mini에 메모리가 부족하면 그 구매자는 mini를 짝지어. 그러니 멀티 호스트 마케팅은 mini 쌍을 겨냥해. 버그를 드러내고 고칠 만큼 큰 체이닝 인구가 형성될 수 있는 곳. Ultra 쌍은 꼬리 안의 꼬리야. 독트린의 말로 로컬 AI가 꼬리에서 몸통으로 건너갔다는 신호는 mini 쌍이 흔해지는 것이지 M5 Ultra 리뷰가 아니야. 판단이고, 퀘스트는 그렇게 실어. 산수가 더하는 건 mini 쌍이 같은 10 GB/s 벽 뒤의 64 GB 풀 둘이라는 것. mini 하나론 안 되는 모델이 들어가고 선의 값으로 디코드해. Studio 쌍이 그럴 것과 정확히 같게.

숙제

스케일아웃의 숙제는 선이야. 열 배 넓은 선, 맥 사이 100 GB/s, NVLink의 10분의 1이면 레이어당 횡단을 배치 뒤에 숨길 수 있는 범위에 두고, 라이벌의 C2C 같은 일관 링크는 맥 둘을 페이지 테이블 하나 뒤에 두어. 두 계층 레슨의 모양에서 둘째 계층이 다른 상자에 있는 것. 어느 것도 맥엔 없고, 독트린의 읽기는 그걸 필요로 하는 인구가 시장의 몸통이 되기 전까진 어느 것도 없을 거라는 것이야. 그때까지 맥의 스케일아웃은 로딩 경로고 시연이고, 이 집의 함대는 반대로 지어졌어. 토큰을 절대 나누지 않는 맥 아홉, 각각 자기 일이 필요로 하는 풀에 맞춰진 크기, 요청과 결과를 나르고(함대 트랙) 토큰당 바이트는 절대 안 나르는 선들로 이어진. 다이가 오면 스케일업하고, 선이 오면 스케일아웃하고, 둘 다 오기 전까지 풀은 패키지 하나고 정직한 문장은 그렇게 말하는 거야.

Code

scale_out.py — 맥 N대: 용량이 더해지고, 벽이 더해지고, 공개된 속도 칸·python
#!/usr/bin/env python3
"""Scale-out is not scale-up. N Macs add capacity linearly and add per-token link crossings
linearly; the link is 250x narrower than the fabric. Public measurements for the speed
column (Geerling 2025-12-18, exo over RDMA); the capacity column is arithmetic."""
LINK, FABRIC = 10.0, 2500.0
for n, tok_s in [(1, 19.5), (2, 26.2), (4, 31.9)]:
    print(f"{n} M3 Ultra (Geerling's mix: 512 GB pairs and 256 GB pairs): capacity ~{n*498:5d} GB if all were 512 | measured 235B-A22B 8-bit decode {tok_s:4.1f} tok/s = x{tok_s/19.5:.2f} | per-token link crossings per layer: {n-1}")
print(f"\nlink / fabric = {LINK/FABRIC:.3f}: each added Mac adds a wall 250x narrower than the pool it adds.")
print("scale-up (a wider bus, a denser die) raises the ceiling for every model that fits; scale-out (another Mac) raises the ceiling only for models that did not fit, at the wire's price.")
print("the household's reading of the 'time' signal: not Ultra pairs but Mac mini pairs becoming common -- the body of the market pooling, where bugs get fixed.")

External links

Exercise

네 맥의 풀과 기계 둘 사이에 실제로 가진 선으로 scale_out.py를 돌려. 가장 원하는 모델에 대해 스케일업(더 빠른 풀)이 필요한지 스케일아웃(둘째 풀)이 필요한지 쓰고, 후자면 선이 줄 속도를 써. 그다음 독트린의 질문을 카드에 써. 그 선의 소프트웨어를 고칠 인구가 너냐, 시장의 몸통이냐?
Hint
모델이 맥 하나에 들어가면 스케일아웃은 도움이 안 되고 스케일업은 다음 세대에 대한 구매 결정이야. 안 들어가면 스케일아웃은 선의 값으로 가능하고, 선이 열 배 넓어질 때까지 이 집의 판결이 적용돼.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.