본문 바로가기
C.W.K.
Stream
Lesson 03 of 05 · published

하드웨어의 이점 — GEMM, Tensor Core, 그리고 스캔이 어려운 이유

~12 min · hardware, gemm, tensor-cores, kernels

Level 0관찰자
0 XP0/50 lessons0/14 achievements
0/100 XP to next level100 XP to go0% complete

GPU는 행렬 곱 기계야

H100, B200과 그 이후의 현대 GPU는 무엇보다 밀집 행렬 곱 엔진으로 설계돼. Tensor core는 큰 행렬 곱 연산으로 효율적으로 채울 수 있고, HBM에서 L2와 SRAM으로 이어지는 메모리 계층 전체가 행렬 곱의 접근 무늬에 맞춰져 있어.

표준 어텐션은 본질적으로 Q·Kᵀ, softmax, weights·V라는 행렬 곱 묶음이야. FlashAttention-3는 이 연산을 Hopper 하드웨어에 잘 맞는 타일 무늬로 합쳐. 그 결과 H100 이론 최고치의 약 85%에 도달해. 칩에서 가능한 상한에 가까운 수치야.

병렬 스캔은 구조부터 달라

SSM이 학습할 때 병렬성을 얻으려면 병렬 스캔 알고리즘이 필요해. 스캔은 순차 요소 사이에 의존성이 있어서 행렬 곱과 구조가 달라. 병렬화하려면 Blelloch scan이나 Brent-Kung adder pattern 같은 영리한 알고리즘이 필요해. 이런 기법은 작동하지만 결과를 tensor core에 행렬 곱만큼 깔끔하게 배치하지는 못해. 스캔을 GPU SRAM에 타일 단위로 배치하기도 더 어렵고 상수 계수도 나빠.

TFLA 커널(NeurIPS 2025)은 이 분야의 큰 돌파구야. H100에서 linear RNN이 마침내 FlashAttention-3의 속도에 맞섰어. 하지만 TFLA가 나오기까지 전용 커널 공학에 몇 년이 걸렸고 아직 FlashAttention 수준의 범용 성숙도에는 못 미쳐. 새로운 스캔 기반 아키텍처는 저마다 비슷한 커널 싸움을 해야 해.

하드웨어와 소프트웨어의 공동 설계가 시작됐어

맞춤형 ASIC도 SSM 친화적인 설계를 겨냥하기 시작했어. Google Ironwood(TPU v5p 세대)와 AWS Trainium3에는 병렬 스캔과 순환 계산을 더 잘 지원하는 기능이 들어가. Cerebras WSEGroq LPU도 NVIDIA GPU와 다른 최적점을 지녀서 경우에 따라 SSM에 더 잘 맞아.

하지만 GPU 생태계의 선행 투자는 수년의 시간과 수십억 달러 규모의 최적화로 쌓였어. 대안 아키텍처를 위한 하드웨어·소프트웨어 공동 설계는 유망하지만 아직 초기 단계야. Nemotron에서 보이는 NVIDIA의 SSM-어텐션 하이브리드 투자는 GPU도 결국 하이브리드 스택을 일급으로 지원하는 커널을 갖게 되리라는 가장 강한 신호야.

External links

Exercise

같은 GPU 한 장에서 매개변수 수가 비슷한 Mamba-130M과 Transformer를 torch.profiler 또는 nsys로 분석해. 커널 기록에서 시간이 연산과 메모리 접근에 각각 얼마나 쓰이는지 봐. Mamba 커널이 FlashAttention 호출보다 메모리 접근에 상대적으로 더 많은 시간을 쓰는 모습이 보여야 해. 분석 결과에서 스캔과 행렬 곱의 차이를 직접 확인할 수 있을 거야.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.