대규모 SSM-어텐션 하이브리드의 대표 사례
NVIDIA Nemotron-H(2025.4)는 기업 규모 하이브리드의 대표 사례야. 8B와 56B/47B 버전이 있고, 어텐션 층의 약 92%를 Mamba-2로 교체했어. 문맥 65K에서 Llama 3.1 70B보다 약 3배 빠르다고 보고했지. 56B 모델은 H100 GPU 6,144개에서 FP8로 20T 토큰을 사용해 사전 학습했어. 최전선 규모의 제품용 사전 학습이야.
이 사례는 “SSM-어텐션 하이브리드를 제품에 쓸 수 있는가?”라는 질문에 사실상 답을 줘. 하드웨어를 누구보다 잘 아는 NVIDIA가 H100 6,144개를 이 구조의 학습에 투입하고 상용 제품으로 내놓았어. 연구 성과에만 건 선택이 아니라 실제 서비스에 건 선택이야.
MiniPuzzle 압축 — 56B에서 47B로
NVIDIA는 하이브리드 아키텍처가 공격적인 학습 후 압축에도 잘 맞는다고 보고했어. 56B 모델을 47B 매개변수로 증류하고 가지치기해 아키텍처 자체의 이득에 더해 20% 속도 향상을 얻었지. 하이브리드 스택의 SSM 층에 순수 Transformer보다 압축하기 쉬운 중복이 있었던 것으로 해석할 수 있어.
Cosmos-Reason 1 — 비전·언어에도 적용해
Nemotron-H는 NVIDIA의 물리 AI 비전·언어 모델 Cosmos-Reason 1의 뼈대이기도 해. 고해상도 비디오 프레임을 많이 처리하는 작업은 긴 다중 양식 문맥이 필요하므로 하이브리드의 효율이 직접 도움이 돼.
Nemotron 3 — 다음 세대도 같은 방향이야
Nemotron 3(2025.12/2026.3)은 NVIDIA의 다음 세대 하이브리드야. MoE 아키텍처에 문맥 1M과 Blackwell GPU에 맞춘 저정밀 형식인 NVFP4 정밀도를 결합해. MoE 희소성, SSM-어텐션 하이브리드, 공격적인 저정밀 학습을 함께 쓰는 구성이 NVIDIA가 2026–2027년 제품 스택에 거는 선택이야.
세대가 바뀔수록 NVIDIA는 SSM-어텐션 하이브리드에서 물러나는 대신 더 깊이 투자하고 있어. 하드웨어 업체가 직접 보내는 이런 신호는 장기 아키텍처 결정을 내릴 때 진지하게 볼 만해.