본문 바로가기
C.W.K.
Stream
Lesson 04 of 05 · published

Nemotron-H와 기업 규모 학습

~12 min · nemotron-h, nvidia, enterprise

Level 0관찰자
0 XP0/50 lessons0/14 achievements
0/100 XP to next level100 XP to go0% complete

대규모 SSM-어텐션 하이브리드의 대표 사례

NVIDIA Nemotron-H(2025.4)는 기업 규모 하이브리드의 대표 사례야. 8B와 56B/47B 버전이 있고, 어텐션 층의 약 92%를 Mamba-2로 교체했어. 문맥 65K에서 Llama 3.1 70B보다 약 3배 빠르다고 보고했지. 56B 모델은 H100 GPU 6,144개에서 FP8로 20T 토큰을 사용해 사전 학습했어. 최전선 규모의 제품용 사전 학습이야.

이 사례는 “SSM-어텐션 하이브리드를 제품에 쓸 수 있는가?”라는 질문에 사실상 답을 줘. 하드웨어를 누구보다 잘 아는 NVIDIA가 H100 6,144개를 이 구조의 학습에 투입하고 상용 제품으로 내놓았어. 연구 성과에만 건 선택이 아니라 실제 서비스에 건 선택이야.

MiniPuzzle 압축 — 56B에서 47B로

NVIDIA는 하이브리드 아키텍처가 공격적인 학습 후 압축에도 잘 맞는다고 보고했어. 56B 모델을 47B 매개변수로 증류하고 가지치기해 아키텍처 자체의 이득에 더해 20% 속도 향상을 얻었지. 하이브리드 스택의 SSM 층에 순수 Transformer보다 압축하기 쉬운 중복이 있었던 것으로 해석할 수 있어.

Cosmos-Reason 1 — 비전·언어에도 적용해

Nemotron-H는 NVIDIA의 물리 AI 비전·언어 모델 Cosmos-Reason 1의 뼈대이기도 해. 고해상도 비디오 프레임을 많이 처리하는 작업은 긴 다중 양식 문맥이 필요하므로 하이브리드의 효율이 직접 도움이 돼.

Nemotron 3 — 다음 세대도 같은 방향이야

Nemotron 3(2025.12/2026.3)은 NVIDIA의 다음 세대 하이브리드야. MoE 아키텍처에 문맥 1M과 Blackwell GPU에 맞춘 저정밀 형식인 NVFP4 정밀도를 결합해. MoE 희소성, SSM-어텐션 하이브리드, 공격적인 저정밀 학습을 함께 쓰는 구성이 NVIDIA가 2026–2027년 제품 스택에 거는 선택이야.

세대가 바뀔수록 NVIDIA는 SSM-어텐션 하이브리드에서 물러나는 대신 더 깊이 투자하고 있어. 하드웨어 업체가 직접 보내는 이런 신호는 장기 아키텍처 결정을 내릴 때 진지하게 볼 만해.

External links

Exercise

Hugging Face에서 NVIDIA Nemotron-H 8B를 받아 출력을 생성하고, 문맥 65K에서 Llama 3.1 8B와 시간을 비교해. H100이 있다면 보고된 3배 속도 이득이 재현되는지 확인해. H100이 없다면 가진 GPU에서라도 시퀀스가 길어질 때 두 모델의 상대적인 속도가 어떻게 변하는지 기록해.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.