회상 실패는 버그가 아니라 구조적 한계야
순수 SSM에 관한 가장 중요한 사실은 분명히 말해야 해. 고정 크기 hidden state를 쓰는 SSM은 임의의 문맥을 완벽하게 회상할 수 없어. 하지 않는 게 아니라 압축 과정에서 정보가 사라지므로 못 하는 거야. 2025년 NeurIPS spotlight 논문 "Achilles' Heel of Mamba"는 연상 회상 계열의 작업에서 이를 엄밀히 증명했어. 순수 SSM은 데이터와 매개변수를 늘리고 학습을 개선해도 고칠 수 없는 방식으로 실패해.
그래서 2026년까지 제품에 성공적으로 배포된 SSM은 모두 하이브리드야. 업계가 찾은 경험적 해답은 보통 SSM 7–9개 층마다 어텐션 층 하나를 남기는 거야. 어텐션이 “정밀 회상 검문소”를 제공하고 SSM 층이 효율을 요구하는 대부분의 계산을 맡지. 화려한 답은 아니지만 제대로 작동해.
안정적으로 학습되는 범위가 Transformer보다 좁아
Mamba 모델을 학습해 본 사람이라면 최적 학습률 구간이 Transformer보다 좁다는 걸 알아. 2025년 연구에서는 회상형 평가에서 Mamba의 정확도가 꽤 좁은 학습률 구간 안에서 거의 0부터 최적값 근처까지 급격히 뛰었어. 값을 잘못 고르면 학습 실행 전체를 낭비해. 초기화와 학습률 일정의 형태가 더 중요하고, 하이퍼파라미터 실수를 만회할 여지도 더 작아.
여러 설정을 폭넓게 시험할 예산이 있는 연구소라면 감당할 만해. 하지만 학습을 한 번 실행할 때마다 실제 비용을 내는 제품 팀에는 이 민감함이 그대로 추가 비용이 돼. NVIDIA의 Nemotron 학습서와 AI21의 Jamba 기술 글처럼 성숙한 조리법이 도움은 돼. 그래도 2026년의 Mamba는 여전히 Transformer보다 다루기 까다로워.
생태계 성숙도의 격차
Hugging Face Transformers는 Mamba와 Mamba-2를 기본 지원하고, vLLM은 출시일부터 Bamba를 지원하며, Together AI의 기술 스택은 StripedHyena를 운영해. 그래도 최적화의 깊이는 Transformer와 견주기 어려워. 양자화 조리법은 덜 검증됐고 speculative decoding 연동도 더 거칠어. “50K 단계에서 생기는 loss 급등은 이렇게 고쳐” 같은 공동체의 경험도 더 천천히 쌓여. 빠르게 나아지고는 있지만, 2026년에도 확신이 없을 때 Transformer를 기본값으로 삼게 만드는 가장 큰 실용적 이유야.