어텐션의 제곱 비용을 피하려는 베팅
트랜스포머 어텐션은 시퀀스 길이에 대해 O(n²)로 커져. 길이가 두 배면 어텐션 연산은 네 배가 될 수 있어. 상태 공간 모델(SSM)은 어텐션을 O(n)으로 자라는 상태 갱신으로 바꿔 매우 긴 시퀀스에서 구조적인 이점을 노려.
Mamba는 입력에 따라 기억을 골라
S4와 S5 같은 초기 SSM은 상태 갱신 규칙이 입력과 무관했어. Mamba는 현재 토큰에 따라 과거 상태를 얼마나 유지하고 잊고 갱신할지 선택하는 구조를 도입했어. 이 선택성이 어텐션과의 품질 차이를 줄이면서 선형 확장의 장점을 남겼지.
어텐션은 다시 보고, SSM은 요약해 들고 가
어텐션은 이전 토큰을 유사도에 따라 다시 살펴봐. SSM은 고정 크기의 상태를 들고 가며 새 토큰마다 갱신하고 원래 토큰 자체는 놓아. 앞쪽은 정확한 회상에 강하지만 길이가 늘수록 비싸고, 뒤쪽은 메모리가 제한된 대신 선형으로 확장돼.
Mamba 2의 이중성
Mamba 2는 선택적 SSM과 어텐션을 구조화 상태 공간 이중성이라는 틀에서 비슷한 계산의 다른 표현으로 묶었어. 덕분에 어텐션 공학의 최적화 기법을 일부 빌려 더 빠르게 학습할 길을 열었고, 이후 세대가 이를 더 다듬었어.
긴 스트리밍에서 강해
Mamba는 길이가 충분히 커지면 비슷한 트랜스포머보다 빠르고 메모리 효율이 좋아질 수 있어. 전사, 로그 분석, 실시간 감시처럼 시퀀스가 계속 흐르는 작업에서 특히 매력적이야.
아직 약한 자리
- 정확한 장거리 회상: 과거를 고정 크기 상태로 압축하므로 아주 먼 곳의 사실을 그대로 꺼내기 어려울 수 있어.
- 프런티어 규모 학습: 10B를 훌쩍 넘는 순수 SSM 사례가 드물어 확장 법칙의 확신이 낮아.
- 긴 추론: 생각 토큰 사이의 정확한 회상이 중요한 작업에서는 어텐션의 강점이 커.