본문 바로가기
C.W.K.
Stream
Lesson 02 of 05 · published

Mamba와 상태 공간 모델의 선형 확장

~12 min · frontier, mamba, ssm

Level 0정찰자
0 XP0/41 lessons0/12 achievements
0/100 XP to next level100 XP to go0% complete

어텐션의 제곱 비용을 피하려는 베팅

트랜스포머 어텐션은 시퀀스 길이에 대해 O(n²)로 커져. 길이가 두 배면 어텐션 연산은 네 배가 될 수 있어. 상태 공간 모델(SSM)은 어텐션을 O(n)으로 자라는 상태 갱신으로 바꿔 매우 긴 시퀀스에서 구조적인 이점을 노려.

Mamba는 입력에 따라 기억을 골라

S4와 S5 같은 초기 SSM은 상태 갱신 규칙이 입력과 무관했어. Mamba는 현재 토큰에 따라 과거 상태를 얼마나 유지하고 잊고 갱신할지 선택하는 구조를 도입했어. 이 선택성이 어텐션과의 품질 차이를 줄이면서 선형 확장의 장점을 남겼지.

어텐션은 다시 보고, SSM은 요약해 들고 가

어텐션은 이전 토큰을 유사도에 따라 다시 살펴봐. SSM은 고정 크기의 상태를 들고 가며 새 토큰마다 갱신하고 원래 토큰 자체는 놓아. 앞쪽은 정확한 회상에 강하지만 길이가 늘수록 비싸고, 뒤쪽은 메모리가 제한된 대신 선형으로 확장돼.

Mamba 2의 이중성

Mamba 2는 선택적 SSM과 어텐션을 구조화 상태 공간 이중성이라는 틀에서 비슷한 계산의 다른 표현으로 묶었어. 덕분에 어텐션 공학의 최적화 기법을 일부 빌려 더 빠르게 학습할 길을 열었고, 이후 세대가 이를 더 다듬었어.

긴 스트리밍에서 강해

Mamba는 길이가 충분히 커지면 비슷한 트랜스포머보다 빠르고 메모리 효율이 좋아질 수 있어. 전사, 로그 분석, 실시간 감시처럼 시퀀스가 계속 흐르는 작업에서 특히 매력적이야.

아직 약한 자리

  • 정확한 장거리 회상: 과거를 고정 크기 상태로 압축하므로 아주 먼 곳의 사실을 그대로 꺼내기 어려울 수 있어.
  • 프런티어 규모 학습: 10B를 훌쩍 넘는 순수 SSM 사례가 드물어 확장 법칙의 확신이 낮아.
  • 긴 추론: 생각 토큰 사이의 정확한 회상이 중요한 작업에서는 어텐션의 강점이 커.

Code

선택적 SSM 상태 갱신: 직관용 의사 코드·python
def selective_ssm_step(x_t, h_t, A, B, C, delta_t):
    # x_t: current input token's hidden representation
    # h_t: state carried from previous step
    # delta_t: input-dependent step size — the 'selective' part
    h_t_new = (1 - delta_t) * (A @ h_t) + delta_t * (B @ x_t)
    y_t = C @ h_t_new
    return y_t, h_t_new
# Linear in sequence length — no quadratic attention computation.

External links

Exercise

Mamba 논문에서 시퀀스 길이별 추론 지연 시간을 트랜스포머와 비교한 부분을 읽어. 평소 작업의 컨텍스트 길이에서 어느 쪽이 빠른지 표시해. 4K 아래와 32K 위에서 판단이 어떻게 달라지는지도 적어.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.