본문 바로가기
C.W.K.
Stream
Lesson 01 of 05 · published

모든 대안이 어텐션을 버리지는 않아

~11 min · taxonomy, transformer-friendly

Level 0관찰자
0 XP0/50 lessons0/14 achievements
0/100 XP to next level100 XP to go0% complete

어텐션의 틀 안에 있는 세 계열

어텐션의 틀 안에서는 세 가지 접근이 주류야. 커널화 어텐션은 커널 함수로 softmax를 근사해 연산량이 시퀀스 길이에 따라 선형으로 늘도록 분해해. 희소 어텐션은 sliding window, 전역 토큰, 학습된 희소 무늬 등을 이용해 일부 토큰에만 어텐션을 줘. 구조화 어텐션은 효율을 높이려고 연산 순서나 어텐션의 형태를 다시 짜. Multi-head latent attention, grouped attention, multi-query attention이 여기에 속해.

세 접근의 공통점은 밖에서 볼 때 어텐션이라는 틀을 그대로 유지한다는 거야. FlashAttention-3로 학습한 모델도 스택의 나머지를 바꾸지 않고 한 층을 sliding-window attention으로 교체할 수 있어. 이 바로 끼워 넣을 수 있는 호환성이 결정적인 장점이야. vLLM, SGLang, TRT-LLM, HF Transformers를 비롯한 Transformer 생태계는 유지하면서 비용만 낮출 수 있거든.

왜 전략적으로 중요할까

2026년의 대부분 팀에게 기본 Transformer를 개선하는 현실적인 경로는 “Mamba로 교체”가 아니라 “일부 어텐션 층을 희소 어텐션으로 교체”하는 거야. 여전히 어텐션이라는 틀 안에 있으니 구조적 위험이 낮고, 긴 문맥에서 효율을 1.5–4배 높일 여지도 의미가 있어. Mamba나 RWKV처럼 완전히 대체하는 아키텍처는 훨씬 큰 결단이 필요해.

게다가 2023년부터 2026년까지 등장한 Transformer 개선안 가운데 실제 제품에 가장 많이 들어간 것도 이 갈래야. GQA, MQA, sliding window, NSA, MoBA, Kimi Linear는 완전 대체형 아키텍처보다 훨씬 빨리 연구에서 제품으로 넘어왔어. 기존 생태계가 주는 이점도 계속 쌓여. 이 갈래의 개선은 FlashAttention-3, GQA, speculative decoding, 양자화 위에 그대로 얹을 수 있지만 완전 대체형 아키텍처는 연동 작업을 처음부터 다시 해야 할 때가 많아.

External links

Exercise

Sliding-window attention을 지원하는 Hugging Face Transformers 모델을 하나 골라. 대표적인 선택은 Mistral 7B야. 문맥 32K에서 추론 벤치마크를 두 번 돌려 봐. 한 번은 기본 완전 어텐션으로, 다른 한 번은 sliding window를 켜고 실행해. 초당 토큰 수와 최대 메모리를 측정해. 모델을 망가뜨리지 않으면서 sliding-window 실행 비용이 눈에 띄게 낮아져야 해. 그게 바로 이 갈래의 가치야.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.