본문 바로가기
C.W.K.
Stream
Lesson 02 of 05 · published

효율형 어텐션으로 충분할 때

~11 min · sliding-window, sparse, 32k-64k

Level 0관찰자
0 XP0/50 lessons0/14 achievements
0/100 XP to next level100 XP to go0% complete

효율형 어텐션이 가장 잘 맞는 구간

대부분의 시퀀스가 64K 토큰보다 짧고 정확한 회상이 중요하다면 효율적인 Transformer가 실용적인 선택이야. Mistral식 sliding window, KV head를 적극적으로 줄인 GQA, NSA식으로 학습한 희소성은 기존 스택의 다른 요소와 잘 맞고 아키텍처를 처음부터 다시 학습하지 않아도 적용할 수 있어.

충분히 효율적인 Transformer가 생태계 지원이 부족한 “이론적으로 더 나은” 대안을 제품에서는 이기기도 해. 미성숙한 대안이 품질을 10% 잃으면 추론 비용을 3배 줄여 얻는 이익보다 버그, 지원 시간, 빠진 기능 때문에 드는 비용이 더 클 수 있어.

실제 속도가 뒤집히는 지점

20–30K 토큰보다 짧은 구간에서는 FlashAttention-3, GQA, sliding window를 적용한 Transformer가 SSM과 하이브리드보다 실제 경과 시간 측정에서 더 빠른 경우가 많아. 점근적 복잡도의 이점은 상수 계수가 지배하는 구간을 지나야 드러나거든. P95 입력이 20K보다 짧다면 교차점 아래에 있으므로 Transformer 이후 논문을 당장 스택을 바꿀 이유처럼 읽지 않아도 돼.

“선형이면 언제나 더 빠르다”는 오해야

20–30K 토큰 아래에서는 최적화된 Transformer가 실제 지연 시간에서 이길 수 있어. 교차점은 하드웨어, 배치 크기, 구현 성숙도에 따라 달라져. 더 빠른 GPU, 큰 배치, 성숙한 커널은 Transformer가 이기는 구간을 더 길게 밀어. FlashAttention-3를 쓰는 2026년 H100은 단순한 어텐션을 쓰는 2024년 A100보다 훨씬 긴 지점에서야 선형 구조에 역전될 수 있어.

그래서 항상 실제 작업으로 벤치마크해야 해. “Linear attention이 더 빠르다”는 말은 시퀀스 길이와 하드웨어 조건이 없으면 거의 의미가 없어. “배치 크기 4, 64K 토큰, H100에서 더 빠르다”처럼 조건이 붙어야 제품 결정에 쓸 수 있는 주장이 돼.

External links

Exercise

워크로드에서 가장 짧은 입력, 중간 길이 입력, 가장 긴 입력을 대표 표본으로 골라. 기본 attention, FlashAttention, sliding window를 쓴 같은 Transformer에서 각각 시간을 재. 목표는 곧바로 아키텍처를 바꾸는 게 아니라 현재 stack이 내는 실제 숫자를 아는 거야. 그 숫자가 있으면 이후의 구조 변경 논의가 훨씬 구체적이 돼.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.