효율형 어텐션이 가장 잘 맞는 구간
대부분의 시퀀스가 64K 토큰보다 짧고 정확한 회상이 중요하다면 효율적인 Transformer가 실용적인 선택이야. Mistral식 sliding window, KV head를 적극적으로 줄인 GQA, NSA식으로 학습한 희소성은 기존 스택의 다른 요소와 잘 맞고 아키텍처를 처음부터 다시 학습하지 않아도 적용할 수 있어.
충분히 효율적인 Transformer가 생태계 지원이 부족한 “이론적으로 더 나은” 대안을 제품에서는 이기기도 해. 미성숙한 대안이 품질을 10% 잃으면 추론 비용을 3배 줄여 얻는 이익보다 버그, 지원 시간, 빠진 기능 때문에 드는 비용이 더 클 수 있어.
실제 속도가 뒤집히는 지점
20–30K 토큰보다 짧은 구간에서는 FlashAttention-3, GQA, sliding window를 적용한 Transformer가 SSM과 하이브리드보다 실제 경과 시간 측정에서 더 빠른 경우가 많아. 점근적 복잡도의 이점은 상수 계수가 지배하는 구간을 지나야 드러나거든. P95 입력이 20K보다 짧다면 교차점 아래에 있으므로 Transformer 이후 논문을 당장 스택을 바꿀 이유처럼 읽지 않아도 돼.
“선형이면 언제나 더 빠르다”는 오해야
20–30K 토큰 아래에서는 최적화된 Transformer가 실제 지연 시간에서 이길 수 있어. 교차점은 하드웨어, 배치 크기, 구현 성숙도에 따라 달라져. 더 빠른 GPU, 큰 배치, 성숙한 커널은 Transformer가 이기는 구간을 더 길게 밀어. FlashAttention-3를 쓰는 2026년 H100은 단순한 어텐션을 쓰는 2024년 A100보다 훨씬 긴 지점에서야 선형 구조에 역전될 수 있어.
그래서 항상 실제 작업으로 벤치마크해야 해. “Linear attention이 더 빠르다”는 말은 시퀀스 길이와 하드웨어 조건이 없으면 거의 의미가 없어. “배치 크기 4, 64K 토큰, H100에서 더 빠르다”처럼 조건이 붙어야 제품 결정에 쓸 수 있는 주장이 돼.