작업별 실용 지침
2025년까지 쌓인 연구와 제품 경험을 기준으로 보면 선택은 이렇게 나눌 수 있어.
- 32K 토큰 미만의 일반 NLP에서 품질이 우선이라면 표준 Transformer에 FlashAttention-3와 GQA를 써. 최적화된 기준 모델이 워낙 강해서 구조를 바꾸며 생기는 비용이 절감분보다 클 수 있어.
- 법률, 의료, 코드처럼 32–128K 문맥을 쓰는 기업 작업에는 Jamba, Nemotron-H, Granite 4.0 같은 SSM-어텐션 하이브리드가 비용과 품질의 균형이 좋아. 희소 어텐션만으로는 비용 차이를 다 메우지 못할 수 있어.
- 문맥 길이가 달라지는 엣지 또는 기기 내 서비스에는 추론 메모리가 일정한 순수 SSM이나 RWKV가 어울려.
- 복잡한 수학, 여러 단계 논리, 도구 사용 같은 최전선 추론에서는 비용이 들더라도 회상 품질을 포기하기 어려우니 순수 Transformer가 안전해.
- 아주 긴 문서의 요약이나 검색에서 작은 품질 차이를 받아들일 수 있다면 Kimi Linear급 linear attention을 검토해. 성숙도가 더 중요하면 sliding window가 현실적인 선택이야.
실제 속도가 뒤집히는 지점
SSM이나 하이브리드가 논문 속 FLOP이 아니라 실제 지연 시간에서 Transformer를 앞서기 시작하는 지점은 대략 20–30K 토큰이야. 그보다 짧으면 FlashAttention-3, GQA, sliding window를 적용한 Transformer가 더 좋은 상수 계수와 성숙한 커널, 검증된 도구 덕분에 실제로 더 빠른 경우가 많아. 32K를 넘으면 대안이 빠르게 따라잡고 128K에서는 차이가 결정적으로 벌어져.
결정하기 전에 길이 분포부터 재
아키텍처를 고르기 전에 가장 먼저 알아야 할 건 작업의 시퀀스 길이 분포야. P95 입력 길이가 4K라면 대안 구조가 유리한 구간에 거의 들어가지 않아. 효율이 필요하면 Transformer에 희소 어텐션을 더하고, 단순함이 중요하면 기본 Transformer를 그대로 쓰면 돼. P95가 64K라면 선택이 성능과 비용을 실제로 바꾸는 구간이니 직접 벤치마크해야 해.
많은 팀이 자기 작업보다 논문에서 화제가 된 구조를 보고 선택해. 그러지 마. “요청의 99%가 8K보다 짧다”는 지루한 측정값은 이 퀘스트에 나온 대안을 전부 미루고 FA3와 GQA에 머물러도 되는 충분한 근거야.