벽에 붙여 둘 표
아래는 2026년 제품 결정을 위한 실용 비교표야. 출력하거나 화면 옆에 붙여 두고 아키텍처를 결정하기 전에 확인해.
| 아키텍처 | 핵심 아이디어 | 주된 장점 | 주된 약점 | 가장 잘 맞는 사례 | 상태(2026) |
|---|---|---|---|---|---|
| Transformer | 완전한 토큰 쌍 어텐션 | 최고의 회상, 가장 성숙한 생태계 | O(n²) 비용, 계속 자라는 KV 캐시 | 32K 미만 일반 NLP, 최전선 추론 | 지금 사용 |
| 효율형 Transformer(FA3 + GQA + sliding window) | 공학적 개선을 더한 표준 어텐션 | 실용적이고 생태계와 완전히 호환 | 창을 넘으면 근본적으로 여전히 제곱 비용 | 64K 토큰까지, 회상이 중요한 작업 | 지금 사용 |
| Mamba / SSM | 선택적 상태 공간 압축 | 선형 시간, O(1) 추론 메모리 | 약한 회상, 좁은 학습률 구간 | 처리량 또는 메모리가 병목인 긴 문맥 | 면밀히 관찰 |
| RWKV | RNN-Transformer 이중 표현 | 토큰당 일정한 비용, 15억 기기에서 검증 | 작은 생태계, 약 28K 회상 한계 | 기기 내, 스트리밍, 엣지 | 면밀히 관찰 |
| RetNet | 지수 감쇠 retention | 세 가지 계산 방식 | 데이터와 무관한 감쇠가 표현력을 제한 | 기초 연구, 개념적 영향 | 연구 |
| Hyena | 암시적 장거리 합성곱 | 64K+에서 어텐션보다 100배 빠름 | 약한 회상, 제한적인 언어 품질 | 유전체학, 바이트 단위, 매우 긴 시퀀스 | 분야별 관찰 |
| SSM-어텐션 하이브리드 | 다수의 SSM + 드문 어텐션 층 | 가장 좋은 품질·효율 균형 | 처음부터 설계할 때 생기는 구조적 복잡성 | 긴 문맥 제품(32K–1M) | 지금 사용 |
| Linear Attention(Kimi Linear, MHLA) | 상태 구조를 갖춘 더 영리한 linear attention | Transformer에 바로 끼울 수 있고 속도 향상이 큼 | 더 새롭고 검증이 덜 됨 | 긴 문맥 요약, 스트리밍 | 면밀히 관찰 |
이 표를 읽는 법
지금 사용은 제품에 쓸 준비가 됐고 도구가 성숙해 팀과 CFO에게 근거를 댈 수 있다는 뜻이야. 면밀히 관찰은 실제 제품 배포가 존재하고 아키텍처가 굳어 가는 단계라, 작업이 요구한다면 2026년에 평가할 수 있어야 한다는 뜻이야. 연구는 개념적으로 중요하고 이해할 가치가 있지만, 2026년에 경쟁 대안 대신 고를 제품 사례는 아직 없다는 뜻이야.