누적된 규모부터 달라
Hugging Face에는 75만 개가 넘는 모델 체크포인트와 400개가 넘는 지원 아키텍처가 있고, 압도적 다수는 Transformer 계열이야. vLLM, SGLang, TensorRT-LLM은 모두 Transformer의 KV 캐시 관리에 깊이 최적화돼 있어. FlashAttention-3는 H100 이론 최고 성능의 85%까지 끌어냈고. Transformer 생태계에는 머신러닝 역사상 가장 큰 규모의 소프트웨어와 도구 투자가 쌓여 있어.
홍보 문구가 아니라 팀 생산성을 직접 몇 배로 바꾸는 기반이야. Transformer 모델은 이 투자를 거의 공짜로 물려받지만 대안 아키텍처는 vLLM 지원, 양자화 조리법, 미세 조정 틀, 평가 도구, RLHF 파이프라인, 배포 도구, 감시 체계, 새 하드웨어용 실행 커널을 하나씩 확보해야 해.
팀에게 “생태계”는 몇 주의 차이야
2026년의 일반적인 공학 팀에서 생태계 성숙도는 절약되는 작업 시간을 주 단위로 바꿔. “Llama 3 모델을 제품에 넣으려면 FP8 양자화가 필요하다”는 이미 검증된 구현이 여럿 있는 표준 작업이야. 반면 Mamba 모델에 같은 지원이 필요하면 연구 프로젝트가 될 수 있어. Speculative decoding, 구조화 생성, 함수 호출, 다중 양식 확장에서도 같은 차이가 반복돼. Transformer가 가는 길은 포장돼 있지만 대안 앞에는 아직 자갈길이 많이 남아 있어.
Hugging Face Transformers v5 — 네트워크 효과가 더 커져
Hugging Face Transformers v5(2025.12)는 상호 운용성을 핵심 기능으로 끌어올렸어. transformers 라이브러리에 추가된 모델이 vLLM, SGLang, llama.cpp, MLX를 비롯한 주요 실행 환경에서 자동으로 작동하도록 연결해. 어느 실행 환경에서 새 최적화가 생겨도 Hugging Face의 Transformer 모델들이 함께 이득을 보는 순환이 만들어진 거야. 대안 아키텍처는 연동마다 별도 지원을 확보해야 하고.
작은 생태계 차이는 시간이 갈수록 큰 격차가 돼. 신생 기업이 제품에 Llama 3와 Mamba 중 하나를 넣는다면 Llama 경로는 다음 주에 배포할 수 있지만, Mamba 경로는 한 분기 동안 기반 시설을 만들게 할 수 있어. 이 비대칭 때문에 대안이 계속 흥미로운 후보로 남으면서도 기본 선택이 되기는 어려워.