"Apple Silicon 엔 좋은 귀가 넷 있어. 네 목소리엔 기본을 고르고, 나머지는 어댑터로 둬."
협상 불가: 온디바이스
엔진 비교 전에, 시장 대부분을 제거하는 한 규칙: 엔진은 기계 위에서 돌아야 해. 클라우드 API 가 더 정확할 수 있지만, Firekeeper 를 정당화하는 두 약속 — 오디오가 로컬에 남고 오프라인으로 됨 — 을 깨. 그래서 아래 모든 엔진이 온디바이스야. 그중 선택은 속도, 언어 처리, 패키징에 관한 거지 '오디오가 떠나야 하나?' 가 아냐. 그 답은 늘 아니오야.
네 엔진
엔진 성격 Firekeeper 에서 역할
---- ---- -----------------
WhisperKit Swift 네이티브, 기본. 한/영 혼합 처리.
Core ML large-v3-turbo 모델.
Apple SpeechAnalyzer macOS 26 API, 빠른 2번 엔진. 모델 파일
무다운로드 없음. 스트리밍 친화.
whisper.cpp C/C++, Core ML 폴백 / 벤치마크 하니스.
MLX Whisper Python, MLX 선택적 배치 '파워 모드'.
WhisperKit 이 기본인 건 Swift 네이티브고, Core ML 최적화됐고, 결정적으로 아빠의 한/영 혼합 말을 처리해서야. Apple SpeechAnalyzer(macOS 26)는 빠른 두 번째 엔진: 관리할 모델 파일 없음, 네이티브 스트리밍, 근데 두 레슨 뒤 부딪힐 언어 함정이 있어. whisper.cpp 는 성숙한 폴백이고 CLI 벤치마크 하니스의 자연스러운 집. MLX Whisper 는 배치 작업용 Python 기반 파워 모드 — 긴 녹음엔 좋고, 패키징된 앱엔 틀려.
기본 더하기 어댑터
모양을 봐: 기본 하나 더하기 어댑터 여럿. 엔진 하나를 영원히 고르는 게 아니라; 흔한 경우엔 기본을 고르고 나머지는 공통 인터페이스 뒤에서 갈아끼울 수 있게 둬. 엔진은 텍스트 와 감지한 언어를 돌려줘서, 앱 나머지는 넷 중 뭐가 단어를 만들었는지 신경 쓸 필요가 절대 없어. 그 인터페이스가 다음 트랙의 주제 전체야 — 여기선 '어느 STT 엔진' 이 영구 결혼이 아니라 런타임 선택이란 것만 새겨.