피파 한 줄 정리: ElevenLabs는 프리미엄 품질과 복제, OpenAI TTS는 개발과 비용, Voxtral은 개방성과 사생활, Cartesia는 실시간 지연에 강해.
머릿속 모형: 음성 모델을 세션 연주자라고 생각해 봐. 감정과 음역이 탁월하지만 비싼 연주자, 늘 일정하고 저렴하게 불러 쓸 수 있는 연주자, 자유롭게 데려가 쓸 수 있는 개방형 거리 연주자가 있다. 녹음 목적이 달라지면 알맞은 사람도 달라져.
ElevenLabs: 프리미엄 스튜디오
자연스러움 벤치마크 9.5/10으로 음성 품질의 기준으로 남아 있다. 30개가 넘는 언어에 100개가 넘는 기본 음성을 제공하고 즉석·전문 음성 복제와 속삭임, 흥분, 침착함, 권위 같은 섬세한 감정 제어를 지원한다. 대규모 기준 문자 100만 개당 약 300달러로 비싸지만 오디오북, 캐릭터 연기, 사람과 구별하기 어려운 브랜드 음성에 알맞다.
OpenAI TTS: 개발자의 작업마
간단한 API, 57개가 넘는 언어, 문자 100만 개당 15달러로 개발 경험과 비용이 강하다. ElevenLabs보다 20배 저렴하지만 기본 음성은 여섯 개이고 음성 복제가 없다. 자연스러움은 약 8.5/10으로 나란히 비교하면 뒤지지만 단독으로 들으면 대부분 알아차리지 못할 품질이라 앱 음성, 대규모 내레이션, 빠른 시안에 맞는다.
Mistral Voxtral TTS: 개방형 도전자
2026년 3월 공개된 40억 매개변수 개방형 가중치 모델이다. 블라인드 테스트에서 ElevenLabs Flash v2.5를 상대로 68.4% 승률을 보였고, 문자 100만 개당 16달러로 비용이 73% 낮다. 16GB 이상 VRAM의 단일 GPU에서 실행해 완전한 사생활 보호와 무제한 생성을 원하는 조직이 직접 호스팅할 수 있다.
Cartesia: 속도 전문가
첫 오디오까지 100ms 미만의 지연으로 실시간 대화형 AI에 집중한다. 몇 밀리초의 지연도 몰입을 깨는 음성 에이전트, 상호작용 캐릭터, 실시간 번역에 맞춘 도구다.
- 주요 플랫폼의 음성은 사람과 구별하기 어려운 단계에 와 경쟁 축이 비용, 제어, 기능으로 이동했다.
- ElevenLabs는 품질과 기능, OpenAI TTS는 개발 편의와 비용, Voxtral은 개방성과 사생활을 이끈다.
- 복제, 지연, 사생활, 예산 중 실제로 필요한 조건에서 모델을 골라.