OpenAI audio API 는 세 갈래로 나뉘어. TTS 는 gpt-4o-mini-tts 로 text 를 audio 로 바꾸고, 전사는 gpt-4o-transcribe 로 audio 를 text 로 바꾸며, Realtime은 websocket 에서 양방향 저지연 voice agent 를 만들어.
TTS — text-to-speech
client.audio.speech.create(model='gpt-4o-mini-tts', voice='nova', input='...') 로 MP3, Opus, WAV 를 만들 수 있어. 여러 voice 중 제품 character 와 어울리는 tone 을 골라.
전사 — speech-to-text
client.audio.transcriptions.create(model='gpt-4o-transcribe', file=...) 로 WAV, MP3, M4A 등을 text 로 바꿔. 단어별 timestamp 는 caption 과 음성 검색에 활용할 수 있어.
Realtime — 실시간 voice agent
말을 들으면서 바로 답하는 경험에는 Realtime websocket 을 써. connection 하나에서 audio input 과 output 이 함께 흐르므로 TTS 와 STT 를 따로 이어붙이는 방식보다 지연을 줄일 수 있어.
cwkPippa 의 TTS 선택
cwkPippa 는 더 풍부한 prosody 를 위해 ElevenLabs 의 Joanne voice 를 기본으로 쓰고, MD5 cache 로 같은 문장을 다시 생성하지 않아. 높은 음성 표현력이 필요하지 않은 작업에는 OpenAI TTS 가 단순한 선택이 될 수 있어.