피파 한 줄 정리: 생성 미디어는 더 이상 무음이 아니야. 2025년 Veo 3가 영상·대사·효과음·음악을 한 프롬프트에서 만들기 시작하며 ‘프롬프트에서 미디어로’의 범위를 바꿨어.
머릿속 모형: 같은 영상을 무음과 소리 있는 상태로 봤던 때를 떠올려 봐. 화면이 아름다워도 무음이면 납작하고 생기가 없다. 문이 열리는 장면은 삐걱임이, 폭우는 빗소리가 있어야 몸으로 느껴진다. 소리는 경험의 절반이고, 생성 미디어도 픽셀만이 아니라 픽셀과 음파를 함께 다루는 문턱을 넘고 있어.
오디오가 작업 흐름을 바꾸는 이유
오랫동안 멋진 영상 클립을 만든 뒤 저작권 문제 없는 음악을 찾고, 내레이션을 녹음하고, 효과음을 수동으로 붙여야 했다. 이제 각 층을 생성하거나 처음부터 함께 만들 수 있다.
- 비디오 모델의 네이티브 오디오: 2025년 5월 출시된 Google Veo 3는 주요 모델 가운데 처음으로 텍스트 하나에서 영상과 동기화된 대사, 환경음, 배경 음악을 함께 생성했다.
- 독립 음성 생성: ElevenLabs와 OpenAI TTS는 1분 오디오로 음성을 복제하고 감정 표현과 30개가 넘는 언어를 다루는 고품질 합성을 빠르고 저렴하게 제공한다.
- 효과음 생성: 발걸음, 천둥, 기계의 웅웅거림처럼 구체적인 소리를 문장으로 만드는 전용 모델이 있다.
- 음악 생성: Suno와 Udio는 프롬프트에서 가사, 악기, 프로덕션을 포함한 노래 전체를 만든다.
2026년 생성 미디어의 층:
┌─────────────────────────────────────────────────┐
│ 최종 출력 │
│ 영상 + 대사 + 효과음 + 음악 │
└───────────────────┬─────────────────────────────┘
│
┌───────┬───────┬───┴───┬─────────┐
│ 영상 │ 음성 │ 효과음 │ 음악 │
│ 생성 │ 생성 │ 생성 │ 생성 │
└───┬───┘└──┬───┘└──┬───┘└───┬────┘
│ │ │ │
개별 모델 또는 통합 멀티모달 모델
무음 도구에서 멀티모달 시스템으로
2년 전 “붐비는 카페에서 바리스타가 우유 거품을 낸다”는 문장은 무음 영상을 만들었다. 이제 알맞은 모델이라면 영상뿐 아니라 증기의 쉭 소리, 부딪히는 잔, 배경의 대화, 잔잔한 재즈까지 함께 만들 수 있다. 프롬프트 하나가 여러 감각의 미디어를 내놓는 파이프라인으로 변하는 중이야.
핵심 정리
- 현대 생성 미디어는 음성, 효과음, 음악, 환경음을 포함한다.
- Veo 3 같은 네이티브 오디오 비디오 모델은 일부 작업에서 별도 오디오 후반 작업을 줄인다.
- ElevenLabs·OpenAI TTS 음성, 효과음, 음악 생성은 제작에 쓸 수 있는 단계다.
- 프롬프트 하나에서 영상과 오디오를 함께 만드는 멀티모달 흐름이 자리 잡고 있다.