피파 한 줄 정리: 작업의 글자·미감·정밀도·일관성·속도 요구를 먼저 적고 그 강점을 가진 모델을 붙여. 모델 하나로 전 과정을 밀지 마.
머릿속 모형: 렌치와 드라이버와 망치로 모두 못을 두드릴 수는 있지만 그 일을 위해 설계된 것은 망치다. 생성 모델도 억지로 시키면 대부분의 작업을 흉내 낼 수 있지만 알맞은 도구는 시간, 돈, 좌절을 줄인다.
개념 미술과 분위기 탐색
Midjourney v7 Draft Mode가 빠른 생성과 강한 미적 의견으로 시각 방향을 넓게 찾는다. 요청하지 않은 구도 판단까지 더하는 성격이 개념 미술에는 장점이 된다.
썸네일과 소셜 그래픽
GPT-Image 1.5의 글자 정확도는 제목, 채널명, 오버레이가 중요한 썸네일에 맞다. “제목을 더 크게”, “배경색을 바꿔”처럼 대화 맥락으로 부분을 반복 수정할 수 있다.
제품 시각화
Imagen 4 Ultra·FLUX.2 Pro는 과도한 예술적 해석으로 제품 형태를 왜곡하지 않고 정밀한 모양, 일관된 조명, 깨끗한 배경을 만드는 데 강하다.
캐릭터 디자인과 삽화
초기 개념은 Midjourney v7로 풍부하게 만들고, 여러 자세와 장면의 일관성은 맞춤 LoRA를 쓴 Stable Diffusion 생태계로 이어 간다.
광고와 상업 작업
읽히는 글자는 GPT-Image 1.5, 세련된 화면은 Midjourney v7에 맡긴다. 둘 다 필요한 상업물은 단일 모델보다 여러 모델 조합이 낫다.
스토리보드
미세 마감보다 구도, 프레이밍, 서사의 명료성과 물량이 중요하므로 Midjourney Draft, FLUX Schnell, Imagen 4 Fast 같은 빠른 모델이면 충분하다.
짧은 영화 클립과 스타일 영상
움직임 품질, 시간 일관성, 네이티브 오디오가 필요한 영웅 영상은 Runway Gen-4.5·Veo 3.1에 투자한다. 애니메이션·삽화·수묵화·게임 CG처럼 비사실적이고 시작·끝 프레임 제어가 중요한 영상은 Hailuo/MiniMax 2.3이 맞는다.
말하는 얼굴과 더빙
Kling 3.0 + ElevenLabs로 비용 효율적인 화면과 고품질 음성을 따로 만든 뒤 동기화할 수 있다. 더빙은 감정과 다국어에 강한 ElevenLabs, 민감한 콘텐츠의 사생활과 비용은 직접 호스팅하는 Voxtral이 알맞다.
- 글자, 스타일, 속도, 일관성 같은 작업 특성을 모델의 강점에 연결해.
- 전문 작업은 대개 모델 하나보다 여러 모델을 단계별로 잇는다.
- 반복해서 직접 시험해야 선택 기준이 직관으로 자리 잡는다.