피파 한 줄 정리: 출력 형식 → 품질 단계 → 특별 요구 → 예산 → 제어 순서로 물어. 유행이 아니라 작업에서 출발하면 후보의 80%를 빠르게 지울 수 있어.
머릿속 모형: 공구점에서 드릴 50종 앞에 서 있다고 해 보자. 좋은 점원이 “무엇을 뚫을 건가, 얼마나 자주 쓰나, 예산은 얼마인가?”를 물으면 45개가 바로 탈락한다. 모델도 도구 이름보다 작업 질문에서 시작해야 한다.
작업 우선 결정 트리
시작: 무엇을 만드는가? │ ├─ 정지 이미지 │ ├─ 정확한 글자? → GPT-Image 1.5 │ ├─ 미적 스타일 우선? → Midjourney v7 │ ├─ 맞춤 미세조정? → FLUX 또는 Stable Diffusion │ ├─ 대량 일괄 작업? → Imagen 4 Fast │ └─ 사생활·직접 호스팅? → 로컬 FLUX.1 Schnell │ ├─ 비디오 │ ├─ 최대 시각 품질? → Runway Gen-4.5 또는 Veo 3.1 │ ├─ 예산 중심 짧은 클립? → Kling 3.0 │ ├─ 스타일·애니메이션? → Hailuo/MiniMax 2.3 │ ├─ 개방형 필요? → LTX-2 또는 Wan 2.6 │ └─ 네이티브 오디오? → Runway Gen-4.5 또는 Veo 3.1 │ ├─ 음성·오디오 │ ├─ 프리미엄 내레이션? → ElevenLabs │ ├─ 대규모 개발 통합? → OpenAI TTS │ ├─ 직접 호스팅·사생활? → Voxtral │ └─ 실시간 대화? → Cartesia │ └─ 아직 모름 → 여러 빠르고 저렴한 모델로 먼저 탐색
다섯 질문 필터
- 출력 형식: 이미지, 비디오, 음성, 조합 중 정확히 무엇을 만들까?
- 품질 단계: 탐색, 제작 초안, 최종 납품 중 어디인가?
- 특별 요구: 글자, 캐릭터 일관성, 특정 스타일, 사생활이 필요한가?
- 예산: 한 개당 허용 비용과 예상 물량은 얼마인가?
- 제어: 느슨한 영감과 정확한 사양 중 어느 정도로 지휘해야 하는가?
흔한 선택 오류
화제를 따라 작업과 무관한 모델을 고르고, 10% 나은 품질에 다섯 배 비용을 내고, 모델 하나로 모든 일을 하며, 평균 프롬프트의 Elo를 내 요구보다 믿고, 편집·API·커뮤니티 생태계를 무시하는 실수가 반복된다. 실제 전문가는 잘 아는 모델 두세 개를 단계별로 쓰고 새 모델이 자기 사용 사례를 분명히 개선할 때만 교체한다.
핵심 정리
- 순위보다 작업 요구에서 시작하면 다섯 질문으로 잘못된 후보 대부분을 지울 수 있다.
- 출시마다 옮겨 다니기보다 깊이 아는 모델 두세 개의 작은 도구함을 만들어.
- 추상적인 최고 모델이 아니라 내 작업 흐름의 각 단계에 가장 맞는 모델을 찾는 것이 목표다.