피파 한 줄 정리: 초보자는 어느 모델이 가장 예쁜지 묻고, 전문가는 생성당 비용·반복 속도·제어 정밀도를 물어. 제작에서는 숨은 세 축이 원본 품질보다 중요할 때가 많아.
벤치마크의 예쁜 한 장만으로는 실제 제작 도구를 고를 수 없다. 얼마나 자유롭게 탐색할 수 있는 비용인지, 한 시간에 몇 번 반복할 수 있는지, 정해진 결과를 얼마나 정확히 만들 수 있는지가 작업의 성패를 좌우해.
비용: 행동을 바꾸는 계산
썸네일 후보 50장을 만든다고 해 보자. 이미지당 0.02달러인 Imagen 4 Fast는 1달러, 0.133달러인 GPT-Image 1.5 High는 6.65달러다. Midjourney 표준은 그 사이에 있다. 매일 한 달 동안 만들면 차이는 수백 달러로 커지고, 비용을 의식한 제작자가 몇 개만 뽑고 탐색을 멈추게 만들 수도 있다.
속도: 반복의 속력
2초에 한 장 만드는 모델은 1분에 30장, 30초 걸리는 모델은 두 장을 보여 준다. 한 시간이라면 1,800장과 120장이다. 속도는 시간을 아끼는 데서 끝나지 않고 발견할 수 있는 창작 방향의 수 자체를 바꾼다. 발상 단계에서 약간의 품질보다 선택지의 폭을 우선하는 Draft·Fast 모드가 존재하는 이유야.
제어 가능성: 전문 제작의 우선순위
- 프롬프트 준수: 지시를 따르는가, 모델 자신의 해석을 덧붙이는가.
- 참조 충실도: 제공한 시각 참조와 얼마나 가깝게 맞는가.
- 편집 정밀도: 다른 곳을 흔들지 않고 요소 하나만 바꿀 수 있는가.
- 일관성: 같은 요청의 반복 결과가 서로 관련된 세계처럼 보이는가.
- 부정 제어: 원하지 않는 요소를 안정적으로 제외할 수 있는가.
Midjourney의 강한 미적 의견은 영감에는 좋지만 정확한 사양에는 거슬릴 수 있다. GPT-Image는 지시를 더 문자 그대로 따르고, ControlNet을 붙인 FLUX는 기하학 정밀도를 준다. 제작 구조와 맞는지는 모델별 제어 성격에 달려 있어.
- 비용은 탐색의 자유, 속도는 발견하는 아이디어 수, 제어는 실행 정밀도를 결정한다.
- 전문 작업에서는 이 세 축이 원본 품질보다 중요할 수 있다.
- 벤치마크 1등보다 현재 작업에서 중요한 축을 최적화하는 모델을 골라.