본문 바로가기
C.W.K.
Stream
Lesson 01 of 10 · published

이미지 모델 지형 읽기

~12 min · models, tradeoffs, l1

Level 0첫 불꽃
0 XP0/100 lessons0/14 achievements
0/200 XP to next level200 XP to go0% complete

피파 한 줄 정리: 2026년 초 이미지 모델은 글자·대화 편집, 미감, 개방형 사실성, 생태계, 기업 통합처럼 서로 다른 축을 이끌어. ‘최고’는 작업마다 달라.

머릿속 모형: DSLR, 스마트폰, 중형 필름 카메라, 즉석카메라는 모두 사진을 찍지만 잘하는 장면과 약점이 다르다. 무엇을 찍고, 얼마나 빨리 필요하고, 결과를 어디에 쓸지 모르면 최고의 카메라를 고를 수 없다. 이미지 모델 선택도 같은 문제야.

OpenAI GPT-Image 1.5

GPT-4o 안의 이미지 생성과 전용 GPT-Image 1.5 API는 대화 맥락을 쓰는 방식이 특징이다. “그 배경을 더 따뜻하게”라고 해도 ‘그것’이 무엇인지 앞 대화에서 찾는다. 표지판, 라벨, UI 목업, 밈처럼 글자가 정확해야 하는 이미지의 텍스트 렌더링을 이끌고 있다. 이전 모델보다 네 배 빠르고 저렴하며 품질과 해상도에 따라 이미지당 API 가격은 0.009–0.133달러다.

Midjourney v7

2025년 중반 기본 모델이 된 Midjourney v7은 미감 엔진에 가깝다. 따뜻함, 풍부함, 세련된 구도라는 뚜렷한 의견을 내며 사진 정확도보다 분위기가 중요한 캠페인 개념, 무드보드, 편집 삽화에 강하다. Draft Mode는 절반 비용에 열 배 속도로 탐색하고, Omni Reference는 정체성·스타일·구도의 시각 참조를 보존한다.

Black Forest Labs FLUX

FLUX는 개방형 벤치마크 선두다. Apache 2.0 라이선스의 FLUX.1 Schnell은 네 번의 추론 단계로 몇 초 안에 사실적인 이미지를 만들고, 320억 매개변수의 FLUX.2 Dev는 로컬 배포 품질을 더 높인다. 사실성, 손 정확도, 프롬프트 준수에서 앞서며 로컬 실행, 미세조정, 제품 통합이 가능해 API 한도와 정책 변화에 덜 의존한다.

Stability AI Stable Diffusion

최신 벤치마크의 꼭대기는 아니어도 생태계 깊이는 독보적이다. 수천 개의 미세조정 모델, 특정 스타일용 LoRA, ComfyUI와 InvokeAI가 가장 깊은 맞춤 파이프라인을 만든다. 특정 애니메이션풍, 건축 렌더, 틈새 삽화처럼 좁은 요구에는 이미 커뮤니티 모델이 있을 가능성이 높다.

Google Imagen 4

Fast는 이미지당 0.02달러이고 Standard와 Ultra까지 세 단계의 품질·비용 사다리를 제공한다. 최대 2K 해상도와 Google AI Studio·Vertex AI 통합을 지원하며, Ultra는 지시를 엄격히 따르는 세부가 많은 장면에 특히 강하다.

핵심 정리
  • 모델마다 미감, 글자 정확도, 개방성, 생태계, 기업 통합이라는 성격이 다르다.
  • 제품명은 몇 달마다 바뀌어도 사실성, 스타일, 글자, 제어, 비용, 개방성이라는 비교 축은 오래간다.
  • 화제가 가장 큰 모델보다 필요한 출력에 맞는 모델을 골라.

External links

Exercise

가장 자주 쓰는 이미지 모델 하나를 고르고 공식 모델 카드를 처음부터 끝까지 읽어. 몰랐던 한계 세 가지와 아직 쓰지 않은 기능 하나를 적어.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.