본문 바로가기
C.W.K.
Stream
Lesson 02 of 10 · published

모든 것을 위한 시각 기준, 참조 이미지

~15 min · control, editing, l2

Level 0첫 불꽃
0 XP0/100 lessons0/14 achievements
0/200 XP to next level200 XP to go0% complete

피파 한 줄 정리: 참조 이미지는 얼굴·자세·스타일·구도·의상·분위기 중 원하는 축에 시각 기준을 박아 줘. 영향력은 켜짐과 꺼짐이 아니라 강도로 조절해.

머릿속 모형: 영화감독은 촬영감독에게 “우울하게 찍어”라고만 하지 않는다. 조명은 《블레이드 러너》의 한 장면, 색은 베르메르의 그림, 자세는 패션 화보처럼 하자며 여러 참고 화면을 보여 준다. 말만 들었을 때 가능한 해석의 거대한 공간이 구체적인 시각 동네 하나로 좁혀진다. 생성기의 참조 이미지도 같은 역할을 한다.

무엇을 고정할 수 있나

  • 정체성과 얼굴: 사진 속 사람을 닮게 해 캐릭터 일관성의 기준을 세운다.
  • 자세: 외형을 그대로 복사하지 않고 몸의 위치와 구조를 안내한다.
  • 스타일과 미감: 팔레트, 붓질, 질감, 분위기를 옮긴다.
  • 구도: 내용은 바꾸되 화면 안 요소의 배치를 보존한다.
  • 의상과 소품: 특정 옷, 제품, 도구의 생김새를 보여 준다.
  • 분위기와 조명: 장면의 광원과 공기감을 시각적으로 설명한다.

작동 원리의 큰 그림

플랫폼마다 구현은 다르지만 핵심은 같다. 보통 CLIP 같은 비전 인코더나 전용 어댑터가 참조 이미지의 특징을 잠재 공간 표현으로 바꾸고, 텍스트 표현과 함께 생성 과정에 넣는다. 모델은 문장이 가리키는 내용과 참조가 가리키는 시각 특징을 동시에 조건으로 삼는다.

┌───────────────┐     ┌───────────────┐
  │ 텍스트 프롬프트 │     │  참조 이미지   │
  │ “숲속의 전사”  │     │ [photo.jpg]   │
  └───────┬───────┘     └───────┬───────┘
          │                     │
          ▼                     ▼
  ┌───────────────┐    ┌───────────────┐
  │ 텍스트 인코더  │    │ 이미지 인코더  │
  │ (CLIP / T5)   │    │ (CLIP / IP)   │
  └───────┬───────┘    └───────┬───────┘
          │                     │
          └────────┬────────────┘
                   ▼
          ┌───────────────┐
          │   확산 과정    │
          │ (교차 어텐션)  │
          └───────┬───────┘
                  ▼
          ┌───────────────┐
          │ 텍스트와 참조가 │
          │ 반영된 결과물  │
          └───────────────┘

플랫폼마다 다른 참조 방식

  • Midjourney V7(--oref): Omni-Reference와 --ow 가중치를 쓴다. 0–50은 얼굴 중심, 200–400은 정체성과 스타일의 균형, 500–1000은 거의 그대로 복사하는 영역이며 일관성이 최대 95%라고 보고된다.
  • DALL-E(Gen_ID): 한 대화 안에서 캐릭터 정체성을 75–80% 수준으로 유지하지만 세션에 묶여 다른 대화로 옮겨 가지 않는다.
  • Stable Diffusion + IP-Adapter: 교차 어텐션에 참조 특징을 넣는 가벼운 어댑터로, 영향 강도를 세밀하게 조정할 수 있다.
  • Leonardo AI: 캐릭터 참조 시트로 50개가 넘는 자세 변화에서 92% 일관성을 제시한다.
핵심 정리
  • 참조 이미지는 정체성, 자세, 스타일, 구도, 의상, 분위기를 고정할 수 있다.
  • 이미지 특징을 인코딩해 텍스트 조건과 함께 생성 과정에 넣는 것이 공통 원리다.
  • 구현과 강점, 제약은 플랫폼마다 다르다.
  • 선명하고 밝고 해석이 분명한 참조가 좋은 신호를 주며, 가중치는 균형 문제다.

External links

Exercise

생김새가 뚜렷한 사람의 참조 이미지를 찾거나 직접 찍어. Midjourney --oref, FLUX IP-Adapter, DALL-E 세션 중 하나로 같은 사람을 서로 다른 세 장면에 생성하고, 정체성 일관성을 1점부터 10점까지 매겨 근거를 적어.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.