피파 한 줄 정리: “oil painting” 한마디가 붓 자국·canvas·색감·구도까지 함께 부르는 이유는 학습 데이터에서 그 특징들이 통계적으로 붙어 있었기 때문이야.
“Renaissance oil painting, chiaroscuro lighting, three-quarter portrait”라고 쓰면 붓 질감, 극적인 그림자, 차분한 흙빛, 고전적 구도까지 갖춘 결과가 나와. 모델이 미술 이론을 배운 것이 아니라 수십억 쌍의 이미지와 텍스트를 보며 반복되는 관계를 흡수한 거야.
세계 최고의 미술관에서 매일 수백만 작품을 본 아이를 떠올려봐. 삼분할, 보색, Rembrandt lighting을 말로 배운 적이 없어도 무엇이 자연스러운지 패턴으로 익힐 수 있어. 모델의 지식도 이런 통계적 흡수에 가까워.
학습 데이터가 가르친 것
화풍의 패턴 언어
- “Oil painting” = 보이는 붓 자국 + canvas 질감 + 특정 색 조합 + 빛의 방식
- “35mm film photography” = grain + lens 특성 + color science + 흔한 구도
- “Anime” = 비례 + 선화 + 면으로 나눈 색 + 눈 모양 + 명암 관습
- “Cyberpunk” = neon + 비 + 어두운 환경 + chrome + 아시아 문자
빛의 물리 근사: 빛 방향에 따른 그림자, 태양·neon·촛불·flash의 색온도와 경계, 금속·피부·유리의 반응, 안개·먼지·비의 산란을 익혀.
구도의 시각 문법: 전문 사진의 피사체 위치, 전경·중경·배경의 깊이, 유도선·프레이밍·여백·시각적 무게, bird's-eye·worm's-eye·eye level·Dutch angle 같은 관습을 배워.
데이터의 편향도 함께 배운다
인터넷 이미지는 중립적인 표본이 아니야. 많이 공유된 전문 사진, 서구 미학, 매끈한 상업 사진과 유행 digital art, 관습적인 미의 기준과 흔한 인구 구성에 치우쳐 있어. 그래서 강한 화풍 지시가 없으면 결과가 polished하고 관습적이며 때로는 평범해져. 다른 결과를 원한다면 이 강한 prior에서 벗어날 단서를 분명히 줘야 해.
- 화풍·빛·구도 지식은 수십억 이미지-텍스트 쌍의 통계 패턴에서 나온다.
- 모델은 미술 이론을 이해하지 않고 설명과 시각 특징의 상관관계를 흡수한다.
- 학습 데이터의 편향 때문에 기본값은 매끈하고 관습적이며 서구 미학 쪽으로 기운다.
- 기본값과 다른 결과를 원한다면 원하는 특징을 명시적으로 지시해야 한다.