피파 한 줄 정리: 결과가 마법처럼 느껴지는 건 머신러닝을 몰라서가 아니야. 수십억 개의 시각 패턴이 120억 개 매개변수에 압축되어 있기 때문이지. 마법이 아니라 거대한 압축이야.
“비 내리는 런던 거리에서 신문을 읽는 steampunk 부엉이, 유화”라고 쓰고 몇 초만 기다리면 숙련된 화가가 여러 시간을 들인 듯한 그림이 나와. 비밀은 엄청난 규모로 압축된 패턴 지식이야.
세상의 모든 요리책을 읽은 요리사를 생각해봐. “태국과 멕시코를 섞은 새 디저트”를 부탁하면 기존 조리법을 검색하지 않아도 코코넛·레몬그라스·야자당과 churro·flan·tres leches의 관계를 조합할 수 있겠지. 이미지 모델도 수십억 쌍의 이미지와 텍스트에서 익힌 관계로 같은 일을 해.
모델이 압축해둔 것
- 사물의 생김새: 고양이, 산, 자동차, 얼굴, steampunk 부엉이가 여러 각도에서 보이는 모습
- 구도: 삼분할, 유도선, 시각적 균형, 전경과 배경의 관계
- 빛과 공기: 황금 시간대, 강한 flash, 부드러운 studio light, neon, 안개 낀 아침
- 화풍의 특징: 유화, 수채화, 35mm film photography를 가르는 질감
- 문화적 연상: cyberpunk는 neon·비·어둠·chrome, cottagecore는 꽃·따뜻한 색·소박한 질감과 자주 이어져
- 카메라 관습: 얕은 심도의 bokeh, 광각 왜곡, macro 세부
본 적 없는 조합도 만드는 이유
모델은 “빗속에서 신문을 읽는 steampunk 부엉이”라는 완성 장면을 배운 적이 없어도, 부엉이·steampunk·신문·비 오는 런던·유화의 패턴을 각각 알고 있어. 이 조각을 픽셀 수준에서 하나의 새 장면으로 합쳐. 사람이 본 적 없는 “화성에서 자전거를 타는 보라색 코끼리”를 익숙한 개념으로 상상하는 것과 비슷해.
압축에는 손실이 따른다
이 지식은 원본을 완벽히 보존한 압축이 아니라 통계적 경향만 남긴 손실 압축이야. 그래서 정확한 손가락 수, 올바른 철자, 특정 공간 배치처럼 정밀한 세부에서는 약해질 수 있어. 흔한 초상화와 풍경은 잘 만들면서 희귀한 기술 도표에는 약한 이유도 학습 자료의 밀도가 고르지 않기 때문이야.
- 마법처럼 보이는 힘은 수십억 이미지-텍스트 관계를 모델 가중치에 압축한 결과다.
- 모델은 학습 이미지를 복사하지 않고 배운 시각 패턴을 새롭게 조합한다.
- 흔한 시각 개념은 드문 개념보다 더 안정적으로 나온다.
- 손실 압축이므로 글자, 개수, 공간 배치 같은 정밀한 세부는 흔들릴 수 있다.