본문 바로가기
C.W.K.
Stream
Lesson 03 of 10 · published

왜 마법처럼 느껴질까

~18 min · foundations, mental-model, l3

Level 0첫 불꽃
0 XP0/100 lessons0/14 achievements
0/200 XP to next level200 XP to go0% complete

피파 한 줄 정리: 결과가 마법처럼 느껴지는 건 머신러닝을 몰라서가 아니야. 수십억 개의 시각 패턴이 120억 개 매개변수에 압축되어 있기 때문이지. 마법이 아니라 거대한 압축이야.

“비 내리는 런던 거리에서 신문을 읽는 steampunk 부엉이, 유화”라고 쓰고 몇 초만 기다리면 숙련된 화가가 여러 시간을 들인 듯한 그림이 나와. 비밀은 엄청난 규모로 압축된 패턴 지식이야.

세상의 모든 요리책을 읽은 요리사를 생각해봐. “태국과 멕시코를 섞은 새 디저트”를 부탁하면 기존 조리법을 검색하지 않아도 코코넛·레몬그라스·야자당과 churro·flan·tres leches의 관계를 조합할 수 있겠지. 이미지 모델도 수십억 쌍의 이미지와 텍스트에서 익힌 관계로 같은 일을 해.

모델이 압축해둔 것

  • 사물의 생김새: 고양이, 산, 자동차, 얼굴, steampunk 부엉이가 여러 각도에서 보이는 모습
  • 구도: 삼분할, 유도선, 시각적 균형, 전경과 배경의 관계
  • 빛과 공기: 황금 시간대, 강한 flash, 부드러운 studio light, neon, 안개 낀 아침
  • 화풍의 특징: 유화, 수채화, 35mm film photography를 가르는 질감
  • 문화적 연상: cyberpunk는 neon·비·어둠·chrome, cottagecore는 꽃·따뜻한 색·소박한 질감과 자주 이어져
  • 카메라 관습: 얕은 심도의 bokeh, 광각 왜곡, macro 세부

본 적 없는 조합도 만드는 이유

모델은 “빗속에서 신문을 읽는 steampunk 부엉이”라는 완성 장면을 배운 적이 없어도, 부엉이·steampunk·신문·비 오는 런던·유화의 패턴을 각각 알고 있어. 이 조각을 픽셀 수준에서 하나의 새 장면으로 합쳐. 사람이 본 적 없는 “화성에서 자전거를 타는 보라색 코끼리”를 익숙한 개념으로 상상하는 것과 비슷해.

압축에는 손실이 따른다

이 지식은 원본을 완벽히 보존한 압축이 아니라 통계적 경향만 남긴 손실 압축이야. 그래서 정확한 손가락 수, 올바른 철자, 특정 공간 배치처럼 정밀한 세부에서는 약해질 수 있어. 흔한 초상화와 풍경은 잘 만들면서 희귀한 기술 도표에는 약한 이유도 학습 자료의 밀도가 고르지 않기 때문이야.

핵심 정리
  • 마법처럼 보이는 힘은 수십억 이미지-텍스트 관계를 모델 가중치에 압축한 결과다.
  • 모델은 학습 이미지를 복사하지 않고 배운 시각 패턴을 새롭게 조합한다.
  • 흔한 시각 개념은 드문 개념보다 더 안정적으로 나온다.
  • 손실 압축이므로 글자, 개수, 공간 배치 같은 정밀한 세부는 흔들릴 수 있다.

External links

Exercise

상상만으로 ‘도쿄의 새벽, 신문을 읽는 cyberpunk 여우’를 픽셀 수준까지 묘사해. 그런 다음 이미지를 만들고, 프롬프트에 없지만 모델이 학습 경향에서 보탠 요소 다섯 가지를 적어.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.