표현이란 무엇인가
표현은 입력에서 과제에 중요한 정보만 담아낸 벡터야. 좋은 단어 임베딩 공간에서는 man과 king이 가까이 있어. 신경망이 왕실과 관련된 단어들이 서로 무리를 이룬다는 사실을 배웠기 때문이야. 비전 인코더에서는 같은 강아지를 서로 다른 각도에서 찍은 사진 두 장이 가까이 있어. 픽셀 단위의 동일성이 아니라 강아지다움을 배웠기 때문이지.
표현은 현대 AI를 떠받치는 핵심 개념이야. 이미지에는 CLIP, 텍스트에는 Sentence Transformer, 오디오에는 음성 모델처럼 강력한 인코더가 있으면 분류, 검색, 군집화, 추천 같은 후속 과제는 그 위에 작은 헤드만 올려서 풀 수 있어. 어려운 일은 표현 자체를 학습하는 거였지.
왜 비용 효율적인가
백본을 사전학습하는 데는 큰 비용이 들어. 가장 큰 모델은 수백만 달러가 들지. 하지만 백본을 한 번 만들어 두면 새 과제를 추가하는 한계비용은 작아져. 라벨이 붙은 예시 수천 개를 모으고, 백본을 동결하거나 조금만 미세 조정한 뒤, 그 위에 작은 분류기를 학습하면 돼. 두 명으로 구성된 팀이 일주일 만에 쓸 만한 이미지 분류기를 배포할 수 있는 방식이야.
표현은 학습 데이터를 반영해
한 인종의 사진만으로 얼굴 인코더를 학습하면 그 인종은 표현의 중심에 놓이고, 다른 인종은 가장자리로 밀려나. 2020년 영어 뉴스로 사전학습된 텍스트 인코더는 2025년 Reddit 속어에 더 약하고, 한국어에는 훨씬 더 약해. 인코더가 무엇을 바탕으로 학습됐는지 아는 것도 인코더를 제대로 쓰는 데 꼭 필요한 일이야.