본문 바로가기
C.W.K.
Stream
Lesson 04 of 10 · published

딥러닝 역사의 흐름

~18 min · history, alexnet, transformer

Level 0호기심
0 XP0/73 lessons0/11 achievements
0/120 XP to next level120 XP to go0% complete

3개의 변곡점

현대 딥러닝의 역사는 짧지만 강렬해. 2012 — AlexNet: GPU 두 장으로 학습한 CNN이 ImageNet top-5 오류율을 하룻밤 사이에 거의 절반으로 낮췄어. 신경망을 회의적으로 보던 연구자 사회도 1년 만에 방향을 틀었지. 2014–2017 — 아키텍처의 질주: VGG, GoogLeNet, ResNet, 어텐션, seq2seq, 배치 정규화, Adam. 지금도 사용하는 도구 대부분이 이때 만들어졌어. 2017 — Transformer: Attention Is All You Need는 순환 구조 없이 GPU/TPU에서 수평 확장할 수 있는 아키텍처를 제안했어. 2018년에는 BERT와 GPT가 NLP를 장악했고, 2020년에는 비전(ViT)과 음성까지 영역을 넓혔어.

변화를 가능하게 한 재료

알고리즘의 천재성만으로 이뤄진 일은 아니야. 세 가지가 함께 맞아떨어져야 했어. 데이터에는 ImageNet과 공개 웹이 있었고, 연산에서는 GPU가 그래픽용 부품에서 범용 텐서 엔진으로 발전했어. 미분 가능한 소프트웨어인 Theano와 Caffe, 이어서 PyTorch와 TensorFlow도 등장했지. 1995년의 연구자들에게도 비슷한 생각은 있었지만, 이 세 가지가 모두 없었어.

팁: 'X가 1986년에 역전파를 발명했다'라는 문장을 읽으면 이렇게 반응해야 해. '그래서 데이터와 GPU가 없던 25년 동안은 쓰이지 못했구나.' 알고리즘은 인프라가 갖춰지기를 기다려.

다음 10년을 읽는 법

변곡점은 지나고 나면 당연해 보이지만, 막상 닥쳤을 때는 충격적이야. 이 흐름은 아직 멈추지 않았어. 지금 최전선에는 파운데이션 모델, 멀티모달 학습, 추론 중심의 사후학습이 있어. 패턴은 그대로야. 더 좋은 표현, 더 많은 데이터, 더 많은 연산, 더 나은 소프트웨어가 변화를 이끌어. 날짜를 외우는 것보다 어떤 재료가 본인 문제를 가로막는 핵심 제약인지 알아보는 직관을 키우는 편이 더 유용해.

원칙: 이 퀘스트에서 이름이 나온 모든 아키텍처는 한 변곡점을 그대로 얼려 놓은 스냅샷이야. 이름을 외우라는 뜻이 아니라, 다음 변곡점이 찾아왔을 때 같은 패턴을 알아보라는 뜻이지.

Code

한눈에 보는 아키텍처 발전사·python
milestones = [
    (2012, "AlexNet",        "First CNN to win ImageNet by a huge margin"),
    (2014, "VGG",             "Deeper is better, with simple 3x3 convs"),
    (2014, "GoogLeNet",       "Inception modules; multi-scale within a layer"),
    (2014, "Seq2Seq",         "Encoder-decoder for translation"),
    (2015, "Batch Norm",      "Normalization that made deeper nets trainable"),
    (2015, "ResNet",          "Residual connections; 100+ layer networks work"),
    (2014, "Adam",            "Per-parameter learning rates; default optimizer"),
    (2017, "Transformer",     "Attention-only; no recurrence; massively parallel"),
    (2018, "BERT / GPT-1",    "Pretrain a transformer, fine-tune on tasks"),
    (2020, "ViT",             "Transformers eat vision too"),
    (2022, "Diffusion + LLM", "Generative scaling on text and images"),
    (2024, "Reasoning LLMs",  "Test-time compute as a first-class scaling axis"),
]
for year, name, why in milestones:
    print(f"{year}  {name:14}  {why}")

External links

Exercise

위의 변곡점마다 한 문장씩 적어 봐. 각 변곡점이 이전 변곡점으로는 풀지 못했던 무엇을 해결했는지 설명해야 해. 적지 못한다면 흐름을 이해한 게 아니라 이름만 외운 거야.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.