본문 바로가기
C.W.K.
Stream
← C.W.K. Quests
🧱

Data Engineering Quest

최근 수정: 2026-08-08

지저분한 파일에서 믿을 수 있는 파이프라인까지

Python, Pandas, NumPy, Parquet, DuckDB, Polars, Airflow, dbt, Apache Arrow까지 — 새벽 2시에 5천만 행짜리 CSV 청소하기 전에 누가 알려줬으면 좋았을 모든 거. 실전 데이터 엔지니어링.

8 tracks · 47 lessons · ~20h · difficulty: beginner-to-intermediate

Level 0구경꾼
0 XP0/47 lessons0/11 achievements
0/120 XP to next level120 XP to go0% complete

데이터 엔지니어링은 화려하지 않은 일이야. 그런데 진지한 AI, 분석, 자동화, 백엔드 시스템은 전부 이 위에 서 있어. 모델은 이 위에서 학습하고, 대시보드는 이 위에서 살고, 파이프라인이 무너지는 것도 결국 여기가 흔들려서야. Data Engineering Quest 는 modern Python data stack 을 실전으로 통과하는 가이드야. 첫 pd.read_csv() 에서 출발해서, lineage 까지 추적되는 production 급 orchestrated pipeline 에 도착해.

8 트랙으로 정리했어: foundation (왜 이게 중요한지, modern stack 정찰, mental model), frames (NumPy + Pandas 진짜로 다루기), storage (CSV, Parquet, Arrow, DuckDB), pipelines (Polars, ETL 패턴, idempotency), quality (Pandera, Great Expectations, profiling), orchestration (Airflow, Dagster, Prefect), modeling (dimensional 설계, dbt, lineage), 마지막으로 production (모니터링, backfill, contract, 비용). 진짜 일이 무너지는 모양 그대로.

버전은 2026년 8월 기준 — Python 3.14, Pandas 3.0.5, NumPy 2.5.1, PyArrow 25.0.0, DuckDB 1.5.5, Polars 1.43.1, Airflow 3.3, dbt-core 1.12, Dagster 1.13. 도구는 바뀌지만 원리는 안 바뀌어.

Tracks

  1. 01🧭Foundation — 데이터 엔지니어링이 중요한 이유

    0/6 lessons

    80% 문제, modern stack, 그리고 mental model.

    코드 짜기 전에 '왜'부터. 데이터 엔지니어링이 진짜로 뭔지, spreadsheet 는 왜 무너지는지, 2026 modern Python data stack 은 어떻게 생겼는지 — 그리고 한 번 돌아간 스크립트와 매일 밤 도는 파이프라인을 가르는 mental model.

    Lesson list (6)퀴즈 · 4 문제
  2. 02🔢Frames — NumPy + Pandas Core

    0/7 lessons

    배열, DataFrame, 그리고 loop 에서 vectorization 으로의 사고 전환.

    Python 으로 데이터를 만지는 사람이라면 결국 다 익히게 되는 두 라이브러리. ndarray 가 빠른 이유, broadcasting 의 진짜 의미, Series 와 DataFrame 의 관계, .loc/.iloc 함정, GroupBy split-apply-combine, 테이블 join, 그리고 transformation 을 읽기 좋게 만드는 method-chaining 스타일.

    Lesson list (7)퀴즈 · 4 문제
  3. 03💾Storage — 진짜 중요한 파일 포맷

    0/6 lessons

    CSV, Excel, Parquet, Arrow, DuckDB, 그리고 고르는 법.

    Disk 에 어떻게 쓰느냐가 다음 stage 의 속도와 비용을 결정해. CSV 는 사람한텐 괜찮지만 분석엔 재앙이야. Parquet 이 분석의 default 고, Arrow 가 도구 사이를 잇는 wire 포맷이고, DuckDB 가 그 전부를 SQL 로 열어 줘. 의도를 갖고 골라 — 어쩌다 말고.

    Lesson list (6)퀴즈 · 4 문제
  4. 04🚰Pipelines — 살아남는 ETL 패턴

    0/6 lessons

    Extract, transform, load — 그리고 Polars 가 존재하는 이유.

    스크립트를 파이프라인으로 만들어 주는 패턴들: 깔끔한 stage 경계, 명시적 설정, idempotent write, 그리고 첫 run 을 짜기 전에 두 번째 run 부터 설계하는 규율. 거기에 Pandas 대신 Polars 로 손이 가야 할 때, 그리고 batch vs streaming 의 진짜 차이까지.

    Lesson list (6)퀴즈 · 4 문제
  5. 05🛡️Quality — 나쁜 데이터는 게이트에서 죽어

    0/6 lessons

    Schema, expectation, profiling, 그리고 검증의 규율.

    Downstream 으로 내보내는 데이터가 contract 가 말한 그 데이터가 맞는지 확인하는 법. Pandera 로 schema 검증, Great Expectations 로 팀 간 데이터 테스트, ydata-profiling 으로 탐색 profiling — 거기에 type drift 탐지와, 사고를 디버깅 가능하게 만드는 구조화 로깅까지.

    Lesson list (6)퀴즈 · 4 문제
  6. 06🎼Orchestration — Airflow, Dagster, Prefect

    0/5 lessons

    뭐가 언제 돌지, 그리고 뭐 fail 했을 때 뭐 할지 결정하는 시스템.

    Orchestrator 없이 언제까지고 버틸 수는 없는 이유. Airflow 의 DAG 모델, Dagster 의 asset-first 접근, Prefect 의 Pythonic flow. 진짜 차이, 진짜 trade-off, 그리고 진짜 팀을 위해 하나를 고르는 법.

    Lesson list (5)퀴즈 · 4 문제
  7. 07🗺️Modeling — 분석 테이블이 어떻게 설계되나

    0/5 lessons

    Star schema, slowly changing dimension, dbt, lineage.

    분석 테이블이 왜 그 모양인지 (또는 왜 그 모양이어야 하는지). Dimensional modeling, fact 와 dimension 테이블, star vs snowflake, slowly changing dimension, modern transformation layer 로서의 dbt — 그리고 대시보드의 모든 숫자가 어디서 왔는지 정확히 아는 것, lineage.

    Lesson list (5)퀴즈 · 4 문제
  8. 08🏭Production — 진짜 세계

    0/6 lessons

    Backfill, contract, 모니터링, PII, 비용 — 파이프라인 오래가게 만드는 것들.

    "내 머신에선 돌아가는데" 에서 "2년째 매일 밤 돌아" 로 건너가기. Backfill 과 time-travel read. 팀 사이의 data contract. PII 와 access control. 비용 — DuckDB 가 Snowflake 를 이길 때 (그리고 그 반대). Stakeholder 보다 먼저 문제를 잡는 모니터링. 그리고 데이터 엔지니어링 커리어에 대한 솔직한 이야기.

    Lesson list (6)퀴즈 · 4 문제
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고
💛 by 똘이playful

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.