01🏠Why Local AI
0/5 lessonsPrivacy, cost, latency, offline, freedom
Local-first가 cloud-only를 이기는 시점, 그리고 그 대가로 뭘 내주는지. 하드웨어, quantization, 형식, 그리고 남은 track에서 계속 만질 engine 생태계까지 훑어.
내 머신에서 모델 돌리고 운영하기
실용적인 local AI 리터러시를 바닥부터 쌓아. Ollama, GGUF / MLX, API 표면, NDJSON streaming, tool 사용, vision, 대체 server, adapter 패턴, production fallback 아키텍처까지.
9 tracks · 41 lessons · ~32h · difficulty: beginner-to-advanced
Privacy, cost, latency, offline, freedom
Local-first가 cloud-only를 이기는 시점, 그리고 그 대가로 뭘 내주는지. 하드웨어, quantization, 형식, 그리고 남은 track에서 계속 만질 engine 생태계까지 훑어.
설치, pull, 실행, 관리
Ollama는 아무것도 안 깔린 상태에서 안정적인 HTTP API 뒤의 local 모델까지 가는, 가장 단순하면서 옳은 경로야. API 만지기 전에 CLI랑 모델 라이브러리랑 Modelfile 시스템부터 손에 익혀.
Endpoint, option, structured output
앞으로 모든 adapter가 상대할 HTTP 표면이야. /api/chat은 대화에, /api/generate는 FIM에, 모델 관리 endpoint는 ops에, format 필드는 typed JSON output에 써.
NDJSON, SSE 아냐
Ollama는 SSE가 아니라 NDJSON으로 stream해. Python이랑 TypeScript에서 streaming을 제대로 만들고, OpenAI-shape frontend랑 붙여야 할 때 쓸 NDJSON→SSE proxy까지 만들어봐.
진짜 동작하는 function calling
OpenAI-format tool 정의, multi-turn tool loop, timeout이랑 error JSON을 갖춘 방어적 dispatch, 그리고 agentic loop이 폭주하지 않게 묶어두는 production 패턴까지.
OCR, chart, screenshot — local에서
Vision-capable local 모델 (Llama 3.2-Vision, Gemma 3, Qwen 2.5-VL), Ollama 이미지 형식, 여러 이미지를 한꺼번에 쓰는 경우, 그리고 local vision이 cloud를 이기는 지점까지.
llama.cpp, vLLM, TGI
Ollama를 넘어설 만큼 자랐을 때 펼쳐볼 engine 지도야. Raw GGUF엔 llama.cpp server, 동시 throughput엔 vLLM, HuggingFace-native production엔 TGI, 그리고 engine을 안전하게 갈아끼우기 위한 호환성 test harness까지.
Local을 cloud의 swap 가능 peer로
좁은 인터페이스 하나, universal stream chunk 하나, 작은 모델을 위한 mini-mode, stateless session, 그리고 cloud→local fallback을 갖춘 multi-vessel orchestrator까지.
튜닝, 벤치마크, 업데이트, ship
성능 env var, 벤치마크 규율, 이 quest가 일부러 얕게 두고 가는 MLX 경계, 업데이트 위생, 그리고 작은 cloud-first / local-fallback 서비스를 end-to-end로 띄우기까지.
아직 댓글이 없어요. 첫 댓글을 남겨보세요.