본문 바로가기
C.W.K.
Stream
Lesson 04 of 05 · published

이 병목이 왜 중요한가

~12 min · long-context, deployment-cost, use-cases

Level 0관찰자
0 XP0/50 lessons0/14 achievements
0/100 XP to next level100 XP to go0% complete

이 벽은 실제 응용을 가로막아

계산 복잡도를 학술적인 문제로만 보기 쉽지만 현실은 달라. 약 32K 토큰이 넘는 문맥을 쓰려는 작업은 이미 제곱 비용을 돈으로 치르거나, 아예 처리를 포기하고 있어. 법률 문서나 코드베이스 전체, 프레임 단위로 토큰화한 긴 오디오, 생물학적 시퀀스, 여러 자료를 한데 넣은 다중 문서 RAG, 길게 이어진 에이전트 실행 기록이 여기에 해당해.

소비자용 하드웨어에서는 벽이 생각보다 훨씬 가까워. 앞 레슨에서 본 2025년 연구가 좋은 예야. 24GB 소비자용 그래픽 카드에서 Transformer는 약 25K 토큰에 멈췄지만 SSM은 220K 토큰 이상을 처리했어. 극단적인 실험실 사례가 아니야. 자기 컴퓨터에서 자기 저장소를 읽는 코딩 도우미를 돌리고 싶은 사람에게 곧바로 닥치는 문제지.

진짜 동기는 배포 비용이야

문맥 128K인 Transformer를 서비스하면 같은 모델을 8K 문맥으로 쓸 때보다 요청당 약 3–5배 비싸. 긴 문맥을 쓰는 사람이 내는 구조적인 세금인 셈이야. Anthropic의 1M 문맥 Claude에 별도 가격 구간이 있고, 일부 업체가 저가 요금제의 문맥을 32K–64K로 제한하는 이유도 여기에 있어. 범용 GPU에서 저렴하게 돌아가는 공개 가중치 장문맥 모델이 시장에 파고들 틈도 같은 곳에서 생겨.

대안 아키텍처가 실제로 주는 것

이 분야의 대안은 적어도 하나를 약속해. 첫째, 선형 또는 선형에 가까운 학습 연산량으로 긴 문맥이 학습 비용을 제곱으로 부풀리지 않게 해. 둘째, 일정한 추론 메모리로 문맥이 길어져도 토큰당 상태 크기를 유지해. 셋째, 하드웨어에 더 잘 맞는 실행 방식으로 같은 FLOP을 더 높은 실제 처리량으로 바꿔. 나머지 퀘스트에서는 각 계열이 무엇을 얻고, 그 대가로 무엇을 포기하는지 살펴볼 거야.

External links

Exercise

8K 토큰이 넘는 실제 작업 하나를 골라 봐. 저장소, 에이전트 실행 기록, 오디오 녹취록 무엇이든 좋아. tiktoken이나 Llama 3 토크나이저로 토큰 수를 센 뒤, (1) 전체 길이에서 fp16 어텐션 행렬이 차지하는 메모리와 (2) 같은 길이에서 Llama 3.1 70B GQA의 KV 캐시 메모리를 계산해. 그러면 “긴 문맥이 왜 중요한가”라는 질문에 붙일 구체적인 비용이 생겨.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 0

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.

아직 댓글이 없어요. 첫 댓글을 남겨보세요.