비용이 생기는 곳
- 수집 임베딩 — 청크마다 한 번, 다시 임베딩할 때마다 비용이 들어.
- 쿼리 임베딩 — 사용자 쿼리마다 한 번 비용이 들어.
- 저장 공간 — 벡터 크기 × 청크 수 × 복제본 수야. 행이 수천만 개를 넘지 않으면 대개 작은 항목이야.
- LLM 호출 — 검색이 작동한 뒤에는 가장 큰 비용 항목이 되기 쉬워. RAG라고 이 비용이 사라지지는 않아.
중요한 비용 절감 수단 세 가지
- 콘텐츠 해시로 임베딩 캐시하기. 같은 청크를 다시 수집할 때 비용은 0이어야 해. 텍스트 해시로 벡터를 찾고 캐시에 없을 때만 모델을 호출해.
- 배치로 묶기. 호스팅형 임베딩 API의 토큰당 가격은 같아도, 배치 호출은 네트워크 왕복 100번을 한 번으로 줄여. 일반적인 배치 크기는 32–128이야.
- 평가가 허용하면 작은 모델 쓰기. 384차원 로컬 모델이 사실 확인형 검색에서 3072차원 호스팅 모델과 비슷할 수 있고 호출당 비용도 없어. 평가 집합으로 실제 쿼리에서 차이가 중요한지 판단해.