Datasets 캐시는 변환 결과까지 기억해
기본 위치는 ~/.cache/huggingface/datasets이고 HF_DATASETS_CACHE나 HF_HOME으로 바꿀 수 있어. 캐시의 Arrow 파일은 데이터셋 ID, config, 처리 fingerprint로 구분돼. fingerprint에는 map과 filter 함수 소스도 반영되므로 같은 입력과 같은 변환이면 결과를 다시 계산하지 않아.
비싼 전처리 결과는 따로 저장해
save_to_disk(path)로 처리된 데이터셋을 저장하고 다음 실행에서 load_from_disk(path)로 바로 열 수 있어. 계산 레시피만 남기는 대신 실제 산출물을 고정하는 방식이야.
Hub에 올린 뒤에도 버전을 고정해
ds.push_to_hub('yourname/my-set', commit_message='initial', private=True)는 Parquet로 올리고 Dataset Viewer를 붙여 줘. 다시 읽을 때는 모델과 마찬가지로 revision='abc123def'에 커밋 SHA를 넣어 정확한 버전을 고정해.