여러 자료원을 한 함수로 불러와
datasets.load_dataset()은 Datasets의 공통 입구야. Hub 데이터셋 ID, 로컬 파일이나 디렉터리, 이름 있는 로더를 받아 Parquet·CSV·JSONL·오디오·이미지 형식을 알아내고 캐시에 내려받아. 결과는 Dataset 또는 DatasetDict야.
반환 형태부터 확인해
- train·validation·test처럼 여러 split이 정의돼 있으면 split 이름을 키로 가진 DatasetDict가 나와.
split='train'처럼 하나를 지정했거나 자료원에 split이 하나뿐이면 Dataset가 나와.
스트리밍을 켜면 사용 계약이 달라져
기본 모드는 전체 자료를 디스크에 받고 임의 위치를 조회할 수 있는 테이블을 만들어. streaming=True를 쓰면 내려받으며 순서대로 읽는 IterableDataset가 되고, 디스크 저장과 임의 접근은 사라져. 디스크보다 큰 데이터셋을 다룰 때는 이 차이가 선택 사항이 아니라 생존 조건이야.