분할에는 비율뿐 아니라 재현성도 넣어
ds.train_test_split(test_size=0.1, seed=42, stratify_by_column='label')은 train과 test를 담은 DatasetDict를 만들어. seed는 같은 분할을 다시 만들게 하고, 층화는 label 비율을 보존해 불균형 분류 평가가 우연한 표본에 흔들리지 않게 해.
붙일지, 비율대로 섞을지 결정해
concatenate_datasets([a, b, c])는 데이터셋의 행을 차례로 이어 붙여. interleave_datasets(..., probabilities=[0.6, 0.3, 0.1])는 매 단계 어느 자료원에서 뽑을지 정해. 선별 데이터와 크롤 자료를 목표 비율로 섞을 때는 후자가 맞아.