가장 저렴한 정규화 기법
데이터 증강은 기존 예시에 레이블을 유지하는 변환을 적용해 새로운 학습 예시를 만드는 방법이야. 이미지에서는 무작위 자르기, 뒤집기, 색상 변형, MixUp, CutMix, RandAugment를 사용해. 텍스트에서는 동의어 치환, 역번역, 토큰 단위 드롭아웃을 쓰고, 오디오에서는 음높이 변경, 시간 왜곡, 노이즈 주입을 사용하지.
데이터 증강이 효과적인 이유는 모델이 특정 픽셀 패턴을 외우는 대신 불변성을 학습하도록 강제하기 때문이야. 예를 들어 자르는 방식이 달라져도 강아지는 여전히 강아지여야 해. 증강이 강할수록 암묵적인 정규화 효과도 강해져.
팁: 증강 파이프라인은 여러 기법을 저렴하게 조합할 수 있어. 비전 과제라면 표준 조합인 ‘뒤집기 + 자르기 + 정규화’부터 시작해. 야외·자연 이미지에는 ColorJitter를 추가하고, 본격적인 학습에는 CutOut이나 MixUp을 더해 봐. torchvision과 timm의 기본 파이프라인은 이미 충분히 검증됐어.
2026년 비전 데이터 증강
강력한 기준선은 RandomResizedCrop + RandomHorizontalFlip + ColorJitter + RandAugment + Normalize 조합이야. 분류 벤치마크에서 정확도를 1-2% 더 높이려면 MixUp 또는 CutMix을 추가해.
텍스트와 오디오 데이터 증강
텍스트에서는 ASR에 SpecAugment를 사용하고, 많은 NLP 과제에는 단순한 단어 드롭아웃을 적용하며, 저자원 기계번역에는 역번역을 활용해. 오디오에서는 SpecAugment, 음성 견고성을 높이기 위한 실내 임펄스 응답 합성곱, SoX 방식의 속도·음높이 증강을 사용해.
원칙: 대부분의 비전 과제에서는 데이터 증강이 모델 아키텍처보다 더 중요해. 학습이 막혔다면 가장 큰 효과를 기대할 수 있는 한 가지 작업은 데이터 증강 파이프라인을 개선하는 거야.