초매개변수는 학습 방식의 손잡이야
모델의 계수와 분할점은 자료에서 배우지만 규제 강도, 나무 깊이, 학습률, 나무 수 같은 값은 학습 전에 정해야 해. 이런 초매개변수는 모델 용량과 학습 속도, 편향과 분산의 균형을 바꿔. 튜닝은 무작정 숫자를 돌리는 일이 아니라 제한된 계산 예산 안에서 검증 성능과 안정성이 좋은 설정을 찾는 실험이야.
먼저 기본값과 범위를 이해해
라이브러리 기본값을 첫 기준선으로 기록하고 어떤 방향이 모델을 더 복잡하게 만드는지 알아야 해. 규제 α는 로그 단위로 여러 자릿수를 탐색하는 편이 자연스럽고, 나무 깊이는 작은 정수 범위면 충분할 수 있어. 의미 없는 세밀한 간격을 수백 개 넣으면 계산만 늘고 검증 자료에 맞출 기회가 커져.
격자 탐색
격자 탐색은 미리 정한 모든 조합을 빠짐없이 평가해. 후보가 두세 개이고 범위가 작을 때 결과를 설명하기 쉽지. 하지만 초매개변수마다 후보 다섯 개를 둔 열 개 손잡이는 거의 천만 조합이 돼. 중요하지 않은 축까지 같은 밀도로 탐색하는 게 약점이야.
무작위 탐색
무작위 탐색은 각 분포에서 설정을 뽑아 정한 횟수만 평가해. 실제 성능을 좌우하는 손잡이가 몇 개뿐이라면 같은 예산으로 더 다양한 중요한 값을 볼 수 있어. 연속 값은 균등분포보다 로그균등분포가 맞는 경우가 많고, 씨앗과 뽑힌 설정을 저장해야 반복할 수 있어.
베이지안 최적화와 Optuna
평가 한 번이 비쌀 때는 이전 결과로 성능 지형을 추정하고 유망한 설정을 제안하는 방식을 쓸 수 있어. Optuna 같은 도구는 조기 종료와 조건부 공간도 다루기 편해. 그래도 목적함수의 잡음과 교차검증 비용은 사라지지 않아. 초기 무작위 시행, 탐색 범위, 중단 규칙을 미리 정하지 않으면 도구가 검증 자료의 우연을 영리하게 쫓을 뿐이야.
탐색 횟수도 초매개변수야
같은 검증 자료에서 100개 설정을 비교하면 어떤 모델도 그 행으로 직접 학습하지 않았어도 선택 과정이 검증 잡음에 맞춰져. 시행이 많을수록 최고 점수의 낙관 편향도 커져. 큰 탐색에는 중첩 교차검증을 쓰거나 최소한 독립 시험 자료를 끝까지 봉인해. 시간과 비용 예산, 최대 시행 수, 중단 조건을 실험 전에 선언해.
최고점보다 안정된 구간을 골라
초매개변수 값에 따른 평균 점수와 폴드 간 흔들림을 그려. 한 점만 아주 조금 높은 절벽 끝보다 넓은 범위에서 비슷한 성능을 내는 설정이 자료 변화에 잘 버텨. 계산량과 제공 시간도 함께 기록하고, 최종 설정을 고른 뒤 전체 학습 자료로 다시 맞춰 얼린 시험 자료에서 한 번 확인해.