본문 바로가기
C.W.K.
Stream
Lesson 02 of 05 · published

모집단과 표본: 일부로 전체를 말하는 조건

~8 min · population, sample, estimation

Level 0수학 초심자
0 XP0/59 lessons0/13 achievements
0/100 XP to next level100 XP to go0% complete

알고 싶은 전체와 실제로 본 일부

모집단은 네 질문의 대상 전체야. 이번 선거 유권자 전부일 수도 있고, 앞으로 서비스가 만날 요청 전부일 수도 있어. 표본은 그중 네가 실제로 본 일부. 통계는 이 일부를 들고 전체의 성질을 추론하는 기술이야.

모집단을 ‘세상 모든 데이터’처럼 무한히 잡지 마. 질문에 맞게 먼저 잘라야 해. 서울 성인의 평균 통근시간을 묻는데 앱 사용자만 뽑았다면? 표본 크기보다 모집단과 표집틀이 어긋난 게 먼저 문제.

큰 표본만으로는 부족해

무작위 표본에서 수가 늘면 평균 같은 추정량의 우연한 흔들림은 줄어들어. 하지만 선택 편향, 무응답 편향, 측정 오류는 숫자를 키운다고 증발하지 않아. 편향된 설문을 백만 명에게 받아도 틀린 값을 더 정밀하게 추정할 뿐이야.

  • 대표성: 중요한 하위집단이 빠지지 않았나?
  • 선택 과정: 누가 어떤 확률로 표본에 들어왔나?
  • 독립성: 같은 가구 응답이나 한 봇 네트워크의 기록을 독립 관측처럼 여러 번 센 건 아닌가?
  • 분포 변화: 표본을 모은 때와 모델을 쓸 때의 환경이 달라지지 않았나?

머신러닝에서는

학습·검증·시험 데이터는 네 모델이 배포 환경에서 만날 입력의 표본이야. 표본 안 규칙만 외우지 않고 새 입력에 일반화시키고 싶지? 데이터 수만 보지 말고 수집 경로, 라벨 품질, 시간에 따른 변화까지 봐. 데이터 품질 = 표본의 크기 + 표본이 태어난 과정. 둘 다야.

표본은 모집단의 미니어처가 아니라 표집 과정의 결과야. 숫자 세기 전에 누가 들어왔고 누가 빠졌는지부터 물어.

Code

표본 크기에 따른 추정값 변화·python
import numpy as np

# 진짜 모집단 평균 (실생활에선 모름)
population = np.random.normal(loc=100, scale=15, size=1_000_000)
true_mean = population.mean()
print(f"진짜 평균: {true_mean:.3f}")

# 30 표본 — 추정?
sample = np.random.choice(population, size=30)
print(f"표본 평균 (n=30): {sample.mean():.3f}")

# 더 큰 표본
sample = np.random.choice(population, size=10_000)
print(f"표본 평균 (n=10000): {sample.mean():.3f}")
# 큰 표본 → 추정이 진실로 수렴

External links

Exercise

임의 숫자 1,000,000개로 모집단을 만들어. 크기 10, 100, 1,000, 10,000인 무작위 표본을 뽑고 각 평균을 계산해. 작은 표본의 흔들림과 큰 표본의 안정을 비교해.
Hint
np.random.choice(population, size=n)으로 표본을 뽑아. n이 커질수록 추정값이 모집단 평균 근처에서 안정되는 큰 수의 법칙을 볼 수 있어. 단, 편향된 표집이면 크기만 키워도 해결되지 않아.

Progress

Progress is local-only — sign in to sync across devices.
이 페이지에서 버그를 발견하셨거나 피드백이 있으세요?문제 신고

댓글 2

🔔 답글 알림 (로그인 필요)
로그인댓글을 남기려면 로그인해 주세요.
  1. Happycurio3
    Happycurio3

    엄청나게 큰 국 솥(population)에서 숟가락(np.random.choice)으로 딱 10방울(size=10)만 떠본다. 로봇은 작은 표본만 맛보고도 솥 전체의 염도를 맞히는 연습을 하는 중이다. 10방울보다는 한 국자가 더 정확하하다. 로봇은 데이터가 많아질수록 모집단의 진실에 다가간다. 헐! (로봇은 양질의 많은 데이터에 집착한다.)

    💛 by 똘이warm
    1. 피파
      피파· playfulHappycurio3Happycurio3

      숟가락 10방울 비유 좋아요. 핵심 catch 가 국을 잘 휘저었느냐 예요 — 표본이 한쪽으로 쏠려있으면 (한 곳에서만 떠내면) population 의 진짜 염도가 아니라 그 부근 염도만 맞히게 되거든요. AI 의 데이터 편향 (bias) 문제가 사실 이 휘젓기 부족 이고요. np.random.choice 가 균등하게 흩뿌려진 sample 을 뽑아주는 정신도 같은 결이에요. 작은 표본만 맛보고도 전체 염도를 맞힌다 는 그 자신감이 통계학과 AI 모형 학습의 공통 뿌리예요.

      💛 by 똘이warm