🏠 전체 위키 수학 위키 지도 목록 사전
더보기

모평균과 표본평균

확률통계 고등 · v1 · 🤖 LLM 버전

🧭 선수 개념 — 이 문서는 다음을 안다는 전제로 쓰였어요: 확률변수 · 확률분포 · 정규분포 · 평균 (초등)

정의

모집단(population)은 조사하고자 하는 대상 전체의 집합이고, 모집단에서 어떤 특성을 나타내는 확률변수를 $X$라 하자. 이때 $X$의 평균 $E(X)$를 모평균, 분산 $V(X)$를 모분산, 표준편차 $\sigma(X)$를 모표준편차라 하고, 각각 기호로 $m$, $\sigma^2$, $\sigma$로 나타낸다.

모집단에서 크기 $n$인 표본을 임의추출(주로 복원추출)하여 얻은 확률변수를 $X_1, X_2, \dots, X_n$이라 하면, 이들은 서로 독립이고 각각 모집단의 확률분포(모평균 $m$, 모분산 $\sigma^2$)를 그대로 따른다. 이때

$$\bar{X} = \frac{X_1+X_2+\cdots+X_n}{n}$$

을 표본평균($\bar{X}$, 엑스바라 읽는다)이라 한다. 표본평균은 하나의 숫자가 아니라, 표본을 뽑을 때마다 값이 달라지는 확률변수이다.

직관

모평균은 모집단 전체를 조사해야 정확히 알 수 있는, 원칙적으로 고정된 값이다. 하지만 모집단 전체 조사는 비용·시간 문제로 불가능한 경우가 많다. 그래서 일부만 뽑아(표본) 그 평균 $\bar{X}$로 모평균 $m$을 추측하는데, 표본을 뽑을 때마다 $\bar{X}$의 값은 조금씩 달라진다. 다만 표본의 크기 $n$이 커질수록 $\bar{X}$의 값들은 $m$ 주위로 점점 더 촘촘하게 모이는데, 이 "촘촘해지는 정도"를 수치로 나타낸 것이 바로 표본평균의 분산 공식이다.

성질

모평균 $m$, 모분산 $\sigma^2$인 모집단에서 크기 $n$인 표본을 임의추출할 때, 표본평균 $\bar{X}$에 대해 다음이 성립한다.

$$E(\bar{X}) = m, \qquad V(\bar{X}) = \frac{\sigma^2}{n}, \qquad \sigma(\bar{X}) = \frac{\sigma}{\sqrt{n}}$$

또한 모집단이 정규분포 $N(m, \sigma^2)$을 따르면 표본평균 $\bar{X}$는 정확히 $N\left(m, \dfrac{\sigma^2}{n}\right)$을 따른다. 모집단의 분포가 정규분포가 아니더라도 $n$이 충분히 크면 $\bar{X}$는 근사적으로 $N\left(m, \dfrac{\sigma^2}{n}\right)$을 따른다.

예시

모평균 $m=60$, 모표준편차 $\sigma=10$인 모집단에서 크기 $n=25$인 표본을 임의추출하면

$$E(\bar{X}) = 60, \qquad V(\bar{X}) = \frac{10^2}{25} = 4, \qquad \sigma(\bar{X}) = \frac{10}{\sqrt{25}} = 2$$

$n$을 $100$으로 늘리면 $\sigma(\bar{X}) = 10/\sqrt{100} = 1$로 더 좁아진다. 아래는 $n=25$일 때와 $n=100$일 때 $\bar{X}$가 따르는 정규분포의 확률밀도함수를 비교한 그래프이다(뾰족한 곡선일수록 $\bar{X}$가 $m=60$ 근처에 몰려 있음을 뜻한다).

🌍 실생활 예시

공장에서 생산된 전구의 평균 수명을 알고 싶다고 하자. 전구의 수명을 측정하려면 전구를 실제로 다 써봐야 하므로(파괴검사), 생산된 전구 전체(모집단)를 검사할 수 없다. 대신 무작위로 $n$개를 뽑아 표본평균 $\bar{X}$를 구하고, 이를 모평균의 추정값으로 사용한다. 표본의 크기를 늘리면 $\sigma(\bar{X})=\sigma/\sqrt{n}$이 작아지므로 추정이 더 정밀해지지만, 검사 비용도 함께 늘어나기 때문에 실제 품질관리에서는 표본 크기와 정확도 사이의 균형을 따져 $n$을 정한다.

⚠️ 흔한 실수

확인 문제

  1. 모평균 $50$, 모표준편차 $8$인 모집단에서 크기 $16$인 표본을 임의추출할 때, 표본평균 $\bar{X}$의 평균과 표준편차를 구하여라.
  2. 어떤 모집단에서 크기 $n$인 표본의 표본평균의 표준편차가 $\sigma(\bar{X})=2$였다. 표본의 크기를 $4n$으로 늘리면 $\sigma(\bar{X})$는 어떻게 변하는지, 그 이유를 $\sigma(\bar{X})=\sigma/\sqrt{n}$ 공식을 이용해 설명하여라. (표본 크기를 늘리는 것이 왜 "제곱근만큼만" 효과가 있는지 생각해 보자.)
  3. 모표준편차가 $\sigma$인 모집단에서 크기 $n$인 표본을 뽑을 때 $V(\bar{X})=\sigma^2/n$인 이유를, $X_1, X_2, \dots, X_n$이 서로 독립임을 이용하여 설명하여라.
정답 보기
  1. $E(\bar{X})=50$, $\sigma(\bar{X})=8/\sqrt{16}=2$.
  2. $\sigma(\bar{X})=\sigma/\sqrt{4n}=\dfrac{\sigma}{2\sqrt{n}}$이므로 원래 값의 $\dfrac{1}{2}$, 즉 $1$이 된다. 표본 크기를 $4$배로 늘려도 표준편차는 $\sqrt{4}=2$배로만 줄어드는데, 이는 분산이 $n$에 반비례하기 때문이다(표본을 늘릴수록 정밀도가 좋아지지만 그 효과는 제곱근 비율로 점점 둔해진다).
  3. $X_1,\dots,X_n$이 서로 독립이므로 합의 분산은 분산의 합과 같아 $V(X_1+\cdots+X_n)=n\sigma^2$이다. $\bar{X}=\dfrac{1}{n}(X_1+\cdots+X_n)$이므로 $V(\bar{X})=\dfrac{1}{n^2}\cdot n\sigma^2=\dfrac{\sigma^2}{n}$이 된다.

관련 개념

연결 문서 그래프 (7)

굵은 테두리가 현재 문서, → 화살표는 선수 관계(선수 → 후속)예요. 노드를 누르면 해당 문서로 이동합니다. 전체 그래프 보기