# 모평균과 표본평균 분야: 확률통계 학교급: 고등 정식 URL: https://pi.devxdev.xyz/wiki/math/%EB%AA%A8%ED%8F%89%EA%B7%A0%EA%B3%BC_%ED%91%9C%EB%B3%B8%ED%8F%89%EA%B7%A0 --- ## 정의 **모집단**(population)은 조사하고자 하는 대상 전체의 집합이고, 모집단에서 어떤 특성을 나타내는 확률변수를 $X$라 하자. 이때 $X$의 평균 $E(X)$를 **모평균**, 분산 $V(X)$를 **모분산**, 표준편차 $\sigma(X)$를 **모표준편차**라 하고, 각각 기호로 $m$, $\sigma^2$, $\sigma$로 나타낸다. 모집단에서 크기 $n$인 표본을 임의추출(주로 복원추출)하여 얻은 확률변수를 $X_1, X_2, \dots, X_n$이라 하면, 이들은 서로 독립이고 각각 모집단의 확률분포(모평균 $m$, 모분산 $\sigma^2$)를 그대로 따른다. 이때 $$\bar{X} = \frac{X_1+X_2+\cdots+X_n}{n}$$ 을 **표본평균**($\bar{X}$, 엑스바라 읽는다)이라 한다. 표본평균은 하나의 숫자가 아니라, 표본을 뽑을 때마다 값이 달라지는 **확률변수**이다. ## 직관 모평균은 모집단 전체를 조사해야 정확히 알 수 있는, 원칙적으로 고정된 값이다. 하지만 모집단 전체 조사는 비용·시간 문제로 불가능한 경우가 많다. 그래서 일부만 뽑아(표본) 그 평균 $\bar{X}$로 모평균 $m$을 추측하는데, 표본을 뽑을 때마다 $\bar{X}$의 값은 조금씩 달라진다. 다만 표본의 크기 $n$이 커질수록 $\bar{X}$의 값들은 $m$ 주위로 점점 더 촘촘하게 모이는데, 이 "촘촘해지는 정도"를 수치로 나타낸 것이 바로 표본평균의 분산 공식이다. ## 성질 모평균 $m$, 모분산 $\sigma^2$인 모집단에서 크기 $n$인 표본을 임의추출할 때, 표본평균 $\bar{X}$에 대해 다음이 성립한다. $$E(\bar{X}) = m, \qquad V(\bar{X}) = \frac{\sigma^2}{n}, \qquad \sigma(\bar{X}) = \frac{\sigma}{\sqrt{n}}$$ 또한 모집단이 정규분포 $N(m, \sigma^2)$을 따르면 표본평균 $\bar{X}$는 정확히 $N\left(m, \dfrac{\sigma^2}{n}\right)$을 따른다. 모집단의 분포가 정규분포가 아니더라도 $n$이 충분히 크면 $\bar{X}$는 근사적으로 $N\left(m, \dfrac{\sigma^2}{n}\right)$을 따른다. ## 예시 모평균 $m=60$, 모표준편차 $\sigma=10$인 모집단에서 크기 $n=25$인 표본을 임의추출하면 $$E(\bar{X}) = 60, \qquad V(\bar{X}) = \frac{10^2}{25} = 4, \qquad \sigma(\bar{X}) = \frac{10}{\sqrt{25}} = 2$$ $n$을 $100$으로 늘리면 $\sigma(\bar{X}) = 10/\sqrt{100} = 1$로 더 좁아진다. 아래는 $n=25$일 때와 $n=100$일 때 $\bar{X}$가 따르는 정규분포의 확률밀도함수를 비교한 그래프이다(뾰족한 곡선일수록 $\bar{X}$가 $m=60$ 근처에 몰려 있음을 뜻한다). 그래프: y=(1/(2*sqrt(2*3.14159265)))*exp(-(x-60)^2/8), y=(1/(1*sqrt(2*3.14159265)))*exp(-(x-60)^2/2) (정의역 50~70) ## 🌍 실생활 예시 공장에서 생산된 전구의 평균 수명을 알고 싶다고 하자. 전구의 수명을 측정하려면 전구를 실제로 다 써봐야 하므로(파괴검사), 생산된 전구 전체(모집단)를 검사할 수 없다. 대신 무작위로 $n$개를 뽑아 표본평균 $\bar{X}$를 구하고, 이를 모평균의 추정값으로 사용한다. 표본의 크기를 늘리면 $\sigma(\bar{X})=\sigma/\sqrt{n}$이 작아지므로 추정이 더 정밀해지지만, 검사 비용도 함께 늘어나기 때문에 실제 품질관리에서는 표본 크기와 정확도 사이의 균형을 따져 $n$을 정한다. ## ⚠️ 흔한 실수 - **모평균과 표본평균을 같은 것으로 착각한다.** 모평균 $m$은 모집단이 정해지면 고정되는 상수이지만, 표본평균 $\bar{X}$는 어떤 표본을 뽑느냐에 따라 값이 달라지는 확률변수다. "$\bar{X}$의 값 하나 = $m$"이 아니라, $\bar{X}$는 $m$을 중심으로 흩어져 분포한다. - **$\sigma(\bar{X})$를 계산할 때 제곱근을 빠뜨린다.** $V(\bar{X})=\sigma^2/n$까지는 맞게 구해놓고, 표준편차를 $\sigma(\bar{X})=\sigma/n$으로 잘못 쓰는 경우가 많다. 반드시 $\sigma(\bar{X})=\sqrt{\sigma^2/n}=\sigma/\sqrt{n}$임을 기억해야 한다. - **표본의 합 $S=X_1+\cdots+X_n$과 표본평균 $\bar{X}$를 혼동한다.** $V(S)=n\sigma^2$이지만 $V(\bar{X})=\sigma^2/n$으로, $n$이 분모와 분자에서 각각 다르게 작용한다. $\bar{X}=S/n$이므로 $V(\bar{X})=V(S)/n^2=n\sigma^2/n^2=\sigma^2/n$임을 직접 확인해 보면 헷갈리지 않는다. ## 확인 문제 1. 모평균 $50$, 모표준편차 $8$인 모집단에서 크기 $16$인 표본을 임의추출할 때, 표본평균 $\bar{X}$의 평균과 표준편차를 구하여라. 2. 어떤 모집단에서 크기 $n$인 표본의 표본평균의 표준편차가 $\sigma(\bar{X})=2$였다. 표본의 크기를 $4n$으로 늘리면 $\sigma(\bar{X})$는 어떻게 변하는지, 그 이유를 $\sigma(\bar{X})=\sigma/\sqrt{n}$ 공식을 이용해 설명하여라. (표본 크기를 늘리는 것이 왜 "제곱근만큼만" 효과가 있는지 생각해 보자.) 3. 모표준편차가 $\sigma$인 모집단에서 크기 $n$인 표본을 뽑을 때 $V(\bar{X})=\sigma^2/n$인 이유를, $X_1, X_2, \dots, X_n$이 서로 독립임을 이용하여 설명하여라. 정답 보기: 1. $E(\bar{X})=50$, $\sigma(\bar{X})=8/\sqrt{16}=2$. 2. $\sigma(\bar{X})=\sigma/\sqrt{4n}=\dfrac{\sigma}{2\sqrt{n}}$이므로 원래 값의 $\dfrac{1}{2}$, 즉 $1$이 된다. 표본 크기를 $4$배로 늘려도 표준편차는 $\sqrt{4}=2$배로만 줄어드는데, 이는 분산이 $n$에 반비례하기 때문이다(표본을 늘릴수록 정밀도가 좋아지지만 그 효과는 제곱근 비율로 점점 둔해진다). 3. $X_1,\dots,X_n$이 서로 독립이므로 합의 분산은 분산의 합과 같아 $V(X_1+\cdots+X_n)=n\sigma^2$이다. $\bar{X}=\dfrac{1}{n}(X_1+\cdots+X_n)$이므로 $V(\bar{X})=\dfrac{1}{n^2}\cdot n\sigma^2=\dfrac{\sigma^2}{n}$이 된다. ## 관련 개념 - 확률변수 — 표본평균 자체가 확률변수이므로 선수로 필요하다. - 확률분포, 평균 — 모평균·모분산의 정의에 쓰이는 기본 개념이다. - 정규분포 — 표본평균의 분포를 정규분포로 근사하거나 정확히 나타낼 때 사용한다. - 통계적 추정 — 표본평균을 이용해 모평균을 추정하는 후속 단원이다. --- 관련 개념: - 정규분포 (/wiki/math/%EC%A0%95%EA%B7%9C%EB%B6%84%ED%8F%AC) - 확률변수 (/wiki/math/%ED%99%95%EB%A5%A0%EB%B3%80%EC%88%98) - 확률분포 (/wiki/math/%ED%99%95%EB%A5%A0%EB%B6%84%ED%8F%AC) - 평균 (/wiki/math/%ED%8F%89%EA%B7%A0) - 통계적 추정 (/wiki/math/%ED%86%B5%EA%B3%84%EC%A0%81_%EC%B6%94%EC%A0%95)