# 통계적 추정 분야: 확률통계 학교급: 고등 정식 URL: https://pi.devxdev.xyz/wiki/math/%ED%86%B5%EA%B3%84%EC%A0%81_%EC%B6%94%EC%A0%95 --- ## 정의 **통계적 추정**은 모집단 전체를 조사하기 어려울 때, 모집단에서 뽑은 표본을 이용하여 모집단의 특성을 나타내는 값(모수, parameter)을 추측하는 방법이다. 추정은 크게 두 가지로 나뉜다. - **점추정**: 모수를 하나의 값으로 추정하는 것. 모평균 $m$의 점추정값으로는 표본평균 $\bar{X}$의 값을 사용한다. - **구간추정**: 모수가 포함될 것으로 기대되는 구간을 제시하는 것. 이때 그 구간이 실제로 모수를 포함할 확률을 **신뢰도**(confidence level)라 하고, 신뢰도에 따라 정해지는 구간을 **신뢰구간**(confidence interval)이라 한다. 모집단이 정규분포 $N(m, \sigma^2)$($\sigma$는 시그마, 모표준편차를 뜻한다)을 따르거나 표본의 크기 $n$이 충분히 클 때, 표본평균 $\bar{X}$는 근사적으로 정규분포 $N\left(m, \dfrac{\sigma^2}{n}\right)$을 따른다. 이를 표준화하면 $Z = \dfrac{\bar{X}-m}{\sigma/\sqrt{n}}$($Z$는 표준정규분포를 따르는 확률변수)이 표준정규분포 $N(0,1)$을 따르게 되고, 이를 이용해 모평균 $m$에 대한 신뢰도 95%, 99%의 신뢰구간을 다음과 같이 구한다. $$\bar{x} - 1.96\frac{\sigma}{\sqrt{n}} \le m \le \bar{x} + 1.96\frac{\sigma}{\sqrt{n}} \quad (\text{신뢰도 } 95\%)$$ $$\bar{x} - 2.58\frac{\sigma}{\sqrt{n}} \le m \le \bar{x} + 2.58\frac{\sigma}{\sqrt{n}} \quad (\text{신뢰도 } 99\%)$$ 여기서 $\bar{x}$는 실제로 뽑은 표본 하나의 표본평균 값이다. ## 직관 모평균을 직접 알 수는 없지만, 표본을 뽑아 표본평균을 구하면 그 값이 모평균 근처에 있을 것이라 기대할 수 있다. 문제는 "얼마나 근처인가"인데, 이를 정량화한 것이 신뢰구간이다. 활을 쏘아 과녁 중심(모평균)을 맞히려는 상황을 떠올려 보자. 화살 하나(표본평균 하나)가 정확히 중심에 꽂힐 확률은 낮지만, 중심 주변에 적당한 크기의 원(신뢰구간)을 그려 놓으면 화살의 95%는 그 원 안에 들어온다. 신뢰구간은 "표본평균을 중심으로 어느 정도 폭을 잡아야 그 안에 모평균이 들어올 가능성이 95%가 되는가"를 알려주는 장치다. 폭을 결정하는 $\sigma/\sqrt{n}$은 표본이 클수록($n$↑) 작아지므로, 표본을 많이 뽑을수록 신뢰구간은 더 좁고 정밀해진다. ## 유도 출발점은 이미 배운 모평균과 표본평균의 결과다. 모집단이 정규분포 $N(m, \sigma^2)$을 따르면, 크기 $n$인 표본의 표본평균 $\bar{X}$는 $$\bar{X} \sim N\left(m, \frac{\sigma^2}{n}\right)$$ 을 따른다. 문제는 여기서 막힌다 — $\bar{X}$의 분포는 알아도, 우리가 실제로 궁금한 것은 "$\bar{X}$ 하나를 관찰했을 때 $m$이 어디쯤 있는가"이고, $\bar{X}$의 분포식만으로는 이 질문에 바로 답할 수 없다. $m$을 분포의 평균 자리에서 끄집어내 부등식으로 표현할 방법이 필요하다. 이를 뚫는 방법은 표준화다. $Z = \dfrac{\bar{X}-m}{\sigma/\sqrt{n}}$으로 두면 $Z \sim N(0,1)$이 되어, $m$과 $\sigma$, $n$이 뒤섞인 문제가 표준정규분포 하나로 정리된다. 표준정규분포표를 보면 $$P(-1.96 \le Z \le 1.96) = 0.95$$ 라는 사실을 확인할 수 있다(표준정규분포 곡선 아래에서 양쪽 끝 2.5%씩을 제외한 가운데 95% 넓이에 대응하는 경계값이 $\pm 1.96$이다). 이제 $Z$ 자리에 원래 식을 대입하면 $$P\left(-1.96 \le \frac{\bar{X}-m}{\sigma/\sqrt{n}} \le 1.96\right) = 0.95$$ 이다. 양변에 $\sigma/\sqrt{n} (>0)$을 곱해 부등호 방향을 그대로 유지하면 $$-1.96\frac{\sigma}{\sqrt{n}} \le \bar{X}-m \le 1.96\frac{\sigma}{\sqrt{n}}$$ 이고, 여기서 $\bar{X}$를 이항하기 위해 전체에서 $\bar{X}$를 빼면 $$-\bar{X}-1.96\frac{\sigma}{\sqrt{n}} \le -m \le -\bar{X}+1.96\frac{\sigma}{\sqrt{n}}$$ 양변에 $-1$을 곱하면 부등호 방향이 바뀌어 $$\bar{X}-1.96\frac{\sigma}{\sqrt{n}} \le m \le \bar{X}+1.96\frac{\sigma}{\sqrt{n}}$$ 를 얻는다. 실제로 뽑은 표본의 관측값 $\bar{x}$를 대입하면 이것이 바로 신뢰도 95%의 신뢰구간이다. 신뢰도를 99%로 바꾸고 싶다면, $P(-z \le Z \le z)=0.99$를 만족하는 경계값을 표준정규분포표에서 찾으면 되는데 그 값이 $z=2.58$이고, 같은 과정을 그대로 반복하면 $1.96$ 자리에 $2.58$이 들어간 신뢰도 99%의 식이 나온다. 즉 신뢰구간 공식의 계수 $1.96$, $2.58$은 암기해야 할 상수가 아니라, "표준정규분포에서 가운데 몇 %를 차지하는 구간의 경계는 어디인가"라는 질문의 답일 뿐이다. ## 예시 어느 공장에서 만든 부품의 수명은 모표준편차 $\sigma=8$(단위: 개월)인 정규분포를 따른다고 알려져 있다. 이 공장 제품 중 $n=64$개를 임의추출하여 조사했더니 표본평균이 $\bar{x}=50$이었다. 이때 모평균 $m$에 대한 신뢰도 95%의 신뢰구간을 구하면, $$50 - 1.96\times\frac{8}{\sqrt{64}} \le m \le 50 + 1.96\times\frac{8}{\sqrt{64}}$$ $\sqrt{64}=8$이므로 $\dfrac{8}{8}=1$, 따라서 $50-1.96 \le m \le 50+1.96$, 즉 $48.04 \le m \le 51.96$이다. 아래는 이 표본평균 $\bar{X}$가 따르는 분포 $N(50, 1)$의 확률밀도함수를 나타낸 그래프로, 신뢰구간은 이 곡선 아래 넓이의 95%를 차지하는 구간에 대응한다. 그래프: y=(1/sqrt(2*3.14159*1))*exp(-(x-50)^2/(2*1)) (정의역 46~54) ## 🌍 실생활 예시 여론조사 결과에 흔히 나오는 "지지율 42%, 표본오차 ±3.1%p, 신뢰수준 95%"라는 문구가 통계적 추정의 대표적 적용 사례다. 전 국민을 모두 조사할 수 없으므로 일부(표본, 보통 1,000명 안팎)만 조사한 뒤, 표본비율을 이용해 실제 지지율(모수)이 들어있을 신뢰구간을 계산해 발표하는 것이다. ## ⚠️ 흔한 실수 - **잘못된 생각**: "신뢰도 95%"는 "모평균이 이 신뢰구간 안에 있을 확률이 95%"라는 뜻이다. → **왜 틀렸는가**: 모평균 $m$은 정해진 상수이지 확률적으로 변하는 값이 아니다. 확률적으로 변하는 것은 표본을 뽑을 때마다 달라지는 신뢰구간 쪽이다. 정확한 의미는 "같은 방법으로 신뢰구간을 100번 만들면 그중 약 95개가 실제 모평균을 포함한다"는 것이다. - **잘못된 생각**: 신뢰구간을 좁히려면 표본표준편차나 산포도를 줄이면 된다. → **왜 틀렸는가**: $\sigma$는 모집단이 가진 고유한 값으로 조사자가 바꿀 수 없다. 신뢰구간의 폭 $2\times1.96\dfrac{\sigma}{\sqrt{n}}$을 줄이는 유일한 방법은 표본의 크기 $n$을 늘리는 것이다. - **잘못된 생각**: 신뢰도를 99%로 높이면 신뢰구간이 더 좁아져서 "더 정확한" 추정이 된다. → **왜 틀렸는가**: 신뢰도가 높아질수록 $z$값(1.96 → 2.58)이 커지므로 신뢰구간의 폭은 오히려 넓어진다. 더 확실하게 맞히려면 그만큼 범위를 넉넉하게 잡아야 하는 것이다. ## 확인 문제 1. 모표준편차가 $\sigma=6$인 모집단에서 크기 $n=36$인 표본을 뽑았더니 표본평균이 $\bar{x}=72$였다. 모평균 $m$에 대한 신뢰도 95%의 신뢰구간을 구하시오. 2. 위 문제에서 신뢰도를 99%로 바꾸면 신뢰구간의 폭이 95%일 때보다 넓어지는지 좁아지는지, 그 이유를 설명하시오. 3. (직관 확인) 문제 1의 신뢰구간의 폭을 절반으로 줄이려면 표본의 크기 $n$을 몇 배로 늘려야 하는지 구하고, 그 이유를 $\sigma/\sqrt{n}$의 구조로 설명하시오. 정답 보기: 1. $72 - 1.96\times\dfrac{6}{\sqrt{36}} \le m \le 72 + 1.96\times\dfrac{6}{\sqrt{36}}$, 즉 $72-1.96 \le m \le 72+1.96$이므로 $70.04 \le m \le 73.96$. 2. 넓어진다. 신뢰도가 높아지면 곱해지는 $z$값이 1.96에서 2.58로 커지기 때문에 구간의 폭 $2\times z\times\dfrac{\sigma}{\sqrt{n}}$도 함께 커진다. 3. $4$배로 늘려야 한다. 폭은 $\sigma/\sqrt{n}$에 비례하는데, $n$을 4배로 하면 $\sqrt{n}$은 2배가 되어 폭이 정확히 절반이 된다. 즉 표본을 더 늘려도 정밀도는 $\sqrt{n}$에 비례해서만 좋아지므로, 오차를 절반으로 줄이려면 조사 비용(표본 수)은 4배가 필요하다. ## 📜 역사 모집단 전체를 조사할 수 없는 상황에서 표본 하나의 결과만으로 모수를 얼마나 믿을 수 있는지 수치로 표현할 방법이 없다는 것이 20세기 초 통계학의 문제였다. 폴란드 태생의 통계학자 예지 네이만(Jerzy Neyman)은 1930년대에 이 문제를 풀기 위해, 모수 자체는 확률적으로 변하지 않는 상수로 두면서도 표본에서 얻은 구간이 모수를 포함할 확률(신뢰도)이라는 개념을 도입했다. 이는 당시 널리 쓰이던 베이즈적 확률 해석과는 다른 방식으로 추정의 불확실성을 정량화하려는 시도였고, 이 아이디어가 오늘날의 신뢰구간으로 정착했다. 이후 표준정규분포의 경계값 1.96과 2.58은 신뢰도 95%, 99%를 나타내는 표준값으로 통계 교과서에 자리 잡았고, 여론조사·품질관리·의약품 임상시험 등 표본으로 모수를 추정해야 하는 실무 전반에서 지금도 쓰이고 있다. ## 관련 개념 - 모평균과 표본평균 - 정규분포 - 확률분포 - 대푯값과 산포도 --- 관련 개념: - 모평균과 표본평균 (/wiki/math/%EB%AA%A8%ED%8F%89%EA%B7%A0%EA%B3%BC_%ED%91%9C%EB%B3%B8%ED%8F%89%EA%B7%A0) - 정규분포 (/wiki/math/%EC%A0%95%EA%B7%9C%EB%B6%84%ED%8F%AC) - 확률분포 (/wiki/math/%ED%99%95%EB%A5%A0%EB%B6%84%ED%8F%AC) - 대푯값과 산포도 (/wiki/math/%EB%8C%80%ED%91%AF%EA%B0%92%EA%B3%BC_%EC%82%B0%ED%8F%AC%EB%8F%84)