🧭 선수 개념 — 이 문서는 다음을 안다는 전제로 쓰였어요: 확률변수 · 확률분포 · 이항분포
정의
연속확률변수 $X$(모든 실수값을 가질 수 있는 확률변수)가 평균 $m$, 표준편차 $\sigma$($\sigma>0$)를 모수로 갖고, 다음과 같은 확률밀도함수를 가질 때 $X$는 정규분포를 따른다고 한다.
$$f(x) = \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{(x-m)^2}{2\sigma^2}} \quad (-\infty < x < \infty)$$
이를 $X \sim N(m, \sigma^2)$($X$는 평균 $m$, 분산 $\sigma^2$인 정규분포 엔을 따른다고 읽는다)로 나타낸다. $X$가 구간 $[a,b]$에 속할 확률은 곡선 $y=f(x)$와 $x$축, 두 직선 $x=a$, $x=b$로 둘러싸인 부분의 넓이이며, $\displaystyle P(a\le X\le b)=\int_a^b f(x)\,dx$로 나타낸다.
특히 $m=0$, $\sigma=1$인 정규분포 $N(0,1)$을 표준정규분포라 하고, 확률변수 $X\sim N(m,\sigma^2)$을
정규분포는 평균 주변에 값이 몰려 있고 평균에서 멀어질수록 점점 드물어지는, 세상의 수많은 측정값(키, 시험 점수, 측정 오차 등)이 실제로 따르는 대표적인 분포 모양이다. 그래프는 평균 $m$을 중심으로 좌우가 완전히 대칭인 종 모양(bell curve)이며, $\sigma$가 클수록 옆으로 퍼진 완만한 모양이 되고 $\sigma$가 작을수록 좁고 뾰족한 모양이 된다.
문제는 $m$과 $\sigma$가 다르면 그래프도 다 달라서, 매번 다른 곡선의 넓이를 계산해야 한다는 점이다. 표준화는 "모든 정규분포는 사실 하나의 표준정규분포를 평행이동·확대/축소한 것뿐"이라는 사실을 이용해, 어떤 $N(m,\sigma^2)$이든 $Z=(X-m)/\sigma$로 바꾸면 똑같은 표준정규분포표 하나로 확률을 구할 수 있게 해 준다.
전국 단위 시험(예: 대학수학능력시험) 성적은 대체로 정규분포에 가깝게 나타난다. 그래서 원점수 대신 표준화한 점수(표준점수)를 사용하는데, 이는 $Z=(X-m)/\sigma$로 각 학생의 점수를 "평균에서 표준편차 몇 배만큼 떨어져 있는가"로 바꾼 값이다. 서로 다른 과목(평균·표준편차가 다른)의 성적을 비교하거나, 상위 몇 퍼센트에 속하는지 계산할 때 정규분포와 표준화가 그 근거가 된다.
⚠️ 흔한 실수
잘못된 생각: 연속확률변수도 이산확률변수처럼 $P(X=70)$이 어떤 값을 가질 것이다. → 왜 틀렸는가: 정규분포는 연속확률변수이므로 한 점에서의 넓이는 $0$이다. 즉 $P(X=70)=0$이고, 반드시 구간으로 물어야 확률이 생긴다($P(X\le 70)$과 $P(X<70)$이 같다).
잘못된 생각: 표준화할 때 $\sigma^2$(분산)으로 나누면 된다. → 왜 틀렸는가: 표준화 공식은 $Z=(X-m)/\sigma$로, 분산이 아니라 표준편차 $\sigma$로 나눈다. 분산으로 나누면 단위가 맞지 않아 $Z$가 표준정규분포를 따르지 않는다.
잘못된 생각: $Z$값이 음수이면 표준정규분포표를 쓸 수 없다. → 왜 틀렸는가: 그래프가 $x=0$에 대해 대칭이므로 $P(Z\le -a)=P(Z\ge a)=0.5-P(0\le Z\le a)$처럼 대칭성을 이용하면 음수 $Z$도 항상 계산할 수 있다.
왜 정규분포표는 여러 개가 아니라 표준정규분포 $N(0,1)$ 하나만 만들어 두는 것으로 충분할까? 이를 설명하고, 그 원리를 이용해 $X\sim N(50,10^2)$일 때 $P(40\le X\le 70)$을 직접 계산해 보시오.
어떤 동전을 $100$번 던져 앞면이 나오는 횟수를 $X$라 하면 $X\sim B(100, 0.5)$이다. $np$와 $n(1-p)$를 각각 구해 정규근사가 가능한 조건을 확인하고, $X$를 근사하는 정규분포 $N(m,\sigma^2)$의 $m$, $\sigma$를 구하시오.