# 정규분포 분야: 확률통계 학교급: 고등 정식 URL: https://pi.devxdev.xyz/wiki/math/%EC%A0%95%EA%B7%9C%EB%B6%84%ED%8F%AC --- ## 정의 연속확률변수 $X$(모든 실수값을 가질 수 있는 확률변수)가 평균 $m$, 표준편차 $\sigma$($\sigma>0$)를 모수로 갖고, 다음과 같은 확률밀도함수를 가질 때 $X$는 **정규분포**를 따른다고 한다. $$f(x) = \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{(x-m)^2}{2\sigma^2}} \quad (-\infty < x < \infty)$$ 이를 $X \sim N(m, \sigma^2)$($X$는 평균 $m$, 분산 $\sigma^2$인 정규분포 엔을 따른다고 읽는다)로 나타낸다. $X$가 구간 $[a,b]$에 속할 확률은 곡선 $y=f(x)$와 $x$축, 두 직선 $x=a$, $x=b$로 둘러싸인 부분의 넓이이며, $\displaystyle P(a\le X\le b)=\int_a^b f(x)\,dx$로 나타낸다. 특히 $m=0$, $\sigma=1$인 정규분포 $N(0,1)$을 **표준정규분포**라 하고, 확률변수 $X\sim N(m,\sigma^2)$을 $$Z=\frac{X-m}{\sigma}$$ 로 바꾸면 $Z\sim N(0,1)$이 된다. 이 변환을 **표준화**라 한다. ## 직관 정규분포는 평균 주변에 값이 몰려 있고 평균에서 멀어질수록 점점 드물어지는, 세상의 수많은 측정값(키, 시험 점수, 측정 오차 등)이 실제로 따르는 대표적인 분포 모양이다. 그래프는 평균 $m$을 중심으로 좌우가 완전히 대칭인 종 모양(bell curve)이며, $\sigma$가 클수록 옆으로 퍼진 완만한 모양이 되고 $\sigma$가 작을수록 좁고 뾰족한 모양이 된다. 문제는 $m$과 $\sigma$가 다르면 그래프도 다 달라서, 매번 다른 곡선의 넓이를 계산해야 한다는 점이다. 표준화는 "모든 정규분포는 사실 하나의 표준정규분포를 평행이동·확대/축소한 것뿐"이라는 사실을 이용해, 어떤 $N(m,\sigma^2)$이든 $Z=(X-m)/\sigma$로 바꾸면 똑같은 표준정규분포표 하나로 확률을 구할 수 있게 해 준다. ## 성질 - 그래프는 직선 $x=m$에 대해 대칭이고, $x=m$에서 최댓값을 가진다. - $x$축을 점근선으로 하며, 곡선과 $x$축 사이의 전체 넓이는 $1$이다. - $\sigma$가 커질수록 곡선은 낮고 옆으로 넓게 퍼지며, $\sigma$가 작을수록 높고 좁아진다. - (68-95-99.7 규칙) $P(m-\sigma\le X\le m+\sigma)\approx 0.683$, $P(m-2\sigma\le X\le m+2\sigma)\approx 0.954$, $P(m-3\sigma\le X\le m+3\sigma)\approx 0.997$이다. - $X\sim B(n,p)$(이항분포)에서 $n$이 충분히 크고 $np\ge 5$, $n(1-p)\ge 5$이면 $X$는 근사적으로 $N(np,\,np(1-p))$를 따른다. ## 예시 $X\sim N(50, 10^2)$이고 $P(0\le Z\le 1)=0.3413$, $P(0\le Z\le 2)=0.4772$일 때 $P(40\le X\le 70)$을 구해 보자. $$Z_1=\frac{40-50}{10}=-1,\qquad Z_2=\frac{70-50}{10}=2$$ 이므로 $$P(40\le X\le 70)=P(-1\le Z\le 2)=P(0\le Z\le1)+P(0\le Z\le2)=0.3413+0.4772=0.8185$$ 표준정규분포의 그래프 모양은 다음과 같다. 그래프: y=exp(-x^2/2)/sqrt(2*pi) (정의역 -4~4) ## 🌍 실생활 예시 전국 단위 시험(예: 대학수학능력시험) 성적은 대체로 정규분포에 가깝게 나타난다. 그래서 원점수 대신 표준화한 점수(표준점수)를 사용하는데, 이는 $Z=(X-m)/\sigma$로 각 학생의 점수를 "평균에서 표준편차 몇 배만큼 떨어져 있는가"로 바꾼 값이다. 서로 다른 과목(평균·표준편차가 다른)의 성적을 비교하거나, 상위 몇 퍼센트에 속하는지 계산할 때 정규분포와 표준화가 그 근거가 된다. ## ⚠️ 흔한 실수 - **잘못된 생각**: 연속확률변수도 이산확률변수처럼 $P(X=70)$이 어떤 값을 가질 것이다. → **왜 틀렸는가**: 정규분포는 연속확률변수이므로 한 점에서의 넓이는 $0$이다. 즉 $P(X=70)=0$이고, 반드시 구간으로 물어야 확률이 생긴다($P(X\le 70)$과 $P(X<70)$이 같다). - **잘못된 생각**: 표준화할 때 $\sigma^2$(분산)으로 나누면 된다. → **왜 틀렸는가**: 표준화 공식은 $Z=(X-m)/\sigma$로, 분산이 아니라 표준편차 $\sigma$로 나눈다. 분산으로 나누면 단위가 맞지 않아 $Z$가 표준정규분포를 따르지 않는다. - **잘못된 생각**: $Z$값이 음수이면 표준정규분포표를 쓸 수 없다. → **왜 틀렸는가**: 그래프가 $x=0$에 대해 대칭이므로 $P(Z\le -a)=P(Z\ge a)=0.5-P(0\le Z\le a)$처럼 대칭성을 이용하면 음수 $Z$도 항상 계산할 수 있다. ## 확인 문제 1. $X\sim N(30, 5^2)$일 때 $P(X\ge 40)$을 구하시오. (단, $P(0\le Z\le 2)=0.4772$) 2. 왜 정규분포표는 여러 개가 아니라 표준정규분포 $N(0,1)$ 하나만 만들어 두는 것으로 충분할까? 이를 설명하고, 그 원리를 이용해 $X\sim N(50,10^2)$일 때 $P(40\le X\le 70)$을 직접 계산해 보시오. 3. 어떤 동전을 $100$번 던져 앞면이 나오는 횟수를 $X$라 하면 $X\sim B(100, 0.5)$이다. $np$와 $n(1-p)$를 각각 구해 정규근사가 가능한 조건을 확인하고, $X$를 근사하는 정규분포 $N(m,\sigma^2)$의 $m$, $\sigma$를 구하시오. 정답 보기: 1. $Z=(40-30)/5=2$이므로 $P(X\ge 40)=P(Z\ge 2)=0.5-0.4772=0.0228$이다. 2. 정규분포는 모두 표준정규분포를 평행이동하고 축을 늘이거나 줄인 모양이므로, $Z=(X-m)/\sigma$로 바꾸면 어떤 $N(m,\sigma^2)$이든 같은 표 하나로 해결된다. 계산: $Z_1=(40-50)/10=-1$, $Z_2=(70-50)/10=2$이므로 $P(40\le X\le70)=P(-1\le Z\le2)=0.3413+0.4772=0.8185$. 3. $np=100\times0.5=50\ge5$, $n(1-p)=100\times0.5=50\ge5$이므로 정규근사가 가능하다. $m=np=50$, $\sigma^2=np(1-p)=25$이므로 $\sigma=5$, 즉 $X$는 근사적으로 $N(50,5^2)$을 따른다. ## 관련 개념 - 확률변수 — 정규분포를 따르는 대상인 연속확률변수의 기초 개념 - 확률분포 — 확률변수의 값과 확률의 대응 관계라는 더 넓은 틀 - 이항분포 — 조건을 만족하면 정규분포로 근사되는 이산확률분포 - 통계적 추정 — 정규분포를 이용해 모평균 등을 추정하는 후속 내용 - 대푯값과 산포도 — 정규분포의 모수인 평균·표준편차의 의미를 다지는 개념 --- 관련 개념: - 이항분포 (/wiki/math/%EC%9D%B4%ED%95%AD%EB%B6%84%ED%8F%AC) - 확률변수 (/wiki/math/%ED%99%95%EB%A5%A0%EB%B3%80%EC%88%98) - 확률분포 (/wiki/math/%ED%99%95%EB%A5%A0%EB%B6%84%ED%8F%AC) - 통계적 추정 (/wiki/math/%ED%86%B5%EA%B3%84%EC%A0%81_%EC%B6%94%EC%A0%95) - 대푯값과 산포도 (/wiki/math/%EB%8C%80%ED%91%AF%EA%B0%92%EA%B3%BC_%EC%82%B0%ED%8F%AC%EB%8F%84)