# 확률분포 분야: 확률통계 학교급: 고등 정식 URL: https://pi.devxdev.xyz/wiki/math/%ED%99%95%EB%A5%A0%EB%B6%84%ED%8F%AC --- 위키 문서 파일이 아니라 텍스트로 직접 주어진 문서이므로, 편집 결과를 아래에 문서 전체로 출력합니다. ## 정의 이산확률변수 $X$(엑스, 확률변수)가 가질 수 있는 값을 $x_1, x_2, \ldots, x_n$이라 하고, $X$가 각 값을 가질 확률을 $$P(X = x_i) = p_i \quad (i = 1, 2, \ldots, n)$$ 라 하자. 이때 $X$의 값과 그에 대응하는 확률 $p_i$ 사이의 대응 관계를 $X$의 **확률분포**라 한다. 확률분포는 보통 표로 나타내며, 다음 두 조건을 항상 만족한다. $$0 \le p_i \le 1, \qquad p_1 + p_2 + \cdots + p_n = 1$$ 확률분포가 주어지면 $X$의 **기댓값**(평균) $E(X)$(이 엑스, expectation의 E)와 **분산** $V(X)$, **표준편차** $\sigma(X)$(시그마 엑스)를 다음과 같이 정의한다. $$E(X) = \sum_{i=1}^{n} x_i p_i, \qquad V(X) = E\big((X-E(X))^2\big) = E(X^2) - \{E(X)\}^2, \qquad \sigma(X) = \sqrt{V(X)}$$ ## 직관 확률변수는 실험 결과에 숫자를 붙여 놓은 것일 뿐이고, 확률분포는 그 숫자들 위에 확률이라는 "무게"를 얹어 놓은 지도라고 생각하면 된다. 예를 들어 동전을 두 번 던져 앞면의 수를 $X$라 하면 $X$는 0, 1, 2라는 값을 가질 수 있는데, 이 세 값에 확률이라는 무게 $\frac14, \frac12, \frac14$가 각각 걸려 있다는 것이 확률분포다. 이 무게들의 총합은 항상 1이 되어야 하는데, 그렇지 않다면 "일어날 수 있는 모든 경우"를 다 세지 않았거나 잘못 셌다는 뜻이다. ## 유도 이미 알고 있는 것은 대푯값과 산포도에서 다룬 아이디어, 즉 자료가 흩어진 정도를 재려면 각 값에서 평균을 뺀 편차를 제곱해서 평균 낸다는 것이다. 확률변수 $X$에 대해서도 같은 방식으로 분산을 "편차제곱의 기댓값"으로 정의한다. $$V(X) = E\big((X - m)^2\big) = \sum_{i=1}^n (x_i - m)^2 p_i \qquad (m = E(X))$$ 그런데 이 식대로 계산하려면 $x_i$마다 편차 $x_i-m$을 구하고 제곱한 뒤 확률을 곱해 다시 더해야 해서 번거롭다. 괄호를 직접 전개해서 더 간단히 만들 수 있는지 확인해 보자. $(x_i-m)^2 = x_i^2 - 2mx_i + m^2$이므로 $$V(X) = \sum_{i=1}^n \big(x_i^2 - 2mx_i + m^2\big)p_i = \sum_{i=1}^n x_i^2 p_i \;-\; 2m\sum_{i=1}^n x_i p_i \;+\; m^2\sum_{i=1}^n p_i$$ 여기서 $\displaystyle\sum_{i=1}^n x_i^2 p_i = E(X^2)$이고, $\displaystyle\sum_{i=1}^n x_i p_i = E(X) = m$이며, $\displaystyle\sum_{i=1}^n p_i = 1$(확률의 총합)이므로 $$V(X) = E(X^2) - 2m\cdot m + m^2\cdot 1 = E(X^2) - 2m^2 + m^2 = E(X^2) - m^2$$ $m=E(X)$를 다시 대입하면 $$V(X) = E(X^2) - \{E(X)\}^2$$ 이 얻어진다. 이 식은 편차를 일일이 구하지 않고 $X^2$의 기댓값과 $X$의 기댓값만으로 분산을 계산할 수 있게 해 주므로, 정의식을 직접 쓰는 것보다 실제 계산에서 훨씬 편리하다. ## 성질 - 확률분포표를 완성했다면 반드시 확률의 합이 1인지 확인해야 하며, 이는 계산 검증의 기본 도구가 된다. - $E(X)$는 확률로 가중된 평균이므로, 단순히 $x_i$들을 산술평균한 값과 다를 수 있다. - $V(X) = E(X^2) - \{E(X)\}^2$ 공식은 분산을 직접 정의($E((X-E(X))^2)$)로 계산하는 것보다 대체로 더 편리하다. ## 예시 동전 2개를 동시에 던지는 실험에서 앞면이 나오는 개수를 $X$라 하자. 표본공간은 (앞,앞), (앞,뒤), (뒤,앞), (뒤,뒤)의 4가지이므로 | $x_i$ | 0 | 1 | 2 | |---|---|---|---| | $P(X=x_i)$ | $\dfrac14$ | $\dfrac12$ | $\dfrac14$ | 이고 합이 $\frac14+\frac12+\frac14=1$로 확인된다. 이때 $$E(X) = 0\cdot\frac14 + 1\cdot\frac12 + 2\cdot\frac14 = 1$$ $$E(X^2) = 0^2\cdot\frac14 + 1^2\cdot\frac12 + 2^2\cdot\frac14 = \frac32$$ $$V(X) = E(X^2) - \{E(X)\}^2 = \frac32 - 1^2 = \frac12, \qquad \sigma(X) = \sqrt{\frac12} = \frac{\sqrt2}{2}$$ ## 🌍 실생활 예시 보험회사는 사고 발생 여부와 그에 따른 지급액을 확률변수로 놓고 확률분포를 만든다. 예를 들어 자동차 사고가 없을 확률이 0.9이고 사고 시 평균 지급액이 정해져 있다면, 지급액을 $X$로 하는 확률분포표를 만들어 $E(X)$(기대 지급액)를 계산하고, 이 값을 바탕으로 적정 보험료를 정한다. 즉 확률분포는 "평균적으로 얼마를 예상해야 하는가"를 수치화하는 도구로 실제 금융·보험 산업에서 쓰인다. ## ⚠️ 흔한 실수 - **잘못된 생각**: 확률분포표를 다 채운 뒤 합이 1이 되는지 확인하지 않고 넘어간다. → 경우의 수를 빠뜨리거나 중복으로 세면 합이 1이 아니게 되는데, 이 검증을 생략하면 오류를 그대로 답으로 낸다. - **잘못된 생각**: $E(X)$를 구할 때 확률을 무시하고 $x_i$들의 산술평균 $\dfrac{x_1+x_2+\cdots+x_n}{n}$을 계산한다. → $E(X)=\sum x_i p_i$는 확률이라는 가중치를 곱한 합이며, 각 값이 같은 비중으로 나온다는 보장이 없으므로 단순 평균과는 다르다. - **잘못된 생각**: $V(X)$를 구할 때 $E(X^2)$와 $\{E(X)\}^2$를 혼동해서 $E(X)^2$ 대신 $E(X^2)$만 쓰거나, 순서를 바꿔 계산한다. → $E(X^2)$는 "$X^2$의 기댓값"이고 $\{E(X)\}^2$는 "$X$의 기댓값을 제곱한 것"으로 서로 다른 값이며, 반드시 $E(X^2)-\{E(X)\}^2$ 순서로 빼야 한다. ## 확인 문제 1. 주사위를 한 번 던져 나오는 눈의 수를 $X$라 할 때, $X$의 확률분포표를 만들고 $E(X)$를 구하시오. 2. 어떤 확률변수 $X$의 확률분포가 $P(X=0)=a$, $P(X=1)=2a$, $P(X=2)=3a$로 주어졌다. 상수 $a$의 값을 구하시오. 3. 위 "동전 2개" 예시에서 만약 표를 $P(X=0)=\frac14$, $P(X=1)=\frac14$, $P(X=2)=\frac14$로 (잘못) 적었다고 하자. 이 표가 확률분포가 될 수 없는 이유를 경우의 수를 직접 나열하여 설명하고, 이 과정이 왜 확률분포의 "합이 1"이라는 조건과 연결되는지 서술하시오. 정답 보기: 1. $P(X=k)=\frac16$ ($k=1,\ldots,6$)이고 $E(X) = \frac16(1+2+3+4+5+6) = \frac{21}{6} = 3.5$ 2. 합이 1이어야 하므로 $a+2a+3a=6a=1$, 즉 $a=\dfrac16$ 3. (앞,앞), (앞,뒤), (뒤,앞), (뒤,뒤) 4가지 중 $X=0$은 1가지, $X=1$은 2가지, $X=2$는 1가지이므로 실제 확률은 $\frac14, \frac12, \frac14$여야 한다. 잘못된 표는 $\frac14+\frac14+\frac14=\frac34 \ne 1$이 되어 확률분포의 정의(전체 확률의 합은 반드시 1)를 어기므로 성립할 수 없다. ## 📜 역사 17세기 유럽에서는 도박에서 게임이 중간에 끝났을 때 판돈을 어떻게 나누는 것이 공정한지를 두고 다투는 문제가 많았다. 파스칼과 페르마는 1654년 편지를 주고받으며, 앞으로 일어날 수 있는 결과들과 그 확률을 따져 각자의 몫을 계산하는 방법을 찾아냈다. 이 논의를 이어받은 하위헌스는 1657년에 낸 책에서, 가능한 각 결과에 그 확률을 곱해서 더한 값을 "기댓값"으로 명확히 정의했는데, 이것이 오늘날 $E(X)=\sum x_i p_i$ 공식의 원형이다. 이후 라플라스가 19세기 초 저작에서 확률변수가 가질 수 있는 값들과 그 확률의 대응 관계를 체계적으로 정리하면서, 오늘날의 확률분포 개념이 자리 잡았다. ## 관련 개념 - 확률변수 — 확률분포가 다루는 대상 - 확률 — 확률분포의 각 값에 매겨지는 무게의 개념적 뿌리 - 경우의 수 — 확률을 계산하기 위한 기초 도구 - 이항분포 — 독립시행을 반복할 때 나타나는 대표적인 확률분포 - 정규분포 — 연속확률변수로 확장된 확률분포 --- 관련 개념: - 확률변수 (/wiki/math/%ED%99%95%EB%A5%A0%EB%B3%80%EC%88%98) - 대푯값과 산포도 (/wiki/math/%EB%8C%80%ED%91%AF%EA%B0%92%EA%B3%BC_%EC%82%B0%ED%8F%AC%EB%8F%84) - 평균 (/wiki/math/%ED%8F%89%EA%B7%A0) - 확률 (/wiki/math/%ED%99%95%EB%A5%A0) - 경우의 수 (/wiki/math/%EA%B2%BD%EC%9A%B0%EC%9D%98_%EC%88%98) - 이항분포 (/wiki/math/%EC%9D%B4%ED%95%AD%EB%B6%84%ED%8F%AC) - 정규분포 (/wiki/math/%EC%A0%95%EA%B7%9C%EB%B6%84%ED%8F%AC)