# 대푯값과 산포도 분야: 확률통계 학교급: 중등 정식 URL: https://pi.devxdev.xyz/wiki/math/%EB%8C%80%ED%91%AF%EA%B0%92%EA%B3%BC_%EC%82%B0%ED%8F%AC%EB%8F%84 --- ## 정의 **대푯값**은 여러 개의 자료(변량)를 하나의 수로 대표해서 나타낸 값이다. 대표적으로 평균, 중앙값, 최빈값이 있다. - **평균**: 변량을 모두 더해 자료의 개수로 나눈 값. 변량이 $x_1, x_2, \ldots, x_n$일 때 평균 $\bar{x}$(엑스 바라고 읽는다)는 $$\bar{x} = \frac{x_1+x_2+\cdots+x_n}{n} = \frac{1}{n}\sum_{i=1}^{n} x_i$$ ($\sum$는 시그마라고 읽으며, 뒤에 붙은 값들을 모두 더하라는 뜻이다.) - **중앙값**: 자료를 크기 순서로 나열했을 때 한가운데 위치하는 값. 자료 개수가 짝수이면 가운데 두 값의 평균을 취한다. - **최빈값**: 자료 중에서 가장 많이 나타나는 값. **산포도**는 자료가 대푯값(주로 평균) 주변에 얼마나 흩어져 있는지를 나타내는 값이다. 대표적으로 범위, 분산, 표준편차가 있다. - **편차**: 변량에서 평균을 뺀 값, $x_i - \bar{x}$ - **분산**: 편차를 제곱한 값들의 평균, $s^2 = \dfrac{1}{n}\sum_{i=1}^{n}(x_i-\bar{x})^2$ - **표준편차**: 분산의 양의 제곱근, $s = \sqrt{s^2}$ ## 직관 대푯값은 "이 자료를 한마디로 요약하면 무엇인가"에 대한 답이고, 산포도는 "그 요약이 자료 전체를 얼마나 잘 대표하는가"에 대한 답이다. 예를 들어 두 반의 평균 점수가 똑같이 70점이어도, 한 반은 모두 65~75점 사이에 몰려 있고 다른 반은 20점부터 100점까지 흩어져 있을 수 있다. 평균만 보면 두 반이 똑같아 보이지만 실제로는 전혀 다른 반이다. 산포도는 바로 이 "흩어진 정도"를 수치화해서 평균이 놓치는 정보를 보완해 준다. 편차를 왜 제곱하는지도 직관적으로 이해할 수 있다. 편차 $x_i-\bar{x}$는 평균보다 큰 값은 양수, 작은 값은 음수가 되어 그냥 더하면 항상 0이 되어버린다(흩어진 정도를 전혀 알 수 없다). 그래서 제곱해서 부호를 없앤 뒤 평균을 낸 것이 분산이다. ## 유도 산포도를 어떻게 숫자 하나로 나타낼 수 있을까? 자연스러운 첫 시도는 "각 변량이 평균에서 얼마나 떨어져 있는지"를 나타내는 편차 $x_i - \bar{x}$들을 모두 구한 뒤 그 평균을 내는 것이다. 그런데 이 편차의 평균은 항상 0이 된다. 실제로 편차의 합을 계산해 보면 $$\sum_{i=1}^n (x_i - \bar x) = \sum_{i=1}^n x_i - n\bar x = n\bar x - n\bar x = 0$$ 이다(평균의 정의에 의해 $\sum x_i = n\bar x$이기 때문). 즉 평균보다 큰 변량의 양수 편차와 평균보다 작은 변량의 음수 편차가 정확히 상쇄되어, 편차를 그냥 더하기만 해서는 자료가 얼마나 흩어져 있는지 전혀 알 수 없다. 이 상쇄를 막으려면 편차의 부호를 없애야 한다. 방법은 두 가지가 있다: 절댓값을 씌우거나, 제곱을 하는 것이다. 절댓값 $|x_i - \bar x|$의 평균(평균절대편차)도 산포도를 나타낼 수는 있지만, 절댓값은 식을 전개하거나 다루는 데 있어 대수적으로 까다롭다. 반면 제곱 $(x_i-\bar x)^2$은 부호를 없애면서도 다항식이라 계산과 이론 전개가 훨씬 간단하다. 그래서 편차를 제곱한 값들의 평균 $$s^2 = \frac{1}{n}\sum_{i=1}^n (x_i-\bar x)^2$$ 을 산포도의 척도로 삼고, 이를 **분산**이라 정의한다. 다만 분산은 편차를 제곱했기 때문에 단위도 원래 변량의 제곱(예: 점수의 분산이면 점²)이 되어버려, 원래 자료와 직접 비교하기 어렵다. 이 문제를 해결하려면 제곱을 상쇄시키는 연산, 즉 제곱근을 다시 취하면 된다. 그래서 $$s = \sqrt{s^2} = \sqrt{\frac{1}{n}\sum_{i=1}^n (x_i-\bar x)^2}$$ 으로 정의한 것이 **표준편차**이며, 이렇게 하면 산포도를 원래 변량과 같은 단위로 나타낼 수 있다. ## 예시 5명의 수학 점수가 70, 80, 80, 90, 100점이라 하자. - 평균: $\bar{x} = \dfrac{70+80+80+90+100}{5} = \dfrac{420}{5} = 84$(점) - 중앙값: 크기순 70, 80, 80, 90, 100에서 가운데 값은 80점 - 최빈값: 두 번 나온 80점 편차는 각각 $-14, -4, -4, 6, 16$이고, 합은 $0$이다(항상 그렇다). 편차를 제곱하면 $196, 16, 16, 36, 256$이고 합은 $520$이므로 $$s^2 = \frac{520}{5} = 104, \qquad s = \sqrt{104} \approx 10.2$$ 즉 이 반 점수는 평균 84점을 중심으로 대략 10점 정도씩 흩어져 있다. ## 🌍 실생활 예시 두 공장 A, B에서 만든 볼트의 지름이 둘 다 평균 10mm라고 홍보해도, A 공장은 표준편차가 0.02mm로 작고 B 공장은 0.5mm로 크다면 품질 차이가 크다. 부품이 다른 부품과 정확히 맞물려야 하는 경우 평균만으로는 부족하고, 표준편차(산포도)가 작아야 "불량률이 낮고 일정한 품질"임을 보장할 수 있다. 그래서 공장의 품질 관리에서는 평균과 함께 표준편차를 반드시 함께 관리한다. ## ⚠️ 흔한 실수 - **잘못된 생각**: 편차를 다 더하면 0이 나오니 "이 자료는 흩어져 있지 않다"고 판단한다. → **왜 틀렸는가**: 편차의 합은 자료가 어떻게 흩어져 있든 항상 0이다(양의 편차와 음의 편차가 상쇄되기 때문). 흩어진 정도를 알려면 편차를 제곱해서 더한 분산을 봐야 한다. - **잘못된 생각**: 자료 개수가 짝수일 때도 가운데 근처의 값 하나만 골라 중앙값이라 한다. → **왜 틀렸는가**: 자료 개수가 짝수이면 정확히 가운데에 오는 값이 두 개이므로, 그 두 값의 평균을 중앙값으로 삼아야 한다. - **잘못된 생각**: 표준편차와 분산의 단위(값)를 그냥 같다고 생각한다. → **왜 틀렸는가**: 분산은 편차를 "제곱"해서 구하므로 원래 변량 단위의 제곱 단위를 갖는다(예: 점수²). 표준편차는 분산에 제곱근을 씌워 원래 변량과 같은 단위로 되돌린 값이라 서로 다른 의미를 갖는다. ## 확인 문제 1. 어떤 자료의 편차를 모두 더하면 왜 항상 0이 되는지 설명하고, 그런데도 왜 분산을 구할 때는 편차를 제곱해서 더하는지 그 이유를 설명해 보시오. 2. 어느 모둠 4명의 줄넘기 횟수가 12, 15, 15, 18회일 때 평균, 중앙값, 최빈값을 각각 구하시오. 3. 자료 3, 5, 7의 평균과 분산, 표준편차를 구하시오. 정답 보기: 1. 평균보다 큰 변량의 편차(양수)와 평균보다 작은 변량의 편차(음수)가 서로 상쇄되어 합이 항상 0이 되기 때문이다. 이 때문에 편차를 그냥 더하면 흩어진 정도를 전혀 알 수 없으므로, 부호를 없애기 위해 제곱한 뒤 더해서 평균을 낸 것이 분산이다. 2. 평균 $=\dfrac{12+15+15+18}{4}=15$회, 중앙값은 크기순 12,15,15,18의 가운데 두 값 15,15의 평균이므로 15회, 최빈값은 15회. 3. 평균 $=\dfrac{3+5+7}{3}=5$. 편차는 $-2,0,2$이고 제곱은 $4,0,4$, 합은 $8$이므로 분산 $=\dfrac{8}{3}\approx 2.67$, 표준편차 $=\sqrt{\dfrac{8}{3}}\approx 1.63$. ## 📜 역사 평균을 이용해 여러 번 측정한 값을 하나로 요약하는 방법은 오래전부터 천문학자와 항해사들이 관측 오차를 줄이기 위해 사용해 왔다. 여러 번 관측한 값을 단순히 더해 나누면 개별 관측의 오차가 서로 상쇄되어 참값에 더 가까워진다는 경험적 사실이 알려져 있었기 때문이다. 반면 자료가 평균 주변에 얼마나 흩어져 있는지를 나타내는 산포도 개념은 훨씬 늦게, 19세기 통계학이 발전하면서 정교해졌다. 영국의 통계학자 칼 피어슨은 1893년 강의에서 편차 제곱의 평균에 제곱근을 취한 값을 가리켜 "표준편차(standard deviation)"라는 용어를 처음 사용했고, 이후 이 용어와 기호 $\sigma$가 표준으로 굳어졌다. 이렇게 평균과 표준편차는 각각 "자료를 하나로 요약하기"와 "그 요약이 자료를 얼마나 잘 대표하는지 재기"라는, 오랜 시간에 걸쳐 따로 발전한 두 가지 필요에서 나온 개념이다. ## 관련 개념 - 도수분포와 상대도수 - 자료의 정리와 그래프 - 상관관계 - 모평균과 표본평균 - 통계적 추정 --- 관련 개념: - 도수분포와 상대도수 (/wiki/math/%EB%8F%84%EC%88%98%EB%B6%84%ED%8F%AC%EC%99%80_%EC%83%81%EB%8C%80%EB%8F%84%EC%88%98) - 자료의 정리와 그래프 (/wiki/math/%EC%9E%90%EB%A3%8C%EC%9D%98_%EC%A0%95%EB%A6%AC%EC%99%80_%EA%B7%B8%EB%9E%98%ED%94%84) - 상관관계 (/wiki/math/%EC%83%81%EA%B4%80%EA%B4%80%EA%B3%84) - 모평균과 표본평균 (/wiki/math/%EB%AA%A8%ED%8F%89%EA%B7%A0%EA%B3%BC_%ED%91%9C%EB%B3%B8%ED%8F%89%EA%B7%A0) - 통계적 추정 (/wiki/math/%ED%86%B5%EA%B3%84%EC%A0%81_%EC%B6%94%EC%A0%95)