🏠 전체 위키 수학 위키 지도 목록 사전
더보기

대푯값과 산포도

확률통계 중등 · v2 · 🤖 LLM 버전

🧭 선수 개념 — 이 문서는 다음을 안다는 전제로 쓰였어요: 도수분포와 상대도수 · 자료의 정리와 그래프 (초등)

정의

대푯값은 여러 개의 자료(변량)를 하나의 수로 대표해서 나타낸 값이다. 대표적으로 평균, 중앙값, 최빈값이 있다.

산포도는 자료가 대푯값(주로 평균) 주변에 얼마나 흩어져 있는지를 나타내는 값이다. 대표적으로 범위, 분산, 표준편차가 있다.

직관

대푯값은 "이 자료를 한마디로 요약하면 무엇인가"에 대한 답이고, 산포도는 "그 요약이 자료 전체를 얼마나 잘 대표하는가"에 대한 답이다. 예를 들어 두 반의 평균 점수가 똑같이 70점이어도, 한 반은 모두 65~75점 사이에 몰려 있고 다른 반은 20점부터 100점까지 흩어져 있을 수 있다. 평균만 보면 두 반이 똑같아 보이지만 실제로는 전혀 다른 반이다. 산포도는 바로 이 "흩어진 정도"를 수치화해서 평균이 놓치는 정보를 보완해 준다.

편차를 왜 제곱하는지도 직관적으로 이해할 수 있다. 편차 $x_i-\bar{x}$는 평균보다 큰 값은 양수, 작은 값은 음수가 되어 그냥 더하면 항상 0이 되어버린다(흩어진 정도를 전혀 알 수 없다). 그래서 제곱해서 부호를 없앤 뒤 평균을 낸 것이 분산이다.

유도

산포도를 어떻게 숫자 하나로 나타낼 수 있을까? 자연스러운 첫 시도는 "각 변량이 평균에서 얼마나 떨어져 있는지"를 나타내는 편차 $x_i - \bar{x}$들을 모두 구한 뒤 그 평균을 내는 것이다.

그런데 이 편차의 평균은 항상 0이 된다. 실제로 편차의 합을 계산해 보면

$$\sum_{i=1}^n (x_i - \bar x) = \sum_{i=1}^n x_i - n\bar x = n\bar x - n\bar x = 0$$

이다(평균의 정의에 의해 $\sum x_i = n\bar x$이기 때문). 즉 평균보다 큰 변량의 양수 편차와 평균보다 작은 변량의 음수 편차가 정확히 상쇄되어, 편차를 그냥 더하기만 해서는 자료가 얼마나 흩어져 있는지 전혀 알 수 없다.

이 상쇄를 막으려면 편차의 부호를 없애야 한다. 방법은 두 가지가 있다: 절댓값을 씌우거나, 제곱을 하는 것이다. 절댓값 $|x_i - \bar x|$의 평균(평균절대편차)도 산포도를 나타낼 수는 있지만, 절댓값은 식을 전개하거나 다루는 데 있어 대수적으로 까다롭다. 반면 제곱 $(x_i-\bar x)^2$은 부호를 없애면서도 다항식이라 계산과 이론 전개가 훨씬 간단하다. 그래서 편차를 제곱한 값들의 평균

$$s^2 = \frac{1}{n}\sum_{i=1}^n (x_i-\bar x)^2$$

을 산포도의 척도로 삼고, 이를 분산이라 정의한다.

다만 분산은 편차를 제곱했기 때문에 단위도 원래 변량의 제곱(예: 점수의 분산이면 점²)이 되어버려, 원래 자료와 직접 비교하기 어렵다. 이 문제를 해결하려면 제곱을 상쇄시키는 연산, 즉 제곱근을 다시 취하면 된다. 그래서

$$s = \sqrt{s^2} = \sqrt{\frac{1}{n}\sum_{i=1}^n (x_i-\bar x)^2}$$

으로 정의한 것이 표준편차이며, 이렇게 하면 산포도를 원래 변량과 같은 단위로 나타낼 수 있다.

예시

5명의 수학 점수가 70, 80, 80, 90, 100점이라 하자.

편차는 각각 $-14, -4, -4, 6, 16$이고, 합은 $0$이다(항상 그렇다). 편차를 제곱하면 $196, 16, 16, 36, 256$이고 합은 $520$이므로

$$s^2 = \frac{520}{5} = 104, \qquad s = \sqrt{104} \approx 10.2$$

즉 이 반 점수는 평균 84점을 중심으로 대략 10점 정도씩 흩어져 있다.

🌍 실생활 예시

두 공장 A, B에서 만든 볼트의 지름이 둘 다 평균 10mm라고 홍보해도, A 공장은 표준편차가 0.02mm로 작고 B 공장은 0.5mm로 크다면 품질 차이가 크다. 부품이 다른 부품과 정확히 맞물려야 하는 경우 평균만으로는 부족하고, 표준편차(산포도)가 작아야 "불량률이 낮고 일정한 품질"임을 보장할 수 있다. 그래서 공장의 품질 관리에서는 평균과 함께 표준편차를 반드시 함께 관리한다.

⚠️ 흔한 실수

확인 문제

  1. 어떤 자료의 편차를 모두 더하면 왜 항상 0이 되는지 설명하고, 그런데도 왜 분산을 구할 때는 편차를 제곱해서 더하는지 그 이유를 설명해 보시오.
  2. 어느 모둠 4명의 줄넘기 횟수가 12, 15, 15, 18회일 때 평균, 중앙값, 최빈값을 각각 구하시오.
  3. 자료 3, 5, 7의 평균과 분산, 표준편차를 구하시오.
정답 보기
  1. 평균보다 큰 변량의 편차(양수)와 평균보다 작은 변량의 편차(음수)가 서로 상쇄되어 합이 항상 0이 되기 때문이다. 이 때문에 편차를 그냥 더하면 흩어진 정도를 전혀 알 수 없으므로, 부호를 없애기 위해 제곱한 뒤 더해서 평균을 낸 것이 분산이다.
  2. 평균 $=\dfrac{12+15+15+18}{4}=15$회, 중앙값은 크기순 12,15,15,18의 가운데 두 값 15,15의 평균이므로 15회, 최빈값은 15회.
  3. 평균 $=\dfrac{3+5+7}{3}=5$. 편차는 $-2,0,2$이고 제곱은 $4,0,4$, 합은 $8$이므로 분산 $=\dfrac{8}{3}\approx 2.67$, 표준편차 $=\sqrt{\dfrac{8}{3}}\approx 1.63$.

📜 역사

평균을 이용해 여러 번 측정한 값을 하나로 요약하는 방법은 오래전부터 천문학자와 항해사들이 관측 오차를 줄이기 위해 사용해 왔다. 여러 번 관측한 값을 단순히 더해 나누면 개별 관측의 오차가 서로 상쇄되어 참값에 더 가까워진다는 경험적 사실이 알려져 있었기 때문이다. 반면 자료가 평균 주변에 얼마나 흩어져 있는지를 나타내는 산포도 개념은 훨씬 늦게, 19세기 통계학이 발전하면서 정교해졌다. 영국의 통계학자 칼 피어슨은 1893년 강의에서 편차 제곱의 평균에 제곱근을 취한 값을 가리켜 "표준편차(standard deviation)"라는 용어를 처음 사용했고, 이후 이 용어와 기호 $\sigma$가 표준으로 굳어졌다. 이렇게 평균과 표준편차는 각각 "자료를 하나로 요약하기"와 "그 요약이 자료를 얼마나 잘 대표하는지 재기"라는, 오랜 시간에 걸쳐 따로 발전한 두 가지 필요에서 나온 개념이다.

관련 개념

연결 문서 그래프 (8)

굵은 테두리가 현재 문서, → 화살표는 선수 관계(선수 → 후속)예요. 노드를 누르면 해당 문서로 이동합니다. 전체 그래프 보기