어떤 시행에서 일어날 수 있는 모든 경우가 $n$가지이고 각 경우가 일어날 가능성이 모두 같을 때, 사건 $A$가 일어나는 경우가 $a$가지이면 사건 $A$의 확률은:
$$P(A) = \frac{a}{n}$$
$P$는 확률을 뜻하는 probability의 첫 글자로, $P(A)$는 "사건 $A$의 확률"이라 읽는다.
일어날 수 있는 모든 결과의 집합을 표본공간 $S$, 그 부분집합을 사건 $A$라 하고, 확률을 $P(A) = \dfrac{n(A)}{n(S)}$로 쓴다. $n(A)$는 집합 $A$의 원소의 개수다.
확률은 "가능성을 $0$과 $1$ 사이의 수로 재는 자"다. 정의의 전제 — 각 경우가 똑같이 일어날 만하다(등확률) — 가 핵심이어서, 주사위 눈처럼 대칭적인 상황에서만 "경우의 수 나누기"가 정당하다. 시행을 무한히 반복할 때 상대도수가 다가가는 값(통계적 확률)이 이 수와 일치한다는 것이 큰 수의 법칙이다.
확률에서 가장 흔한 함정은 "경우의 수만 세서 나누면 확률"이라고 무조건 믿는 것이다. 이 방법은 각 경우가 똑같이 일어날 만할 때만 옳다. 주사위 두 개를 던져 나온 눈의 합을 보자. 합은 $2$부터 $12$까지 $11$가지지만, 그렇다고 각 합의 확률이 $\frac{1}{11}$인 건 아니다. 합이 $7$이 되는 경우는 여러 조합이 있고 합이 $12$가 되는 경우는 하나뿐이라, 나올 만한 정도가 서로 다르기 때문이다. 그래서 확률을 셀 때는 "무엇을 하나의 경우로 놓아야 각 경우가 대등한가"를 먼저 정해야 한다(여기서는 두 주사위를 구별해 $36$가지로 놓는다).
또 하나 익혀 두면 좋은 시선이 여사건이다. "적어도 하나는 $\sim$"처럼 조건에 맞는 경우가 여러 갈래로 흩어져 세기 번거로울 때, 반대로 "하나도 $\sim$ 아님"만 세서 전체 $1$에서 빼면 훨씬 빠르다. 정면으로 세기 어려우면 뒤집어 세는 습관, 이게 확률 문제의 큰 무기다.
마지막으로 확률은 항상 $0$과 $1$ 사이의 값이다. 계산 결과가 음수가 되거나 $1$을 넘으면 어딘가 잘못 센 것이니, 답을 구한 뒤 이 범위 안에 드는지 점검하는 것만으로도 실수를 많이 걸러낼 수 있다.
$P(A) = \dfrac{a}{n}$이라는 정의는 하늘에서 떨어진 약속이 아니다. "가능성을 수로 재고 싶다"는 요구에서 출발하면 이 꼴이 거의 강제된다.
① 무엇이 막히나. 우리는 두 사건 중 어느 것이 더 일어날 만한지 말하고 싶다. 그런데 "일어날 만하다"는 느낌은 크고 작음을 비교할 수 없다 — 재는 눈금이 필요하다.
② 대등한 경우로 쪼갠다. 주사위 한 개의 여섯 눈처럼, 어느 하나를 특별히 우대할 이유가 없는 결과 $n$개로 시행을 쪼갤 수 있다고 하자. 이유가 없으니 이들에게는 모두 같은 값 $p$를 주어야 한다. (여기가 정의의 전제인 등확률이 들어오는 자리다.)
③ 전체를 1로 놓는다. 눈금의 기준이 필요하다. 시행을 하면 여섯 눈 중 무언가는 반드시 나오므로, "반드시 일어남"에 $1$을 주기로 약속한다. 그러면 $n$개의 대등한 경우가 이 $1$을 똑같이 나눠 가지므로
$$n \times p = 1 \quad \Longrightarrow \quad p = \frac{1}{n}$$
④ 사건은 경우의 묶음이다. 사건 $A$가 그중 $a$개의 경우로 이루어져 있다면, $A$의 값은 그 $a$개가 가진 값의 합이다.
$$P(A) = a \times \frac{1}{n} = \frac{a}{n}$$
정의의 분수 꼴은 이렇게 "대등하게 나눈 $1$을 몇 조각 가졌나"를 센 결과다.
⑤ 기본 성질도 따라온다. $0 \le a \le n$이므로 $0 \le P(A) \le 1$이고, $a = n$이면 $P(S) = 1$, $a = 0$이면 $P(\varnothing) = 0$이다. 여사건은 남은 조각 수가 $n - a$이므로 $P(A^c) = \frac{n-a}{n} = 1 - P(A)$다. 덧셈정리도 조각 세기다 — $A$의 조각과 $B$의 조각을 그냥 더하면 양쪽에 모두 든 $A \cap B$의 조각을 두 번 센 셈이라, 그만큼 한 번 빼 준다. 즉 아래 세 성질은 외울 항목이 아니라 ④의 따름결과다.
주사위 2개를 던져 눈의 합이 $10$ 이상일 확률: 전체 $36$가지 중 합이 $10, 11, 12$인 경우는 $3 + 2 + 1 = 6$가지이므로 $P = \frac{6}{36} = \frac{1}{6}$.
"두 개의 눈이 서로 다를 확률"은 여사건(두 눈이 같음, $6$가지)으로 세는 게 빠르다: $1 - \frac{6}{36} = \frac{5}{6}$.
확률은 놀랍게도 도박장에서 태어났다. 16세기 이탈리아의 지롤라모 카르다노는 도박꾼이면서 수학자였고, 주사위의 승률을 따진 『주사위 놀이에 관한 책』을 썼지만 원고는 그의 사후에야 출판되어 당대에 영향을 주지 못했다.
전환점은 1654년이다. 도박사 슈발리에 드 메레가 블레즈 파스칼에게 물었다. 판돈을 걸고 하던 승부를 중간에 그만두게 되면, 남은 판을 치지 않고 판돈을 어떻게 나누는 것이 공정한가(이른바 '점수 나누기 문제'). 파스칼은 피에르 드 페르마와 편지를 주고받으며 이 문제를 풀었고, 그 서신에서 "앞으로 일어날 수 있는 경우들을 모두 헤아려 그 비율로 나눈다"는 생각이 자리를 잡았다. 오늘 우리가 배우는 $\frac{a}{n}$의 조상이다. 곧 크리스티안 하위헌스가 이 결과들을 정리해 최초의 확률 교재를 냈고(1657), 야코프 베르누이는 『추측술』(1713)에서 시행을 늘리면 상대도수가 확률에 다가감을 증명했다.
$P(A) = \frac{a}{n}$을 표준 정의로 못박은 사람은 피에르시몽 라플라스다(1812). 하지만 이 정의에는 약점이 있었다 — 위 유도의 ②처럼 대등한 경우로 쪼갤 수 있어야만 쓸 수 있다. 예컨대 "막대의 한 점을 무작위로 고른다"처럼 경우가 무한히 촘촘한 상황에서는 $n$을 셀 수 없다. 이 한계를 넘은 것이 안드레이 콜모고로프의 1933년 공리적 정의로, 확률을 '경우의 비'가 아니라 넓이처럼 재는 양($0 \le P \le 1$, $P(S)=1$, 서로 배타적인 사건의 합은 더해진다)으로 규정했다. 위 기본 성질 세 줄이 그 공리계의 출발점이며, 고교 과정의 확률은 대등한 경우가 있는 특수한 경우를 다루는 셈이다.