🧭 선수 개념 — 이 문서는 다음을 안다는 전제로 쓰였어요: 지수함수 (고등) · 로그 (고등) · 확률 (중등) · 경사하강법
정의
로지스틱 회귀(logistic regression)는 설명변수 $\mathbf{x} = (x_1, \dots, x_n)$로부터 이진 반응변수 $y \in \{0, 1\}$가 일어날 확률을 추정하는 회귀 모델이다. 선형회귀처럼 $\mathbf{w}^\top \mathbf{x} + b$($\mathbf{w}^\top \mathbf{x}$는 "더블유 트랜스포즈 엑스"라 읽으며, 가중치 벡터 $\mathbf{w}$와 입력 벡터 $\mathbf{x}$의 내적 $w_1x_1 + \cdots + w_nx_n$을 뜻한다)를 계산하지만, 그 값을 그대로 쓰지 않고 시그모이드 함수 $\sigma$(시그마 함수라 읽는다)에 통과시켜 $[0,1]$ 구간의 확률로 바꾼다.
여기서 $e$는 자연로그의 밑이다. 모델의 파라미터 $\mathbf{w}, b$는 로그 우도(log-likelihood)를 최대화하도록, 즉 교차 엔트로피 손실을 최소화하도록 경사하강법으로 학습한다.
직관
선형회귀는 예측값이 $-\infty$부터 $\infty$까지 뻗어 나가므로 "확률"을 직접 예측하기에 부적합하다. 시그모이드 함수는 실수 전체를 입력받아 0과 1 사이로 "눌러 담는" S자 곡선이다. $z$가 매우 크면 $e^{-z} \to 0$이라 $\sigma(z) \to 1$, $z$가 매우 작으면(음수로 클수록) $e^{-z} \to \infty$이라 $\sigma(z) \to 0$이 된다. $z=0$일 때는 정확히 $\sigma(0) = 1/2$로 결정 경계가 된다.
이를 뒤집어 생각하면, 로지스틱 회귀는 확률 $p$가 아니라 오즈(odds) $\dfrac{p}{1-p}$의 로그, 즉 로짓(logit) $\ln\dfrac{p}{1-p} = \mathbf{w}^\top\mathbf{x}+b$를 선형모델로 적합시키는 것과 같다. 시그모이드는 로짓 함수의 역함수다.
도함수: $\sigma'(z) = \sigma(z)\bigl(1-\sigma(z)\bigr)$. 이 성질 덕분에 미분법으로 그래디언트를 계산할 때 $\sigma(z)$ 값만 알면 도함수 값도 바로 얻어진다.
결정 경계: 보통 $\hat{p} \ge 0.5$이면 $y=1$로 분류하는데, 이는 $\mathbf{w}^\top\mathbf{x}+b \ge 0$과 동치다. 즉 결정 경계는 $\mathbf{x}$ 공간에서 초평면(직선·평면 등)이다.
손실함수: 하나의 데이터 $(\mathbf{x}, y)$에 대한 교차 엔트로피는 $L = -\bigl[y\ln\hat{p} + (1-y)\ln(1-\hat{p})\bigr]$이며, 전체 데이터에 대해 합(또는 평균)한 것을 최소화한다.
예시
학생의 하루 공부 시간 $x$(시간)로 시험 합격 여부를 예측하는 모델을 $\hat{p} = \sigma(2x - 5)$라 하자.
$x = 2$: $z = 2(2)-5 = -1$, $\sigma(-1) = \dfrac{1}{1+e^{1}} \approx \dfrac{1}{1+2.718} \approx 0.269$ → 합격 확률 약 27%
$x = 2.5$: $z = 0$, $\sigma(0) = 0.5$ → 결정 경계 지점
$x = 4$: $z = 3$, $\sigma(3) = \dfrac{1}{1+e^{-3}} \approx \dfrac{1}{1+0.0498} \approx 0.952$ → 합격 확률 약 95%
🌍 실생활 예시
신용카드사가 대출 신청자의 소득, 부채, 신용 기록 등을 입력으로 받아 "연체할 확률"을 계산하는 신용평점 모델에 로지스틱 회귀가 널리 쓰인다. 출력 확률이 임계값(예: 0.3)을 넘으면 고위험군으로 분류해 심사를 강화하는 식으로 실제 의사결정에 반영된다.
⚠️ 흔한 실수
잘못된 생각: 시그모이드 출력값 $\hat{p}$ 자체가 손실함수라 생각하고 이를 그대로 최소화하려 한다. → 왜 틀렸는가: $\hat{p}$는 예측 확률일 뿐이며, 학습은 정답 $y$와 $\hat{p}$의 차이를 재는 교차 엔트로피를 최소화하는 것이다. $\hat{p}$를 무작정 0에 가깝게 만들면 $y=1$인 데이터에서는 오히려 손실이 커진다.
잘못된 생각: 로지스틱 회귀도 "회귀"니까 선형회귀처럼 $\hat{y} = \mathbf{w}^\top\mathbf{x}+b$를 직접 예측값(확률)으로 쓴다. → 왜 틀렸는가: $\mathbf{w}^\top\mathbf{x}+b$는 확률이 아니라 로짓(범위 $(-\infty,\infty)$)이며, 반드시 $\sigma$를 씌워야 $[0,1]$ 범위의 확률이 된다.
잘못된 생각: 결정 경계가 곡선일 거라 생각한다. → 왜 틀렸는가: $\sigma$ 자체는 S자 곡선이지만, $\hat{p}=0.5$가 되는 지점은 $\mathbf{w}^\top\mathbf{x}+b=0$이라는 선형 조건이므로 결정 경계는 항상 직선(또는 초평면)이다. 곡선처럼 보이는 것은 확률의 등고선이지 경계가 아니다.
확인 문제
$\sigma(z) = 1/(1+e^{-z})$일 때 $\sigma'(z) = \sigma(z)(1-\sigma(z))$임을 몫의 미분법을 이용해 직접 유도하라. (이 관계가 왜 경사하강법 구현을 간단하게 만드는지도 함께 생각해 보라.)
모델이 $\hat{p}=\sigma(\mathbf{w}^\top\mathbf{x}+b)=0.8$을 출력했다면, 이때의 오즈(odds)와 로짓 $\mathbf{w}^\top\mathbf{x}+b$ 값을 구하라.
$\hat{p} = \sigma(3x-6)$인 모델의 결정 경계(즉 $\hat{p}=0.5$가 되는 $x$)를 구하라.
정답 보기
$\sigma(z) = (1+e^{-z})^{-1}$이므로 $\sigma'(z) = -(1+e^{-z})^{-2}\cdot(-e^{-z}) = \dfrac{e^{-z}}{(1+e^{-z})^2}$. 이를 $\sigma(z)(1-\sigma(z))$로 정리하면 $\dfrac{1}{1+e^{-z}}\cdot\dfrac{e^{-z}}{1+e^{-z}} = \dfrac{e^{-z}}{(1+e^{-z})^2}$로 같음을 확인할 수 있다. 이 성질 덕분에 $e^{-z}$를 따로 계산하지 않고 순전파에서 이미 구한 $\sigma(z)$ 값만으로 도함수를 구해 역전파(그래디언트 계산)를 빠르게 할 수 있다.