# 로지스틱 회귀와 시그모이드 함수 분야: CS·데이터사이언스 학교급: 대학 정식 URL: https://pi.devxdev.xyz/wiki/math/%EB%A1%9C%EC%A7%80%EC%8A%A4%ED%8B%B1_%ED%9A%8C%EA%B7%80%EC%99%80_%EC%8B%9C%EA%B7%B8%EB%AA%A8%EC%9D%B4%EB%93%9C_%ED%95%A8%EC%88%98 --- ## 정의 **로지스틱 회귀**(logistic regression)는 설명변수 $\mathbf{x} = (x_1, \dots, x_n)$로부터 이진 반응변수 $y \in \{0, 1\}$가 일어날 확률을 추정하는 회귀 모델이다. 선형회귀처럼 $\mathbf{w}^\top \mathbf{x} + b$($\mathbf{w}^\top \mathbf{x}$는 "더블유 트랜스포즈 엑스"라 읽으며, 가중치 벡터 $\mathbf{w}$와 입력 벡터 $\mathbf{x}$의 내적 $w_1x_1 + \cdots + w_nx_n$을 뜻한다)를 계산하지만, 그 값을 그대로 쓰지 않고 **시그모이드 함수** $\sigma$(시그마 함수라 읽는다)에 통과시켜 $[0,1]$ 구간의 확률로 바꾼다. $$ \sigma(z) = \frac{1}{1 + e^{-z}}, \qquad \hat{p} = P(y=1 \mid \mathbf{x}) = \sigma(\mathbf{w}^\top \mathbf{x} + b) $$ 여기서 $e$는 자연로그의 밑이다. 모델의 파라미터 $\mathbf{w}, b$는 로그 우도(log-likelihood)를 최대화하도록, 즉 **교차 엔트로피 손실**을 최소화하도록 경사하강법으로 학습한다. ## 직관 선형회귀는 예측값이 $-\infty$부터 $\infty$까지 뻗어 나가므로 "확률"을 직접 예측하기에 부적합하다. 시그모이드 함수는 실수 전체를 입력받아 0과 1 사이로 "눌러 담는" S자 곡선이다. $z$가 매우 크면 $e^{-z} \to 0$이라 $\sigma(z) \to 1$, $z$가 매우 작으면(음수로 클수록) $e^{-z} \to \infty$이라 $\sigma(z) \to 0$이 된다. $z=0$일 때는 정확히 $\sigma(0) = 1/2$로 결정 경계가 된다. 이를 뒤집어 생각하면, 로지스틱 회귀는 확률 $p$가 아니라 **오즈**(odds) $\dfrac{p}{1-p}$의 로그, 즉 **로짓**(logit) $\ln\dfrac{p}{1-p} = \mathbf{w}^\top\mathbf{x}+b$를 선형모델로 적합시키는 것과 같다. 시그모이드는 로짓 함수의 역함수다. ## 성질 - **치역**: $0 < \sigma(z) < 1$이며 절대 정확히 0 또는 1이 되지 않는다. - **대칭성**: $\sigma(-z) = 1 - \sigma(z)$. - **도함수**: $\sigma'(z) = \sigma(z)\bigl(1-\sigma(z)\bigr)$. 이 성질 덕분에 미분법으로 그래디언트를 계산할 때 $\sigma(z)$ 값만 알면 도함수 값도 바로 얻어진다. - **결정 경계**: 보통 $\hat{p} \ge 0.5$이면 $y=1$로 분류하는데, 이는 $\mathbf{w}^\top\mathbf{x}+b \ge 0$과 동치다. 즉 결정 경계는 $\mathbf{x}$ 공간에서 초평면(직선·평면 등)이다. - **손실함수**: 하나의 데이터 $(\mathbf{x}, y)$에 대한 교차 엔트로피는 $L = -\bigl[y\ln\hat{p} + (1-y)\ln(1-\hat{p})\bigr]$이며, 전체 데이터에 대해 합(또는 평균)한 것을 최소화한다. ## 예시 학생의 하루 공부 시간 $x$(시간)로 시험 합격 여부를 예측하는 모델을 $\hat{p} = \sigma(2x - 5)$라 하자. - $x = 2$: $z = 2(2)-5 = -1$, $\sigma(-1) = \dfrac{1}{1+e^{1}} \approx \dfrac{1}{1+2.718} \approx 0.269$ → 합격 확률 약 27% - $x = 2.5$: $z = 0$, $\sigma(0) = 0.5$ → 결정 경계 지점 - $x = 4$: $z = 3$, $\sigma(3) = \dfrac{1}{1+e^{-3}} \approx \dfrac{1}{1+0.0498} \approx 0.952$ → 합격 확률 약 95% 그래프: y=1/(1+e^(-x)) (정의역 -6~6) ## 🌍 실생활 예시 신용카드사가 대출 신청자의 소득, 부채, 신용 기록 등을 입력으로 받아 "연체할 확률"을 계산하는 신용평점 모델에 로지스틱 회귀가 널리 쓰인다. 출력 확률이 임계값(예: 0.3)을 넘으면 고위험군으로 분류해 심사를 강화하는 식으로 실제 의사결정에 반영된다. ## ⚠️ 흔한 실수 - **잘못된 생각**: 시그모이드 출력값 $\hat{p}$ 자체가 손실함수라 생각하고 이를 그대로 최소화하려 한다. → 왜 틀렸는가: $\hat{p}$는 예측 확률일 뿐이며, 학습은 정답 $y$와 $\hat{p}$의 차이를 재는 교차 엔트로피를 최소화하는 것이다. $\hat{p}$를 무작정 0에 가깝게 만들면 $y=1$인 데이터에서는 오히려 손실이 커진다. - **잘못된 생각**: 로지스틱 회귀도 "회귀"니까 선형회귀처럼 $\hat{y} = \mathbf{w}^\top\mathbf{x}+b$를 직접 예측값(확률)으로 쓴다. → 왜 틀렸는가: $\mathbf{w}^\top\mathbf{x}+b$는 확률이 아니라 로짓(범위 $(-\infty,\infty)$)이며, 반드시 $\sigma$를 씌워야 $[0,1]$ 범위의 확률이 된다. - **잘못된 생각**: 결정 경계가 곡선일 거라 생각한다. → 왜 틀렸는가: $\sigma$ 자체는 S자 곡선이지만, $\hat{p}=0.5$가 되는 지점은 $\mathbf{w}^\top\mathbf{x}+b=0$이라는 **선형** 조건이므로 결정 경계는 항상 직선(또는 초평면)이다. 곡선처럼 보이는 것은 확률의 등고선이지 경계가 아니다. ## 확인 문제 1. $\sigma(z) = 1/(1+e^{-z})$일 때 $\sigma'(z) = \sigma(z)(1-\sigma(z))$임을 몫의 미분법을 이용해 직접 유도하라. (이 관계가 왜 경사하강법 구현을 간단하게 만드는지도 함께 생각해 보라.) 2. 모델이 $\hat{p}=\sigma(\mathbf{w}^\top\mathbf{x}+b)=0.8$을 출력했다면, 이때의 오즈(odds)와 로짓 $\mathbf{w}^\top\mathbf{x}+b$ 값을 구하라. 3. $\hat{p} = \sigma(3x-6)$인 모델의 결정 경계(즉 $\hat{p}=0.5$가 되는 $x$)를 구하라. 정답 보기: 1. $\sigma(z) = (1+e^{-z})^{-1}$이므로 $\sigma'(z) = -(1+e^{-z})^{-2}\cdot(-e^{-z}) = \dfrac{e^{-z}}{(1+e^{-z})^2}$. 이를 $\sigma(z)(1-\sigma(z))$로 정리하면 $\dfrac{1}{1+e^{-z}}\cdot\dfrac{e^{-z}}{1+e^{-z}} = \dfrac{e^{-z}}{(1+e^{-z})^2}$로 같음을 확인할 수 있다. 이 성질 덕분에 $e^{-z}$를 따로 계산하지 않고 순전파에서 이미 구한 $\sigma(z)$ 값만으로 도함수를 구해 역전파(그래디언트 계산)를 빠르게 할 수 있다. 2. 오즈 $= \dfrac{p}{1-p} = \dfrac{0.8}{0.2} = 4$. 로짓 $= \ln 4 \approx 1.386$. 3. $\hat{p}=0.5 \iff 3x-6=0 \iff x=2$. ## 관련 개념 - 지수함수 — 시그모이드 함수의 정의에 쓰이는 $e^{-z}$의 배경 개념 - 로그 — 로짓(log-odds) 계산과 교차 엔트로피 손실의 기반 - 경사하강법 — 로지스틱 회귀 파라미터를 학습하는 최적화 방법 - 확률변수 — 이진 반응변수 $y$를 확률적으로 다루는 틀 - 함수의 극한 — $z\to\pm\infty$에서 $\sigma(z)$의 극한값을 이해하는 데 사용 --- 관련 개념: - 경사하강법 (/wiki/math/%EA%B2%BD%EC%82%AC%ED%95%98%EA%B0%95%EB%B2%95) - 미분법 (/wiki/math/%EB%AF%B8%EB%B6%84%EB%B2%95) - 지수함수 (/wiki/math/%EC%A7%80%EC%88%98%ED%95%A8%EC%88%98) - 로그 (/wiki/math/%EB%A1%9C%EA%B7%B8) - 확률변수 (/wiki/math/%ED%99%95%EB%A5%A0%EB%B3%80%EC%88%98) - 함수의 극한 (/wiki/math/%ED%95%A8%EC%88%98%EC%9D%98_%EA%B7%B9%ED%95%9C)