본문으로 건너뛰기
Park JiHo
#artificial-intelligence#machine-learning#generalization#bayes-classifier#support-vector-machine#uncertainty#modern-ai-course#study-notes

현대 인공지능 II — 머신러닝의 기본 과제와 일반화

ECE5992 머신러닝 기초 13쪽을 페이지·문단·도표·수식 원장으로 완전 추적하며, 분류·회귀·밀도추정, 일반화, 정규화, 교차검증, SVM, 최소거리·베이즈 분류기, 차원의 저주를 2026년 연구까지 연결한다.

Series map

현대 인공지능 · 8편 학습 지도

기초 수학에서 생성·표현학습까지 이어지는 8편 학습 경로. 빈 번호나 자리 채우기용 글 없이, 실제 확보된 강의자료를 여덟 단계로 연결한다.

2 / 8
  1. 기초 게시됨 AI·ML·DL에서 확률·최적화까지 AI·ML·DL의 관계, 선형대수, 확률변수, 가우시안 모델, WSS, 손실함수와 경사하강법을 연결한다.
  2. 학습 문제 읽는 중 머신러닝의 기본 과제와 일반화 분류·회귀·밀도추정에서 과적합, 정규화, 검증, SVM, Bayes 분류와 차원의 저주까지 다룬다.
  3. 신경망 후속 편 퍼셉트론·MLP·CNN과 컨볼루션 선형 판별기에서 다층 퍼셉트론으로 확장하고, 1D·2D 컨볼루션과 CNN의 계산 구조를 정리한다.
  4. 최적화 후속 편 기울기 기반 최적화: GD에서 OGM까지 Lipschitz 연속성, GD·PSD·PGD·FGM과 최적화된 기울기 방법 OGM의 수렴 구조를 비교한다.
  5. 영상 분류 후속 편 이미지 분류의 발전: AlexNet에서 SE Network까지 AlexNet, VGG, GoogLeNet, ResNet, WRN, DenseNet과 채널 재가중 SE Network의 발전을 추적한다.
  6. 픽셀 이해 후속 편 의미론적 영상 분할: FCN·U-Net·DeepLab 픽셀 단위 예측, encoder-decoder, skip connection, dilated convolution과 다중 스케일 분할을 다룬다.
  7. 생성·복원 후속 편 영상 잡음제거·VAE·확산모델 MMSE와 비선형 필터에서 VAE의 ELBO, 재매개변수화, DDPM의 순방향·역방향 확산으로 이어진다.
  8. 표현학습 후속 편 대조 표현학습: InfoNCE·SimCLR·BYOL·CLIP 양성·음성 쌍, InfoNCE, augmentation, memory bank, SimCLR·BYOL과 이미지-언어 CLIP을 연결한다.
게시된 편만 링크로 연결된다. 후속 PDF의 내용을 담은 글이 공개되면 같은 위치가 자동으로 활성화되며, 빈 게시물은 만들지 않는다.

강의자료 출처 — 이 글은 성균관대학교 ECE5992 「Modern Artificial Intelligence」의 2025년 3월 19일 강의자료를 학습 목적으로 한국어로 재구성했다. 원 강의자료의 저작권은 강의 제작자인 Il Yong Chun 교수와 원 제작자에게 있다. 문장·페이지 구성·삽화는 복제하지 않고, 수학적 내용은 페이지·수식 원장으로 추적하며 도식과 해설은 새로 작성했다.

읽는 법 — 먼저 2025년 PDF의 개념과 수식을 순서대로 읽고, 마지막의 2026년 연구 업데이트에서 현재의 일반화·분포이동·검증 논쟁으로 확장한다.

#PDF 원자료 재구성

#2. 머신러닝의 기초(Fundamentals of machine learning)

머신러닝(ML)은 대량의 데이터에서 패턴을 자동으로 찾아내고, 그 패턴으로 미래 데이터를 예측하거나 불확실성 아래에서 의사결정을 수행하는 방법들의 집합으로 소개된다. 강의자료는 이를 ‘빅데이터 시대’의 자동 분석 요구에 대한 답으로 놓는다.

데이터셋이 겉보기에는 매우 커도 관심 있는 희귀 사례의 실효 표본 수는 작을 수 있다. 자료는 이를 롱테일(long tail) 성질로 설명한다. 소수 사건은 매우 흔하지만, 대부분의 사건은 드물게 나타난다.

#2.1 과제(Tasks)

#2.1.1 분류(Classification)

분류의 목표는 입력에서 출력으로 가는 사상을 학습하는 것이다. 출력 공간은 y{1,,C}y\in\{1,\ldots,C\}이며, C=2C=2이면 이진 분류(binary classification)로 부르고 보통 y{0,1}y\in\{0,1\}를 사용한다. C>2C>2이면 다중 클래스 분류(multiclass classification)다.

  • 클래스가 서로 배타적이지 않으면 다중 레이블 분류(multi-label classification)이며, 관련된 여러 이진 레이블을 동시에 예측하는 다중 출력 모델로 볼 수 있다.

이 자료에서 별도 언급 없이 ‘분류’라고 하면 단일 출력 다중 클래스 분류를 뜻한다.

분류를 함수 근사(function approximation)로 쓰면, 알 수 없는 관계 y=f(x)y=f(x)를 가정하고 레이블이 있는 학습 집합을 이용해 그 함수를 추정한다.

원자료 수식 · PDF 1쪽

수식을 계산 가능한 작은 연산으로 분해하기
Dtrain={(xl,yl):l=1,,L}\mathcal{D}_{\mathrm{train}}=\{(x_l,y_l):l=1,\ldots,L\}
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

등호 왼쪽 값을 만들기 위해 오른쪽에서 어떤 연산을 어떤 순서로 수행하는가?

한 줄 핵심

괄호·인덱스·내적·합·나눗셈을 안쪽부터 계산하고, 마지막에 왼쪽 값의 차원과 의미를 확인한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    등호 왼쪽의 목표를 확인한다

    스칼라·벡터·행렬·확률 중 무엇을 구하는지 먼저 정한다.

  2. 2

    입력 기호의 값과 차원을 적는다

    기호를 말로만 읽지 말고 작은 숫자 예시로 치환한다.

  3. 3

    가장 안쪽 괄호와 인덱스부터 계산한다

  4. 4

    곱 → 합 → 정규화 순서로 바깥 연산을 진행한다

  5. 5

    차원·부호·범위를 검산한다

    왼쪽과 오른쪽의 모양과 단위가 일치해야 한다.

Worked example

숫자로 직접 계산 — 직접 계산하는 공통 절차

복잡한 식도 N=2 또는 샘플 2개로 축소한다.

  1. 1

    최소 크기 선택

    N=2N=2
  2. 2

    기호를 숫자로 치환

    x=[1,2]Tx=[1,2]^T
  3. 3

    안쪽 연산부터 기록

    중간값을 생략하지 않고 한 줄씩 적는다.

  4. 4

    최종 범위 확인

    확률이면 0~1, 거리·제곱오차면 0 이상인지 본다.

결과: 이 절차를 적용하면 기호 조작이 아니라 재현 가능한 계산으로 읽을 수 있다.

Sanity check

검산 포인트
  • 좌변과 우변의 차원·단위를 비교한다.
  • 바로 앞 문단에서 정의된 인덱스 범위와 분모를 다시 확인한다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 1쪽 · 2.1.1 Classification 식별자: MAI-P2-006

학습 뒤에는 y^=f^(x)\hat y=\hat f(x)로 새 입력을 예측한다. 이전에 관측하지 않은 입력에서도 잘 작동하는 능력이 일반화(generalization)다.

#2.1.2 회귀(Regression)

회귀는 입력으로부터 수치 값을 예측한다. 학습 알고리즘이 내놓아야 하는 함수의 형식은 f:RNRf:\mathbb{R}^{N}\to\mathbb{R}이다. 분류와 핵심 구조는 비슷하지만 출력 형식이 실수라는 점이 다르다.

강의자료의 예시는 하나의 실수 입력 xlRx_l\in\mathbb{R}와 실수 응답 ylRy_l\in\mathbb{R}를 사용해 직선 모델과 2차 다항식 모델을 비교한다. 페이지 끝의 질문은 ‘어느 적합 모델이 더 좋아 보이는가?’이며, 정답을 제시하지 않고 ??로 남겨 둔다.

강의 주석 — PDF p.1
회귀 예시 주변에 ‘path’로 읽히는 메모와 λ 기호가 있다. 의미를 확정할 문맥이 부족하므로 원장에는 판독 불확실로 남긴다.

Simple linear modelMAI-P2-011: y=b₀+b₁xPolynomial modelMAI-P2-012: y=b₀+b₁x+b₂x²
Figure 1 재구성. 같은 산점도에 직선과 2차 곡선을 적합한다. 그림만으로 모델을 고르면 안 되며, 뒤의 일반화·검증 논의가 필요한 이유를 예고한다.
y=b0+b1xy=b_0+b_1x y=b0+b1x+b2x2y=b_0+b_1x+b_2x^2

#2.1.3 밀도 추정(Density estimation)

밀도 추정에서는 알고리즘이 pmodel:RNRp_{\mathrm{model}}:\mathbb{R}^{N}\to\mathbb{R}을 학습하며, pmodel(x)p_{\mathrm{model}}(x)는 표본이 나온 공간의 확률밀도함수(PDF) 또는 확률질량함수(PMF)로 해석한다.

좋은 밀도 모델은 관측 데이터가 어디에 빽빽하게 모이는지, 어디에서는 거의 나타나지 않는지를 포함해 데이터 구조를 익혀야 한다. 다만 실제로는 밀도 자체를 알더라도 필요한 연산이 계산적으로 다루기 어려운 경우가 많아 관련 과제가 자동으로 해결되지는 않는다.

#2.2 예제: 선형 회귀(Linear regression)

입력은 xRNx\in\mathbb{R}^{N}, 출력은 스칼라 yRy\in\mathbb{R}이다. 모델의 예측값은 다음과 같이 정의된다.

원자료 수식 · PDF 2쪽

수식을 계산 가능한 작은 연산으로 분해하기
y^=wTx\hat y=w^{\mathsf T}x
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

등호 왼쪽 값을 만들기 위해 오른쪽에서 어떤 연산을 어떤 순서로 수행하는가?

한 줄 핵심

괄호·인덱스·내적·합·나눗셈을 안쪽부터 계산하고, 마지막에 왼쪽 값의 차원과 의미를 확인한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    등호 왼쪽의 목표를 확인한다

    스칼라·벡터·행렬·확률 중 무엇을 구하는지 먼저 정한다.

  2. 2

    입력 기호의 값과 차원을 적는다

    기호를 말로만 읽지 말고 작은 숫자 예시로 치환한다.

  3. 3

    가장 안쪽 괄호와 인덱스부터 계산한다

  4. 4

    곱 → 합 → 정규화 순서로 바깥 연산을 진행한다

  5. 5

    차원·부호·범위를 검산한다

    왼쪽과 오른쪽의 모양과 단위가 일치해야 한다.

Worked example

숫자로 직접 계산 — 직접 계산하는 공통 절차

복잡한 식도 N=2 또는 샘플 2개로 축소한다.

  1. 1

    최소 크기 선택

    N=2N=2
  2. 2

    기호를 숫자로 치환

    x=[1,2]Tx=[1,2]^T
  3. 3

    안쪽 연산부터 기록

    중간값을 생략하지 않고 한 줄씩 적는다.

  4. 4

    최종 범위 확인

    확률이면 0~1, 거리·제곱오차면 0 이상인지 본다.

결과: 이 절차를 적용하면 기호 조작이 아니라 재현 가능한 계산으로 읽을 수 있다.

Sanity check

검산 포인트
  • 좌변과 우변의 차원·단위를 비교한다.
  • 바로 앞 문단에서 정의된 인덱스 범위와 분모를 다시 확인한다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 2.2 Linear regression 식별자: MAI-P2-017

여기서 wRNw\in\mathbb{R}^{N}는 파라미터 벡터다. 각 성분은 해당 특성에 곱해지는 계수이며, 전체 벡터는 각 특성이 예측에 미치는 영향을 정한다.

학습 알고리즘은 학습 자료 (X(train),y(train))\left(X^{(\mathrm{train})},y^{(\mathrm{train})}\right)를 보고 가중치를 조정한다. 직관적인 기준은 학습 평균제곱오차(MSE)를 최소화하는 것이다.

원자료 수식 · PDF 2쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
MSEtrain=1LX(train)wy(train)22\operatorname{MSE}_{\mathrm{train}}=\frac{1}{L}\left\|X^{(\mathrm{train})}w-y^{(\mathrm{train})}\right\|_2^2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
XX샘플을 모은 데이터 행렬
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 2.2 Linear regression 식별자: MAI-P2-020

강의자료는 기울기를 0으로 두어 정규방정식(normal equation)을 얻는 전개를 한 줄도 건너뛰지 않고 보여 준다.

원자료 수식 · PDF 2쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
wMSEtrain=0\nabla_w\operatorname{MSE}_{\mathrm{train}}=0
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 2.2 Linear regression 식별자: MAI-P2-021

원자료 수식 · PDF 2쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
w ⁣(1LX(train)wy(train)22)=0\nabla_w\!\left(\frac{1}{L}\left\|X^{(\mathrm{train})}w-y^{(\mathrm{train})}\right\|_2^2\right)=0
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
XX샘플을 모은 데이터 행렬
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 2.2 Linear regression 식별자: MAI-P2-022

원자료 수식 · PDF 2쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
w ⁣((X(train)wy(train))T(X(train)wy(train)))=0\nabla_w\!\left(\left(X^{(\mathrm{train})}w-y^{(\mathrm{train})}\right)^{\mathsf T}\left(X^{(\mathrm{train})}w-y^{(\mathrm{train})}\right)\right)=0
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
XX샘플을 모은 데이터 행렬
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 2.2 Linear regression 식별자: MAI-P2-023

원자료 수식 · PDF 2쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
w ⁣(wT(X(train))TX(train)w2wT(X(train))Ty(train)+(y(train))Ty(train))=0\nabla_w\!\left(w^{\mathsf T}\left(X^{(\mathrm{train})}\right)^{\mathsf T}X^{(\mathrm{train})}w-2w^{\mathsf T}\left(X^{(\mathrm{train})}\right)^{\mathsf T}y^{(\mathrm{train})}+\left(y^{(\mathrm{train})}\right)^{\mathsf T}y^{(\mathrm{train})}\right)=0
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
XX샘플을 모은 데이터 행렬
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 2.2 Linear regression 식별자: MAI-P2-024

원자료 수식 · PDF 2쪽

수식을 계산 가능한 작은 연산으로 분해하기
2(X(train))TX(train)w2(X(train))Ty(train)=02\left(X^{(\mathrm{train})}\right)^{\mathsf T}X^{(\mathrm{train})}w-2\left(X^{(\mathrm{train})}\right)^{\mathsf T}y^{(\mathrm{train})}=0
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

등호 왼쪽 값을 만들기 위해 오른쪽에서 어떤 연산을 어떤 순서로 수행하는가?

한 줄 핵심

괄호·인덱스·내적·합·나눗셈을 안쪽부터 계산하고, 마지막에 왼쪽 값의 차원과 의미를 확인한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    등호 왼쪽의 목표를 확인한다

    스칼라·벡터·행렬·확률 중 무엇을 구하는지 먼저 정한다.

  2. 2

    입력 기호의 값과 차원을 적는다

    기호를 말로만 읽지 말고 작은 숫자 예시로 치환한다.

  3. 3

    가장 안쪽 괄호와 인덱스부터 계산한다

  4. 4

    곱 → 합 → 정규화 순서로 바깥 연산을 진행한다

  5. 5

    차원·부호·범위를 검산한다

    왼쪽과 오른쪽의 모양과 단위가 일치해야 한다.

Worked example

숫자로 직접 계산 — 직접 계산하는 공통 절차

복잡한 식도 N=2 또는 샘플 2개로 축소한다.

  1. 1

    최소 크기 선택

    N=2N=2
  2. 2

    기호를 숫자로 치환

    x=[1,2]Tx=[1,2]^T
  3. 3

    안쪽 연산부터 기록

    중간값을 생략하지 않고 한 줄씩 적는다.

  4. 4

    최종 범위 확인

    확률이면 0~1, 거리·제곱오차면 0 이상인지 본다.

결과: 이 절차를 적용하면 기호 조작이 아니라 재현 가능한 계산으로 읽을 수 있다.

Sanity check

검산 포인트
  • 좌변과 우변의 차원·단위를 비교한다.
  • 바로 앞 문단에서 정의된 인덱스 범위와 분모를 다시 확인한다.

Symbols

이 식에 실제로 나온 기호
기호의미
XX샘플을 모은 데이터 행렬

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 2.2 Linear regression 식별자: MAI-P2-025

원자료 수식 · PDF 2쪽

수식을 계산 가능한 작은 연산으로 분해하기
(X(train))TX(train)w=(X(train))Ty(train)\left(X^{(\mathrm{train})}\right)^{\mathsf T}X^{(\mathrm{train})}w=\left(X^{(\mathrm{train})}\right)^{\mathsf T}y^{(\mathrm{train})}
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

등호 왼쪽 값을 만들기 위해 오른쪽에서 어떤 연산을 어떤 순서로 수행하는가?

한 줄 핵심

괄호·인덱스·내적·합·나눗셈을 안쪽부터 계산하고, 마지막에 왼쪽 값의 차원과 의미를 확인한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    등호 왼쪽의 목표를 확인한다

    스칼라·벡터·행렬·확률 중 무엇을 구하는지 먼저 정한다.

  2. 2

    입력 기호의 값과 차원을 적는다

    기호를 말로만 읽지 말고 작은 숫자 예시로 치환한다.

  3. 3

    가장 안쪽 괄호와 인덱스부터 계산한다

  4. 4

    곱 → 합 → 정규화 순서로 바깥 연산을 진행한다

  5. 5

    차원·부호·범위를 검산한다

    왼쪽과 오른쪽의 모양과 단위가 일치해야 한다.

Worked example

숫자로 직접 계산 — 직접 계산하는 공통 절차

복잡한 식도 N=2 또는 샘플 2개로 축소한다.

  1. 1

    최소 크기 선택

    N=2N=2
  2. 2

    기호를 숫자로 치환

    x=[1,2]Tx=[1,2]^T
  3. 3

    안쪽 연산부터 기록

    중간값을 생략하지 않고 한 줄씩 적는다.

  4. 4

    최종 범위 확인

    확률이면 0~1, 거리·제곱오차면 0 이상인지 본다.

결과: 이 절차를 적용하면 기호 조작이 아니라 재현 가능한 계산으로 읽을 수 있다.

Sanity check

검산 포인트
  • 좌변과 우변의 차원·단위를 비교한다.
  • 바로 앞 문단에서 정의된 인덱스 범위와 분모를 다시 확인한다.

Symbols

이 식에 실제로 나온 기호
기호의미
XX샘플을 모은 데이터 행렬

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 2.2 Linear regression 식별자: MAI-P2-026

원자료 수식 · PDF 2쪽 · 식 (1)

정규방정식은 MSE의 기울기를 0으로 놓아 회귀 가중치를 직접 구함
w=((X(train))TX(train))1(X(train))Ty(train)w^{\star}=\left(\left(X^{(\mathrm{train})}\right)^{\mathsf T}X^{(\mathrm{train})}\right)^{-1}\left(X^{(\mathrm{train})}\right)^{\mathsf T}y^{(\mathrm{train})}
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

선형회귀의 제곱오차를 가장 작게 만드는 w는 무엇인가?

한 줄 핵심

제곱오차를 전개하고 w로 미분한 뒤 0으로 두면 XᵀXw=Xᵀy가 나온다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    잔차 제곱합을 쓴다

    J(w)=Xwy22J(w)=\lVert Xw-y\rVert_2^2
  2. 2

    행렬곱으로 전개한다

    J(w)=wTXTXw2wTXTy+yTyJ(w)=w^TX^TXw-2w^TX^Ty+y^Ty
  3. 3

    w로 미분한다

    wJ=2XTXw2XTy\nabla_wJ=2X^TXw-2X^Ty
  4. 4

    최솟값 후보에서 0으로 둔다

    XTXw=XTyX^TXw=X^Ty
  5. 5

    선형시스템을 푼다

    w=(XTX)1XTyw^*=(X^TX)^{-1}X^Ty

Worked example

숫자로 직접 계산 — 절편과 기울기 회귀

두 점 (1,1), (2,2)에 직선을 맞춘다.

  1. 1

    행렬 구성

    X=[1112],y=[12]X=\begin{bmatrix}1&1\\1&2\end{bmatrix},\quad y=\begin{bmatrix}1\\2\end{bmatrix}
  2. 2

    곱 계산

    XTX=[2335],XTy=[35]X^TX=\begin{bmatrix}2&3\\3&5\end{bmatrix},\quad X^Ty=\begin{bmatrix}3\\5\end{bmatrix}
  3. 3

    역행렬 적용

    (XTX)1=[5332](X^TX)^{-1}=\begin{bmatrix}5&-3\\-3&2\end{bmatrix}
  4. 4

    가중치

    w=[01]w^*=\begin{bmatrix}0\\1\end{bmatrix}

결과: 절편 0, 기울기 1인 y=x가 두 점을 정확히 지난다.

주의: 실제 구현에서는 (XᵀX)⁻¹을 직접 만들기보다 QR·SVD·선형 solve를 사용한다.

Sanity check

검산 포인트
  • XᵀX가 가역인지 확인한다.
  • w의 길이는 X의 열 수와 같아야 한다.

Symbols

이 식에 실제로 나온 기호
기호의미
XX샘플을 모은 데이터 행렬

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 식 (1) · 2.2 Linear regression 식별자: MAI-P2-027

마지막 식은 원자료의 식 (1)이다. 이 역행렬 표현은 그램 행렬이 가역이라는 조건을 암묵적으로 사용한다.

원자료 수식 · PDF 2쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
x(yAx)TW(yAx)=2ATW(yAx)\frac{\partial}{\partial x}(y-Ax)^{\mathsf T}W(y-Ax)=-2A^{\mathsf T}W(y-Ax)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\partial특정 변수에 대한 편미분

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 2.2 Linear regression 식별자: MAI-P2-028

원자료는 이 미분 공식을 The Matrix Cookbook의 항등식으로 덧붙인다.

강의 주석 — PDF p.2, 학습표본 표기
(x_l,y_l)을 하나의 training sample로 읽고, 행별 특성 벡터를 적층해 X^(train)을 만드는 구조를 메모했다.

원자료 수식 · PDF 2쪽

수식을 계산 가능한 작은 연산으로 분해하기
argminw  1Ll=1L(wTxlyl)2\underset{w}{\operatorname{argmin}}\;\frac{1}{L}\sum_{l=1}^{L}(w^{\mathsf T}x_l-y_l)^2
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

등호 왼쪽 값을 만들기 위해 오른쪽에서 어떤 연산을 어떤 순서로 수행하는가?

한 줄 핵심

괄호·인덱스·내적·합·나눗셈을 안쪽부터 계산하고, 마지막에 왼쪽 값의 차원과 의미를 확인한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    등호 왼쪽의 목표를 확인한다

    스칼라·벡터·행렬·확률 중 무엇을 구하는지 먼저 정한다.

  2. 2

    입력 기호의 값과 차원을 적는다

    기호를 말로만 읽지 말고 작은 숫자 예시로 치환한다.

  3. 3

    가장 안쪽 괄호와 인덱스부터 계산한다

  4. 4

    곱 → 합 → 정규화 순서로 바깥 연산을 진행한다

  5. 5

    차원·부호·범위를 검산한다

    왼쪽과 오른쪽의 모양과 단위가 일치해야 한다.

Worked example

숫자로 직접 계산 — 직접 계산하는 공통 절차

복잡한 식도 N=2 또는 샘플 2개로 축소한다.

  1. 1

    최소 크기 선택

    N=2N=2
  2. 2

    기호를 숫자로 치환

    x=[1,2]Tx=[1,2]^T
  3. 3

    안쪽 연산부터 기록

    중간값을 생략하지 않고 한 줄씩 적는다.

  4. 4

    최종 범위 확인

    확률이면 0~1, 거리·제곱오차면 0 이상인지 본다.

결과: 이 절차를 적용하면 기호 조작이 아니라 재현 가능한 계산으로 읽을 수 있다.

Sanity check

검산 포인트
  • 좌변과 우변의 차원·단위를 비교한다.
  • 바로 앞 문단에서 정의된 인덱스 범위와 분모를 다시 확인한다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · Page 2 lecture annotation 식별자: MAI-P2-032

원자료 수식 · PDF 2쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
1L[x1TxLT]w[y1yL]22\frac{1}{L}\left\|\begin{bmatrix}x_1^{\mathsf T}\\ \vdots\\ x_L^{\mathsf T}\end{bmatrix}w-\begin{bmatrix}y_1\\ \vdots\\ y_L\end{bmatrix}\right\|_2^2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · Page 2 lecture annotation 식별자: MAI-P2-033

원자료 수식 · PDF 2쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
x(axb)2=2a(axb)\frac{\partial}{\partial x}(ax-b)^2=2a(ax-b)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\partial특정 변수에 대한 편미분

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · Page 2 lecture annotation 식별자: MAI-P2-029

원자료 수식 · PDF 2쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
xAxy22=2AT(Axy)\nabla_x\|Ax-y\|_2^2=2A^{\mathsf T}(Ax-y)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · Page 2 lecture annotation 식별자: MAI-P2-030

원자료 수식 · PDF 2쪽

수식을 계산 가능한 작은 연산으로 분해하기
XTX=l=1LxlxlTX^{\mathsf T}X=\sum_{l=1}^{L}x_lx_l^{\mathsf T}
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

등호 왼쪽 값을 만들기 위해 오른쪽에서 어떤 연산을 어떤 순서로 수행하는가?

한 줄 핵심

괄호·인덱스·내적·합·나눗셈을 안쪽부터 계산하고, 마지막에 왼쪽 값의 차원과 의미를 확인한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    등호 왼쪽의 목표를 확인한다

    스칼라·벡터·행렬·확률 중 무엇을 구하는지 먼저 정한다.

  2. 2

    입력 기호의 값과 차원을 적는다

    기호를 말로만 읽지 말고 작은 숫자 예시로 치환한다.

  3. 3

    가장 안쪽 괄호와 인덱스부터 계산한다

  4. 4

    곱 → 합 → 정규화 순서로 바깥 연산을 진행한다

  5. 5

    차원·부호·범위를 검산한다

    왼쪽과 오른쪽의 모양과 단위가 일치해야 한다.

Worked example

숫자로 직접 계산 — 직접 계산하는 공통 절차

복잡한 식도 N=2 또는 샘플 2개로 축소한다.

  1. 1

    최소 크기 선택

    N=2N=2
  2. 2

    기호를 숫자로 치환

    x=[1,2]Tx=[1,2]^T
  3. 3

    안쪽 연산부터 기록

    중간값을 생략하지 않고 한 줄씩 적는다.

  4. 4

    최종 범위 확인

    확률이면 0~1, 거리·제곱오차면 0 이상인지 본다.

결과: 이 절차를 적용하면 기호 조작이 아니라 재현 가능한 계산으로 읽을 수 있다.

Sanity check

검산 포인트
  • 좌변과 우변의 차원·단위를 비교한다.
  • 바로 앞 문단에서 정의된 인덱스 범위와 분모를 다시 확인한다.

Symbols

이 식에 실제로 나온 기호
기호의미
XX샘플을 모은 데이터 행렬
\sum지정된 항을 모두 더하는 연산
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · Page 2 lecture annotation 식별자: MAI-P2-031

판독 불확실 — PDF p.2 하단 오른쪽
L ≫ N으로 보이는 차원 비교와 수치 예시가 있으나 필기선이 겹친다. 추측해 복원하지 않고 위치만 보존한다.

#2.3 과소적합과 과대적합(Underfitting and overfitting)

머신러닝의 중심 과제는 학습에 사용하지 않은 새 입력에서도 성능을 유지하는 것이다. 이 능력이 일반화다.

보통 학습 집합에서 오차를 계산하고 파라미터를 최적화해 학습 오차를 줄인다. 여기까지만 보면 최적화 문제다. 머신러닝이 단순 최적화와 달라지는 지점은 일반화 오차 또는 테스트 오차도 낮아야 한다는 요구다. 일반화 오차는 새 입력에서의 오차 기댓값으로 정의된다.

선형 회귀 예제에서는 식 (1)로 얻은 모델을 테스트 집합에서 평가한다.

원자료 수식 · PDF 3쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
MSEtest=1MX(test)wy(test)22\operatorname{MSE}_{\mathrm{test}}=\frac{1}{M}\left\|X^{(\mathrm{test})}w^{\star}-y^{(\mathrm{test})}\right\|_2^2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
XX샘플을 모은 데이터 행렬

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 3쪽 · 2.3 Overfitting and underfitting 식별자: MAI-P2-034

여기서 M은 테스트 표본 수다.

학습·테스트 자료는 데이터 생성 과정(data-generating process)이라는 확률분포에서 만들어진다고 본다. 전형적인 가정은 각 표본이 서로 독립이고, 학습 집합과 테스트 집합이 같은 분포에서 나온다는 i.i.d. 가정이다. 이 공유 분포가 데이터 생성 분포다.

자료는 학습 집합을 먼저 뽑아 파라미터를 최적화한 뒤 테스트 집합을 뽑는 절차를 전제로 하면, 기대 테스트 오차가 기대 학습 오차보다 작지 않다고 설명한다.

원자료 수식 · PDF 3쪽

기댓값은 가능한 값에 확률을 곱해 모두 더한 장기 평균
E[errortest]E[errortrain]\mathbb{E}[\operatorname{error}_{\mathrm{test}}]\geq\mathbb{E}[\operatorname{error}_{\mathrm{train}}]
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

같은 실험을 매우 많이 반복하면 평균이 어디에 가까워지는가?

한 줄 핵심

각 결과값×그 결과의 확률을 계산한 뒤 합한다. 연속형에서는 합 대신 적분한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    가능한 값과 확률을 짝지운다

    (xi,pi)(x_i,p_i)
  2. 2

    각 값에 확률을 곱한다

    xipix_ip_i
  3. 3

    모두 더한다

    E[X]=ixipiE[X]=\sum_i x_ip_i
  4. 4

    확률의 합을 확인한다

    ipi=1\sum_i p_i=1

Worked example

숫자로 직접 계산 — 이산 확률변수 평균

X가 1,2,3을 각각 0.2,0.5,0.3 확률로 갖는다.

  1. 1

    가중값

    1(0.2), 2(0.5), 3(0.3)1(0.2),\ 2(0.5),\ 3(0.3)
  2. 2

    0.2+1.0+0.9=2.10.2+1.0+0.9=2.1

결과: E[X]=2.1이다. 실제 관측값 중 하나일 필요는 없다.

Sanity check

검산 포인트
  • 확률 또는 밀도가 정규화되어야 한다.
  • E[g(X)]는 일반적으로 g(E[X])와 같지 않다.

Symbols

이 식에 실제로 나온 기호
기호의미
E\mathbb{E}가능한 값의 확률가중평균인 기댓값

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 3쪽 · 2.3 Overfitting and underfitting 식별자: MAI-P2-035
  • 좋은 학습 알고리즘은 학습 오차 자체를 작게 만들어야 한다.
  • 동시에 학습 오차와 테스트 오차 사이의 간격을 작게 만들어야 한다.

과소적합(underfitting)은 모델이 학습 집합에서도 충분히 낮은 오차를 얻지 못하는 경우다.

과대적합(overfitting)은 학습 오차와 테스트 오차의 간격이 지나치게 큰 경우다.

모델의 용량(capacity)을 바꾸면 과소적합·과대적합 가능성을 조절할 수 있다. 낮은 용량은 학습 집합을 표현하지 못할 수 있고, 높은 용량은 테스트에 도움이 되지 않는 학습 집합의 속성을 암기할 수 있다.

#2.3.1 공짜 점심 없음 정리(No free lunch theorem)

“모든 모델은 틀리지만, 그중 일부는 유용하다.” — George Box

머신러닝은 다양한 모델과 그 모델을 적합하는 알고리즘을 설계한다. 교차검증으로 특정 문제에서 더 나은 방법을 경험적으로 고를 수 있지만, 모든 문제에서 항상 최적인 단일 모델은 없다. 한 영역에 맞는 가정이 다른 영역에서는 나쁠 수 있기 때문이다.

판독 불확실 — PDF p.3 하단
‘예시)’ 뒤의 필기는 해상도와 획 중첩 때문에 내용 확정이 불가능하다.

Underfitting

표본의 곡률을 따라가지 못하는 단순 직선. 학습 오차부터 높다.

Overfitting

각 표본 주변을 요동하며 통과하는 지나치게 복잡한 곡선. 학습–테스트 간격이 커진다.

Appropriate capacity

전체 추세를 따르되 국소 잡음은 추종하지 않는 곡선.

Figure 2 재구성. 모델 용량이 너무 작을 때, 너무 클 때, 적절할 때의 적합을 한 화면에서 비교한다.
Underfitting — Excessive λ

9차 모델이 거의 평평해져 과소적합.

Appropriate weight decay — Medium λ

고차 모델의 진동을 억제해 참 2차 함수에 가까운 적합.

Overfitting — λ→0

경계에서 크게 발산하는 과대적합 곡선.

Figure 3 재구성. 참 함수는 2차이지만 모델은 모두 9차이며, λ만 바꾸어 정규화 효과를 보여 준다.

공짜 점심 없음 정리의 결과로 현실의 다양한 데이터 구조를 덮기 위해 여러 종류의 모델이 필요하다. 같은 모델도 훈련 알고리즘에 따라 속도·정확도·복잡도 절충이 달라진다.

#2.3.2 정규화(Regularization)

특정 과제에서 잘 작동하도록 학습 알고리즘에 선호(preference)를 넣을 수 있다. 그 선호가 실제 문제 구조와 맞으면 성능이 좋아진다.

선형 회귀의 예는 작은 가중치를 선호하도록 학습 기준에 가중치 감쇠(weight decay)를 더한다.

원자료 수식 · PDF 4쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
MSEtrain+λw22\operatorname{MSE}_{\mathrm{train}}+\lambda\|w\|_2^2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
λ\lambda정규화 강도 또는 고유값

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · 2.3.2 Regularization 식별자: MAI-P2-036

λ는 미리 선택하는 값이다. λ=0\lambda=0이면 작은 가중치에 대한 선호가 없고, λ가 클수록 가중치를 더 강하게 줄인다.

λ0\lambda\to0

Figure 3은 λ가 지나치게 크면 과소적합, 중간이면 적정 적합, 0에 가까우면 과대적합하는 모습을 비교한다.

해를 선호하는 방식은 명시적일 수도 암묵적일 수도 있다. 이 예에서는 최소화 기준에 추가 항을 넣어 작은 가중치의 선형 함수를 명시적으로 선호한다.

강의 주석 — PDF p.4 Figure 2 오른쪽
반복 횟수에 따른 오차 곡선을 덧그렸고, 학습·테스트·과소적합으로 읽히는 세 경향을 구분했다.

판독 불확실 — PDF p.4 하단 오른쪽
일부만 읽히는 짧은 필기를 의미 추정으로 채우지 않는다.

이러한 서로 다른 선호 부여 방식을 통틀어 정규화라고 부른다.

정규화는 학습 오차가 아니라 일반화 오차를 줄이려는 의도로 학습 알고리즘을 수정하는 모든 방법이다.

모든 문제에 가장 좋은 알고리즘이 없듯, 가장 좋은 정규화도 하나로 정해지지 않는다. 해결하려는 과제에 맞는 정규화를 골라야 한다.

강의자료는 딥러닝의 철학을 ‘매우 일반적인 형태의 정규화로 폭넓은 과제를 효과적으로 해결하려는 것’으로 요약한다.

#2.4 하이퍼파라미터와 검증 집합(Hyperparameters and validation sets)

대부분의 머신러닝 알고리즘에는 동작을 조절하는 하이퍼파라미터가 있다. 이 값들은 학습 알고리즘이 자체적으로 적응시키는 모델 파라미터가 아니다.

Figure 1의 다항식 차수는 용량 하이퍼파라미터이고, 가중치 감쇠의 λ도 하이퍼파라미터다.

어떤 설정은 최적화가 어려워 하이퍼파라미터로 남는다. 더 흔한 이유는 학습 집합에서 그 값을 학습하는 것이 부적절하기 때문이다. 용량을 조절하는 값을 학습 집합에서 고르면 가능한 최대 용량을 선택해 과대적합할 수 있다.

이를 해결하려면 학습 알고리즘이 보지 않는 검증 집합(validation set)이 필요하다.

#2.4.1 학습·검증·테스트 집합

  • 학습 집합(training set): 모델 파라미터를 학습한다.
  • 검증 집합(validation set): 보지 않은 데이터에서의 일반화를 추정하며, 하이퍼파라미터와 모델 구성을 고른다.
  • 테스트 집합(test set): 최종 고정 모델을 진짜 미관측 자료에서 평가해 일반화 성능의 편향되지 않은 추정치를 얻는다.
Train
Validation
Test
하이퍼파라미터 후보

iterations, depth, width, optimizer, learning rate, batch size, epochs, …

Model — parameter tuning
Frozen model — one final test
원자료의 비번호 도식: Train은 모델 학습, Validation은 구성 선택, Test는 고정 모델의 마지막 평가로 연결된다.

강의 주석 — PDF p.5
하이퍼파라미터 제목 옆에 ‘hyper’, 정규화 문맥에 ‘dropout’으로 읽히는 메모가 있다.

Iteration 1 [TEST][TRAIN][TRAIN][TRAIN][TRAIN]
Iteration 2 [TRAIN][TEST][TRAIN][TRAIN][TRAIN]
Iteration 3 [TRAIN][TRAIN][TEST][TRAIN][TRAIN]
Iteration k [TRAIN][TRAIN][TRAIN][TRAIN][TEST]
Figure 4 재구성. K개의 겹치지 않는 부분집합을 번갈아 평가용으로 쓰고 나머지를 학습에 사용한다.

#2.4.2 교차검증(Cross-validation)

고정 학습·테스트 분할에서 테스트 집합이 작으면 평균 테스트 오차 추정의 통계적 불확실성이 커져 알고리즘 A와 B의 우열을 주장하기 어렵다.

수십만 개 이상의 표본이 있으면 문제가 덜하지만, 작은 데이터셋에서는 계산량을 더 쓰는 대신 여러 무작위 분할에서 학습과 평가를 반복해 모든 표본을 평균 테스트 오차 추정에 활용할 수 있다.

가장 흔한 K-fold 절차는 데이터셋을 K개의 겹치지 않는 부분집합으로 나누고 K번 실험한다. k번째 실험에서는 k번째 부분집합을 테스트에, 나머지를 학습에 쓰며 K개의 테스트 오차를 평균한다.

#2.5 지도학습 예제: 서포트 벡터 머신(SVM)

SVM은 로지스틱 회귀처럼 선형 함수 wTx+bw^{\mathsf T}x+b를 중심으로 하지만, 확률이 아니라 클래스 정체성을 출력한다. wTx+b>0w^{\mathsf T}x+b>0이면 양성, wTx+b<0w^{\mathsf T}x+b<0이면 음성 클래스로 예측한다.

핵심 혁신은 커널 트릭(kernel trick)이다. 여러 학습 알고리즘을 표본 간 내적만으로 쓸 수 있다는 점을 이용해, 명시적으로 고차원 특성 벡터를 만들지 않고도 변환된 공간에서 선형 모델을 학습한다.

각주에서는 로지스틱 회귀를 이진 분류용 일반화 선형 회귀로 소개한다. 표적은 y{0,1}y\in\{0,1\}이고, 선형 출력을 σ(wTx+b)\sigma(w^{\mathsf T}x+b)로 눌러 확률로 해석한다.

원자료 수식 · PDF 6쪽

시그모이드는 실수 점수를 0과 1 사이 값으로 압축
σ(x)=11+ex(0,1)\sigma(x)=\frac{1}{1+e^{-x}}\in(0,1)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

선형 점수를 확률처럼 해석 가능한 값으로 어떻게 바꾸는가?

한 줄 핵심

점수 z에 음수를 붙여 지수함수를 계산하고 1+e^{-z}의 역수를 취한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    선형 점수 z를 계산한다

    z=wTx+bz=w^Tx+b
  2. 2

    음의 지수값을 계산한다

    eze^{-z}
  3. 3

    1을 더한다

    1+ez1+e^{-z}
  4. 4

    역수를 취한다

    σ(z)=1/(1+ez)\sigma(z)=1/(1+e^{-z})

Worked example

숫자로 직접 계산 — z=2일 때

양의 점수가 어느 정도의 출력으로 변하는지 본다.

  1. 1

    지수

    e20.1353e^{-2}\approx0.1353
  2. 2

    분모

    1+0.1353=1.13531+0.1353=1.1353
  3. 3

    역수

    1/1.13530.8811/1.1353\approx0.881

결과: 출력은 약 0.881이다.

Sanity check

검산 포인트
  • z=0이면 정확히 0.5다.
  • 큰 양수에서는 1, 큰 음수에서는 0에 가까워진다.

Symbols

이 식에 실제로 나온 기호
기호의미
σ\sigma표준편차 또는 시그모이드 표기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 6쪽 · Page 6 footnote 식별자: MAI-P2-044

SVM의 선형 함수는 학습표본과의 내적 합으로 다시 쓸 수 있다.

원자료 수식 · PDF 7쪽

초평면 분류기는 가중합 점수의 부호로 클래스를 나눔
wTx+b=b+l=1LαlxTxlw^{\mathsf T}x+b=b+\sum_{l=1}^{L}\alpha_l x^{\mathsf T}x_l
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

입력 x가 결정경계의 어느 쪽에 있는가?

한 줄 핵심

wᵀx+b를 계산해 양수면 한 클래스, 음수면 다른 클래스로 보낸다. 0이면 경계 위다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    특징과 가중치를 같은 위치끼리 곱한다

    wixiw_ix_i
  2. 2

    모든 곱을 더하고 bias를 더한다

    g(x)=wTx+bg(x)=w^Tx+b
  3. 3

    부호를 확인한다

    g(x)>0+1,g(x)<01g(x)>0\Rightarrow+1,\quad g(x)<0\Rightarrow-1
  4. 4

    필요하면 경계까지 거리를 구한다

    distance=g(x)/w2\mathrm{distance}=|g(x)|/\lVert w\rVert_2

Worked example

숫자로 직접 계산 — 한 점 분류하기

w=[1,-2], x=[3,1], b=0.5이다.

  1. 1

    가중합

    13+(2)1+0.5=1.51\cdot3+(-2)\cdot1+0.5=1.5
  2. 2

    클래스

    sign(1.5)=+1\operatorname{sign}(1.5)=+1
  3. 3

    경계까지 거리

    1.5/12+(2)20.671.5/\sqrt{1^2+(-2)^2}\approx0.67

결과: 이 점은 양의 클래스 쪽에 있고 경계에서 약 0.67 떨어져 있다.

Sanity check

검산 포인트
  • w와 x의 차원이 같아야 한다.
  • 거리에는 |g(x)|가 필요하지만 signed distance는 부호를 유지할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\sum지정된 항을 모두 더하는 연산
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · 2.5 Support vector machine 식별자: MAI-P2-045

여기서 x_l은 학습표본이고 α는 계수 벡터다. 입력을 특성 함수 φ(x)로 바꾸고 내적을 커널로 치환한다.

원자료 수식 · PDF 7쪽

커널은 특징공간을 직접 만들지 않고 두 입력의 내적·유사도를 계산
κ(x,xl)=ϕ(x)Tϕ(xl)\kappa(x,x_l)=\phi(x)^{\mathsf T}\phi(x_l)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

비선형 관계를 선형모델이 사용할 수 있는 유사도 점수로 어떻게 바꾸는가?

한 줄 핵심

두 입력의 거리 또는 특징공간 내적을 계산해 스칼라 유사도 κ(u,v)를 만든다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    두 입력의 차이를 구한다

    r=uvr=u-v
  2. 2

    거리 제곱을 계산한다

    r22\lVert r\rVert_2^2
  3. 3

    커널 폭으로 나눈다

    r22/(2σ2)\lVert r\rVert_2^2/(2\sigma^2)
  4. 4

    음의 지수함수로 유사도를 만든다

    κ(u,v)=euv2/(2σ2)\kappa(u,v)=e^{-\lVert u-v\rVert^2/(2\sigma^2)}

Worked example

숫자로 직접 계산 — RBF 커널

u=[0,0], v=[1,1], σ=1이다.

  1. 1

    거리 제곱

    (01)2+(01)2=2(0-1)^2+(0-1)^2=2
  2. 2

    지수

    e2/(212)=e10.368e^{-2/(2\cdot1^2)}=e^{-1}\approx0.368

결과: 두 점의 RBF 유사도는 약 0.368이다.

Sanity check

검산 포인트
  • u=v이면 RBF 커널은 1이다.
  • σ가 너무 작으면 거의 모든 다른 점이 0에 가깝고, 너무 크면 모두 비슷해진다.

Symbols

이 식에 실제로 나온 기호
기호의미
κ\kappa두 입력의 유사도를 반환하는 커널
ϕ\phi입력을 특징공간으로 보내는 변환

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · 2.5 Support vector machine 식별자: MAI-P2-046

원자료 수식 · PDF 7쪽

커널은 특징공간을 직접 만들지 않고 두 입력의 내적·유사도를 계산
f(x)=b+l=1Lαlκ(x,xl)f(x)=b+\sum_{l=1}^{L}\alpha_l\kappa(x,x_l)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

비선형 관계를 선형모델이 사용할 수 있는 유사도 점수로 어떻게 바꾸는가?

한 줄 핵심

두 입력의 거리 또는 특징공간 내적을 계산해 스칼라 유사도 κ(u,v)를 만든다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    두 입력의 차이를 구한다

    r=uvr=u-v
  2. 2

    거리 제곱을 계산한다

    r22\lVert r\rVert_2^2
  3. 3

    커널 폭으로 나눈다

    r22/(2σ2)\lVert r\rVert_2^2/(2\sigma^2)
  4. 4

    음의 지수함수로 유사도를 만든다

    κ(u,v)=euv2/(2σ2)\kappa(u,v)=e^{-\lVert u-v\rVert^2/(2\sigma^2)}

Worked example

숫자로 직접 계산 — RBF 커널

u=[0,0], v=[1,1], σ=1이다.

  1. 1

    거리 제곱

    (01)2+(01)2=2(0-1)^2+(0-1)^2=2
  2. 2

    지수

    e2/(212)=e10.368e^{-2/(2\cdot1^2)}=e^{-1}\approx0.368

결과: 두 점의 RBF 유사도는 약 0.368이다.

Sanity check

검산 포인트
  • u=v이면 RBF 커널은 1이다.
  • σ가 너무 작으면 거의 모든 다른 점이 0에 가깝고, 너무 크면 모두 비슷해진다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
κ\kappa두 입력의 유사도를 반환하는 커널
\sum지정된 항을 모두 더하는 연산
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · 2.5 Support vector machine 식별자: MAI-P2-047

x에 대해서는 비선형일 수 있지만 φ(x)와 f(x)의 관계, α와 f(x)의 관계는 선형이다. 이는 모든 입력에 φ를 적용한 뒤 새 공간에서 선형 모델을 학습하는 것과 정확히 대응한다.

  • 고정된 φ를 두고 α만 최적화하면, 원래 입력에 대해서 비선형인 모델을 볼록 최적화로 학습할 수 있다.
  • κ는 두 고차원 특성 벡터를 직접 만들고 내적하는 것보다 훨씬 효율적으로 계산될 수 있다.

원자료가 대표 커널로 드는 것은 가우시안 커널이다.

원자료 수식 · PDF 7쪽

가우시안 밀도는 평균에서의 표준화 거리로 가능성을 계산
κ(u,v)=N(uv;0,σ2I)\kappa(u,v)=\mathcal{N}(u-v;0,\sigma^2I)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측값 x가 평균 μ와 공분산 Σ를 가진 분포에서 얼마나 그럴듯한가?

한 줄 핵심

평균과의 차이를 공분산으로 스케일링한 거리와 정규화 상수를 계산해 밀도를 얻는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    평균에서의 차이를 구한다

    r=xμr=x-\mu
  2. 2

    분산·공분산으로 거리 스케일을 보정한다

    d2=rTΣ1rd^2=r^T\Sigma^{-1}r
  3. 3

    지수 감쇠를 계산한다

    exp(d2/2)\exp(-d^2/2)
  4. 4

    정규화 상수로 나눈다

    (2π)N/2Σ1/2(2\pi)^{N/2}|\Sigma|^{1/2}

Worked example

숫자로 직접 계산 — 표준정규에서 x=1

μ=0, σ=1인 1차원 가우시안이다.

  1. 1

    표준화 거리

    z=(10)/1=1z=(1-0)/1=1
  2. 2

    지수항

    e12/2=e0.50.6065e^{-1^2/2}=e^{-0.5}\approx0.6065
  3. 3

    정규화

    0.6065/2π0.24200.6065/\sqrt{2\pi}\approx0.2420

결과: x=1에서 확률밀도는 약 0.242다. 밀도값 자체는 사건확률이 아니다.

Sanity check

검산 포인트
  • Σ는 대칭 양의 정부호여야 역행렬과 양의 밀도가 안정적으로 정의된다.
  • 확률은 구간 적분으로 얻으며 한 점의 밀도와 구분한다.

Symbols

이 식에 실제로 나온 기호
기호의미
σ\sigma표준편차 또는 시그모이드 표기
κ\kappa두 입력의 유사도를 반환하는 커널
N\mathcal{N}가우시안 분포

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · 2.5 Support vector machine 식별자: MAI-P2-048

N(x;μ,Σ)\mathcal{N}(x;\mu,\Sigma)은 평균 μ와 공분산 Σ를 갖는 정규밀도 표기다.

x10.5
PDF p.6의 각주가 p.7 상단의 비번호 그래프로 이어진다. 출력 범위는 (0,1)이며 x=0에서 0.5다.

#2.6 최소거리 분류기: 결정론적 분류

최소거리 분류기는 패턴 벡터와 각 클래스 프로토타입 사이의 거리를 계산하고 가장 가까운 프로토타입의 클래스를 배정한다.

보통 프로토타입은 클래스별 평균 벡터다.

원자료 수식 · PDF 7쪽

최소거리 분류는 클래스 대표점까지 거리를 계산해 가장 가까운 곳 선택
mc=1McxScx,c=1,,Cm_c=\frac{1}{M_c}\sum_{x\in S_c}x,\qquad c=1,\ldots,C
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

입력 x는 어느 클래스 평균과 가장 가까운가?

한 줄 핵심

클래스별 평균 m_c를 구하고 x와의 거리 D_c(x)를 모두 비교한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    클래스 대표점을 계산한다

    mc=1McxScxm_c=\frac{1}{M_c}\sum_{x\in S_c}x
  2. 2

    입력과 대표점의 차이를 구한다

    rc=xmcr_c=x-m_c
  3. 3

    거리 제곱을 계산한다

    Dc(x)=rc22D_c(x)=\lVert r_c\rVert_2^2
  4. 4

    가장 작은 클래스를 고른다

    c=argmincDc(x)c^*=\arg\min_cD_c(x)

Worked example

숫자로 직접 계산 — 2차원 두 클래스

x=(3,2), m₁=(2,2), m₂=(5,2)다.

  1. 1

    클래스 1 거리

    D1=(32)2+(22)2=1D_1=(3-2)^2+(2-2)^2=1
  2. 2

    클래스 2 거리

    D2=(35)2+(22)2=4D_2=(3-5)^2+(2-2)^2=4

결과: D₁<D₂이므로 클래스 1로 분류한다.

Sanity check

검산 포인트
  • 비교할 때 거리와 거리 제곱 중 하나로 통일한다.
  • 특징 스케일이 다르면 표준화 또는 Mahalanobis 거리가 필요할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · 2.6 Minimum-distance classifier 식별자: MAI-P2-050

M_c는 c번째 평균을 계산하는 패턴 수, S_c는 c번째 패턴 클래스, C는 클래스 수다.

유클리드 거리로 유사도를 정의하면 다음 거리를 계산한다.

원자료 수식 · PDF 8쪽

최소거리 분류는 클래스 대표점까지 거리를 계산해 가장 가까운 곳 선택
Dc(x)=xmc2,c=1,,CD_c(x)=\|x-m_c\|_2,\qquad c=1,\ldots,C
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

입력 x는 어느 클래스 평균과 가장 가까운가?

한 줄 핵심

클래스별 평균 m_c를 구하고 x와의 거리 D_c(x)를 모두 비교한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    클래스 대표점을 계산한다

    mc=1McxScxm_c=\frac{1}{M_c}\sum_{x\in S_c}x
  2. 2

    입력과 대표점의 차이를 구한다

    rc=xmcr_c=x-m_c
  3. 3

    거리 제곱을 계산한다

    Dc(x)=rc22D_c(x)=\lVert r_c\rVert_2^2
  4. 4

    가장 작은 클래스를 고른다

    c=argmincDc(x)c^*=\arg\min_cD_c(x)

Worked example

숫자로 직접 계산 — 2차원 두 클래스

x=(3,2), m₁=(2,2), m₂=(5,2)다.

  1. 1

    클래스 1 거리

    D1=(32)2+(22)2=1D_1=(3-2)^2+(2-2)^2=1
  2. 2

    클래스 2 거리

    D2=(35)2+(22)2=4D_2=(3-5)^2+(2-2)^2=4

결과: D₁<D₂이므로 클래스 1로 분류한다.

Sanity check

검산 포인트
  • 비교할 때 거리와 거리 제곱 중 하나로 통일한다.
  • 특징 스케일이 다르면 표준화 또는 Mahalanobis 거리가 필요할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 2.6 Minimum-distance classifier 식별자: MAI-P2-051

패턴 x는 다른 모든 클래스보다 거리가 작은 클래스에 배정된다.

원자료 수식 · PDF 8쪽

최소거리 분류는 클래스 대표점까지 거리를 계산해 가장 가까운 곳 선택
Dc(x)<Dc(x),ccD_c(x)<D_{c\prime}(x),\qquad c\prime\ne c
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

입력 x는 어느 클래스 평균과 가장 가까운가?

한 줄 핵심

클래스별 평균 m_c를 구하고 x와의 거리 D_c(x)를 모두 비교한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    클래스 대표점을 계산한다

    mc=1McxScxm_c=\frac{1}{M_c}\sum_{x\in S_c}x
  2. 2

    입력과 대표점의 차이를 구한다

    rc=xmcr_c=x-m_c
  3. 3

    거리 제곱을 계산한다

    Dc(x)=rc22D_c(x)=\lVert r_c\rVert_2^2
  4. 4

    가장 작은 클래스를 고른다

    c=argmincDc(x)c^*=\arg\min_cD_c(x)

Worked example

숫자로 직접 계산 — 2차원 두 클래스

x=(3,2), m₁=(2,2), m₂=(5,2)다.

  1. 1

    클래스 1 거리

    D1=(32)2+(22)2=1D_1=(3-2)^2+(2-2)^2=1
  2. 2

    클래스 2 거리

    D2=(35)2+(22)2=4D_2=(3-5)^2+(2-2)^2=4

결과: D₁<D₂이므로 클래스 1로 분류한다.

Sanity check

검산 포인트
  • 비교할 때 거리와 거리 제곱 중 하나로 통일한다.
  • 특징 스케일이 다르면 표준화 또는 Mahalanobis 거리가 필요할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 2.6 Minimum-distance classifier 식별자: MAI-P2-052

Dc(x)=Dc(x)D_c(x)=D_{c\prime}(x)인 동률은 임의로 해소한다.

최소 거리를 고르는 것은 다음 판별함수를 최대화하는 것과 동치다.

원자료 수식 · PDF 8쪽 · 식 (2)

최소거리 분류는 클래스 대표점까지 거리를 계산해 가장 가까운 곳 선택
dc(x)=mcTx12mcTmc,c=1,,Cd_c(x)=m_c^{\mathsf T}x-\frac{1}{2}m_c^{\mathsf T}m_c,\qquad c=1,\ldots,C
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

입력 x는 어느 클래스 평균과 가장 가까운가?

한 줄 핵심

클래스별 평균 m_c를 구하고 x와의 거리 D_c(x)를 모두 비교한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    클래스 대표점을 계산한다

    mc=1McxScxm_c=\frac{1}{M_c}\sum_{x\in S_c}x
  2. 2

    입력과 대표점의 차이를 구한다

    rc=xmcr_c=x-m_c
  3. 3

    거리 제곱을 계산한다

    Dc(x)=rc22D_c(x)=\lVert r_c\rVert_2^2
  4. 4

    가장 작은 클래스를 고른다

    c=argmincDc(x)c^*=\arg\min_cD_c(x)

Worked example

숫자로 직접 계산 — 2차원 두 클래스

x=(3,2), m₁=(2,2), m₂=(5,2)다.

  1. 1

    클래스 1 거리

    D1=(32)2+(22)2=1D_1=(3-2)^2+(2-2)^2=1
  2. 2

    클래스 2 거리

    D2=(35)2+(22)2=4D_2=(3-5)^2+(2-2)^2=4

결과: D₁<D₂이므로 클래스 1로 분류한다.

Sanity check

검산 포인트
  • 비교할 때 거리와 거리 제곱 중 하나로 통일한다.
  • 특징 스케일이 다르면 표준화 또는 Mahalanobis 거리가 필요할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 식 (2) · 2.6 Minimum-distance classifier 식별자: MAI-P2-054

원자료 수식 · PDF 8쪽

최소거리 분류는 클래스 대표점까지 거리를 계산해 가장 가까운 곳 선택
dc(x)>dc(x),ccd_c(x)>d_{c\prime}(x),\qquad c\prime\ne c
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

입력 x는 어느 클래스 평균과 가장 가까운가?

한 줄 핵심

클래스별 평균 m_c를 구하고 x와의 거리 D_c(x)를 모두 비교한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    클래스 대표점을 계산한다

    mc=1McxScxm_c=\frac{1}{M_c}\sum_{x\in S_c}x
  2. 2

    입력과 대표점의 차이를 구한다

    rc=xmcr_c=x-m_c
  3. 3

    거리 제곱을 계산한다

    Dc(x)=rc22D_c(x)=\lVert r_c\rVert_2^2
  4. 4

    가장 작은 클래스를 고른다

    c=argmincDc(x)c^*=\arg\min_cD_c(x)

Worked example

숫자로 직접 계산 — 2차원 두 클래스

x=(3,2), m₁=(2,2), m₂=(5,2)다.

  1. 1

    클래스 1 거리

    D1=(32)2+(22)2=1D_1=(3-2)^2+(2-2)^2=1
  2. 2

    클래스 2 거리

    D2=(35)2+(22)2=4D_2=(3-5)^2+(2-2)^2=4

결과: D₁<D₂이므로 클래스 1로 분류한다.

Sanity check

검산 포인트
  • 비교할 때 거리와 거리 제곱 중 하나로 통일한다.
  • 특징 스케일이 다르면 표준화 또는 Mahalanobis 거리가 필요할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 2.6 Minimum-distance classifier 식별자: MAI-P2-055

인식 문제에서는 이런 형태를 결정함수 또는 판별함수(discriminant function)라고 부른다.

두 클래스의 결정경계는 두 판별함수가 같은 x의 집합이다.

원자료 수식 · PDF 8쪽 · 식 (3)

최소거리 분류는 클래스 대표점까지 거리를 계산해 가장 가까운 곳 선택
dc(x)=dc(x)d_c(x)=d_{c\prime}(x)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

입력 x는 어느 클래스 평균과 가장 가까운가?

한 줄 핵심

클래스별 평균 m_c를 구하고 x와의 거리 D_c(x)를 모두 비교한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    클래스 대표점을 계산한다

    mc=1McxScxm_c=\frac{1}{M_c}\sum_{x\in S_c}x
  2. 2

    입력과 대표점의 차이를 구한다

    rc=xmcr_c=x-m_c
  3. 3

    거리 제곱을 계산한다

    Dc(x)=rc22D_c(x)=\lVert r_c\rVert_2^2
  4. 4

    가장 작은 클래스를 고른다

    c=argmincDc(x)c^*=\arg\min_cD_c(x)

Worked example

숫자로 직접 계산 — 2차원 두 클래스

x=(3,2), m₁=(2,2), m₂=(5,2)다.

  1. 1

    클래스 1 거리

    D1=(32)2+(22)2=1D_1=(3-2)^2+(2-2)^2=1
  2. 2

    클래스 2 거리

    D2=(35)2+(22)2=4D_2=(3-5)^2+(2-2)^2=4

결과: D₁<D₂이므로 클래스 1로 분류한다.

Sanity check

검산 포인트
  • 비교할 때 거리와 거리 제곱 중 하나로 통일한다.
  • 특징 스케일이 다르면 표준화 또는 Mahalanobis 거리가 필요할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 식 (3) · 2.6 Minimum-distance classifier 식별자: MAI-P2-056

원자료 수식 · PDF 8쪽

최소거리 분류는 클래스 대표점까지 거리를 계산해 가장 가까운 곳 선택
dc,c(x)=dc(x)dc(x)=(mcmc)Tx12(mcmc)T(mc+mc)=0d_{c,c\prime}(x)=d_c(x)-d_{c\prime}(x)=(m_c-m_{c\prime})^{\mathsf T}x-\frac{1}{2}(m_c-m_{c\prime})^{\mathsf T}(m_c+m_{c\prime})=0
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

입력 x는 어느 클래스 평균과 가장 가까운가?

한 줄 핵심

클래스별 평균 m_c를 구하고 x와의 거리 D_c(x)를 모두 비교한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    클래스 대표점을 계산한다

    mc=1McxScxm_c=\frac{1}{M_c}\sum_{x\in S_c}x
  2. 2

    입력과 대표점의 차이를 구한다

    rc=xmcr_c=x-m_c
  3. 3

    거리 제곱을 계산한다

    Dc(x)=rc22D_c(x)=\lVert r_c\rVert_2^2
  4. 4

    가장 작은 클래스를 고른다

    c=argmincDc(x)c^*=\arg\min_cD_c(x)

Worked example

숫자로 직접 계산 — 2차원 두 클래스

x=(3,2), m₁=(2,2), m₂=(5,2)다.

  1. 1

    클래스 1 거리

    D1=(32)2+(22)2=1D_1=(3-2)^2+(2-2)^2=1
  2. 2

    클래스 2 거리

    D2=(35)2+(22)2=4D_2=(3-5)^2+(2-2)^2=4

결과: D₁<D₂이므로 클래스 1로 분류한다.

Sanity check

검산 포인트
  • 비교할 때 거리와 거리 제곱 중 하나로 통일한다.
  • 특징 스케일이 다르면 표준화 또는 Mahalanobis 거리가 필요할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 2.6 Minimum-distance classifier 식별자: MAI-P2-057

이 경계는 m_c와 m_c′를 잇는 선분의 수직이등분면이다. {mcR2:c}\{m_c\in\mathbb{R}^2:\forall c\}이면 직선, {mcR3:c}\{m_c\in\mathbb{R}^3:\forall c\}이면 평면, 더 높은 차원에서는 초평면이다.

#2.7 베이즈 분류기: 통계적 분류

패턴 클래스가 무작위 과정에서 생성되므로 확률을 고려한다. 이 절의 목표는 평균적으로 분류 오류의 확률을 가장 낮추는 분류 규칙을 유도하는 것이다.

#2.7.1 임의 패턴 클래스의 베이즈 분류기

P(Scx)P(S_c\mid x)는 x가 클래스 S_c에서 왔을 사후확률이고, L(acSc)L(a_c\mid S_{c\prime})는 실제 클래스가 S_c′일 때 행동 a_c를 취한 손실이다.

가장 흔한 0–1 손실은 올바른 결정에 0, 잘못된 결정에 동일한 단위 손실 1을 준다.

원자료 수식 · PDF 8쪽 · 식 (4)

조건부 위험은 각 실제 클래스에서 생길 손실의 확률가중합
L(acSc)={0,c=c,1,cc,c,c=1,,CL(a_c\mid S_{c\prime})=\begin{cases}0,&c=c\prime,\\1,&c\ne c\prime,\end{cases}\qquad c,c\prime=1,\ldots,C
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

현재 관측에서 어떤 행동을 택해야 평균 손실이 가장 작은가?

한 줄 핵심

행동 하나를 가정하고 각 실제 클래스일 때의 손실×사후확률을 모두 더한다. 위험이 가장 작은 행동을 고른다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    후보 행동을 하나 고른다

    aca_c
  2. 2

    실제 클래스별 손실을 적는다

    L(acSj)L(a_c\mid S_j)
  3. 3

    각 손실에 사후확률을 곱한다

    L(acSj)P(Sjx)L(a_c\mid S_j)P(S_j\mid x)
  4. 4

    모든 클래스를 더한다

    Rc(x)=jL(acSj)P(Sjx)R_c(x)=\sum_jL(a_c\mid S_j)P(S_j\mid x)
  5. 5

    가장 작은 위험을 선택한다

    c=argmincRc(x)c^*=\arg\min_cR_c(x)

Worked example

숫자로 직접 계산 — 0-1 손실의 두 클래스

P(S₁|x)=0.7, P(S₂|x)=0.3이다.

  1. 1

    S₁로 결정할 위험

    R1=0(0.7)+1(0.3)=0.3R_1=0(0.7)+1(0.3)=0.3
  2. 2

    S₂로 결정할 위험

    R2=1(0.7)+0(0.3)=0.7R_2=1(0.7)+0(0.3)=0.7

결과: R₁<R₂이므로 S₁을 선택한다.

Sanity check

검산 포인트
  • 손실행렬의 행·열 의미를 먼저 고정한다.
  • 비대칭 비용이면 가장 확률이 큰 클래스와 최소위험 결정이 다를 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 식 (4) · 2.7.1 Bayes classifier 식별자: MAI-P2-062

조건부 평균 위험은 x를 특정 클래스에 배정했을 때 손실을 사후확률로 평균한 값이다.

원자료 수식 · PDF 8쪽 · 식 (5)

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
Rc(x)=c=1CL(acSc)P(Scx),c=1,,CR_{c\prime}(x)=\sum_{c=1}^{C}L(a_c\mid S_{c\prime})P(S_c\mid x),\qquad c\prime=1,\ldots,C
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산
P()P(\cdot)사건의 확률
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 식 (5) · 2.7.1 Bayes classifier 식별자: MAI-P2-063

#베이즈 규칙, 사전분포, 클래스 조건부 밀도

원자료 수식 · PDF 9쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
P(XY)=P(YX)P(X)P(Y)P(X\mid Y)=\frac{P(Y\mid X)P(X)}{P(Y)}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 2.7.1 Bayes classifier 식별자: MAI-P2-064

말로 쓰면 posterior = likelihood × prior / observation이다. P(S_c)는 관측 전 클래스 가능성인 사전확률, P(S_c|x)는 관측 뒤의 사후확률, p(x|S_c)는 클래스 조건부 밀도다.

원자료 수식 · PDF 9쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
P(Sc,x)=P(Scx)p(x)=p(xSc)P(Sc)P(S_c,x)=P(S_c\mid x)p(x)=p(x\mid S_c)P(S_c)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 2.7.1 Bayes classifier 식별자: MAI-P2-065

원자료는 사후확률을 직접 완성하도록 식 (6)을 빈칸으로 남긴다.

원자료 수식 · PDF 9쪽 · 식 (6)

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
P(Scx)=??P(S_c\mid x)=\boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 식 (6) · 2.7.1 Bayes classifier 식별자: MAI-P2-066

원자료의 빈칸을 베이즈 규칙으로 완성하면 다음과 같다.

원자료 빈칸의 완성식 · PDF 9쪽 · 식 (6) completed

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
P(Scx)=p(xSc)P(Sc)p(x)P(S_c\mid x)=\frac{p(x\mid S_c)P(S_c)}{p(x)}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 식 (6) completed · Editorial completion for 2.7.1 식별자: MAI-P2-067

#베이즈 분류기

식 (6)을 위험 식에 대입하면 공통 양의 항 1/p(x)가 생긴다.

원자료 수식 · PDF 9쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
Rc(x)=1p(x)c=1CL(acSc)p(xSc)P(Sc)R_{c\prime}(x)=\frac{1}{p(x)}\sum_{c=1}^{C}L(a_c\mid S_{c\prime})p(x\mid S_c)P(S_c)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 2.7.1 Bayes classifier 식별자: MAI-P2-068

모든 후보 위험에 공통이고 양수이므로 1/p(x)를 버려도 최소 위험 클래스는 바뀌지 않는다.

원자료 수식 · PDF 9쪽 · 식 (7)

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
Rc(x)=c=1CL(acSc)p(xSc)P(Sc),c=1,,CR_{c\prime}(x)=\sum_{c=1}^{C}L(a_c\mid S_{c\prime})p(x\mid S_c)P(S_c),\qquad c\prime=1,\ldots,C
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 식 (7) · 2.7.1 Bayes classifier 식별자: MAI-P2-069

각 x에서 모든 위험을 계산하고 가장 작은 위험의 클래스를 선택하면 전체 평균 위험이 최소가 된다.

원자료 수식 · PDF 9쪽

조건부 위험은 각 실제 클래스에서 생길 손실의 확률가중합
Rc(x)<Rc(x),ccR_c(x)<R_{c\prime}(x),\qquad c\prime\ne c
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

현재 관측에서 어떤 행동을 택해야 평균 손실이 가장 작은가?

한 줄 핵심

행동 하나를 가정하고 각 실제 클래스일 때의 손실×사후확률을 모두 더한다. 위험이 가장 작은 행동을 고른다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    후보 행동을 하나 고른다

    aca_c
  2. 2

    실제 클래스별 손실을 적는다

    L(acSj)L(a_c\mid S_j)
  3. 3

    각 손실에 사후확률을 곱한다

    L(acSj)P(Sjx)L(a_c\mid S_j)P(S_j\mid x)
  4. 4

    모든 클래스를 더한다

    Rc(x)=jL(acSj)P(Sjx)R_c(x)=\sum_jL(a_c\mid S_j)P(S_j\mid x)
  5. 5

    가장 작은 위험을 선택한다

    c=argmincRc(x)c^*=\arg\min_cR_c(x)

Worked example

숫자로 직접 계산 — 0-1 손실의 두 클래스

P(S₁|x)=0.7, P(S₂|x)=0.3이다.

  1. 1

    S₁로 결정할 위험

    R1=0(0.7)+1(0.3)=0.3R_1=0(0.7)+1(0.3)=0.3
  2. 2

    S₂로 결정할 위험

    R2=1(0.7)+0(0.3)=0.7R_2=1(0.7)+0(0.3)=0.7

결과: R₁<R₂이므로 S₁을 선택한다.

Sanity check

검산 포인트
  • 손실행렬의 행·열 의미를 먼저 고정한다.
  • 비대칭 비용이면 가장 확률이 큰 클래스와 최소위험 결정이 다를 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 2.7.1 Bayes classifier 식별자: MAI-P2-070

#0–1 손실을 쓴 베이즈 분류기

원자료 수식 · PDF 9쪽

조건부 위험은 각 실제 클래스에서 생길 손실의 확률가중합
L(acSc)=1δc,cL(a_c\mid S_{c\prime})=1-\delta_{c,c\prime}
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

현재 관측에서 어떤 행동을 택해야 평균 손실이 가장 작은가?

한 줄 핵심

행동 하나를 가정하고 각 실제 클래스일 때의 손실×사후확률을 모두 더한다. 위험이 가장 작은 행동을 고른다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    후보 행동을 하나 고른다

    aca_c
  2. 2

    실제 클래스별 손실을 적는다

    L(acSj)L(a_c\mid S_j)
  3. 3

    각 손실에 사후확률을 곱한다

    L(acSj)P(Sjx)L(a_c\mid S_j)P(S_j\mid x)
  4. 4

    모든 클래스를 더한다

    Rc(x)=jL(acSj)P(Sjx)R_c(x)=\sum_jL(a_c\mid S_j)P(S_j\mid x)
  5. 5

    가장 작은 위험을 선택한다

    c=argmincRc(x)c^*=\arg\min_cR_c(x)

Worked example

숫자로 직접 계산 — 0-1 손실의 두 클래스

P(S₁|x)=0.7, P(S₂|x)=0.3이다.

  1. 1

    S₁로 결정할 위험

    R1=0(0.7)+1(0.3)=0.3R_1=0(0.7)+1(0.3)=0.3
  2. 2

    S₂로 결정할 위험

    R2=1(0.7)+0(0.3)=0.7R_2=1(0.7)+0(0.3)=0.7

결과: R₁<R₂이므로 S₁을 선택한다.

Sanity check

검산 포인트
  • 손실행렬의 행·열 의미를 먼저 고정한다.
  • 비대칭 비용이면 가장 확률이 큰 클래스와 최소위험 결정이 다를 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 2.7.1 Bayes classifier 식별자: MAI-P2-071
δc,c=1if c=c\delta_{c,c\prime}=1\quad\text{if }c=c\prime δc,c=0if cc\delta_{c,c\prime}=0\quad\text{if }c\ne c\prime

이를 식 (7)에 넣으면 다음 합이 된다.

원자료 수식 · PDF 9쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
Rc(x)=c=1C(1δc,c)p(xSc)P(Sc)R_{c\prime}(x)=\sum_{c=1}^{C}(1-\delta_{c,c\prime})p(x\mid S_c)P(S_c)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 2.7.1 Bayes classifier 식별자: MAI-P2-074

원자료는 전체확률법칙을 이용한 단순화 결과를 다시 ??로 남긴다.

원자료 수식 · PDF 9쪽

조건부 위험은 각 실제 클래스에서 생길 손실의 확률가중합
Rc(x)=??,c=1,,CR_{c\prime}(x)=\boxed{\text{??}},\qquad c\prime=1,\ldots,C
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

현재 관측에서 어떤 행동을 택해야 평균 손실이 가장 작은가?

한 줄 핵심

행동 하나를 가정하고 각 실제 클래스일 때의 손실×사후확률을 모두 더한다. 위험이 가장 작은 행동을 고른다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    후보 행동을 하나 고른다

    aca_c
  2. 2

    실제 클래스별 손실을 적는다

    L(acSj)L(a_c\mid S_j)
  3. 3

    각 손실에 사후확률을 곱한다

    L(acSj)P(Sjx)L(a_c\mid S_j)P(S_j\mid x)
  4. 4

    모든 클래스를 더한다

    Rc(x)=jL(acSj)P(Sjx)R_c(x)=\sum_jL(a_c\mid S_j)P(S_j\mid x)
  5. 5

    가장 작은 위험을 선택한다

    c=argmincRc(x)c^*=\arg\min_cR_c(x)

Worked example

숫자로 직접 계산 — 0-1 손실의 두 클래스

P(S₁|x)=0.7, P(S₂|x)=0.3이다.

  1. 1

    S₁로 결정할 위험

    R1=0(0.7)+1(0.3)=0.3R_1=0(0.7)+1(0.3)=0.3
  2. 2

    S₂로 결정할 위험

    R2=1(0.7)+0(0.3)=0.7R_2=1(0.7)+0(0.3)=0.7

결과: R₁<R₂이므로 S₁을 선택한다.

Sanity check

검산 포인트
  • 손실행렬의 행·열 의미를 먼저 고정한다.
  • 비대칭 비용이면 가장 확률이 큰 클래스와 최소위험 결정이 다를 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 2.7.1 Bayes classifier 식별자: MAI-P2-075

전체확률법칙으로 빈칸을 완성하면 다음 위험식이 된다.

원자료 빈칸의 완성식 · PDF 9쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
Rc(x)=p(x)p(xSc)P(Sc)R_{c\prime}(x)=p(x)-p(x\mid S_{c\prime})P(S_{c\prime})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · Editorial completion for 2.7.1 식별자: MAI-P2-076

이 위험을 비교하면 공통 p(x)가 상쇄된다.

원자료 수식 · PDF 9쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
p(x)p(xSc)P(Sc)<p(x)p(xSc)P(Sc)p(x)-p(x\mid S_c)P(S_c)<p(x)-p(x\mid S_{c\prime})P(S_{c\prime})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 2.7.1 Bayes classifier 식별자: MAI-P2-077

따라서 클래스 조건부 가능도와 사전확률의 곱이 가장 큰 클래스를 고르는 규칙과 동치다.

원자료 수식 · PDF 9쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
p(xSc)P(Sc)>p(xSc)P(Sc)p(x\mid S_c)P(S_c)>p(x\mid S_{c\prime})P(S_{c\prime})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · 2.7.1 Bayes classifier 식별자: MAI-P2-078

0–1 손실 아래의 판별함수는 다음과 같다.

원자료 수식 · PDF 10쪽 · 식 (8)

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
dc(x)=p(xSc)P(Sc),c=1,,Cd_c(x)=p(x\mid S_c)P(S_c),\qquad c=1,\ldots,C
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 식 (8) · 2.7.1 Bayes classifier 식별자: MAI-P2-079

이 판별함수를 최대화하는 규칙은 평균 오분류 위험을 최소화한다. 단, 최적성을 주장하려면 p(x|S_c)와 P(S_c)를 알아야 한다.

  • 클래스가 같은 빈도로 나온다면 P(Sc)=1CP(S_c)=\frac{1}{C}로 둘 수 있다. 그렇지 않아도 문제 지식이나 표본 빈도로 사전확률을 추정할 수 있다.
  • 어려운 부분은 N차원 클래스 조건부 밀도 p(x|S_c)의 추정이다. 클래스별 표본이 적거나 밀도가 잘 behaved하지 않으면 다변량 밀도 추정이 매우 어렵다. 그래서 실제 베이즈 분류기는 흔히 밀도의 해석적 형태를 가정한다.

#2.7.2 가우시안 패턴 클래스

클래스 조건부 밀도의 분포족을 가정하면 밀도 전체 대신 필요한 파라미터를 학습표본에서 추정하면 된다. 가장 널리 쓰이는 가정은 다변량 가우시안이다.

원자료 수식 · PDF 10쪽 · 식 (9)

가우시안 밀도는 평균에서의 표준화 거리로 가능성을 계산
p(xSc)=1(2π)N/2Vc1/2exp ⁣[12(xmc)TVc1(xmc)]p(x\mid S_c)=\frac{1}{(2\pi)^{N/2}|V_c|^{1/2}}\exp\!\left[-\frac{1}{2}(x-m_c)^{\mathsf T}V_c^{-1}(x-m_c)\right]
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측값 x가 평균 μ와 공분산 Σ를 가진 분포에서 얼마나 그럴듯한가?

한 줄 핵심

평균과의 차이를 공분산으로 스케일링한 거리와 정규화 상수를 계산해 밀도를 얻는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    평균에서의 차이를 구한다

    r=xμr=x-\mu
  2. 2

    분산·공분산으로 거리 스케일을 보정한다

    d2=rTΣ1rd^2=r^T\Sigma^{-1}r
  3. 3

    지수 감쇠를 계산한다

    exp(d2/2)\exp(-d^2/2)
  4. 4

    정규화 상수로 나눈다

    (2π)N/2Σ1/2(2\pi)^{N/2}|\Sigma|^{1/2}

Worked example

숫자로 직접 계산 — 표준정규에서 x=1

μ=0, σ=1인 1차원 가우시안이다.

  1. 1

    표준화 거리

    z=(10)/1=1z=(1-0)/1=1
  2. 2

    지수항

    e12/2=e0.50.6065e^{-1^2/2}=e^{-0.5}\approx0.6065
  3. 3

    정규화

    0.6065/2π0.24200.6065/\sqrt{2\pi}\approx0.2420

결과: x=1에서 확률밀도는 약 0.242다. 밀도값 자체는 사건확률이 아니다.

Sanity check

검산 포인트
  • Σ는 대칭 양의 정부호여야 역행렬과 양의 밀도가 안정적으로 정의된다.
  • 확률은 구간 적분으로 얻으며 한 점의 밀도와 구분한다.

Symbols

이 식에 실제로 나온 기호
기호의미
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 식 (9) · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-081

각 밀도는 평균 벡터와 공분산 행렬로 완전히 정해진다.

원자료 수식 · PDF 10쪽

가우시안 밀도는 평균에서의 표준화 거리로 가능성을 계산
mc=E[xSc]m_c=\mathbb{E}[x\mid S_c]
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측값 x가 평균 μ와 공분산 Σ를 가진 분포에서 얼마나 그럴듯한가?

한 줄 핵심

평균과의 차이를 공분산으로 스케일링한 거리와 정규화 상수를 계산해 밀도를 얻는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    평균에서의 차이를 구한다

    r=xμr=x-\mu
  2. 2

    분산·공분산으로 거리 스케일을 보정한다

    d2=rTΣ1rd^2=r^T\Sigma^{-1}r
  3. 3

    지수 감쇠를 계산한다

    exp(d2/2)\exp(-d^2/2)
  4. 4

    정규화 상수로 나눈다

    (2π)N/2Σ1/2(2\pi)^{N/2}|\Sigma|^{1/2}

Worked example

숫자로 직접 계산 — 표준정규에서 x=1

μ=0, σ=1인 1차원 가우시안이다.

  1. 1

    표준화 거리

    z=(10)/1=1z=(1-0)/1=1
  2. 2

    지수항

    e12/2=e0.50.6065e^{-1^2/2}=e^{-0.5}\approx0.6065
  3. 3

    정규화

    0.6065/2π0.24200.6065/\sqrt{2\pi}\approx0.2420

결과: x=1에서 확률밀도는 약 0.242다. 밀도값 자체는 사건확률이 아니다.

Sanity check

검산 포인트
  • Σ는 대칭 양의 정부호여야 역행렬과 양의 밀도가 안정적으로 정의된다.
  • 확률은 구간 적분으로 얻으며 한 점의 밀도와 구분한다.

Symbols

이 식에 실제로 나온 기호
기호의미
E\mathbb{E}가능한 값의 확률가중평균인 기댓값

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-082

원자료 수식 · PDF 10쪽

가우시안 밀도는 평균에서의 표준화 거리로 가능성을 계산
Vc=E ⁣[(xmc)(xmc)TSc]V_c=\mathbb{E}\!\left[(x-m_c)(x-m_c)^{\mathsf T}\mid S_c\right]
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측값 x가 평균 μ와 공분산 Σ를 가진 분포에서 얼마나 그럴듯한가?

한 줄 핵심

평균과의 차이를 공분산으로 스케일링한 거리와 정규화 상수를 계산해 밀도를 얻는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    평균에서의 차이를 구한다

    r=xμr=x-\mu
  2. 2

    분산·공분산으로 거리 스케일을 보정한다

    d2=rTΣ1rd^2=r^T\Sigma^{-1}r
  3. 3

    지수 감쇠를 계산한다

    exp(d2/2)\exp(-d^2/2)
  4. 4

    정규화 상수로 나눈다

    (2π)N/2Σ1/2(2\pi)^{N/2}|\Sigma|^{1/2}

Worked example

숫자로 직접 계산 — 표준정규에서 x=1

μ=0, σ=1인 1차원 가우시안이다.

  1. 1

    표준화 거리

    z=(10)/1=1z=(1-0)/1=1
  2. 2

    지수항

    e12/2=e0.50.6065e^{-1^2/2}=e^{-0.5}\approx0.6065
  3. 3

    정규화

    0.6065/2π0.24200.6065/\sqrt{2\pi}\approx0.2420

결과: x=1에서 확률밀도는 약 0.242다. 밀도값 자체는 사건확률이 아니다.

Sanity check

검산 포인트
  • Σ는 대칭 양의 정부호여야 역행렬과 양의 밀도가 안정적으로 정의된다.
  • 확률은 구간 적분으로 얻으며 한 점의 밀도와 구분한다.

Symbols

이 식에 실제로 나온 기호
기호의미
E\mathbb{E}가능한 값의 확률가중평균인 기댓값

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-083

기댓값을 표본평균으로 근사하면 다음 추정식을 얻는다.

원자료 수식 · PDF 10쪽

가우시안 밀도는 평균에서의 표준화 거리로 가능성을 계산
mc=1McxScxm_c=\frac{1}{M_c}\sum_{x\in S_c}x
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측값 x가 평균 μ와 공분산 Σ를 가진 분포에서 얼마나 그럴듯한가?

한 줄 핵심

평균과의 차이를 공분산으로 스케일링한 거리와 정규화 상수를 계산해 밀도를 얻는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    평균에서의 차이를 구한다

    r=xμr=x-\mu
  2. 2

    분산·공분산으로 거리 스케일을 보정한다

    d2=rTΣ1rd^2=r^T\Sigma^{-1}r
  3. 3

    지수 감쇠를 계산한다

    exp(d2/2)\exp(-d^2/2)
  4. 4

    정규화 상수로 나눈다

    (2π)N/2Σ1/2(2\pi)^{N/2}|\Sigma|^{1/2}

Worked example

숫자로 직접 계산 — 표준정규에서 x=1

μ=0, σ=1인 1차원 가우시안이다.

  1. 1

    표준화 거리

    z=(10)/1=1z=(1-0)/1=1
  2. 2

    지수항

    e12/2=e0.50.6065e^{-1^2/2}=e^{-0.5}\approx0.6065
  3. 3

    정규화

    0.6065/2π0.24200.6065/\sqrt{2\pi}\approx0.2420

결과: x=1에서 확률밀도는 약 0.242다. 밀도값 자체는 사건확률이 아니다.

Sanity check

검산 포인트
  • Σ는 대칭 양의 정부호여야 역행렬과 양의 밀도가 안정적으로 정의된다.
  • 확률은 구간 적분으로 얻으며 한 점의 밀도와 구분한다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-084

원자료 수식 · PDF 10쪽

가우시안 밀도는 평균에서의 표준화 거리로 가능성을 계산
Vc=1McxScxxTmcmcTV_c=\frac{1}{M_c}\sum_{x\in S_c}xx^{\mathsf T}-m_cm_c^{\mathsf T}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측값 x가 평균 μ와 공분산 Σ를 가진 분포에서 얼마나 그럴듯한가?

한 줄 핵심

평균과의 차이를 공분산으로 스케일링한 거리와 정규화 상수를 계산해 밀도를 얻는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    평균에서의 차이를 구한다

    r=xμr=x-\mu
  2. 2

    분산·공분산으로 거리 스케일을 보정한다

    d2=rTΣ1rd^2=r^T\Sigma^{-1}r
  3. 3

    지수 감쇠를 계산한다

    exp(d2/2)\exp(-d^2/2)
  4. 4

    정규화 상수로 나눈다

    (2π)N/2Σ1/2(2\pi)^{N/2}|\Sigma|^{1/2}

Worked example

숫자로 직접 계산 — 표준정규에서 x=1

μ=0, σ=1인 1차원 가우시안이다.

  1. 1

    표준화 거리

    z=(10)/1=1z=(1-0)/1=1
  2. 2

    지수항

    e12/2=e0.50.6065e^{-1^2/2}=e^{-0.5}\approx0.6065
  3. 3

    정규화

    0.6065/2π0.24200.6065/\sqrt{2\pi}\approx0.2420

결과: x=1에서 확률밀도는 약 0.242다. 밀도값 자체는 사건확률이 아니다.

Sanity check

검산 포인트
  • Σ는 대칭 양의 정부호여야 역행렬과 양의 밀도가 안정적으로 정의된다.
  • 확률은 구간 적분으로 얻으며 한 점의 밀도와 구분한다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-085

원자료의 공분산 식은 1/M_c를 쓰는 최대우도형 표본 모멘트이며, 불편추정량의 1/(M_c-1)과 구분해야 한다.

예제는 N=1,C=2N=1,\qquad C=2이고, 두 클래스의 평균은 m₁,m₂, 표준편차는 σ₁,σ₂다.

원자료 하단의 1차원 가우시안 판별식은 다음과 같이 인쇄되어 있다.

원자료 표기 확인 필요 · PDF 10쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
dc(x)=p(xSc)P(Sc)=12πσcexp ⁣[xmc2σc2]P(Sc),c=1,2d_c(x)=p(x\mid S_c)P(S_c)=\frac{1}{\sqrt{2\pi}\sigma_c}\exp\!\left[-\frac{x-m_c}{2\sigma_c^2}\right]P(S_c),\qquad c=1,2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
σ\sigma표준편차 또는 시그모이드 표기
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-087

표준 1차원 가우시안 밀도와 다변량 식 (9)에 맞춘 교정식은 다음과 같다.

수학적 교정식 · PDF 10쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
dc(x)=p(xSc)P(Sc)=12πσcexp ⁣[(xmc)22σc2]P(Sc),c=1,2d_c(x)=p(x\mid S_c)P(S_c)=\frac{1}{\sqrt{2\pi}\sigma_c}\exp\!\left[-\frac{(x-m_c)^2}{2\sigma_c^2}\right]P(S_c),\qquad c=1,2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
σ\sigma표준편차 또는 시그모이드 표기
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · Editorial correction for 2.7.2 식별자: MAI-P2-088

원자료 연습문제 ??: 두 클래스의 1차원 확률밀도함수를 스케치한다.

두 클래스의 경계는 판별값이 같은 한 점 x₀다.

원자료 수식 · PDF 11쪽

가우시안 밀도는 평균에서의 표준화 거리로 가능성을 계산
d1(x0)=d2(x0)d_1(x_0)=d_2(x_0)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측값 x가 평균 μ와 공분산 Σ를 가진 분포에서 얼마나 그럴듯한가?

한 줄 핵심

평균과의 차이를 공분산으로 스케일링한 거리와 정규화 상수를 계산해 밀도를 얻는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    평균에서의 차이를 구한다

    r=xμr=x-\mu
  2. 2

    분산·공분산으로 거리 스케일을 보정한다

    d2=rTΣ1rd^2=r^T\Sigma^{-1}r
  3. 3

    지수 감쇠를 계산한다

    exp(d2/2)\exp(-d^2/2)
  4. 4

    정규화 상수로 나눈다

    (2π)N/2Σ1/2(2\pi)^{N/2}|\Sigma|^{1/2}

Worked example

숫자로 직접 계산 — 표준정규에서 x=1

μ=0, σ=1인 1차원 가우시안이다.

  1. 1

    표준화 거리

    z=(10)/1=1z=(1-0)/1=1
  2. 2

    지수항

    e12/2=e0.50.6065e^{-1^2/2}=e^{-0.5}\approx0.6065
  3. 3

    정규화

    0.6065/2π0.24200.6065/\sqrt{2\pi}\approx0.2420

결과: x=1에서 확률밀도는 약 0.242다. 밀도값 자체는 사건확률이 아니다.

Sanity check

검산 포인트
  • Σ는 대칭 양의 정부호여야 역행렬과 양의 밀도가 안정적으로 정의된다.
  • 확률은 구간 적분으로 얻으며 한 점의 밀도와 구분한다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-089

두 클래스가 같은 빈도로 나온다면 다음과 같다.

원자료 수식 · PDF 11쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
P(S1)=P(S2)=12P(S_1)=P(S_2)=\frac{1}{2}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-090

결정경계는 두 밀도 곡선의 교점이다.

원자료 수식 · PDF 11쪽

가우시안 밀도는 평균에서의 표준화 거리로 가능성을 계산
p(x0S1)=p(x0S2)p(x_0\mid S_1)=p(x_0\mid S_2)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측값 x가 평균 μ와 공분산 Σ를 가진 분포에서 얼마나 그럴듯한가?

한 줄 핵심

평균과의 차이를 공분산으로 스케일링한 거리와 정규화 상수를 계산해 밀도를 얻는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    평균에서의 차이를 구한다

    r=xμr=x-\mu
  2. 2

    분산·공분산으로 거리 스케일을 보정한다

    d2=rTΣ1rd^2=r^T\Sigma^{-1}r
  3. 3

    지수 감쇠를 계산한다

    exp(d2/2)\exp(-d^2/2)
  4. 4

    정규화 상수로 나눈다

    (2π)N/2Σ1/2(2\pi)^{N/2}|\Sigma|^{1/2}

Worked example

숫자로 직접 계산 — 표준정규에서 x=1

μ=0, σ=1인 1차원 가우시안이다.

  1. 1

    표준화 거리

    z=(10)/1=1z=(1-0)/1=1
  2. 2

    지수항

    e12/2=e0.50.6065e^{-1^2/2}=e^{-0.5}\approx0.6065
  3. 3

    정규화

    0.6065/2π0.24200.6065/\sqrt{2\pi}\approx0.2420

결과: x=1에서 확률밀도는 약 0.242다. 밀도값 자체는 사건확률이 아니다.

Sanity check

검산 포인트
  • Σ는 대칭 양의 정부호여야 역행렬과 양의 밀도가 안정적으로 정의된다.
  • 확률은 구간 적분으로 얻으며 한 점의 밀도와 구분한다.

Symbols

이 식에 실제로 나온 기호
기호의미
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-091

가우시안의 지수형을 다루기 쉽게 하려고 단조 증가 함수인 로그를 취한다.

원자료 수식 · PDF 11쪽 · 식 (10)

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
dc(x)=ln ⁣(p(xSc)P(Sc))=lnp(xSc)+lnP(Sc)d_c(x)=\ln\!\big(p(x\mid S_c)P(S_c)\big)=\ln p(x\mid S_c)+\ln P(S_c)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 식 (10) · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-092

원자료 수식 · PDF 11쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
dc(x)=lnP(Sc)N2ln(2π)12lnVc12(xmc)TVc1(xmc)d_c(x)=\ln P(S_c)-\frac{N}{2}\ln(2\pi)-\frac{1}{2}\ln|V_c|-\frac{1}{2}(x-m_c)^{\mathsf T}V_c^{-1}(x-m_c)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-093

모든 클래스에 공통인 −N/2 ln(2π)를 버리면 0–1 손실 아래의 가우시안 판별함수는 다음과 같다.

원자료 수식 · PDF 11쪽 · 식 (11)

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
dc(x)=lnP(Sc)12lnVc12(xmc)TVc1(xmc),c=1,,Cd_c(x)=\ln P(S_c)-\frac{1}{2}\ln|V_c|-\frac{1}{2}(x-m_c)^{\mathsf T}V_c^{-1}(x-m_c),\qquad c=1,\ldots,C
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 식 (11) · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-094

이 함수는 N차원 공간의 2차 함수(hyperquadric)다. 가우시안 패턴에서 클래스 쌍마다 2차 결정경계를 두는 것이 베이즈 분류기가 달성할 수 있는 최소 평균 위험 경계다.

공분산이 모두 같아 {Vc=V:c=1,,C}\{V_c=V:c=1,\ldots,C\}이면 클래스에 의존하지 않는 항을 버릴 수 있다.

원자료 수식 · PDF 11쪽 · 식 (12)

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
dc(x)=lnP(Sc)+xTV1mc12mcTV1mc,c=1,,Cd_c(x)=\ln P(S_c)+x^{\mathsf T}V^{-1}m_c-\frac{1}{2}m_c^{\mathsf T}V^{-1}m_c,\qquad c=1,\ldots,C
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 식 (12) · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-096

이때 판별함수와 클래스 간 경계는 선형, 즉 초평면이다.

더 나아가 V=IV=I이고 모든 클래스가 동일 사전확률 P(Sc)=1C,c=1,,CP(S_c)=\frac{1}{C},\qquad c=1,\ldots,C을 가지면 공통 사전항도 제거된다.

원자료 수식 · PDF 11쪽

가우시안 밀도는 평균에서의 표준화 거리로 가능성을 계산
dc(x)=xTmc12mcTmc,c=1,,Cd_c(x)=x^{\mathsf T}m_c-\frac{1}{2}m_c^{\mathsf T}m_c,\qquad c=1,\ldots,C
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측값 x가 평균 μ와 공분산 Σ를 가진 분포에서 얼마나 그럴듯한가?

한 줄 핵심

평균과의 차이를 공분산으로 스케일링한 거리와 정규화 상수를 계산해 밀도를 얻는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    평균에서의 차이를 구한다

    r=xμr=x-\mu
  2. 2

    분산·공분산으로 거리 스케일을 보정한다

    d2=rTΣ1rd^2=r^T\Sigma^{-1}r
  3. 3

    지수 감쇠를 계산한다

    exp(d2/2)\exp(-d^2/2)
  4. 4

    정규화 상수로 나눈다

    (2π)N/2Σ1/2(2\pi)^{N/2}|\Sigma|^{1/2}

Worked example

숫자로 직접 계산 — 표준정규에서 x=1

μ=0, σ=1인 1차원 가우시안이다.

  1. 1

    표준화 거리

    z=(10)/1=1z=(1-0)/1=1
  2. 2

    지수항

    e12/2=e0.50.6065e^{-1^2/2}=e^{-0.5}\approx0.6065
  3. 3

    정규화

    0.6065/2π0.24200.6065/\sqrt{2\pi}\approx0.2420

결과: x=1에서 확률밀도는 약 0.242다. 밀도값 자체는 사건확률이 아니다.

Sanity check

검산 포인트
  • Σ는 대칭 양의 정부호여야 역행렬과 양의 밀도가 안정적으로 정의된다.
  • 확률은 구간 적분으로 얻으며 한 점의 밀도와 구분한다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 2.7.2 Gaussian pattern classes 식별자: MAI-P2-099

이는 식 (2)의 최소거리 판별함수와 동일하다. 따라서 클래스가 가우시안이고, 공분산이 모두 단위행렬이며, 사전확률이 같을 때 최소거리 분류기는 베이즈 의미에서 최적이다.

이 조건의 클래스는 N차원에서 같은 모양의 구형 구름(hypersphere)이며, 최소거리 분류기는 각 중심을 잇는 선분의 수직이등분 초평면을 둔다.

(a) 1D

● ● ● ● ●

5 points

(b) 2D

●●●●●
●●●●●
●●●●●
●●●●●
●●●●●

25 points

(c) 3D

5×5×5 격자

125 points

Figure 5 재구성. 축마다 동일한 해상도 5를 유지해도 1D 5개, 2D 25개, 3D 125개로 표본 요구량이 빠르게 증가한다.

#2.7.3 나이브 베이즈 분류기

개별 특성 xn,n=1,,Nx_n,\qquad n=1,\ldots,N이 클래스 S_c가 주어졌을 때 조건부 독립이라고 가정한다.

원자료는 이 가정 아래의 사후확률 관계를 다음과 같이 쓴다.

원자료 표기 확인 필요 · PDF 12쪽

나이브 베이즈는 조건부 독립을 가정해 특징별 우도를 곱함
p(Scx)n=1Np(xnSc)p(S_c\mid x)\propto\prod_{n=1}^{N}p(x_n\mid S_c)
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

여러 특징을 관측했을 때 어느 클래스의 점수가 가장 큰가?

한 줄 핵심

클래스 사전확률에 각 특징의 조건부 우도를 차례로 곱하고 클래스끼리 비교한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    클래스 사전확률을 준비한다

    P(Sc)P(S_c)
  2. 2

    특징별 조건부 우도를 계산한다

    p(xnSc)p(x_n\mid S_c)
  3. 3

    모두 곱한다

    scorec=P(Sc)np(xnSc)\text{score}_c=P(S_c)\prod_np(x_n\mid S_c)
  4. 4

    수치 안정성을 위해 로그합으로 바꿀 수 있다

    logscorec=logP(Sc)+nlogp(xnSc)\log\text{score}_c=\log P(S_c)+\sum_n\log p(x_n\mid S_c)
  5. 5

    가장 큰 점수의 클래스를 고른다

    c=argmaxcscorecc^*=\arg\max_c\text{score}_c

Worked example

숫자로 직접 계산 — 두 특징·두 클래스

S₁: prior=.6, likelihoods=.8,.5 / S₂: prior=.4, likelihoods=.3,.9다.

  1. 1

    S₁ 점수

    0.60.80.5=0.240.6\cdot0.8\cdot0.5=0.24
  2. 2

    S₂ 점수

    0.40.30.9=0.1080.4\cdot0.3\cdot0.9=0.108

결과: 0.24>0.108이므로 S₁을 선택한다.

Sanity check

검산 포인트
  • 일반 MAP 식에는 사전확률 P(S_c)가 포함된다.
  • 특징 수가 많으면 곱이 underflow되므로 log-domain 계산을 쓴다.

Symbols

이 식에 실제로 나온 기호
기호의미
\prod지정된 항을 모두 곱하는 연산
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · 2.7.3 Naive Bayes classifier 식별자: MAI-P2-102

클래스별 사전확률이 같다고 가정하지 않는 일반적인 MAP 판별식에서는 다음처럼 사전확률이 남는다.

수학적 교정식 · PDF 12쪽

베이즈 규칙은 우도×사전확률을 관측 전체 가능성으로 정규화
p(Scx)P(Sc)n=1Np(xnSc)p(S_c\mid x)\propto P(S_c)\prod_{n=1}^{N}p(x_n\mid S_c)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

관측 x를 본 뒤 클래스 S의 확률은 얼마인가?

한 줄 핵심

관측이 그 클래스에서 나올 가능성에 관측 전 클래스 비율을 곱하고, 모든 설명의 합인 p(x)로 나눈다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    사전확률을 확인한다

    P(S)P(S)
  2. 2

    클래스별 우도를 계산한다

    p(xS)p(x\mid S)
  3. 3

    둘을 곱해 공동점수를 만든다

    p(xS)P(S)p(x\mid S)P(S)
  4. 4

    모든 클래스 점수의 합으로 나눈다

    P(Sx)=p(xS)P(S)p(x)P(S\mid x)=\frac{p(x\mid S)P(S)}{p(x)}

Worked example

숫자로 직접 계산 — 사후확률 계산

P(S)=0.4, p(x|S)=0.3, p(x)=0.2라고 하자.

  1. 1

    분자

    0.30.4=0.120.3\cdot0.4=0.12
  2. 2

    정규화

    0.12/0.2=0.60.12/0.2=0.6

결과: 관측 후 클래스 S의 확률은 0.6이다.

주의: p(x)는 모든 클래스의 p(x|S_c)P(S_c)를 더해 계산한다.

Sanity check

검산 포인트
  • 모든 클래스의 사후확률 합은 1이어야 한다.
  • 분류만 필요하면 클래스 공통 분모 p(x)를 생략해도 순위는 같다.

Symbols

이 식에 실제로 나온 기호
기호의미
\prod지정된 항을 모두 곱하는 연산
P()P(\cdot)사건의 확률
p()p(\cdot)확률밀도 또는 조건부 확률밀도

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · Editorial correction for 2.7.3 식별자: MAI-P2-103
  • 다변량 p(x|S_c)를 직접 추정하는 차원 문제를 피하고, 각 단변량 조건부 밀도를 추정할 수 있다.
  • 실제 특성 독립 가정이 깨져도 놀랄 만큼 높은 정확도를 보이는 경우가 있다.

#2.8 강화학습(Reinforcement learning)

일부 알고리즘은 고정 데이터셋만 경험하지 않는다. 강화학습에서는 학습 시스템이 환경과 상호작용하므로 경험과 정책 사이에 피드백 루프가 생긴다. 강의자료는 이를 본 과목 범위 밖으로 두고 Sutton–Barto와 DQN 논문을 안내한다.

#2.9 차원의 저주(Curse of dimensionality)

데이터 차원이 높아지면 많은 머신러닝 문제가 극도로 어려워진다. 이 현상을 차원의 저주라고 한다.

강의자료는 고차원 데이터를 특성 수가 관측 수보다 많은 데이터로 설명하고, 본질적으로는 데이터 수가 데이터의 내재 차원(intrinsic dimension)에 비해 작을 때 생기는 문제를 강조한다.

원자료 수식 · PDF 12쪽

수식을 계산 가능한 작은 연산으로 분해하기
Nfeatures>NobservationsN_{\mathrm{features}}>N_{\mathrm{observations}}
쉽게 설명 + 계산 과정 5단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

등호 왼쪽 값을 만들기 위해 오른쪽에서 어떤 연산을 어떤 순서로 수행하는가?

한 줄 핵심

괄호·인덱스·내적·합·나눗셈을 안쪽부터 계산하고, 마지막에 왼쪽 값의 차원과 의미를 확인한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    등호 왼쪽의 목표를 확인한다

    스칼라·벡터·행렬·확률 중 무엇을 구하는지 먼저 정한다.

  2. 2

    입력 기호의 값과 차원을 적는다

    기호를 말로만 읽지 말고 작은 숫자 예시로 치환한다.

  3. 3

    가장 안쪽 괄호와 인덱스부터 계산한다

  4. 4

    곱 → 합 → 정규화 순서로 바깥 연산을 진행한다

  5. 5

    차원·부호·범위를 검산한다

    왼쪽과 오른쪽의 모양과 단위가 일치해야 한다.

Worked example

숫자로 직접 계산 — 직접 계산하는 공통 절차

복잡한 식도 N=2 또는 샘플 2개로 축소한다.

  1. 1

    최소 크기 선택

    N=2N=2
  2. 2

    기호를 숫자로 치환

    x=[1,2]Tx=[1,2]^T
  3. 3

    안쪽 연산부터 기록

    중간값을 생략하지 않고 한 줄씩 적는다.

  4. 4

    최종 범위 확인

    확률이면 0~1, 거리·제곱오차면 0 이상인지 본다.

결과: 이 절차를 적용하면 기호 조작이 아니라 재현 가능한 계산으로 읽을 수 있다.

Sanity check

검산 포인트
  • 좌변과 우변의 차원·단위를 비교한다.
  • 바로 앞 문단에서 정의된 인덱스 범위와 분모를 다시 확인한다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · 2.9 Curse of dimensionality 식별자: MAI-P2-100

특성 차원이 커지면 분석에 필요한 계산량과 유용한 모델을 만들기 위한 학습데이터 요구량이 함께 증가한다.

#2.9.1 차원 축소: 차원의 저주에 대한 주요 해법

차원 축소는 고려할 확률변수 수를 줄여 주요 변수 집합을 얻는 과정이다. 중요한 정보를 남기고 중복되거나 덜 중요한 특성을 버리는 것이 목적이다.

  • 주성분분석(PCA)
  • 선형판별분석(LDA)
  • t-분포 확률적 이웃 임베딩(t-SNE)

#2.9.2 딥러닝은 차원의 저주를 깨는가?

강의자료는 이미지 분류에서 7,500차원에 이르는 입력도 심층신경망이 처리하는 실무 경험을 든다. CNN과 Transformer가 고차원 입력에서 전통적 머신러닝보다 훨씬 잘 작동하는 경우가 많다는 관찰이다.

왜 딥러닝이 자주 차원의 저주를 덜 받는지는 정확히 알려지지 않은 열린 문제라고 명시한다.

  • 가설 1 — 다양체 가설(manifold hypothesis)과 자동 특성 추출: 관측 차원은 높아도 유효 구조는 낮은 차원에 놓일 수 있다.
  • 가설 2 — 국소성(locality)과 대칭성(symmetry): 구조적 귀납편향이 탐색해야 할 함수 공간을 줄인다.
  • 가설 3 — 정규화 기법: weight decay, dropout, 데이터 증강, 조기 종료가 일반화를 돕는다.

딥러닝이 여러 문제에서 차원의 저주를 효과적으로 완화했다는 것이 강의자료의 결론이지만, 고차원성의 모든 한계에서 면역인 것은 아니다.

데이터 품질, 모델 구조, 하이퍼파라미터 조정, 계산 자원에 따라 성능이 여전히 영향을 받으며, 어떤 고차원 문제에서는 특성공학이나 추가 튜닝이 필요하다.

#원자료 참고문헌

  1. I. Goodfellow, Y. Bengio, A. Courville, Deep Learning, MIT Press, 2016 — http://www.deeplearningbook.org.
  1. R. S. Sutton, A. G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018.
  1. V. Mnih et al., “Human-level control through deep reinforcement learning,” Nature, no. 7540, pp. 529–533, Feb. 2015.


#2026-08-18 최신 연구 업데이트

아래 내용은 PDF 원자료가 아니다. 2025–2026년의 peer-reviewed 논문과 공식 프로시딩을 기준으로 강의의 핵심 질문이 어떻게 확장되었는지 정리한다.

#1. 일반화는 더 이상 ‘같은 분포의 새 표본’만 뜻하지 않는다

강의자료의 i.i.d. 틀은 일반화 이론의 기준점이다. 그러나 실제 배포에서는 센서, 지역, 사용자군, 시간, 클래스 비율, 배경 상관이 바뀐다. 그래서 현재 평가는 in-distribution(ID) 성능, distribution shift, out-of-distribution(OOD) generalization, OOD detection을 구분해야 한다.

  • ICML 2025, peer-reviewed — Qiang et al.은 자기지도학습(SSL)도 학습 중 허위 상관(spurious correlation)을 습득해 OOD 일반화가 떨어질 수 있음을 분석하고, 인과적 post-intervention distribution을 만족시키는 배치 구성법을 제안했다. PMLR 원문
  • ICML 2025, peer-reviewed — Harun et al.은 neural collapse가 강할수록 OOD detection에는 유리하지만 OOD generalization에는 불리할 수 있다는 층별 절충을 보고했다. ‘OOD를 잘 거절하는 표현’과 ‘OOD에서 잘 예측하는 표현’이 동일 목표가 아님을 보여 준다. PMLR 원문
  • UAI 2025, peer-reviewed — Cai et al.은 단순한 out-of-sample robustness와 훈련·시험 환경 자체가 다른 OOD robustness를 구분하고, covariate/label shift 같은 구조 가정이 비자명한 해를 얻는 데 필요할 수 있음을 보였다. PMLR 원문

따라서 현대적 테스트 집합은 하나의 무작위 holdout만이 아니라, 예상되는 변화축을 명시한 환경별·시간별·그룹별·난이도별 분할을 포함해야 한다.

#2. 과매개변수 모델은 ‘학습오차 0 = 과대적합’이라는 단순 도식을 깨뜨린다

고전적 그림에서는 용량이 커져 학습자료를 완전히 맞추면 테스트 오차가 나빠질 것으로 예상한다. 현대 과매개변수 모델에서는 보간(interpolation) 이후에도 테스트 위험이 다시 낮아지는 double descent, 잡음까지 맞추면서 일반화하는 benign overfitting, 최적화가 특정 해를 고르는 implicit regularization이 핵심 연구 주제가 됐다.

  • ICML 2025, peer-reviewed — Xu & Chen은 클래스별 이질적 잡음을 포함한 2층 신경망 모델에서, 장꼬리 데이터의 일부 ‘잡음’이 암묵적 특성 학습에 기여할 수 있음을 분석했다. benign/harmful overfitting의 경계는 단순한 파라미터 수가 아니라 데이터 구조와 학습 동역학에 달린다. PMLR 원문
  • ICML 2025, peer-reviewed — Sakamoto & Sato는 레이블 잡음을 완전히 맞추면서도 attention의 token selection이 일반화하는 조건을 신호대잡음비로 분석했다. PMLR 원문
  • COLT 2026, peer-reviewed extended abstract — Wu et al.은 선형 회귀에서 조기 종료된 GD, ridge, online SGD의 유한표본 위험을 instance-wise로 비교했다. GD가 ridge를 상수배 내에서 지배하는 범위가 있지만, benign-overfitting형 문제에서는 최적 조기종료 GD보다 SGD가 다항식 수준으로 나을 수도 있어 ‘한 정규화가 항상 우월하다’는 결론은 성립하지 않는다. PMLR 원문

강의자료의 capacity 그림은 여전히 입문적으로 유효하지만, 현대적으로는 함수공간, 데이터 스펙트럼, 마진, 최적화 경로, 학습 중단 시점까지 함께 봐야 한다.

#3. 검증 집합도 반복 사용하면 학습 집합이 된다

Train/Validation/Test의 구분은 이름이 아니라 정보 흐름으로 정의해야 한다. 논문·리더보드·개발 반복에서 같은 validation/test 결과를 계속 보고 의사결정하면, 모델이 직접 gradient를 받지 않아도 연구 과정 전체가 그 집합에 적합된다.

  • NeurIPS 2025 Datasets & Benchmarks, peer-reviewed — TabArena는 정적 벤치마크의 결함과 버전 노후화를 다루는 living benchmark를 제안했다. 큰 시간 예산·앙상블·검증 방식이 순위에 큰 영향을 주며, 일부 모델의 교차모델 앙상블 과대표현이 validation overfitting과 관련됨을 보고했다. 공식 프로시딩
  • NeurIPS 2025 Datasets & Benchmarks, peer-reviewed — Scientific ML Common Task Framework는 약한 baseline, reporting bias, 비일관 평가를 줄이기 위해 표준 과제·현실적 잡음·제한 데이터·진짜 숨김 테스트 집합을 제안한다. 공식 프로시딩
  • COLT 2026, peer-reviewed — Nachum et al.은 k-fold CV를 데이터 재사용형 위험 추정기로 분석해, fold 수가 표본 수와 함께 증가할 때 피할 수 없는 minimax MSE 하한을 제시했다. 교차검증도 무한히 정확한 평가기가 아니다. PMLR 원문

실무 프로토콜은 그룹/환자/개체 단위 분할, 시간 순 분할, 전처리·특성선택·정규화의 fold 내부 적합, nested CV, 최종 test 1회 사용, seed와 fold 공개를 기본으로 삼아야 한다.

#4. 정확도만으로는 위험을 말할 수 없다: calibration과 conformal prediction

분류 확률 0.9가 실제로 약 90% 맞는지 묻는 것이 calibration이다. 그러나 평균 calibration이 좋아도 하위집단·OOD·시간 변화에서 무너질 수 있다. Conformal prediction은 교환가능성(exchangeability) 또는 i.i.d. 조건에서 유한표본 coverage를 제공하지만, 분포 변화가 있으면 그 가정을 다시 점검해야 한다.

  • ICML 2025, peer-reviewed — Van der Laan & Alaa는 Venn/Venn-Abers를 일반 손실로 확장하고, 유한표본 set-valued calibration과 subpopulation multicalibration을 제안했다. PMLR 원문
  • ICML 2025, peer-reviewed — Bashari, Sesia, Romano는 conformal outlier detection의 reference set이 일부 오염된 경우를 분석해, 비적대적 조건에서는 type-I error가 보수적으로 통제되지만 검출력이 감소함을 보였다. PMLR 원문
  • ALT 2026, peer-reviewed — Vovk는 i.i.d. randomness 가정 아래 conformal predictor의 효율성 보편성(universality)을 정량화했다. 이는 conformal이 강력하다는 뜻이지, shift 아래 무조건 유효하다는 뜻은 아니다. PMLR 원문

보고서에는 accuracy/F1뿐 아니라 reliability diagram, ECE의 bin 의존성, NLL/Brier score, prediction-set coverage와 size, 그룹별 coverage, shift별 성능을 함께 기록하는 편이 안전하다.

#5. 차원의 저주는 관측 차원보다 ‘유효 차원’과 귀납편향의 문제로 이동했다

딥러닝이 고차원 입력을 처리한다고 해서 차원의 저주가 사라진 것은 아니다. 핵심 질문은 모델이 어떤 저차원 구조를 실제로 활용하는지, 그리고 그 구조가 시험 환경에서도 유지되는지다.

  • ICML 2025, peer-reviewed — Dong et al.은 weak-to-strong fine-tuning을 ridgeless regression으로 분석하며, 미세조정이 낮은 intrinsic-dimensional subspace에서 일어난다는 관점으로 분산 감소를 설명했다. PMLR 원문
  • ICML 2025, peer-reviewed — Chen et al.은 low-dimension-to-high-dimension generalization이 적절한 귀납편향 없이는 불가능함을 보였고, 아키텍처와 (S)GD가 선택하는 보간자의 편향이 목표 함수와 맞아야 확장 일반화가 가능하다고 분석했다. PMLR 원문
  • COLT 2026, peer-reviewed open problem — Feldman, Kamath, Srebro는 딥러닝이 선형 모델보다 강한 이유가 본질적으로 분포 의존적인지라는 문제를 공식적으로 제기했다. 2026년에도 ‘왜 딥러닝이 차원의 저주를 이기는가’는 닫힌 문제가 아니다. PMLR 원문

따라서 ‘입력 픽셀 수가 많지만 DNN은 괜찮다’가 아니라, intrinsic/effective dimension, architecture-induced symmetry, locality, data spectrum, sample-to-dimension ratio를 측정하는 방향으로 질문을 바꿔야 한다.

#6. 고전 분류기는 사라진 것이 아니라 강한 기준선이 되었다

SVM, 최소거리, LDA/QDA, 나이브 베이즈는 대규모 foundation model과 경쟁하는 만능 해법은 아니지만, 작은 데이터·설명가능성·확률 가정 검증·calibration·저비용 배포에서 여전히 중요한 기준선이다. 특히 다음 연결은 계속 유효하다.

  • nearest class mean은 공유 단위 공분산과 동일 사전확률을 둔 Gaussian Bayes의 특수형이다.
  • LDA는 클래스별 공분산이 같을 때, QDA는 클래스별 공분산이 다를 때의 Gaussian Bayes 경계다.
  • SVM 커널은 고정 특성공간의 볼록 최적화라는 장점이 있지만, 표본 수가 매우 커지면 kernel matrix의 시간·메모리 비용이 병목이 된다.
  • 나이브 베이즈의 독립 가정은 틀릴 수 있어도, 적은 데이터에서 낮은 분산과 빠른 학습이라는 유용한 편향을 제공한다.

#키워드 요약

키워드의미
Generalization학습하지 않은 입력에서 낮은 위험을 유지하는 능력. 2026년에는 i.i.d.뿐 아니라 shift/OOD 축을 명시해야 한다.
Capacity & interpolation파라미터 수만이 아니라 데이터 스펙트럼, 마진, 최적화 경로, 암묵적 정규화가 일반화를 결정한다.
Validation leakagevalidation/test 결과가 개발 의사결정에 반복 유입되면 평가 집합도 사실상 학습된다.
Calibration예측 확률과 실제 빈도의 일치. 평균뿐 아니라 그룹·OOD·시간별로 확인해야 한다.
Conformal prediction교환가능성 아래 유한표본 coverage를 주는 set-valued prediction. shift에서는 가정과 가중화를 다시 검토한다.
Intrinsic dimension관측 차원보다 모델이 실제로 사용하는 유효 자유도. 딥러닝의 고차원 일반화를 설명하는 핵심 후보다.

#연구 질문 / 다음 실험

  1. 로봇 비전 데이터에서 분할 단위가 일반화 추정에 미치는 영향: frame-random split, sequence split, subject/site split을 비교하면 성능과 calibration이 얼마나 달라지는가?
  2. 보간 이후 일반화의 원인 분해: ridge, early-stopped GD, SGD를 동일 선형·커널·신경 특성에서 비교할 때 데이터 공분산 스펙트럼과 위험 곡선의 관계는 무엇인가?
  3. shift-aware uncertainty: ID calibration, OOD detection, conformal coverage를 동시에 만족시키려 할 때 어떤 층·표현·정규화가 Pareto frontier를 만드는가?

#최신 연구 참고문헌

  • Qiang et al., On the Out-of-Distribution Generalization of Self-Supervised Learning, ICML 2025.
  • Harun et al., Controlling Neural Collapse Enhances Out-of-Distribution Detection and Transfer Learning, ICML 2025.
  • Xu & Chen, Rethinking Benign Overfitting in Two-Layer Neural Networks, ICML 2025.
  • Wu et al., Risk Comparisons in Linear Regression: Implicit Regularization Dominates Explicit Regularization, COLT 2026.
  • Nachum et al., Minimax Limits of k-Fold Cross-Validation via Majority, COLT 2026.
  • Van der Laan & Alaa, Generalized Venn and Venn-Abers Calibration with Applications in Conformal Prediction, ICML 2025.
  • Vovk, Universality of Conformal Prediction under the Assumption of Randomness, ALT 2026.
  • Dong et al., Discrepancies are Virtue: Weak-to-Strong Generalization through Lens of Intrinsic Dimension, ICML 2025.
  • Feldman, Kamath, Srebro, Is the Power of Deep Learning over Linear Models Inherently Distribution Dependent?, COLT 2026.

Connect