본문으로 건너뛰기
Park JiHo
#gradient-descent#convex-optimization#accelerated-optimization#preconditioning#logistic-regression

현대 인공지능 IV — 기울기 기반 최적화: GD에서 OGM까지

ECE5992 최적화 강의자료 19쪽을 페이지·본문·수식·표·그림·질문·주석 원장으로 완전 추적하며, Lipschitz 연속성, GD·PSD·PGD·FGM·OGM, 복소수 하강방향, 효율적 선탐색과 로지스틱 회귀를 2026년 연구까지 연결한다.

Series map

현대 인공지능 · 8편 학습 지도

기초 수학에서 생성·표현학습까지 이어지는 8편 학습 경로. 빈 번호나 자리 채우기용 글 없이, 실제 확보된 강의자료를 여덟 단계로 연결한다.

4 / 8
  1. 기초 게시됨 AI·ML·DL에서 확률·최적화까지 AI·ML·DL의 관계, 선형대수, 확률변수, 가우시안 모델, WSS, 손실함수와 경사하강법을 연결한다.
  2. 학습 문제 게시됨 머신러닝의 기본 과제와 일반화 분류·회귀·밀도추정에서 과적합, 정규화, 검증, SVM, Bayes 분류와 차원의 저주까지 다룬다.
  3. 신경망 게시됨 퍼셉트론·MLP·CNN과 컨볼루션 선형 판별기에서 다층 퍼셉트론으로 확장하고, 1D·2D 컨볼루션과 CNN의 계산 구조를 정리한다.
  4. 최적화 읽는 중 기울기 기반 최적화: GD에서 OGM까지 Lipschitz 연속성, GD·PSD·PGD·FGM과 최적화된 기울기 방법 OGM의 수렴 구조를 비교한다.
  5. 영상 분류 후속 편 이미지 분류의 발전: AlexNet에서 SE Network까지 AlexNet, VGG, GoogLeNet, ResNet, WRN, DenseNet과 채널 재가중 SE Network의 발전을 추적한다.
  6. 픽셀 이해 후속 편 의미론적 영상 분할: FCN·U-Net·DeepLab 픽셀 단위 예측, encoder-decoder, skip connection, dilated convolution과 다중 스케일 분할을 다룬다.
  7. 생성·복원 후속 편 영상 잡음제거·VAE·확산모델 MMSE와 비선형 필터에서 VAE의 ELBO, 재매개변수화, DDPM의 순방향·역방향 확산으로 이어진다.
  8. 표현학습 후속 편 대조 표현학습: InfoNCE·SimCLR·BYOL·CLIP 양성·음성 쌍, InfoNCE, augmentation, memory bank, SimCLR·BYOL과 이미지-언어 CLIP을 연결한다.
게시된 편만 링크로 연결된다. 후속 PDF의 내용을 담은 글이 공개되면 같은 위치가 자동으로 활성화되며, 빈 게시물은 만들지 않는다.

완전성 계약(Completeness contract)
이 글은 5_Ch4-General-purpose gradient-based opt(1).pdf 19 / 19쪽을 기준으로 작성했다. 번호식뿐 아니라 번호 없는 표시식, 의미 있는 인라인 수학, 표·그림·캡션, 객관식·??·공란, 각주·참고문헌, 판독 가능한 손글씨를 원장에 연결했다. 원문 빈칸·오류 의심 표기는 보존하고 완성식과 교정식은 별도 상태로 등록한다.

세 층을 섞지 않는다.
2025 PDF 원자료 재구성, ② 편집·수학 검증, ③ 2026-08-18 최신 연구 업데이트를 분리한다.

#원장 현황

  • PDF: 19 / 19쪽
  • PDF SHA-256: 23272c39a5ad9c0dddf24eb7d42fdebe8575344f74bac3de761b7844fd81e58c
  • 전체 수식 record: 211개
  • source-derived 수식: 188개
  • display formula: 110개, inline formula: 101개
  • content record: 151개
  • figures/tables: 10개
  • handwritten annotations: 17개
  • editorial completion/correction: 23개

#PDF 원자료 재구성

#4. 범용 기울기 기반 최적화 방법(General-purpose gradient-based optimization methods)

비제약 최적화는 비용함수(cost function) Ψ:FNR\Psi:\mathbb{F}^{N}\to\mathbb{R}의 최소화 문제

원자료 수식 · PDF 1쪽 · 식 (1)

수식의 역할과 기호만 확인하기
x^=arg minxFNΨ(x)\widehat{x}=\operatorname*{arg\,min}_{x\in\mathbb{F}^{N}}\Psi(x)
쉽게 설명 핵심 설명

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 1쪽 · 식 (1) · 4. 범용 기울기 기반 최적화 방법(General-purpose gradient-based optimization methods) 식별자: MAI-P4-001

에서 시작한다. 초기 추정 x(0)x^{(0)}을 정한 뒤 반복열 {x(k)}k0\{x^{(k)}\}_{k\ge 0}을 만들고, 어떤 norm에서 x(k)x^0(k)\|x^{(k)}-\widehat{x}\|\to 0\quad(k\to\infty)가 되기를 기대한다.

강의자료는 응용에 따라 실수 또는 복소수 공간을 함께 다루기 위해 F{R,C}\mathbb{F}\in\{\mathbb{R},\mathbb{C}\}를 사용한다. 이 장의 중심은 convex하고 gradient가 Lipschitz continuous인 smooth objective이며, least-squares는 그 특수한 경우다.

nonsmoothcompositedifferentiableLipschitzgradientboundedcurvaturequadratic LS
PDF p.1 Venn diagram 재구성. convex function class 안에서 nonsmooth → composite → differentiable → Lipschitz-gradient → bounded-curvature → quadratic least-squares로 가정이 강해지는 관계를 보존했다.

#동기 응용: edge-preserving image recovery

측정모델은 y=Ax+εy=Ax+\varepsilon이고, data fidelity와 convex smooth regularizer를 결합해

원자료 수식 · PDF 1쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
x^=arg minxFN12Axy22+βR(x)\widehat{x}=\operatorname*{arg\,min}_{x\in\mathbb{F}^{N}}\frac{1}{2}\|Ax-y\|_{2}^{2}+\beta R(x)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 1쪽 · 동기 응용: edge-preserving image recovery 식별자: MAI-P4-008

를 푼다. 정규화항은 transform coefficient마다 potential을 더하는 R(x)=jψ([Cx]j)R(x)=\sum_{j}\psi([Cx]_{j})의 형태다.

11×11 uniform blur

additive noise · 60 dB blurred SNR

edge-preserving recovery

smooth convex regularization + gradient method

Figure 1 구조 재구성(PDF pp.1–2). 원본 사진을 복제하지 않고 degradation 조건과 이 장의 복원 결과가 대비되는 관계만 보존했다.

강의 주석 — PDF p.1. 우측 필기에서 등고선, gradient 방향, step size와 Lipschitz constant를 연결하는 짧은 메모가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#4.1 Lipschitz 연속성(Lipschitz continuity)

함수 g:FNFMg:\mathbb{F}^{N}\to\mathbb{F}^{M}에 대해 어떤 유한한 L<L<\infty이 존재하여

원자료 수식 · PDF 2쪽

노름은 여러 성분을 하나의 크기로 요약
g(x)g(z)Lxz,x,zFN\|g(x)-g(z)\|\le L\|x-z\|,\qquad \forall x,z\in\mathbb{F}^{N}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Lipschitz 곱: 반례와 bounded-product bound

x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 4.1 Lipschitz 연속성(Lipschitz continuity) 식별자: MAI-P4-011

을 만족하면 Lipschitz continuous라 한다. 가능한 상수 중 가장 작은 값을 best Lipschitz constant라고 하며, 자료는 특별한 언급이 없으면 Euclidean norm을 사용한다.

이하에서 f와 g의 best constants를 Lf,LgL_f,\,L_g로 둔다.

  • Scaling: h(x)=αf(x)+βLh=αLfh(x)=\alpha f(x)+\beta\quad\Longrightarrow\quad L_h=|\alpha|L_f
  • Translation: h(x)=f(xx0)Lh=Lfh(x)=f(x-x_0)\quad\Longrightarrow\quad L_h=L_f
  • Addition: h(x)=f(x)+g(x)LhLf+Lgh(x)=f(x)+g(x)\quad\Longrightarrow\quad L_h\le L_f+L_g
  • Composition: h(x)=f(g(x))LhLfLgh(x)=f(g(x))\quad\Longrightarrow\quad L_h\le L_fL_g
  • Affine transformation: h(x)=Ax+bLh=A2h(x)=Ax+b\quad\Longrightarrow\quad L_h=\|A\|_2
  • Multiplication: h(x)=f(x)g(x)Lh=??h(x)=f(x)g(x)\quad\Longrightarrow\quad L_h=\boxed{\text{??}}

자료는 두 Lipschitz 함수의 곱도 전체 실수축에서 항상 Lipschitz인지 True/False로 묻고 답을 비운다.

원자료 표기 확인 필요 · PDF 2쪽

수식의 역할과 기호만 확인하기
f,g Lipschitz on R  fg Lipschitz on R ???f,g\text{ Lipschitz on }\mathbb{R}\ \Longrightarrow\ fg\text{ Lipschitz on }\mathbb{R}\ ?\quad\boxed{\text{??}}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Lipschitz 곱: 반례와 bounded-product bound

x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 4.1 Lipschitz 연속성(Lipschitz continuity) 식별자: MAI-P4-020

곱에 대한 충분조건과 proof도 빈칸 상태로 제시된다.

원자료 표기 확인 필요 · PDF 2쪽

수식의 역할과 기호만 확인하기
f,g Lipschitz,??,??f,g\text{ Lipschitz},\qquad \boxed{\text{??}},\qquad \Longrightarrow\qquad \boxed{\text{??}}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Lipschitz 곱: 반례와 bounded-product bound

x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 4.1 Lipschitz 연속성(Lipschitz continuity) 식별자: MAI-P4-021

원자료 표기 확인 필요 · PDF 2쪽

수식의 역할과 기호만 확인하기
f(x)g(x)f(z)g(z)=f(x)(g(x)g(z))??f(x)g(x)-f(z)g(z)=f(x)(g(x)-g(z))-\boxed{\text{??}}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Lipschitz 곱: 반례와 bounded-product bound

x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 4.1 Lipschitz 연속성(Lipschitz continuity) 식별자: MAI-P4-022

원자료 표기 확인 필요 · PDF 2쪽

노름은 여러 성분을 하나의 크기로 요약
h(x)h(z)??fmaxLgxz+gmaxLfxz\|h(x)-h(z)\|\le \boxed{\text{??}}\le f_{\max}L_g\|x-z\|+g_{\max}L_f\|x-z\|
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Lipschitz 곱: 반례와 bounded-product bound

x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · 4.1 Lipschitz 연속성(Lipschitz continuity) 식별자: MAI-P4-023

다음 페이지는 boundedness가 필요한 조건인지 다시 묻는다. f,g가 모두 bounded여야 하는가???f,g\text{가 모두 bounded여야 하는가?}\quad\boxed{\text{??}}

강의 주석 — PDF p.2. 곱의 차이를 한 항씩 더하고 빼서 triangle inequality를 적용하는 proof 방향과 boundedness 표시가 손으로 보강되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#Smooth function: Lipschitz-continuous gradient

이 장에서 smooth function은 differentiable하고 gradient가

원자료 수식 · PDF 3쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
f(x)f(z)2Lxz2,x,zRN\|\nabla f(x)-\nabla f(z)\|_2\le L\|x-z\|_2,\qquad \forall x,z\in\mathbb{R}^{N}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Gradient Lipschitz ↔ Hessian spectral bound

같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 3쪽 · Smooth function: Lipschitz-continuous gradient 식별자: MAI-P4-025

을 만족하는 함수다. 복소수 공간의 derivative는 더 미묘하므로 이 정의는 우선 실수공간에 둔다.

Least-squares 예제 f(x)=12Axy22f(x)=\frac12\|Ax-y\|_2^2의 gradient는 f(x)=AT(Axy)\nabla f(x)=A^{\mathsf T}(Ax-y)이며,

원자료 수식 · PDF 3쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
f(x)f(z)2=ATA(xz)2ATA2xz2\|\nabla f(x)-\nabla f(z)\|_2=\|A^{\mathsf T}A(x-z)\|_2\le\|A^{\mathsf T}A\|_2\|x-z\|_2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Gradient Lipschitz ↔ Hessian spectral bound

같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 3쪽 · Smooth function: Lipschitz-continuous gradient 식별자: MAI-P4-028

에서

원자료 수식 · PDF 3쪽

노름은 여러 성분을 하나의 크기로 요약
L=ATA2=A22=σmax2(A)=ρmax(ATA)L=\|A^{\mathsf T}A\|_2=\|A\|_2^2=\sigma_{\max}^2(A)=\rho_{\max}(A^{\mathsf T}A)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Gradient Lipschitz ↔ Hessian spectral bound

같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
σ\sigma표준편차 또는 시그모이드 표기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 3쪽 · Smooth function: Lipschitz-continuous gradient 식별자: MAI-P4-029

을 얻는다.

두 번 미분 가능하고 Hessian spectral norm이

원자료 수식 · PDF 3쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
2f(x)2L,xRN\|\nabla^2 f(x)\|_2\le L,\qquad \forall x\in\mathbb{R}^{N}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Gradient Lipschitz ↔ Hessian spectral bound

같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 3쪽 · Smooth function: Lipschitz-continuous gradient 식별자: MAI-P4-030

처럼 bounded이면 gradient Lipschitz의 충분조건이다. Taylor integral form

원자료 수식 · PDF 3쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
f(x)f(z)=(012f(x+τ(zx))dτ)(xz)\nabla f(x)-\nabla f(z)=\left(\int_0^1\nabla^2f(x+\tau(z-x))\,d\tau\right)(x-z)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Gradient Lipschitz ↔ Hessian spectral bound

같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 3쪽 · Smooth function: Lipschitz-continuous gradient 식별자: MAI-P4-031

과 norm bound

원자료 수식 · PDF 3쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
f(x)f(z)2(01Ldτ)xz2=Lxz2\|\nabla f(x)-\nabla f(z)\|_2\le\left(\int_0^1L\,d\tau\right)\|x-z\|_2=L\|x-z\|_2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Gradient Lipschitz ↔ Hessian spectral bound

같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 3쪽 · Smooth function: Lipschitz-continuous gradient 식별자: MAI-P4-032

가 proof를 이룬다. 자료는 이 조건이 sufficient이지만 necessary는 아니라고 명시한다.

Quadratic examples로 2f=ATA,2f2=A22\nabla^2f=A^{\mathsf T}A,\qquad \|\nabla^2f\|_2=\|A\|_2^2와 rank-one form f(x)=xT[1224]xf(x)=x^{\mathsf T}\begin{bmatrix}1&2\\2&4\end{bmatrix}x, zT=[12]z^{\mathsf T}=\begin{bmatrix}1&2\end{bmatrix},

원자료 수식 · PDF 3쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
2f=2zzT,2f2=2z22=10\nabla^2f=2zz^{\mathsf T},\qquad \|\nabla^2f\|_2=2\|z\|_2^2=10
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Gradient Lipschitz ↔ Hessian spectral bound

같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 3쪽 · Smooth function: Lipschitz-continuous gradient 식별자: MAI-P4-036

을 제시한다.

강의 주석 — PDF p.3. least-squares gradient, Hessian의 spectral norm, singular value와 eigenvalue 관계를 따라가는 필기가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#Fair potential과 edge-preserving regularizer

Fair potential은

원자료 수식 · PDF 4쪽

수식의 역할과 기호만 확인하기
ψδ(x)=δ2(xδlog(1+xδ))\psi_\delta(x)=\delta^2\left(\left|\frac{x}{\delta}\right|-\log\left(1+\left|\frac{x}{\delta}\right|\right)\right)
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 edge-preserving regularizer 식별자: MAI-P4-037

이며,

원자료 수식 · PDF 4쪽

수식의 역할과 기호만 확인하기
ψ˙δ(x)=x1+x/δ\dot\psi_\delta(x)=\frac{x}{1+|x/\delta|}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 edge-preserving regularizer 식별자: MAI-P4-038

,

원자료 수식 · PDF 4쪽

수식의 역할과 기호만 확인하기
ψ¨δ(x)=1(1+x/δ)21\ddot\psi_\delta(x)=\frac{1}{(1+|x/\delta|)^2}\le1
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 edge-preserving regularizer 식별자: MAI-P4-039

을 만족한다. 원점 근처에서는 roughly quadratic, 큰 |x|에서는 |x|처럼 증가하고, 두 번째 도함수가 nonnegative라 convex다.

approximately |x|quadratic near 0
PDF p.4 곡선 재구성. δ=1인 Fair potential의 quadratic/linear-like 두 regime을 새 SVG로 표현했다.

자료는 potential 자체도 Lipschitz continuous인지 ψδ itself Lipschitz continuous???\psi_\delta\text{ itself Lipschitz continuous?}\quad\boxed{\text{??}}로 질문한다.

Regularizer gradient와 그 Lipschitz constant를 합성함수로 계산하는 exercise는

원자료 표기 확인 필요 · PDF 4쪽 · 식 (2)

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
R(x)=j=1Jψ([Cx]j)R(x)=??R(x)=\sum_{j=1}^{J}\psi([Cx]_j)\quad\Longrightarrow\quad\nabla R(x)=\boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
\sum지정된 항을 모두 더하는 연산
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · 식 (2) · Fair potential과 edge-preserving regularizer 식별자: MAI-P4-041

에서 시작해 f(x)=Cx,g(u)=ψ˙(u),h(v)=CTvf(x)=Cx,\qquad g(u)=\dot\psi_{\cdot}(u),\qquad h(v)=C^{\mathsf T}v,

원자료 표기 확인 필요 · PDF 4쪽

수식의 역할과 기호만 확인하기
Lf=??,Lh=??L_f=\boxed{\text{??}},\qquad L_h=\boxed{\text{??}}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 edge-preserving regularizer 식별자: MAI-P4-043

,

원자료 표기 확인 필요 · PDF 4쪽

노름은 여러 성분을 하나의 크기로 요약
g(u)g(v)22=j=1J????\|g(u)-g(v)\|_2^2=\sum_{j=1}^{J}\boxed{\text{??}}\le\boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 edge-preserving regularizer 식별자: MAI-P4-044

,

원자료 표기 확인 필요 · PDF 4쪽 · 식 (3)

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
LR=??L_{\nabla R}=\boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · 식 (3) · Fair potential과 edge-preserving regularizer 식별자: MAI-P4-045

,

원자료 표기 확인 필요 · PDF 4쪽

노름은 여러 성분을 하나의 크기로 요약
Lψ˙1:A:1B:C2C:CTC2D:C24E:None??L_{\dot\psi}\le1:\quad A:1\quad B:\|C\|_2\quad C:\|C^{\mathsf T}C\|_2\quad D:\|C\|_2^4\quad E:\text{None}\quad\boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 edge-preserving regularizer 식별자: MAI-P4-046

의 빈칸을 남긴다.

강의 주석 — PDF p.4. Fair potential 그래프에는 quadratic regime와 edge-preserving 성질을 연결하는 메모가 있고, regularizer exercise 옆에는 chain rule 순서가 표시되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#4.2 Smooth convex 함수의 gradient descent

가정은 finite minimizer <Ψ(x^)Ψ(x),xRN-\infty<\Psi(\widehat{x})\le\Psi(x),\qquad \forall x\in\mathbb{R}^{N}, Lipschitz gradient Ψ(x)Ψ(z)2Lxz2\|\nabla\Psi(x)-\nabla\Psi(z)\|_2\le L\|x-z\|_2, 그리고 step size 0<α<2L0<\alpha<\frac{2}{L}이다. 이때 iteration은

원자료 수식 · PDF 5쪽 · 식 (4)

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x(k+1)=x(k)αΨ(x(k))x^{(k+1)}=x^{(k)}-\alpha\nabla\Psi(x^{(k)})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

GD step size, anisotropy, and corrected worst-case scaling

2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 5쪽 · 식 (4) · 4.2 Smooth convex 함수의 gradient descent 식별자: MAI-P4-050

이다.

자료가 열거하는 properties는 cost monotonicity Ψ(x(k+1))Ψ(x(k))\Psi(x^{(k+1)})\le\Psi(x^{(k)}), minimizer까지 거리의 monotonicity x(k+1)x^2x(k)x^2\|x^{(k+1)}-\widehat{x}\|_2\le\|x^{(k)}-\widehat{x}\|_2, minimizer convergence다. 0<α1/L0<\alpha\le1/L에서는

원자료 표기 확인 필요 · PDF 5쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
Ψ(x(k))Ψ(x^)Lx(0)x^222max{12kα+1,(1α)2k}\Psi(x^{(k)})-\Psi(\widehat{x})\le\frac{L\|x^{(0)}-\widehat{x}\|_2^2}{2}\max\left\{\frac{1}{2k\alpha+1},(1-\alpha)^{2k}\right\}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

GD step size, anisotropy, and corrected worst-case scaling

2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 5쪽 · 4.2 Smooth convex 함수의 gradient descent 식별자: MAI-P4-053

을 제시하고, 같은 bound가 1L<α<2L\frac1L<\alpha<\frac2L에도 성립할 것이라는 conjecture를 적는다.

Convergence rate는 objective gap Ψ(x(k))Ψ(x^)\Psi(x^{(k)})\to\Psi(\widehat{x}), gradient norm Ψ(x(k))0\|\nabla\Psi(x^{(k)})\|\to0, iterate error x(k)x^0\|x^{(k)}-\widehat{x}\|\to0를 global/local하게 본다. fixed step α=1/L인 GD의 tight worst-case objective bound는

원자료 표기 확인 필요 · PDF 5쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
Ψ(x(k))Ψ(x^)x(0)x^22L(2k+2)=O(k1)\Psi(x^{(k)})-\Psi(\widehat{x})\le\frac{\|x^{(0)}-\widehat{x}\|_2^2}{L(2k+2)}=O(k^{-1})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

GD step size, anisotropy, and corrected worst-case scaling

2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 5쪽 · 4.2 Smooth convex 함수의 gradient descent 식별자: MAI-P4-059

이고, Nesterov FGM은 O(k2)O(k^{-2}) rate를 갖는다.

느린 example은 least-squares에서 A=[1002]A=\begin{bmatrix}1&0\\0&2\end{bmatrix}, y=0y=0를 사용한다. optimal fixed step을 써도 길쭉한 level set 때문에 iteration이 zig-zag한다. 자료는 acceleration의 두 실무 방향으로 preconditioner와 line search를 제시한다.

x⁽⁰⁾x̂=0
Figure 2 재구성(PDF pp.5–6). anisotropic least-squares contour에서 unpreconditioned GD가 gradient 방향을 번갈아 바꾸며 느리게 수렴하는 관계를 보존했다.

강의 주석 — PDF p.5. O(1/k)와 O(1/k²) 비교, condition number가 큰 타원에서 zig-zag가 생긴다는 메모가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#4.3 Preconditioned steepest descent(PSD)와 PGD

PSD는 negative preconditioned gradient d(k)=PΨ(x(k))d^{(k)}=-P\nabla\Psi(x^{(k)}), one-dimensional line search α(k)=arg minαΨ(x(k)+αd(k))\alpha^{(k)}=\operatorname*{arg\,min}_{\alpha}\Psi(x^{(k)}+\alpha d^{(k)}), update

원자료 수식 · PDF 6쪽 · 식 (5)

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x(k+1)=x(k)+α(k)d(k)x^{(k+1)}=x^{(k)}+\alpha^{(k)}d^{(k)}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 6쪽 · 식 (5) · 4.3 Preconditioned steepest descent(PSD)와 PGD 식별자: MAI-P4-065

를 결합한다.

Quadratic case에는 analytic line search α(k)=arg minα12yAx(k)αAd(k)22\alpha^{(k)}=\operatorname*{arg\,min}_{\alpha}\frac12\|y-Ax^{(k)}-\alpha Ad^{(k)}\|_2^2가 가능하다. P0P\succ0이면 strict decrease가 필요한 경우 Ψ(x(k+1))Ψ(x(k))\Psi(x^{(k+1)})\le\Psi(x^{(k)})를 얻지만, nonquadratic objective에서는 매 iteration의 line search 비용이 생긴다.

Exact line search의 first-order condition은

원자료 수식 · PDF 6쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
0=αΨ(x(k)+αd(k))α=α(k)=Ψ(x(k+1)),d(k)0=\left.\frac{\partial}{\partial\alpha}\Psi(x^{(k)}+\alpha d^{(k)})\right|_{\alpha=\alpha^{(k)}}=\langle\nabla\Psi(x^{(k+1)}),d^{(k)}\rangle
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기
\partial특정 변수에 대한 편미분

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 6쪽 · 4.3 Preconditioned steepest descent(PSD)와 PGD 식별자: MAI-P4-069

이므로 다음 gradient와 현재 search direction이 orthogonal하다. inexact line search라면 approximate orthogonality만 기대한다.

Fixed-step PGD는

원자료 수식 · PDF 6쪽 · 식 (6)

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x(k+1)=x(k)αPΨ(x(k))x^{(k+1)}=x^{(k)}-\alpha P\nabla\Psi(x^{(k)})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 6쪽 · 식 (6) · 4.3 Preconditioned steepest descent(PSD)와 PGD 식별자: MAI-P4-070

다. P=TTTP=TT^{\mathsf T}와 coordinate change z=T1xz=T^{-1}x를 쓰면 원문 문제를

원자료 수식 · PDF 6쪽

수식의 역할과 기호만 확인하기
z^=arg minzΨP(z),ΨP(z)=Ψ(Tz)\widehat{z}=\operatorname*{arg\,min}_{z}\Psi_P(z),\qquad \Psi_P(z)=\Psi(Tz)
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 6쪽 · 4.3 Preconditioned steepest descent(PSD)와 PGD 식별자: MAI-P4-073

로 바꾼다.

강의 주석 — PDF p.6. line search 후 gradient와 search direction이 직교한다는 표시, FGM/OGM은 L을 알면 line search가 필요 없다는 메모가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

Chain rule을 적용한 transformed-coordinate GD는

원자료 수식 · PDF 7쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
z(k+1)=z(k)αTTΨ(Tz(k))z^{(k+1)}=z^{(k)}-\alpha T^{\mathsf T}\nabla\Psi(Tz^{(k)})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · 4.3 Preconditioned steepest descent(PSD)와 PGD 식별자: MAI-P4-074

이며, T를 곱하면 PGD가 된다. 자료는 이 동일성을 ordinary GD on ΨP is the same as ??\text{ordinary GD on }\Psi_P\text{ is the same as }\boxed{\text{??}}로 비워 둔다.

Least-squares에서는 α=1과 T=(ATA)1/2,P=(ATA)1T=(A^{\mathsf T}A)^{-1/2},\qquad P=(A^{\mathsf T}A)^{-1}을 택하면 x(1)=(ATA)1ATyx^{(1)}=(A^{\mathsf T}A)^{-1}A^{\mathsf T}y이고, 따라서 P=(ATA)1=[2Ψ(x(k))]1P=(A^{\mathsf T}A)^{-1}=[\nabla^2\Psi(x^{(k)})]^{-1}를 ideal preconditioner로 해석한다. 좋은 preconditioner는 level set을 거의 spherical하게 만드는 좌표계를 뜻한다.

ill-conditioned x-space
nearly spherical z-space
PDF p.7 geometry 재구성. preconditioning을 coordinate transform으로 해석해 길쭉한 level set을 spherical하게 만드는 목적을 표현했다.

#Descent direction

Definition 4.5는 local decrease를

원자료 수식 · PDF 7쪽 · 식 (7)

수식의 역할과 기호만 확인하기
c>0 s.t. ϵ[0,c): Ψ(x+ϵd)Ψ(x)\exists c>0\ \text{s.t.}\ \forall\epsilon\in[0,c):\ \Psi(x+\epsilon d)\le\Psi(x)
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · 식 (7) · Descent direction 식별자: MAI-P4-079

로 정의하며 d=0도 degenerate descent direction이다. 실수공간에서 앞 절의 positive-definite P 조건 아래 nonzero

원자료 수식 · PDF 7쪽 · 식 (8)

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
d=PΨ(x)d=-P\nabla\Psi(x)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · 식 (8) · Descent direction 식별자: MAI-P4-080

가 descent direction이고, proof sketch는

원자료 수식 · PDF 7쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
Ψ(x)Ψ(x+αd)=αΨ(x),d+o(α)=α(dTP1d+o(α)α)\Psi(x)-\Psi(x+\alpha d)=-\alpha\langle\nabla\Psi(x),d\rangle+o(\alpha)=\alpha\left(d^{\mathsf T}P^{-1}d+\frac{o(\alpha)}{\alpha}\right)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · Descent direction 식별자: MAI-P4-081

이다.

대표 선택은 positive diagonal P=diag(p1,,pN),pi>0P=\operatorname{diag}(p_1,\ldots,p_N),\qquad p_i>0

원자료 표기 확인 필요 · PDF 7쪽

수식의 역할과 기호만 확인하기
P=??,D positive diagonal, Q unitaryP=\boxed{\text{??}},\qquad D\text{ positive diagonal},\ Q\text{ unitary}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · Descent direction 식별자: MAI-P4-083

이다. 후자는 circulant 구조일 때 FFT로 P-gradient product를 빠르게 계산할 수 있다고 설명한다.

강의 주석 — PDF p.7. elliptical level set을 circular하게 만드는 coordinate transform, ideal inverse-Hessian preconditioner, unitary diagonalization 표시가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#Descent direction: complex case

Ψ(x)=12Axy22,ACM×N, yCM\Psi(x)=\frac12\|Ax-y\|_2^2,\qquad A\in\mathbb{C}^{M\times N},\ y\in\mathbb{C}^{M}는 holomorphic하지 않지만, positive-definite P에 대해

원자료 수식 · PDF 8쪽

수식의 역할과 기호만 확인하기
d=PAH(Axy)d=-PA^{\mathsf H}(Ax-y)
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · Descent direction: complex case 식별자: MAI-P4-085

가 descent direction이다. 자료는 complex case의 g=Ψ(x)=AH(Axy)g=\nabla\Psi(x)=A^{\mathsf H}(Ax-y)를 derivative라기보다 negative descent direction을 만드는 gradient-like quantity로 사용한다. 이어 stationary equation을 AT(Axy)=0A^{\mathsf T}(Ax-y)=0라고 인쇄한다.

#4.4 Complex edge-preserving regularizer의 descent direction

Complex regularizer는

원자료 수식 · PDF 8쪽 · 식 (9)

수식의 역할과 기호만 확인하기
R(x)=j=1Jψ([Cx]j),ψ(z)=f(z)R(x)=\sum_{j=1}^{J}\psi([Cx]_j),\qquad \psi(z)=f(|z|)
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 식 (9) · 4.4 Complex edge-preserving regularizer의 descent direction 식별자: MAI-P4-088

다. f는 real-valued, nondecreasing on nonnegative arguments, differentiable이고, ωf(t)=f˙(t)t\omega_f(t)=\frac{\dot f(t)}{t}가 t=0에서도 well-defined이며 0ωf(t)ωmax<0\le\omega_f(t)\le\omega_{\max}<\infty를 만족한다고 가정한다. Fair potential에는 ωf(t)=11+t/δ(0,1]\omega_f(t)=\frac{1}{1+|t/\delta|}\in(0,1]가 된다.

Claim은

원자료 수식 · PDF 8쪽 · 식 (10)

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
R(x)=CHdiag(ωf ⁣(Cx))Cx-\nabla R(x)=-C^{\mathsf H}\operatorname{diag}(\omega_f\!\cdot(|Cx|))Cx
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 식 (10) · 4.4 Complex edge-preserving regularizer의 descent direction 식별자: MAI-P4-092

가 descent direction이라는 것이다. intuition은 f˙(t)=ωf(t)t\dot f(t)=\omega_f(t)t이다.

한 row에 대한 proof는 r(x)=ψ(vHx),d(x)=vωf(vHx)vHxr(x)=\psi(v^{\mathsf H}x),\qquad d(x)=-v\omega_f(|v^{\mathsf H}x|)v^{\mathsf H}x, contraction

원자료 수식 · PDF 8쪽

노름은 여러 성분을 하나의 크기로 요약
r(x+ϵd)=f ⁣(vHx1ϵωv22)r(x+\epsilon d)=f\!\left(|v^{\mathsf H}x|\,|1-\epsilon\omega\|v\|_2^2|\right)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · 4.4 Complex edge-preserving regularizer의 descent direction 식별자: MAI-P4-095

, step interval 0ϵ1ωv221ϵωv22[0,1]0\le\epsilon\le\frac{1}{\omega\|v\|_2^2}\quad\Longrightarrow\quad |1-\epsilon\omega\|v\|_2^2|\in[0,1]을 사용한다. 마지막 비교는 원자료에 r(x+ϵd)f(vHv)=r(x)r(x+\epsilon d)\le f(v^{\mathsf H}v)=r(x)로 적혀 있다.

강의 주석 — PDF p.8. Wirtinger/complex derivative를 직접 쓰지 않고 negative descent direction으로 gradient notation을 재사용한다는 메모와 Hermitian transpose 표시가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#Complex descent field의 Lipschitz constant와 practical bound

자료는 R(x)=CHdiag(ω ⁣(Cx))Cx\nabla R(x)=C^{\mathsf H}\operatorname{diag}(\omega\!\cdot(|Cx|))CxCHdiag(ω ⁣(Cx))Cx=h(g(f(x))),f(x)=Cx, g(u)=d(u), h(v)=CHvC^{\mathsf H}\operatorname{diag}(\omega\!\cdot(|Cx|))Cx=h(g(f(x))),\quad f(x)=Cx,\ g(u)=d_{\cdot}(u),\ h(v)=C^{\mathsf H}v로 분해한다. real argument에서 d(z)=??(zR)d(z)=\boxed{\text{??}}\qquad(z\in\mathbb{R})를 비우고, complex argument에는 numerical evidence에 기반한 conjecture Ld=ω(0)L_d=\omega(0), LR=C22LdL_{\nabla R}=\|C\|_2^2L_d를 제시한다. 이는 원자료의 연구 중 진술로 보존하며 정리로 격상하지 않는다.

1D finite difference가 periodic이면 circulant/normal이라 spectral radius

원자료 표기 확인 필요 · PDF 9쪽

수식의 역할과 기호만 확인하기
ρmax(C)={2,N even,1+cos(π(N1)/N)2,N odd,\rho_{\max}(C)=\begin{cases}2,&N\text{ even},\\1+\cos(\pi(N-1)/N)\approx2,&N\text{ odd},\end{cases}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · Complex descent field의 Lipschitz constant와 practical bound 식별자: MAI-P4-103

를 쓸 수 있다. nonperiodic boundary에는

원자료 수식 · PDF 9쪽

노름은 여러 성분을 하나의 크기로 요약
C22=CTC2=ρmax(CTC)CTC\|C\|_2^2=\|C^{\mathsf T}C\|_2=\rho_{\max}(C^{\mathsf T}C)\le\|C^{\mathsf T}C\|
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · Complex descent field의 Lipschitz constant와 practical bound 식별자: MAI-P4-104

과 convenient 1-norm bound

원자료 수식 · PDF 9쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
CTC1CT1C1=CC1=22=4\|C^{\mathsf T}C\|_1\le\|C^{\mathsf T}\|_1\|C\|_1=\|C\|_\infty\|C\|_1=2\cdot2=4
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · Complex descent field의 Lipschitz constant와 practical bound 식별자: MAI-P4-105

를 사용하여 practical choice LR=4Lψ˙L_{\nabla R}=4L_{\dot\psi}를 얻는다.

Preconditioned fixed step을 정하기 위해 transformed objective f(z)=Ψ(Tz)f(z)=\Psi(Tz), gradient f(z)=TTΨ(Tz)\nabla f(z)=T^{\mathsf T}\nabla\Psi(Tz), Lipschitz bound

원자료 표기 확인 필요 · PDF 9쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
Lf=TT2T2LΨ=P2LΨL_{\nabla f}=\|T^{\mathsf T}\|_2\|T\|_2L_{\nabla\Psi}=\|P\|_2L_{\nabla\Psi}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · Complex descent field의 Lipschitz constant와 practical bound 식별자: MAI-P4-109

을 계산한다.

강의 주석 — PDF p.9. finite-difference matrix의 periodic/circulant 구조, spectral radius ≈2, matrix 1-norm으로 4를 얻는 계산이 손으로 보강되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

Transformed-coordinate GD를 x-space로 옮기면

원자료 수식 · PDF 10쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
z(k+1)=z(k)αfTTΨ(Tz(k)),x(k+1)=x(k)αfPΨ(x(k)),\begin{aligned}z^{(k+1)}&=z^{(k)}-\alpha_fT^{\mathsf T}\nabla\Psi(Tz^{(k)}),\\x^{(k+1)}&=x^{(k)}-\alpha_fP\nabla\Psi(x^{(k)}),\end{aligned}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · Complex descent field의 Lipschitz constant와 practical bound 식별자: MAI-P4-110

이며, valid fixed step은

원자료 표기 확인 필요 · PDF 10쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
0<αf<2Lf=2P2LΨ0<\alpha_f<\frac{2}{L_{\nabla f}}=\frac{2}{\|P\|_2L_{\nabla\Psi}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · Complex descent field의 Lipschitz constant와 practical bound 식별자: MAI-P4-111

이다. 따라서 preconditioning을 써도 반드시 line search로 갈 필요는 없다.

대표 inverse problem은

원자료 수식 · PDF 10쪽 · 식 (11)

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
x^=arg minxFN12Axy22+βR(x),R(x)=r(Cx),r(v)=j=1Jψ(vj)\widehat{x}=\operatorname*{arg\,min}_{x\in\mathbb{F}^{N}}\frac12\|Ax-y\|_2^2+\beta R(x),\quad R(x)=r(Cx),\quad r(v)=\sum_{j=1}^{J}\psi(v_j)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

General inverse problem: cached products make line search cheap

Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 식 (11) · 4.5 General inverse problems with efficient line search 식별자: MAI-P4-112

이고, 이를 포함하는 general form은 원자료에서

원자료 표기 확인 필요 · PDF 10쪽 · 식 (12)

수식의 역할과 기호만 확인하기
Ψ(x)=??\Psi(x)=\boxed{\text{??}}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

General inverse problem: cached products make line search cheap

Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 식 (12) · 4.5 General inverse problems with efficient line search 식별자: MAI-P4-113

로 비워 둔다. 각 B_i는 M_i×N, 각 f_i는 보통 convex다.

Special case mapping은

원자료 수식 · PDF 10쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
I=2,B1=A,B2=C,f1(u)=12uy22,f2(v)=βr(v)I=2,\quad B_1=A,\quad B_2=C,\quad f_1(u)=\frac12\|u-y\|_2^2,\quad f_2(v)=\beta r(v)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

General inverse problem: cached products make line search cheap

Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 4.5 General inverse problems with efficient line search 식별자: MAI-P4-114

이며, Fair potential일 때 f₂ gradient의 best constant를

원자료 표기 확인 필요 · PDF 10쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
Lf2:A:1B:βC:βKD:βJE:None??L_{\nabla f_2}:\quad A:1\quad B:\beta\quad C:\beta\sqrt{K}\quad D:\beta J\quad E:\text{None}\quad\boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

General inverse problem: cached products make line search cheap

Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 4.5 General inverse problems with efficient line search 식별자: MAI-P4-115

로 묻는다.

Naive line search h(k)(α)=Ψ(x(k)+αd(k))h^{(k)}(\alpha)=\Psi(x^{(k)}+\alpha d^{(k)})는 매 trial마다 B_i product를 반복한다. 미리 products를 계산하면

원자료 수식 · PDF 10쪽

수식의 역할과 기호만 확인하기
h(k)(α)=i=1Ifi ⁣(ui(k)+αvi(k)),ui(k)=Bix(k), vi(k)=Bid(k)h^{(k)}(\alpha)=\sum_{i=1}^{I}f_i\!\left(u_i^{(k)}+\alpha v_i^{(k)}\right),\qquad u_i^{(k)}=B_ix^{(k)},\ v_i^{(k)}=B_id^{(k)}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

General inverse problem: cached products make line search cheap

Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\sum지정된 항을 모두 더하는 연산

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 4.5 General inverse problems with efficient line search 식별자: MAI-P4-117

가 되고, outer iteration의 update를 곱해

원자료 수식 · PDF 10쪽

수식의 역할과 기호만 확인하기
ui(k+1)=ui(k)+αkvi(k)u_i^{(k+1)}=u_i^{(k)}+\alpha_kv_i^{(k)}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

General inverse problem: cached products make line search cheap

Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · 4.5 General inverse problems with efficient line search 식별자: MAI-P4-118

로 재사용한다. 이 simplification에서 line derivative의 Lipschitz constant는 B_i operator norm을 직접 필요로 하지 않는다.

강의 주석 — PDF p.10. B_i x와 B_i d를 line search 전에 cache하고 다음 iteration에서 recursive update하라는 계산 흐름이 표시되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#4.6 Convergence rates

Local strict convexity와 twice differentiability 아래에서 PGD·PSD·PCG의 asymptotic behavior를

원자료 수식 · PDF 11쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
P1/2(x(k+1)x^)2cρ(k)P1/2(x(0)x^)2\|P^{-1/2}(x^{(k+1)}-\widehat{x})\|_2\le c\rho^{(k)}\|P^{-1/2}(x^{(0)}-\widehat{x})\|_2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 4.6 Convergence rates 식별자: MAI-P4-119

, root convergence factor supx(0)limkP1/2(x(k)x^)21/k=ρ\sup_{x^{(0)}}\lim_{k\to\infty}\|P^{-1/2}(x^{(k)}-\widehat{x})\|_2^{1/k}=\rho, preconditioned Hessian/condition number H^=P1/22Ψ(x^)P1/2,κ=λmax(H^)λmin(H^)\widehat{H}=P^{1/2}\nabla^2\Psi(\widehat{x})P^{1/2},\qquad \kappa=\frac{\lambda_{\max}(\widehat{H})}{\lambda_{\min}(\widehat{H})}로 정리한다.

PDF p.11 convergence-factor table 재구성
Method
ρ
κ=10²
PGD standard step
ρPGD,1/λmax=κ1κ\rho_{\mathrm{PGD},\,1/\lambda_{\max}}=\frac{\kappa-1}{\kappa}
0.99
PGD optimal step
ρPGD,α=κ1κ+1\rho_{\mathrm{PGD},\,\alpha^*}=\frac{\kappa-1}{\kappa+1}
0.98
PSD exact line search
ρPSD=κ1κ+1\rho_{\mathrm{PSD}}=\frac{\kappa-1}{\kappa+1}
0.98
PCG exact line search
ρPCG=κ1κ+1\rho_{\mathrm{PCG}}=\frac{\sqrt\kappa-1}{\sqrt\kappa+1}
0.82

자료는 이어 “PCG converges quadratically”\text{“PCG converges quadratically”}라고 서술하고, 위 ρ가 lower bound와 맞는다고 적는다.

강의 주석 — PDF p.11. κ=100에서 0.99·0.98·0.82를 비교하며 preconditioning과 PCG의 이점을 강조하는 표시가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#Generalized S-Lipschitz PGD analysis

Definition 4.7은

원자료 수식 · PDF 11쪽 · 식 (13)

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
S1(Ψ(x)Ψ(z))2ST(xz)2\|S^{-1}(\nabla\Psi(x)-\nabla\Psi(z))\|_2\le\|S^{\mathsf T}(x-z)\|_2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 식 (13) · Generalized S-Lipschitz PGD analysis 식별자: MAI-P4-127

으로 anisotropic smoothness를 정의하고, S=LIΨ(x)Ψ(z)2Lxz2S=\sqrt{L}\,I\quad\Longrightarrow\quad\|\nabla\Psi(x)-\nabla\Psi(z)\|_2\le L\|x-z\|_2에서 classic condition을 회복한다. Theorem 4.8은 matrix condition

원자료 수식 · PDF 11쪽 · 식 (14)

수식의 역할과 기호만 확인하기
αPTSSTPP+PT\alpha P^{\mathsf T}SS^{\mathsf T}P\preceq P+P^{\mathsf T}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 식 (14) · Generalized S-Lipschitz PGD analysis 식별자: MAI-P4-129

아래의 PGD

원자료 수식 · PDF 11쪽 · 식 (15)

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x(k+1)=x(k)αPΨ(x(k))x^{(k+1)}=x^{(k)}-\alpha P\nabla\Psi(x^{(k)})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · 식 (15) · Generalized S-Lipschitz PGD analysis 식별자: MAI-P4-130

에 대해 decrease

원자료 수식 · PDF 11쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
Ψ(x(k))Ψ(x(k+1))α2gT(P+PTαPTSSTP)g\Psi(x^{(k)})-\Psi(x^{(k+1)})\ge\frac{\alpha}{2}g^{\mathsf T}(P+P^{\mathsf T}-\alpha P^{\mathsf T}SS^{\mathsf T}P)g
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · Generalized S-Lipschitz PGD analysis 식별자: MAI-P4-131

와 gradient norm convergence를 준다.

P가 SPD이면 condition은 P=PT0:αSST2P1P=P^{\mathsf T}\succ0:\qquad \alpha SS^{\mathsf T}\preceq2P^{-1}이고 weighted distance P1/2(x(k)x^)20\|P^{-1/2}(x^{(k)}-\widehat{x})\|_2\downarrow0가 감소한다. αP=(SST)1\alpha P=(SS^{\mathsf T})^{-1}는 MM method와 같으며 classical bound

원자료 수식 · PDF 12쪽 · 식 (16)

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
Ψ(x(k))Ψ(x^)ST(x(0)x^)222k\Psi(x^{(k)})-\Psi(\widehat{x})\le\frac{\|S^{\mathsf T}(x^{(0)}-\widehat{x})\|_2^2}{2k}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · 식 (16) · Generalized S-Lipschitz PGD analysis 식별자: MAI-P4-135

, 2014 tight bound

원자료 수식 · PDF 12쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
Ψ(x(k))Ψ(x^)ST(x(0)x^)224k+2\Psi(x^{(k)})-\Psi(\widehat{x})\le\frac{\|S^{\mathsf T}(x^{(0)}-\widehat{x})\|_2^2}{4k+2}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · Generalized S-Lipschitz PGD analysis 식별자: MAI-P4-136

를 제시한다. Huber-like function이 tight example이다.

서로 다른 physical units를 가진 diagonal A example에서 scalar Lipschitz constant의 단위를

원자료 표기 확인 필요 · PDF 12쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
LΨ의 단위:A:AV/mB:A2C:V2/m2D:ΩmE:None??L_{\nabla\Psi}\text{의 단위}:\quad A:\mathrm{A\,V/m}\quad B:\mathrm{A^2}\quad C:\mathrm{V^2/m^2}\quad D:\Omega\,\mathrm m\quad E:\text{None}\quad\boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · Generalized S-Lipschitz PGD analysis 식별자: MAI-P4-137

로 묻는다.

#Generalized Nesterov fast gradient method(FGM)

Generalized FGM은 t(k+1)=1+1+4(t(k))22t^{(k+1)}=\frac{1+\sqrt{1+4(t^{(k)})^2}}{2}, x(k+1)=z(k)(SST)1Ψ(z(k))x^{(k+1)}=z^{(k)}-(SS^{\mathsf T})^{-1}\nabla\Psi(z^{(k)}), z(k+1)=x(k+1)+t(k)1t(k+1)(x(k+1)x(k))z^{(k+1)}=x^{(k+1)}+\frac{t^{(k)}-1}{t^{(k+1)}}(x^{(k+1)}-x^{(k)})를 결합한

원자료 수식 · PDF 12쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
t(k+1)=1+1+4(t(k))22,x(k+1)=z(k)(SST)1Ψ(z(k)),z(k+1)=x(k+1)+t(k)1t(k+1)(x(k+1)x(k)),\begin{aligned}t^{(k+1)}&=\frac{1+\sqrt{1+4(t^{(k)})^2}}2,\\x^{(k+1)}&=z^{(k)}-(SS^{\mathsf T})^{-1}\nabla\Psi(z^{(k)}),\\z^{(k+1)}&=x^{(k+1)}+\frac{t^{(k)}-1}{t^{(k+1)}}(x^{(k+1)}-x^{(k)}),\end{aligned}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · Generalized Nesterov fast gradient method(FGM) 식별자: MAI-P4-141

이다. 모든 t=1이면 ordinary GD가 되며, convex S-Lipschitz objective에서

원자료 수식 · PDF 12쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
Ψ(x(k))Ψ(x^)ST(x(0)x^)22k2\Psi(x^{(k)})-\Psi(\widehat{x})\le\frac{\|S^{\mathsf T}(x^{(0)}-\widehat{x})\|_2^2}{k^2}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · Generalized Nesterov fast gradient method(FGM) 식별자: MAI-P4-142

의 O(1/k²) worst-case rate를 얻는다. quadratic in R^N에서는 CG가 exact arithmetic에서 N iterations 내 종료할 수 있어 worst-case bound가 개별 application을 과도하게 비관할 수 있다고 덧붙인다.

Second-order baseline으로 Newton update

원자료 수식 · PDF 12쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x(k+1)=x(k)[2Ψ(x(k))]1Ψ(x(k))x^{(k+1)}=x^{(k)}-[\nabla^2\Psi(x^{(k)})]^{-1}\nabla\Psi(x^{(k)})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · Generalized Nesterov fast gradient method(FGM) 식별자: MAI-P4-143

을 제시하지만, large-scale problem에서는 Hessian formation/inversion이 impractical해 first-order methods에 초점을 둔다.

강의 주석 — PDF p.12. O(1/k)와 O(1/k²) bound, momentum, Newton의 Hessian inverse 비용을 비교하는 필기가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#4.7 Accelerated first-order methods

General first-order class는

원자료 수식 · PDF 13쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x(k+1)=function(x(0),Ψ(x(0)),Ψ(x(0)),,Ψ(x(k)),Ψ(x(k)))x^{(k+1)}=\operatorname{function}(x^{(0)},\Psi(x^{(0)}),\nabla\Psi(x^{(0)}),\ldots,\Psi(x^{(k)}),\nabla\Psi(x^{(k)}))
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 13쪽 · 4.7 Accelerated first-order methods 식별자: MAI-P4-144

, fixed-coefficient FO class는

원자료 수식 · PDF 13쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x(n+1)=x(n)1Lk=0nhn+1,kΨ(x(k))x^{(n+1)}=x^{(n)}-\frac1L\sum_{k=0}^{n}h_{n+1,k}\nabla\Psi(x^{(k)})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
\sum지정된 항을 모두 더하는 연산
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 13쪽 · 4.7 Accelerated first-order methods 식별자: MAI-P4-145

다. 어떤 algorithms가 FO인지

원자료 표기 확인 필요 · PDF 13쪽

수식의 역할과 기호만 확인하기
FO fixed-step methods?A:PGD,FGM,PSD,PCGB:PGD,FGM,PSDC:PGD,PSDD:PGD,FGME:PGD??\text{FO fixed-step methods?}\quad A:\mathrm{PGD,FGM,PSD,PCG}\quad B:\mathrm{PGD,FGM,PSD}\quad C:\mathrm{PGD,PSD}\quad D:\mathrm{PGD,FGM}\quad E:\mathrm{PGD}\quad\boxed{\text{??}}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 13쪽 · 4.7 Accelerated first-order methods 식별자: MAI-P4-146

로 묻는다.

Barzilai–Borwein method은 g(k)=Ψ(x(k))g^{(k)}=\nabla\Psi(x^{(k)}), α(k)=x(k)x(k1)22x(k)x(k1),g(k)g(k1)\alpha^{(k)}=\frac{\|x^{(k)}-x^{(k-1)}\|_2^2}{\langle x^{(k)}-x^{(k-1)},g^{(k)}-g^{(k-1)}\rangle}, x(k+1)=x(k)α(k)g(k)x^{(k+1)}=x^{(k)}-\alpha^{(k)}g^{(k)}를 묶은

원자료 수식 · PDF 13쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
g(k)=Ψ(x(k)),α(k)=x(k)x(k1)22x(k)x(k1),g(k)g(k1),x(k+1)=x(k)α(k)g(k),\begin{aligned}g^{(k)}&=\nabla\Psi(x^{(k)}),\\\alpha^{(k)}&=\frac{\|x^{(k)}-x^{(k-1)}\|_2^2}{\langle x^{(k)}-x^{(k-1)},g^{(k)}-g^{(k-1)}\rangle},\\x^{(k+1)}&=x^{(k)}-\alpha^{(k)}g^{(k)},\end{aligned}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 13쪽 · 4.7 Accelerated first-order methods 식별자: MAI-P4-150

이다. GFO에는 속하지만 coefficients가 trajectory에 의존하므로 fixed-step FO에는 속하지 않는다.

자료가 제시하는 research questions는 주어진 coefficients의 convergence rate 분석, coefficients 최적화, fast recursion, L에 독립적인 universal design, 그리고 GFO가 얼마나 더 나아질 수 있는지다.

#Nesterov FGM1의 recursive/FO 표현

Nesterov iteration은 usual GD step z(n+1)=x(n)1LΨ(x(n))z^{(n+1)}=x^{(n)}-\frac1L\nabla\Psi(x^{(n)}), momentum factor t(n+1)=1+1+4(t(n))22t^{(n+1)}=\frac{1+\sqrt{1+4(t^{(n)})^2}}2, update x(n+1)=z(n+1)+t(n)1t(n+1)(z(n+1)z(n))x^{(n+1)}=z^{(n+1)}+\frac{t^{(n)}-1}{t^{(n+1)}}(z^{(n+1)}-z^{(n)}), β(n)=t(n)1t(n+1)>0\beta^{(n)}=\frac{t^{(n)}-1}{t^{(n+1)}}>0를 가진

원자료 수식 · PDF 13쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
z(n+1)=x(n)L1Ψ(x(n)),t(n+1)=1+1+4(t(n))22,x(n+1)=(1+β(n))z(n+1)β(n)z(n),\begin{aligned}z^{(n+1)}&=x^{(n)}-L^{-1}\nabla\Psi(x^{(n)}),\\t^{(n+1)}&=\frac{1+\sqrt{1+4(t^{(n)})^2}}2,\\x^{(n+1)}&=(1+\beta^{(n)})z^{(n+1)}-\beta^{(n)}z^{(n)},\end{aligned}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 13쪽 · Nesterov FGM1의 recursive/FO 표현 식별자: MAI-P4-155

이다. Implementation은 recursive하지만 analysis에서는 FO coefficient form으로 펼칠 수 있다.

강의 주석 — PDF p.13. FO/GFO 포함관계, Barzilai–Borwein step이 과거 iterate와 gradient 차이를 이용한다는 표시가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

FGM1의 fixed-step coefficients는

원자료 표기 확인 필요 · PDF 14쪽

수식의 역할과 기호만 확인하기
hn+1,k={t(n)1t(n+1)hn,k,k=0,,n2,t(n)1t(n+1)(hn,n1),k=n1,1+t(n)1t(n+1),k=n,h_{n+1,k}=\begin{cases}\frac{t^{(n)}-1}{t^{(n+1)}}h_{n,k},&k=0,\ldots,n-2,\\\frac{t^{(n)}-1}{t^{(n+1)}}(h_{n,n}-1),&k=n-1,\\1+\frac{t^{(n)}-1}{t^{(n+1)}},&k=n,\end{cases}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · Nesterov FGM1의 recursive/FO 표현 식별자: MAI-P4-156

이며, 자료는 n=0…5에 대한 lower-triangular numerical coefficient matrix를 함께 보여 준다.

PDF p.14 FGM coefficient matrix 재구성
1.00
0
0
0
0
0
0
1.25
0
0
0
0
0
0.10
1.40
0
0
0
0
0.05
0.20
1.50
0
0
0
0.03
0.11
1.29
1.57
0
0
0.02
0.07
0.18
0.36
1.62

Primary sequence bound는

원자료 수식 · PDF 14쪽 · 식 (17)

노름은 여러 성분을 하나의 크기로 요약
Ψ(z(n))Ψ(x)Lx(0)x222(t(n1))22Lx(0)x22(n+1)2\Psi(z^{(n)})-\Psi(x^*)\le\frac{L\|x^{(0)}-x^*\|_2^2}{2(t^{(n-1)})^2}\le\frac{2L\|x^{(0)}-x^*\|_2^2}{(n+1)^2}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · 식 (17) · Nesterov FGM1의 recursive/FO 표현 식별자: MAI-P4-157

, Nesterov worst-function lower bound는

원자료 수식 · PDF 14쪽

노름은 여러 성분을 하나의 크기로 요약
3Lx(0)x2232(n+1)2Ψ(x(n))Ψ(x)\frac{3L\|x^{(0)}-x^*\|_2^2}{32(n+1)^2}\le\Psi(x^{(n)})-\Psi(x^*)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · Nesterov FGM1의 recursive/FO 표현 식별자: MAI-P4-158

, secondary sequence bound는

원자료 수식 · PDF 14쪽 · 식 (18)

노름은 여러 성분을 하나의 크기로 요약
Ψ(x(n))Ψ(x)Lx(0)x222(t(n))22Lx(0)x22(n+1)2\Psi(x^{(n)})-\Psi(x^*)\le\frac{L\|x^{(0)}-x^*\|_2^2}{2(t^{(n)})^2}\le\frac{2L\|x^{(0)}-x^*\|_2^2}{(n+1)^2}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · 식 (18) · Nesterov FGM1의 recursive/FO 표현 식별자: MAI-P4-159

이다. 두 upper bounds는 asymptotically tight하지만 leading constant gap은 개선 여지를 남긴다.

ε-accuracy에 필요한 iteration complexity를

원자료 표기 확인 필요 · PDF 14쪽

수식의 역할과 기호만 확인하기
Ψ(x(n))Ψ(x)ϵ:A:O(1) B:O(1/ϵ) C:O(1/ϵ) D:O(1/ϵ2) E:O(1/ϵ4)??\Psi(x^{(n)})-\Psi(x^*)\le\epsilon:\quad A:O(1)\ B:O(1/\sqrt\epsilon)\ C:O(1/\epsilon)\ D:O(1/\epsilon^2)\ E:O(1/\epsilon^4)\quad\boxed{\text{??}}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · Nesterov FGM1의 recursive/FO 표현 식별자: MAI-P4-160

로 묻는다.

#Optimized gradient method(OGM)

D. Kim이 optimized coefficients

원자료 수식 · PDF 14쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
hn+1,k={θ(n)1θ(n+1)hn,k,k=0,,n2,θ(n)1θ(n+1)(hn,n11),k=n1,1+2θ(n)1θ(n+1),k=n,h_{n+1,k}^{*}=\begin{cases}\frac{\theta^{(n)}-1}{\theta^{(n+1)}}h_{n,k},&k=0,\ldots,n-2,\\\frac{\theta^{(n)}-1}{\theta^{(n+1)}}(h_{n,n-1}-1),&k=n-1,\\1+\frac{2\theta^{(n)}-1}{\theta^{(n+1)}},&k=n,\end{cases}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · Optimized gradient method(OGM) 식별자: MAI-P4-161

와 horizon-dependent θ recurrence

원자료 표기 확인 필요 · PDF 14쪽

수식의 역할과 기호만 확인하기
θ(n)={1,n=0,1+1+4(θ(n1))22,n=1,,N1,1+1+8(θ(n1))22,N=1,\theta^{(n)}=\begin{cases}1,&n=0,\\\frac{1+\sqrt{1+4(\theta^{(n-1)})^2}}2,&n=1,\ldots,N-1,\\\frac{1+\sqrt{1+8(\theta^{(n-1)})^2}}2,&N=1,\end{cases}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · Optimized gradient method(OGM) 식별자: MAI-P4-162

를 제시한다. Analytical bound

원자료 수식 · PDF 14쪽 · 식 (19)

노름은 여러 성분을 하나의 크기로 요약
Ψ(x(N))Ψ(x)Lx(0)x222(θ(N))2Lx(0)x222(N+1)(N+1+2)Lx(0)x222(N+1)2\Psi(x^{(N)})-\Psi(x^*)\le\frac{L\|x^{(0)}-x^*\|_2^2}{2(\theta^{(N)})^2}\le\frac{L\|x^{(0)}-x^*\|_2^2}{2(N+1)(N+1+\sqrt2)}\le\frac{L\|x^{(0)}-x^*\|_2^2}{2(N+1)^2}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · 식 (19) · Optimized gradient method(OGM) 식별자: MAI-P4-163

는 O(1/N²)이지만 FGM의 leading constant보다 factor 2 개선된다.

강의 주석 — PDF p.14. FGM coefficient matrix와 OGM의 새 final-horizon coefficient가 비교되어 있고, ε complexity 질문 옆에 square-root 표시가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

Efficient OGM recursion은 GD step z(n+1)=x(n)1LΨ(x(n))z^{(n+1)}=x^{(n)}-\frac1L\nabla\Psi(x^{(n)}), horizon-aware θ(n+1)={1+1+4(θ(n))22,nN2,1+1+8(θ(n))22,n=N1,\theta^{(n+1)}=\begin{cases}\frac{1+\sqrt{1+4(\theta^{(n)})^2}}2,&n\le N-2,\\\frac{1+\sqrt{1+8(\theta^{(n)})^2}}2,&n=N-1,\end{cases}, two-momentum update

원자료 수식 · PDF 15쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x(n+1)=z(n+1)+θ(n)1θ(n+1)(z(n+1)z(n))+θ(n)θ(n+1)(z(n+1)x(n))x^{(n+1)}=z^{(n+1)}+\frac{\theta^{(n)}-1}{\theta^{(n+1)}}(z^{(n+1)}-z^{(n)})+\frac{\theta^{(n)}}{\theta^{(n+1)}}(z^{(n+1)}-x^{(n)})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 15쪽 · Optimized gradient method(OGM) 식별자: MAI-P4-166

이다. 마지막 새 momentum을 제거하면 Nesterov FGM으로 되돌아간다. 단점은 final bound를 위해 N을 미리 정해야 한다는 점이다.

Primary sequence는

원자료 수식 · PDF 15쪽

노름은 여러 성분을 하나의 크기로 요약
Ψ(z(n))Ψ(x)Lx(0)x224(θ(n1))2Lx(0)x22(n+1)2\Psi(z^{(n)})-\Psi(x^*)\le\frac{L\|x^{(0)}-x^*\|_2^2}{4(\theta^{(n-1)})^2}\le\frac{L\|x^{(0)}-x^*\|_2^2}{(n+1)^2}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 15쪽 · Optimized gradient method(OGM) 식별자: MAI-P4-167

이다. newer OGM’은 standard recurrence t(n+1)=1+1+4(t(n))22t^{(n+1)}=\frac{1+\sqrt{1+4(t^{(n)})^2}}2와 over-relaxed gradient + FGM momentum

원자료 수식 · PDF 15쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x(n+1)=x(n)1+t(n)/t(n+1)LΨ(x(n))+t(n)1t(n+1)(z(n+1)z(n))x^{(n+1)}=x^{(n)}-\frac{1+t^{(n)}/t^{(n+1)}}{L}\nabla\Psi(x^{(n)})+\frac{t^{(n)}-1}{t^{(n+1)}}(z^{(n+1)}-z^{(n)})
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 15쪽 · Optimized gradient method(OGM) 식별자: MAI-P4-169

를 사용해 N을 미리 정하지 않는다. 자료는 (t(n))2(n+1)24,n>1(t^{(n)})^2\le\frac{(n+1)^2}{4},\qquad n>1도 각주로 제시한다.

GDFGMOGMgradient stepFGM momentumextra over-relaxed gradient momentumO(1/k²)same order, better constant
PDF pp.15–16 momentum structure 재구성. OGM이 FGM momentum에 추가 gradient-related momentum을 더하고, over-relaxation factor가 2에 접근하는 intuition을 보존했다.

자료의 intuition은 over-relaxed gradient multiplier가 1+t(n)t(n+1)2(n)1+\frac{t^{(n)}}{t^{(n+1)}}\to2\qquad(n\to\infty)라는 것이다.

#OGM의 GFO worst-case optimality

OGM은 fixed-step class x(n+1)=x(n)1Lk=0nhn+1,kΨ(x(k))x^{(n+1)}=x^{(n)}-\frac1L\sum_{k=0}^{n}h_{n+1,k}\nabla\Psi(x^{(k)})에서 optimized h를 사용해

원자료 수식 · PDF 16쪽 · 식 (20)

노름은 여러 성분을 하나의 크기로 요약
Ψ(x(N))Ψ(x)Lx(0)x222(θ(N))2Lx(0)x22N2\Psi(x^{(N)})-\Psi(x^*)\le\frac{L\|x^{(0)}-x^*\|_2^2}{2(\theta^{(N)})^2}\le\frac{L\|x^{(0)}-x^*\|_2^2}{N^2}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 16쪽 · 식 (20) · OGM의 GFO worst-case optimality 식별자: MAI-P4-173

을 만족한다. Drori는 dimension d>N인 large-scale setting의 GFO class x(n+1)=function(x(0),Ψ(x(0)),Ψ(x(0)),,Ψ(x(n)),Ψ(x(n)))x^{(n+1)}=\operatorname{function}(x^{(0)},\Psi(x^{(0)}),\nabla\Psi(x^{(0)}),\ldots,\Psi(x^{(n)}),\nabla\Psi(x^{(n)})) 전체에 대해 lower bound

원자료 수식 · PDF 16쪽

노름은 여러 성분을 하나의 크기로 요약
Lx(0)x222(θ(N))2Ψ(x(N))Ψ(x)\frac{L\|x^{(0)}-x^*\|_2^2}{2(\theta^{(N)})^2}\le\Psi(x^{(N)})-\Psi(x^*)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 16쪽 · OGM의 GFO worst-case optimality 식별자: MAI-P4-175

를 보였다. 따라서 이 oracle model 안에서 OGM의 worst-case complexity가 optimal하다고 설명한다.

Huber-like worst case

Quadratic worst case

PDF p.16 worst-case panels 재구성. Huber-like function과 quadratic function에서 OGM iterates가 upper bound를 맞추는 두 형태를 개념적으로 다시 그렸다.

강의 주석 — PDF p.16. OGM이 fixed-step FO뿐 아니라 GFO oracle model에서도 worst-case optimal하다는 “optimal” 강조와 Huber/quadratic 두 worst-case 경로가 표시되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

두 worst-case families에는

원자료 수식 · PDF 17쪽

노름은 여러 성분을 하나의 크기로 요약
R=x(0)x:Ψ(x(N))Ψ(x)=LR22(θ(N))2LR2(N+1)(N+1+2)LR2(N+1)2R=\|x^{(0)}-x^*\|:\qquad \Psi(x^{(N)})-\Psi(x^*)=\frac{LR^2}{2(\theta^{(N)})^2}\le\frac{LR^2}{(N+1)(N+1+\sqrt2)}\le\frac{LR^2}{(N+1)^2}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 17쪽 · OGM의 GFO worst-case optimality 식별자: MAI-P4-176

가 성립한다. 하지만 일반적으로 FGM/OGM은

원자료 수식 · PDF 17쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
Ψ(x(k+1))Ψ(x(k))is not guaranteed for FGM/OGM\Psi(x^{(k+1)})\le\Psi(x^{(k)})\quad\text{is not guaranteed for FGM/OGM}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 17쪽 · OGM의 GFO worst-case optimality 식별자: MAI-P4-177

이며, bound가 k에 따라 감소한다고 실제 iterate cost가 monotone인 것은 아니다.

#4.8 Machine learning: Binary classification with logistic regression

Feature vectors v_m∈R^N, labels y_m∈{±1}, regularization β>0에 대해

원자료 수식 · PDF 17쪽 · 식 (21)

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
x^=arg minxΨ(x),Ψ(x)=m=1Mψ(ymx,vm)+β2x22\widehat{x}=\operatorname*{arg\,min}_{x}\Psi(x),\qquad \Psi(x)=\sum_{m=1}^{M}\psi(y_m\langle x,v_m\rangle)+\frac\beta2\|x\|_2^2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

Logistic regression: margin, surrogate curvature, gradient, L bound

2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 17쪽 · 식 (21) · 4.8 Machine learning: Binary classification with logistic regression 식별자: MAI-P4-178

를 최소화한다.

원하는 classifier margin은

원자료 수식 · PDF 17쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
x,vm>0 (ym=+1),x,vm<0 (ym=1),i.e. x,ymvm>0\langle x,v_m\rangle>0\ (y_m=+1),\quad \langle x,v_m\rangle<0\ (y_m=-1),\quad\text{i.e. }\langle x,y_mv_m\rangle>0
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

Logistic regression: margin, surrogate curvature, gradient, L bound

2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 17쪽 · 4.8 Machine learning: Binary classification with logistic regression 식별자: MAI-P4-179

이며, sign(⟨x,v_m⟩)을 class decision으로 사용한다.

Logistic surrogate는 ψ(z)=log(1+ez)\psi(z)=\log(1+e^{-z}), derivative ψ˙(z)=1ez+1\dot\psi(z)=-\frac{1}{e^z+1}, curvature

원자료 수식 · PDF 17쪽

시그모이드는 실수 점수를 0과 1 사이 값으로 압축
ψ¨(z)=ez(ez+1)2(0,14]\ddot\psi(z)=\frac{e^z}{(e^z+1)^2}\in\left(0,\frac14\right]
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

선형 점수를 확률처럼 해석 가능한 값으로 어떻게 바꾸는가?

한 줄 핵심

점수 z에 음수를 붙여 지수함수를 계산하고 1+e^{-z}의 역수를 취한다.

Formula-specific lesson

Logistic regression: margin, surrogate curvature, gradient, L bound

2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    선형 점수 z를 계산한다

    z=wTx+bz=w^Tx+b
  2. 2

    음의 지수값을 계산한다

    eze^{-z}
  3. 3

    1을 더한다

    1+ez1+e^{-z}
  4. 4

    역수를 취한다

    σ(z)=1/(1+ez)\sigma(z)=1/(1+e^{-z})

Worked example

숫자로 직접 계산 — z=2일 때

양의 점수가 어느 정도의 출력으로 변하는지 본다.

  1. 1

    지수

    e20.1353e^{-2}\approx0.1353
  2. 2

    분모

    1+0.1353=1.13531+0.1353=1.1353
  3. 3

    역수

    1/1.13530.8811/1.1353\approx0.881

결과: 출력은 약 0.881이다.

Sanity check

검산 포인트
  • z=0이면 정확히 0.5다.
  • 큰 양수에서는 1, 큰 음수에서는 0에 가까워진다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 17쪽 · 4.8 Machine learning: Binary classification with logistic regression 식별자: MAI-P4-182

라 gradient Lipschitz constant 계산이 가능하다.

Surrogate losses

exponential / hinge / logistic / 0–1

Decision boundary update

PDF pp.17–18 figures 재구성. surrogate loss shapes와 labeled points에서 initial/final/ideal boundary를 비교하는 관계를 새 SVG로 표현했다.

General inverse form과의 대응은

원자료 표기 확인 필요 · PDF 17쪽

시그모이드는 실수 점수를 0과 1 사이 값으로 압축
Is (21) a special case of (12)?A:TrueB:False??\text{Is (21) a special case of (12)?}\quad A:\text{True}\quad B:\text{False}\quad\boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

선형 점수를 확률처럼 해석 가능한 값으로 어떻게 바꾸는가?

한 줄 핵심

점수 z에 음수를 붙여 지수함수를 계산하고 1+e^{-z}의 역수를 취한다.

Formula-specific lesson

Logistic regression: margin, surrogate curvature, gradient, L bound

2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    선형 점수 z를 계산한다

    z=wTx+bz=w^Tx+b
  2. 2

    음의 지수값을 계산한다

    eze^{-z}
  3. 3

    1을 더한다

    1+ez1+e^{-z}
  4. 4

    역수를 취한다

    σ(z)=1/(1+ez)\sigma(z)=1/(1+e^{-z})

Worked example

숫자로 직접 계산 — z=2일 때

양의 점수가 어느 정도의 출력으로 변하는지 본다.

  1. 1

    지수

    e20.1353e^{-2}\approx0.1353
  2. 2

    분모

    1+0.1353=1.13531+0.1353=1.1353
  3. 3

    역수

    1/1.13530.8811/1.1353\approx0.881

결과: 출력은 약 0.881이다.

Sanity check

검산 포인트
  • z=0이면 정확히 0.5다.
  • 큰 양수에서는 1, 큰 음수에서는 0에 가까워진다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 17쪽 · 4.8 Machine learning: Binary classification with logistic regression 식별자: MAI-P4-183

,

원자료 표기 확인 필요 · PDF 17쪽

시그모이드는 실수 점수를 0과 1 사이 값으로 압축
I=??, B1=??, B2=??, f1(u)=??, f2(v)=??I=\boxed{\text{??}},\ B_1=\boxed{\text{??}},\ B_2=\boxed{\text{??}},\ f_1(u)=\boxed{\text{??}},\ f_2(v)=\boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

선형 점수를 확률처럼 해석 가능한 값으로 어떻게 바꾸는가?

한 줄 핵심

점수 z에 음수를 붙여 지수함수를 계산하고 1+e^{-z}의 역수를 취한다.

Formula-specific lesson

Logistic regression: margin, surrogate curvature, gradient, L bound

2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    선형 점수 z를 계산한다

    z=wTx+bz=w^Tx+b
  2. 2

    음의 지수값을 계산한다

    eze^{-z}
  3. 3

    1을 더한다

    1+ez1+e^{-z}
  4. 4

    역수를 취한다

    σ(z)=1/(1+ez)\sigma(z)=1/(1+e^{-z})

Worked example

숫자로 직접 계산 — z=2일 때

양의 점수가 어느 정도의 출력으로 변하는지 본다.

  1. 1

    지수

    e20.1353e^{-2}\approx0.1353
  2. 2

    분모

    1+0.1353=1.13531+0.1353=1.1353
  3. 3

    역수

    1/1.13530.8811/1.1353\approx0.881

결과: 출력은 약 0.881이다.

Sanity check

검산 포인트
  • z=0이면 정확히 0.5다.
  • 큰 양수에서는 1, 큰 음수에서는 0에 가까워진다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 17쪽 · 4.8 Machine learning: Binary classification with logistic regression 식별자: MAI-P4-184

로 비워 두고, V=[y1v1,,yMvM]RN×MV=[y_1v_1,\ldots,y_Mv_M]\in\mathbb{R}^{N\times M}를 정의한다. Gradient와 practical constant는

원자료 수식 · PDF 17쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
Ψ(x)=Vψ˙(VTx)+βx,LΨ=V22Lψ˙+β=14V22+β\nabla\Psi(x)=V\dot\psi_{\cdot}(V^{\mathsf T}x)+\beta x,\qquad L_{\nabla\Psi}=\|V\|_2^2L_{\dot\psi}+\beta=\frac14\|V\|_2^2+\beta
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Logistic regression: margin, surrogate curvature, gradient, L bound

2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 17쪽 · 4.8 Machine learning: Binary classification with logistic regression 식별자: MAI-P4-186

이다.

Practical notes는 V columns를 unit norm으로 normalize해 exponent overflow를 줄이고, β를 cross-validation으로 tuning하며, convex smooth objective라 FGM/OGM에 적합하다는 것이다. N이 매우 크고 sparse classifier가 필요하면 ℓ₂ regularizer를 ℓ₁으로 바꾸고 FISTA 또는 POGM을 사용하라고 제안한다.

Sparse variant의 regularizer 교체는 β2x22  βx1\frac\beta2\|x\|_2^2\ \longrightarrow\ \beta\|x\|_1이다.

Numerical result는 M=100, N=7 labeled training data에서 initial boundary, optimized final boundary, ideal boundary를 비교한다. 자료 스스로 ‘large scale?’라고 반문한다.

강의 주석 — PDF p.17. logistic·hinge·exponential·0–1 surrogate를 비교하고 V=[y₁v₁,…]로 데이터를 쌓는 메모가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

강의 주석 — PDF p.18. column normalization, cross-validation, sparse ℓ₁ variant를 practical implementation 항목 옆에서 강조한다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.

#4.9 Summary

이 장은 differentiable unconstrained objective를 위한 gradient-based algorithms를 정리한다. 매 iteration의 gradient computation이 흔히 가장 비싸다.

PSD와 PCG는 line search를 추가로 요구하며, line search 자체도 cost/gradient를 여러 번 평가하는 1D optimization이다. 그러나 equation (12) 구조에서는 §4.5의 cached products와 recursive update로 효율화할 수 있다.

마지막 question은 general form이 모든 Lipschitz-gradient objective의 strict subset인지

원자료 표기 확인 필요 · PDF 18쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
{Ψ=ifi(Bix):fi Lipschitz}{Ψ:Ψ Lipschitz} ?A:True B:False ??\{\Psi=\sum_i f_i(B_ix):\nabla f_i\text{ Lipschitz}\}\subsetneq\{\Psi:\nabla\Psi\text{ Lipschitz}\}\ ?\quad A:\text{True}\ B:\text{False}\ \boxed{\text{??}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
\sum지정된 항을 모두 더하는 연산
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 18쪽 · 4.9 Summary 식별자: MAI-P4-188

로 묻는다.

#강의자료 참고문헌

  1. R. C. Fair, “On the robust estimation of econometric models,” Annals of Economic and Social Measurement, 1974.
  1. K. Lange, “Convergence of EM image reconstruction algorithms with Gibbs smoothing,” IEEE Transactions on Medical Imaging, 1990.
  1. X. Zheng et al., “Sparse-view X-ray CT reconstruction using ℓ1 prior with learned transform,” submitted 2019; arXiv:1711.00905.
  1. B. T. Polyak, Introduction to Optimization, 1987.
  1. Y. Drori and M. Teboulle, “Performance of first-order methods for smooth convex minimization: a novel approach,” Mathematical Programming, 2014.
  1. A. B. Taylor, J. M. Hendrickx, and F. Glineur, “Smooth strongly convex interpolation and exact worst-case performance of first-order methods,” Mathematical Programming, 2017.
  1. D. Kim and J. A. Fessler, “Optimized first-order methods for smooth convex minimization,” Mathematical Programming, 2016.
  1. Y. Nesterov, Lectures on Convex Optimization, 2018.
  1. I. Y. Chun and J. A. Fessler, “Convolutional analysis operator learning: Acceleration and convergence,” IEEE Transactions on Image Processing, 2020.
  1. J. Barzilai and J. M. Borwein, “Two-point step size gradient methods,” IMA Journal of Numerical Analysis, 1988.
  1. Y. Nesterov, “A method for unconstrained convex minimization problem with the rate of convergence O(1/k²),” 1983.
  1. Y. Nesterov, “Smooth minimization of non-smooth functions,” Mathematical Programming, 2005.
  1. O. Güler, “New proximal point algorithms for convex minimization,” SIAM Journal on Optimization, 1992.
  1. D. Kim and J. A. Fessler, “On the convergence analysis of the optimized gradient method,” Journal of Optimization Theory and Applications, 2017.
  1. Y. Drori, “The exact information-based complexity of smooth convex minimization,” Journal of Complexity, 2017.
  1. A. Beck and M. Teboulle, “A fast iterative shrinkage-thresholding algorithm for linear inverse problems,” SIAM Journal on Imaging Sciences, 2009.
  1. A. B. Taylor, J. M. Hendrickx, and F. Glineur, “Exact worst-case performance of first-order methods for composite convex optimization,” SIAM Journal on Optimization, 2017.

#편집·수학 검증(Editorial audit)

이 절은 PDF 원문을 덮어쓰지 않는다. 위 source-suspect/blank formula를 그대로 남겨 두고, 아래에서 corrects로 연결한 완성식 또는 교정식을 별도 record로 제공한다.

#Lipschitz 함수의 곱: 전역 명제는 거짓이고 boundedness는 충분조건

Counterexample는

수학적 교정식 · PDF 2쪽

초평면 분류기는 가중합 점수의 부호로 클래스를 나눔
f(x)=g(x)=xf,g are Lipschitz on R,f(x)g(x)=x2 is not globally Lipschitzf(x)=g(x)=x\quad\Longrightarrow\quad f,g\text{ are Lipschitz on }\mathbb{R},\quad f(x)g(x)=x^2\text{ is not globally Lipschitz}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

입력 x가 결정경계의 어느 쪽에 있는가?

한 줄 핵심

wᵀx+b를 계산해 양수면 한 클래스, 음수면 다른 클래스로 보낸다. 0이면 경계 위다.

Formula-specific lesson

Lipschitz 곱: 반례와 bounded-product bound

x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    특징과 가중치를 같은 위치끼리 곱한다

    wixiw_ix_i
  2. 2

    모든 곱을 더하고 bias를 더한다

    g(x)=wTx+bg(x)=w^Tx+b
  3. 3

    부호를 확인한다

    g(x)>0+1,g(x)<01g(x)>0\Rightarrow+1,\quad g(x)<0\Rightarrow-1
  4. 4

    필요하면 경계까지 거리를 구한다

    distance=g(x)/w2\mathrm{distance}=|g(x)|/\lVert w\rVert_2

Worked example

숫자로 직접 계산 — 한 점 분류하기

w=[1,-2], x=[3,1], b=0.5이다.

  1. 1

    가중합

    13+(2)1+0.5=1.51\cdot3+(-2)\cdot1+0.5=1.5
  2. 2

    클래스

    sign(1.5)=+1\operatorname{sign}(1.5)=+1
  3. 3

    경계까지 거리

    1.5/12+(2)20.671.5/\sqrt{1^2+(-2)^2}\approx0.67

결과: 이 점은 양의 클래스 쪽에 있고 경계에서 약 0.67 떨어져 있다.

Sanity check

검산 포인트
  • w와 x의 차원이 같아야 한다.
  • 거리에는 |g(x)|가 필요하지만 signed distance는 부호를 유지할 수 있다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · Lipschitz 함수의 곱: 전역 명제는 거짓이고 boundedness는 충분조건 식별자: MAI-P4-189

다. |f|≤fmax, |g|≤gmax이면 decomposition

원자료 빈칸의 완성식 · PDF 2쪽

수식의 역할과 기호만 확인하기
f(x)g(x)f(z)g(z)=f(x)(g(x)g(z))+g(z)(f(x)f(z))f(x)g(x)-f(z)g(z)=f(x)(g(x)-g(z))+g(z)(f(x)-f(z))
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Lipschitz 곱: 반례와 bounded-product bound

x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · Lipschitz 함수의 곱: 전역 명제는 거짓이고 boundedness는 충분조건 식별자: MAI-P4-190

와 bound

원자료 빈칸의 완성식 · PDF 2쪽

수식의 역할과 기호만 확인하기
h(x)h(z)(fmaxLg+gmaxLf)xz|h(x)-h(z)|\le\bigl(f_{\max}L_g+g_{\max}L_f\bigr)|x-z|
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Lipschitz 곱: 반례와 bounded-product bound

x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 2쪽 · Lipschitz 함수의 곱: 전역 명제는 거짓이고 boundedness는 충분조건 식별자: MAI-P4-191

가 성립한다. boundedness는 sufficient이지만 necessary는 아니다. 예를 들어 bounded factor 하나와 constant factor의 곱처럼 더 약한 조건에서도 Lipschitz가 될 수 있다.

#Fair potential과 real regularizer 빈칸 완성

Potential 자체의 constant는

원자료 빈칸의 완성식 · PDF 4쪽

수식의 역할과 기호만 확인하기
ψ˙δ(x)=x1+x/δδLψδ=δ|\dot\psi_\delta(x)|=\frac{|x|}{1+|x|/\delta}\le\delta\quad\Longrightarrow\quad L_{\psi_\delta}=\delta
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 real regularizer 빈칸 완성 식별자: MAI-P4-192

이다. Real chain rule은

원자료 빈칸의 완성식 · PDF 4쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
R(x)=CTψ˙(Cx)\nabla R(x)=C^{\mathsf T}\dot\psi_{\cdot}(Cx)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 real regularizer 빈칸 완성 식별자: MAI-P4-193

; component constants와 vector bound는

원자료 빈칸의 완성식 · PDF 4쪽

노름은 여러 성분을 하나의 크기로 요약
Lf=C2,Lh=CT2=C2L_f=\|C\|_2,\qquad L_h=\|C^{\mathsf T}\|_2=\|C\|_2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 real regularizer 빈칸 완성 식별자: MAI-P4-194

,

원자료 빈칸의 완성식 · PDF 4쪽

노름은 여러 성분을 하나의 크기로 요약
ψ˙(u)ψ˙(v)22Lψ˙2uv22\|\dot\psi_{\cdot}(u)-\dot\psi_{\cdot}(v)\|_2^2\le L_{\dot\psi}^{2}\|u-v\|_2^2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 real regularizer 빈칸 완성 식별자: MAI-P4-195

; 최종 regularizer-gradient constant는

원자료 빈칸의 완성식 · PDF 4쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
LRC22Lψ˙=CTC2Lψ˙L_{\nabla R}\le\|C\|_2^2L_{\dot\psi}=\|C^{\mathsf T}C\|_2L_{\dot\psi}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Fair potential → chain rule → regularizer Lipschitz bound

δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
CC전체 클래스 수 또는 행렬—문맥 확인
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 4쪽 · Fair potential과 real regularizer 빈칸 완성 식별자: MAI-P4-196

이다. Ldotψ≤1일 때 source MCQ의 선택지는 C다.

#Preconditioning 빈칸 완성

Coordinate-change answer는

원자료 빈칸의 완성식 · PDF 7쪽

수식의 역할과 기호만 확인하기
GD on ΨP(z)=Ψ(Tz)PGD on Ψ(x) with P=TTT\text{GD on }\Psi_P(z)=\Psi(Tz)\quad\Longleftrightarrow\quad\text{PGD on }\Psi(x)\text{ with }P=TT^{\mathsf T}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
P()P(\cdot)사건의 확률
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · Preconditioning 빈칸 완성 식별자: MAI-P4-197

, unitary diagonalization은

원자료 빈칸의 완성식 · PDF 7쪽

수식의 역할과 기호만 확인하기
P=QDQH,D0,QHQ=IP=QDQ^{\mathsf H},\qquad D\succ0,\quad Q^{\mathsf H}Q=I
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Preconditioning and exact line-search orthogonality

ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 7쪽 · Preconditioning 빈칸 완성 식별자: MAI-P4-198

이다.

#Complex notation의 transpose 및 proof-end 교정

Complex least-squares stationarity에는 transpose가 아니라 Hermitian transpose가 필요하므로

수학적 교정식 · PDF 8쪽

수식의 역할과 기호만 확인하기
AH(Axy)=0A^{\mathsf H}(Ax-y)=0
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · Complex notation의 transpose 및 proof-end 교정 식별자: MAI-P4-199

이 맞다. single-term proof 마지막은

수학적 교정식 · PDF 8쪽

수식의 역할과 기호만 확인하기
r(x+ϵd)f(vHx)=r(x)r(x+\epsilon d)\le f(|v^{\mathsf H}x|)=r(x)
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 8쪽 · Complex notation의 transpose 및 proof-end 교정 식별자: MAI-P4-200

로 교정한다. real symmetric derivative의 빈칸은

원자료 빈칸의 완성식 · PDF 9쪽

수식의 역할과 기호만 확인하기
d(z)=ω(z)z=ψ˙(z)(zR, ψ˙ odd)d(z)=\omega(|z|)z=\dot\psi(z)\qquad(z\in\mathbb{R},\ \dot\psi\text{ odd})
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · Complex notation의 transpose 및 proof-end 교정 식별자: MAI-P4-201

이다.

#General inverse form 및 line-search exercise 완성

Equation (12)의 blank는

원자료 빈칸의 완성식 · PDF 10쪽

수식의 역할과 기호만 확인하기
Ψ(x)=i=1Ifi(Bix)\Psi(x)=\sum_{i=1}^{I}f_i(B_ix)
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

General inverse problem: cached products make line search cheap

Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · General inverse form 및 line-search exercise 완성 식별자: MAI-P4-202

, normalized Fair potential의 MCQ answer는

원자료 빈칸의 완성식 · PDF 10쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
f2(v)=βr(v),Lf2=βLψ˙=βf_2(v)=\beta r(v),\qquad L_{\nabla f_2}=\beta L_{\dot\psi}=\beta
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

General inverse problem: cached products make line search cheap

Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · General inverse form 및 line-search exercise 완성 식별자: MAI-P4-203

로 B다.

#PCG의 “quadratic convergence” 문구 분리

원자료 문구는 generic numerical-analysis terminology의 quadratic convergence와 혼동될 수 있다. 안전한 교정은

수학적 교정식 · PDF 11쪽

커널은 특징공간을 직접 만들지 않고 두 입력의 내적·유사도를 계산
For an N-dimensional SPD quadratic, exact-arithmetic CG terminates in at most N steps; the generic rate is governed by κ1κ+1.\text{For an }N\text{-dimensional SPD quadratic, exact-arithmetic CG terminates in at most }N\text{ steps; the generic rate is governed by }\frac{\sqrt\kappa-1}{\sqrt\kappa+1}.
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

비선형 관계를 선형모델이 사용할 수 있는 유사도 점수로 어떻게 바꾸는가?

한 줄 핵심

두 입력의 거리 또는 특징공간 내적을 계산해 스칼라 유사도 κ(u,v)를 만든다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    두 입력의 차이를 구한다

    r=uvr=u-v
  2. 2

    거리 제곱을 계산한다

    r22\lVert r\rVert_2^2
  3. 3

    커널 폭으로 나눈다

    r22/(2σ2)\lVert r\rVert_2^2/(2\sigma^2)
  4. 4

    음의 지수함수로 유사도를 만든다

    κ(u,v)=euv2/(2σ2)\kappa(u,v)=e^{-\lVert u-v\rVert^2/(2\sigma^2)}

Worked example

숫자로 직접 계산 — RBF 커널

u=[0,0], v=[1,1], σ=1이다.

  1. 1

    거리 제곱

    (01)2+(01)2=2(0-1)^2+(0-1)^2=2
  2. 2

    지수

    e2/(212)=e10.368e^{-2/(2\cdot1^2)}=e^{-1}\approx0.368

결과: 두 점의 RBF 유사도는 약 0.368이다.

Sanity check

검산 포인트
  • u=v이면 RBF 커널은 1이다.
  • σ가 너무 작으면 거의 모든 다른 점이 0에 가깝고, 너무 크면 모두 비슷해진다.

Symbols

이 식에 실제로 나온 기호
기호의미
κ\kappa두 입력의 유사도를 반환하는 커널
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 11쪽 · PCG의 “quadratic convergence” 문구 분리 식별자: MAI-P4-204

이다.

#객관식 및 OGM recurrence 교정

Heterogeneous units example의 answer는

원자료 빈칸의 완성식 · PDF 12쪽

수식의 역할과 기호만 확인하기
E: None of these\boxed{E:\ \text{None of these}}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · 객관식 및 OGM recurrence 교정 식별자: MAI-P4-205

; fixed-coefficient FO answer는

원자료 빈칸의 완성식 · PDF 13쪽

수식의 역할과 기호만 확인하기
D: PGD, FGM\boxed{D:\ \mathrm{PGD,\ FGM}}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

구조 해설
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 13쪽 · 객관식 및 OGM recurrence 교정 식별자: MAI-P4-206

; ε complexity는

원자료 빈칸의 완성식 · PDF 14쪽

수식의 역할과 기호만 확인하기
Ψ(x(n))Ψ(x)=O(n2)ϵn=O(ϵ1/2)\Psi(x^{(n)})-\Psi(x^*)=O(n^{-2})\le\epsilon\quad\Longrightarrow\quad n=O(\epsilon^{-1/2})
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · 객관식 및 OGM recurrence 교정 식별자: MAI-P4-207

; OGM final-horizon line의 인덱스는

수학적 교정식 · PDF 14쪽

수식의 역할과 기호만 확인하기
θ(n)={1,n=0,1+1+4(θ(n1))22,n=1,,N1,1+1+8(θ(N1))22,n=N,\theta^{(n)}=\begin{cases}1,&n=0,\\\frac{1+\sqrt{1+4(\theta^{(n-1)})^2}}2,&n=1,\ldots,N-1,\\\frac{1+\sqrt{1+8(\theta^{(N-1)})^2}}2,&n=N,\end{cases}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · 객관식 및 OGM recurrence 교정 식별자: MAI-P4-208

로 교정한다.

#Logistic regression mapping 완성

Equation (21)은 True\boxed{\text{True}}; exact mapping은

원자료 빈칸의 완성식 · PDF 17쪽

시그모이드는 실수 점수를 0과 1 사이 값으로 압축
I=2,B1=VT,B2=I,f1(u)=m=1Mψ(um),f2(v)=β2v22I=2,\quad B_1=V^{\mathsf T},\quad B_2=I,\quad f_1(u)=\sum_{m=1}^{M}\psi(u_m),\quad f_2(v)=\frac\beta2\|v\|_2^2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

선형 점수를 확률처럼 해석 가능한 값으로 어떻게 바꾸는가?

한 줄 핵심

점수 z에 음수를 붙여 지수함수를 계산하고 1+e^{-z}의 역수를 취한다.

Formula-specific lesson

Logistic regression: margin, surrogate curvature, gradient, L bound

2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    선형 점수 z를 계산한다

    z=wTx+bz=w^Tx+b
  2. 2

    음의 지수값을 계산한다

    eze^{-z}
  3. 3

    1을 더한다

    1+ez1+e^{-z}
  4. 4

    역수를 취한다

    σ(z)=1/(1+ez)\sigma(z)=1/(1+e^{-z})

Worked example

숫자로 직접 계산 — z=2일 때

양의 점수가 어느 정도의 출력으로 변하는지 본다.

  1. 1

    지수

    e20.1353e^{-2}\approx0.1353
  2. 2

    분모

    1+0.1353=1.13531+0.1353=1.1353
  3. 3

    역수

    1/1.13530.8811/1.1353\approx0.881

결과: 출력은 약 0.881이다.

Sanity check

검산 포인트
  • z=0이면 정확히 0.5다.
  • 큰 양수에서는 1, 큰 음수에서는 0에 가까워진다.

Symbols

이 식에 실제로 나온 기호
기호의미
\sum지정된 항을 모두 더하는 연산

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 17쪽 · Logistic regression mapping 완성 식별자: MAI-P4-210

이다.

#마지막 strict-subset 질문

허용되는 f_i가 임의의 Lipschitz-gradient function이면 I=1, B₁=I로 모든 Ψ를 표현할 수 있으므로

원자료 빈칸의 완성식 · PDF 18쪽

수식의 역할과 기호만 확인하기
I=1,B1=I,f1=ΨFalseI=1,\quad B_1=I,\quad f_1=\Psi\quad\Longrightarrow\quad\boxed{\text{False}}
쉽게 설명 핵심 설명

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 18쪽 · 마지막 strict-subset 질문 식별자: MAI-P4-211

다. 구조를 더 제한할 때에만 proper subset이 된다.

#2026-08-18 최신 연구 업데이트

아래는 2025 lecture source가 아니다. 강의자료의 GD–FGM–OGM 축을 2026-08-18까지의 peer-reviewed/official proceedings와 공개 preprint로 확장하며, source claim과 섞지 않는다.

#1. Worst-case analysis는 손계산에서 PEP/SDP 기반의 algorithm design으로 확장됐다

Drori–Teboulle의 Performance Estimation Problem(PEP)은 ‘주어진 oracle model에서 최악의 함수·iterate는 무엇인가’를 optimization problem으로 바꾼다. 원 논문은 smooth convex first-order methods의 tight analysis와 step-coefficient design을 제시했고, PEPit은 gradient/prox/projection oracle을 포함한 분석을 Python과 SDP로 자동화한다.

2025년 Numerical Design of Optimized First-Order Algorithms은 PEP를 사용해 memoryless/full-memory coefficients를 수치적으로 설계한다. 즉 Part IV의 OGM은 끝점이 아니라, function class·oracle·metric·horizon을 명시해 algorithm 자체를 최적화하는 연구 프로그램의 한 사례다.

반드시 구분할 것: PEP가 제공하는 것은 명시된 가정 아래의 worst-case certificate다. stochastic noise, mixed precision, finite batch, distributed communication을 추가하면 새로운 PEP 또는 별도의 stability model이 필요하다.

#2. Acceleration은 O(1/k²)만이 아니라 oscillation·restart·monotonicity를 함께 본다

FGM/OGM은 objective value가 매번 감소하지 않을 수 있다. Adaptive Restart for Accelerated Gradient Schemes는 function/gradient-based restart로 과도한 momentum의 oscillation을 감지한다. Restarts Subject to Approximate Sharpness는 2025년 공개된 parameter-free restart 분석으로 sharpness가 근사적으로만 알려진 상황까지 확장한다.

실무 gate는 단일 best theoretical rate가 아니라 objective spike, gradient norm, validation metric, restart count, wall-clock, numerical overflow를 함께 본다. accelerated method를 선택할 때 ‘몇 iteration인가’와 ‘한 iteration이 얼마나 비싸고 안정적인가’를 분리해야 한다.

#3. 대규모 모델 optimizer는 diagonal adaptivity, low-rank state, matrix geometry로 분화됐다

Adam 계열의 element-wise moment만이 유일한 선택은 아니다. ICLR 2025의 SPAM은 gradient spike를 감지해 momentum reset과 clipping을 결합하고, LDAdam은 low-dimensional gradient statistics와 projection-aware state transport로 optimizer-memory를 줄인다.

ICLR 2026의 Muon Outperforms Adam in Tail-End Associative Memory Learning은 Muon의 matrix update가 더 isotropic한 singular spectrum을 만들고 heavy-tailed associative-memory task의 tail class 학습에 유리하다는 분석을 보고한다. 이는 Part IV의 preconditioning 관점을 neural-network matrix geometry로 확장한 사례지만, 모든 architecture·dataset에서의 보편적 우월성을 뜻하지는 않는다.

#4. Nonconvex·distributed setting에서는 guarantee의 목표가 달라진다

Deep-network training은 일반적으로 convex minimizer guarantee가 아니라 stationarity, gradient norm, stochastic variance, communication complexity를 본다. BnB-PEP은 convex/nonconvex method design을 branch-and-bound로 다루고, ICLR 2026의 Error Feedback for Muon and Friends는 non-Euclidean matrix optimizer를 stochastic/distributed compression과 연결한다.

따라서 lecture의 0 < α < 2/L theorem을 그대로 LLM training에 이식하면 안 된다. objective class, norm geometry, stochastic oracle, optimizer state, distributed operator를 먼저 명시해야 한다.

#5. Second/high-order methods는 iteration 수와 per-step cost의 Pareto 문제다

ICLR 2025의 OPTAMI는 high-order convex methods의 global superlinear analysis와 PyTorch implementation을 제시한다. Hessian 또는 higher-order information은 iteration complexity를 줄일 수 있지만, derivative construction, linear solve, memory, accelerator mapping이 비싸다.

결론적으로 optimizer 선택은 GD·FGM·OGM·Adam·Muon·Newton 중 하나를 이름으로 고르는 문제가 아니다. curvature access, batch noise, matrix shape, memory budget, communication, horizon, target accuracy를 포함한 quality–cost–stability Pareto optimization이다.

#핵심 키워드

  • L-smoothness — gradient 변화량을 input 변화량으로 제한하는 first-order regularity.
  • Performance Estimation Problem(PEP) — algorithm의 worst-case performance를 SDP 등으로 계산·설계하는 framework.
  • Restart — momentum을 reset해 accelerated method의 oscillation과 local mismatch를 줄이는 mechanism.
  • Preconditioning — 좌표·norm geometry를 바꾸어 curvature anisotropy와 condition number를 줄이는 설계.
  • Matrix optimizer — parameter matrix의 singular spectrum 또는 non-Euclidean norm을 직접 반영하는 update family.
  • Optimizer-state efficiency — moment/preconditioner state의 memory와 communication을 줄이는 설계.

#연구 질문

  1. PEP로 설계한 finite-horizon optimizer가 stochastic mini-batch·mixed precision에서도 동일한 ranking을 유지하는가?
  2. Restart trigger를 objective/gradient/validation 신호 중 무엇으로 정의할 때 wall-clock과 final generalization이 가장 안정적인가?
  3. Diagonal Adam, low-rank adaptive method, Muon-style matrix geometry를 같은 compute·memory budget에서 어떻게 공정하게 비교할 것인가?

Adversarial review · source-preserving corrections

추가 적대적 검토 교정

아래 식은 PDF 원문을 덮어쓰지 않는다. 검토에서 수학적 문제가 확인된 원문 ID는 source-suspect 상태로 그대로 남기고, 각 교정식은 별도 ID와 corrects 링크를 가진다.

수학적 교정식 · PDF 5쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
Ψ(x(k))Ψ(x^)Lx(0)x^222k(k1)\Psi(x^{(k)})-\Psi(\widehat{x})\le\frac{L\|x^{(0)}-\widehat{x}\|_2^2}{2k}\qquad(k\ge1)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

GD step size, anisotropy, and corrected worst-case scaling

2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 5쪽 · Adversarial review correction — GD bound scaling 식별자: MAI-P4-212

수학적 교정식 · PDF 9쪽

노름은 여러 성분을 하나의 크기로 요약
ρ(C)=C2={2,N even,2cos ⁣(π2N),N odd,ρ(C)2\rho(C)=\|C\|_2=\begin{cases}2,&N\text{ even},\\2\cos\!\left(\frac{\pi}{2N}\right),&N\text{ odd},\end{cases}\qquad\rho(C)\to2
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

벡터·오차가 원점에서 얼마나 큰가?

한 줄 핵심

L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    각 성분을 제곱한다

    음수와 양수를 모두 양의 기여도로 바꾼다.

  2. 2

    제곱값을 모두 더한다

    ixi2\sum_i x_i^2
  3. 3

    노름이면 제곱근을 취한다

    x2=ixi2\lVert x\rVert_2=\sqrt{\sum_i x_i^2}
  4. 4

    제곱 노름인지 구분한다

    x22=ixi2\lVert x\rVert_2^2=\sum_i x_i^2

Worked example

숫자로 직접 계산 — 3-4-5 벡터

가장 익숙한 피타고라스 예시다.

  1. 1

    벡터

    x=[3,4]Tx=[3,4]^T
  2. 2

    제곱합

    32+42=9+16=253^2+4^2=9+16=25
  3. 3

    제곱근

    25=5\sqrt{25}=5

결과: 따라서 ||x||₂=5, ||x||₂²=25다.

Sanity check

검산 포인트
  • 노름은 항상 0 이상이다.
  • 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.

Symbols

이 식에 실제로 나온 기호
기호의미
CC전체 클래스 수 또는 행렬—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · Adversarial review correction — periodic first difference 식별자: MAI-P4-213

수학적 교정식 · PDF 12쪽

경사하강법은 현재값에서 기울기의 반대 방향으로 한 걸음 이동
P1/2(x(k+1)x)2P1/2(x(k)x)2(xarg minΨ)\|P^{-1/2}(x^{(k+1)}-x^*)\|_2\le\|P^{-1/2}(x^{(k)}-x^*)\|_2\qquad(x^*\in\operatorname*{arg\,min}\Psi)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?

한 줄 핵심

현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.

Formula-specific lesson

S-Lipschitz PGD: anisotropic norm, decrease, and rate

S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    현재 손실의 기울기를 계산한다

    gk=J(wk)g_k=\nabla J(w_k)
  2. 2

    이동량을 정한다

    Δw=αgk\Delta w=\alpha g_k
  3. 3

    증가 방향의 반대로 이동한다

    wk+1=wkαgkw_{k+1}=w_k-\alpha g_k
  4. 4

    새 손실을 확인하고 반복한다

    학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.

Worked example

숫자로 직접 계산 — 한 번의 업데이트

f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.

  1. 1

    기울기

    g=2(53)=4g=2(5-3)=4
  2. 2

    이동량

    αg=0.14=0.4\alpha g=0.1\cdot4=0.4
  3. 3

    업데이트

    wnew=50.4=4.6w_{new}=5-0.4=4.6
  4. 4

    손실 비교

    f(5)=4,f(4.6)=2.56f(5)=4,\qquad f(4.6)=2.56

결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.

Sanity check

검산 포인트
  • 마이너스 부호가 있는지 확인한다.
  • 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 12쪽 · Adversarial review correction — PGD Fejer monotonicity 식별자: MAI-P4-214

수학적 교정식 · PDF 13쪽

수식의 역할과 기호만 확인하기
β(n)=t(n)1t(n+1)0,t(0)=1β(0)=0\beta^{(n)}=\frac{t^{(n)}-1}{t^{(n+1)}}\ge0,\qquad t^{(0)}=1\Longrightarrow\beta^{(0)}=0
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 13쪽 · Adversarial review correction — FGM initial momentum 식별자: MAI-P4-215

수학적 교정식 · PDF 14쪽

수식의 역할과 기호만 확인하기
hn+1,k={t(n)1t(n+1)hn,k,k=0,,n2,t(n)1t(n+1)(hn,n11),k=n1,1+t(n)1t(n+1),k=n,h_{n+1,k}=\begin{cases}\frac{t^{(n)}-1}{t^{(n+1)}}h_{n,k},&k=0,\ldots,n-2,\\\frac{t^{(n)}-1}{t^{(n+1)}}(h_{n,n-1}-1),&k=n-1,\\1+\frac{t^{(n)}-1}{t^{(n+1)}},&k=n,\end{cases}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

유도 단계 동기화
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 14쪽 · Adversarial review correction — FGM coefficient indexing 식별자: MAI-P4-216

수학적 교정식 · PDF 15쪽

수식의 역할과 기호만 확인하기
t(0)=1,t(n+1)=1+1+4(t(n))22t(n)n+22,(t(n))2(n+2)24t^{(0)}=1,\quad t^{(n+1)}=\frac{1+\sqrt{1+4(t^{(n)})^2}}2\quad\Longrightarrow\quad t^{(n)}\ge\frac{n+2}{2},\quad (t^{(n)})^2\ge\frac{(n+2)^2}{4}
쉽게 설명 핵심 설명 · 수식별 학습 장면

이 식이 답하는 질문

이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?

한 줄 핵심

별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.

Formula-specific lesson

FGM → OGM: recurrence, momentum, and worst-case constants

같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Symbols

이 식에 실제로 나온 기호
기호의미
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 15쪽 · Adversarial review correction — Nesterov recurrence bound 식별자: MAI-P4-217

수학적 교정식 · PDF 5쪽

MSE는 잔차를 만들고 제곱하고 평균내는 3단계 계산
Ψ(x(k))Ψ(x^)Lx(0)x^222max{12kαL+1,(1αL)2k}\Psi(x^{(k)})-\Psi(\widehat{x})\le\frac{L\|x^{(0)}-\widehat{x}\|_2^2}{2}\max\left\{\frac{1}{2k\alpha L+1},(1-\alpha L)^{2k}\right\}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?

한 줄 핵심

예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.

Formula-specific lesson

GD step size, anisotropy, and corrected worst-case scaling

2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    예측값을 계산한다

    선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.

    y^=Xw\hat y=Xw
  2. 2

    잔차를 계산한다

    r=y^yr=\hat y-y
  3. 3

    잔차를 제곱한다

    부호를 없애고 큰 오차를 더 크게 반영한다.

    ri2r_i^2
  4. 4

    모두 더해 샘플 수로 나눈다

    MSE=1Li=1Lri2\mathrm{MSE}=\frac{1}{L}\sum_{i=1}^{L}r_i^2

Worked example

숫자로 직접 계산 — 두 샘플 MSE

정답과 예측을 직접 비교한다.

  1. 1

    정답·예측

    y=[3,1],y^=[2,4]y=[3,1],\quad\hat y=[2,4]
  2. 2

    잔차

    y^y=[1,3]\hat y-y=[-1,3]
  3. 3

    제곱

    [1,3]2=[1,9][-1,3]^2=[1,9]
  4. 4

    평균

    (1+9)/2=5(1+9)/2=5

결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.

Sanity check

검산 포인트
  • 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
  • MSE 단위는 원래 출력 단위의 제곱이다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 5쪽 · Adversarial review correction — normalized GD step 식별자: MAI-P4-218

수학적 교정식 · PDF 9쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
LfTT2T2LΨ=P2LΨL_{\nabla f}\le\|T^{\mathsf T}\|_2\|T\|_2L_{\nabla\Psi}=\|P\|_2L_{\nabla\Psi}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 9쪽 · Adversarial review correction — transformed Lipschitz bound 식별자: MAI-P4-219

수학적 교정식 · PDF 10쪽

기울기는 변수를 조금 움직였을 때 손실이 변하는 방향과 세기
0<αf<2P2LΨ2Lf0<\alpha_f<\frac{2}{\|P\|_2L_{\nabla\Psi}}\le\frac{2}{L_{\nabla f}}
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면

이 식이 답하는 질문

각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?

한 줄 핵심

각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.

Formula-specific lesson

Complex descent, finite-difference spectrum, and safe fixed step

periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.

직접 조작
현재 수식의 정확한 ID와 유도 단계에 맞춘 학습 장면을 불러오는 중입니다.

Calculation walkthrough

계산 과정
중간 계산을 생략하지 않음
  1. 1

    미분할 변수를 정한다

    다른 변수는 상수로 취급한다.

  2. 2

    합·곱·연쇄법칙을 적용한다

    복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.

  3. 3

    각 편미분을 한 벡터로 모은다

    f=[f/x1,,f/xN]T\nabla f=[\partial f/\partial x_1,\ldots,\partial f/\partial x_N]^T
  4. 4

    현재 값에 대입한다

    기울기의 숫자와 부호를 얻는다.

Worked example

숫자로 직접 계산 — 1차원 손실의 기울기

목표값 3에서 멀어진 정도를 제곱한 손실이다.

  1. 1

    함수

    f(w)=(w3)2f(w)=(w-3)^2
  2. 2

    미분

    f(w)=2(w3)f'(w)=2(w-3)
  3. 3

    w=5 대입

    f(5)=2(53)=4f'(5)=2(5-3)=4

결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.

Sanity check

검산 포인트
  • 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
  • 상수항의 미분은 0이다.

Symbols

이 식에 실제로 나온 기호
기호의미
α\alpha학습률·혼합계수·쌍대계수
\nabla각 변수 방향의 미분값을 모은 기울기
LL샘플 수 또는 손실함수—문맥 확인

Reference-quality follow-up

같은 계산을 더 깊게 확인할 레퍼런스
PDF 10쪽 · Adversarial review correction — conservative transformed step 식별자: MAI-P4-220

Connect