완전성 계약(Completeness contract)
이 글은5_Ch4-General-purpose gradient-based opt(1).pdf19 / 19쪽을 기준으로 작성했다. 번호식뿐 아니라 번호 없는 표시식, 의미 있는 인라인 수학, 표·그림·캡션, 객관식·??·공란, 각주·참고문헌, 판독 가능한 손글씨를 원장에 연결했다. 원문 빈칸·오류 의심 표기는 보존하고 완성식과 교정식은 별도 상태로 등록한다.
세 층을 섞지 않는다.
① 2025 PDF 원자료 재구성, ② 편집·수학 검증, ③ 2026-08-18 최신 연구 업데이트를 분리한다.
#원장 현황
- PDF: 19 / 19쪽
- PDF SHA-256:
23272c39a5ad9c0dddf24eb7d42fdebe8575344f74bac3de761b7844fd81e58c - 전체 수식 record: 211개
- source-derived 수식: 188개
- display formula: 110개, inline formula: 101개
- content record: 151개
- figures/tables: 10개
- handwritten annotations: 17개
- editorial completion/correction: 23개
#PDF 원자료 재구성
#4. 범용 기울기 기반 최적화 방법(General-purpose gradient-based optimization methods)
비제약 최적화는 비용함수(cost function) 의 최소화 문제
원자료 수식 · PDF 1쪽 · 식 (1)
쉽게 설명 핵심 설명
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
에서 시작한다. 초기 추정 을 정한 뒤 반복열 을 만들고, 어떤 norm에서 가 되기를 기대한다.
강의자료는 응용에 따라 실수 또는 복소수 공간을 함께 다루기 위해 를 사용한다. 이 장의 중심은 convex하고 gradient가 Lipschitz continuous인 smooth objective이며, least-squares는 그 특수한 경우다.
#동기 응용: edge-preserving image recovery
측정모델은 이고, data fidelity와 convex smooth regularizer를 결합해
원자료 수식 · PDF 1쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
를 푼다. 정규화항은 transform coefficient마다 potential을 더하는 의 형태다.
11×11 uniform blur
additive noise · 60 dB blurred SNR
edge-preserving recovery
smooth convex regularization + gradient method
강의 주석 — PDF p.1. 우측 필기에서 등고선, gradient 방향, step size와 Lipschitz constant를 연결하는 짧은 메모가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#4.1 Lipschitz 연속성(Lipschitz continuity)
함수 에 대해 어떤 유한한 이 존재하여
원자료 수식 · PDF 2쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Lipschitz 곱: 반례와 bounded-product bound
x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
을 만족하면 Lipschitz continuous라 한다. 가능한 상수 중 가장 작은 값을 best Lipschitz constant라고 하며, 자료는 특별한 언급이 없으면 Euclidean norm을 사용한다.
이하에서 f와 g의 best constants를 로 둔다.
- Scaling:
- Translation:
- Addition:
- Composition:
- Affine transformation:
- Multiplication:
자료는 두 Lipschitz 함수의 곱도 전체 실수축에서 항상 Lipschitz인지 True/False로 묻고 답을 비운다.
원자료 표기 확인 필요 · PDF 2쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Lipschitz 곱: 반례와 bounded-product bound
x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
곱에 대한 충분조건과 proof도 빈칸 상태로 제시된다.
원자료 표기 확인 필요 · PDF 2쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Lipschitz 곱: 반례와 bounded-product bound
x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
원자료 표기 확인 필요 · PDF 2쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Lipschitz 곱: 반례와 bounded-product bound
x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
원자료 표기 확인 필요 · PDF 2쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Lipschitz 곱: 반례와 bounded-product bound
x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
다음 페이지는 boundedness가 필요한 조건인지 다시 묻는다.
강의 주석 — PDF p.2. 곱의 차이를 한 항씩 더하고 빼서 triangle inequality를 적용하는 proof 방향과 boundedness 표시가 손으로 보강되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#Smooth function: Lipschitz-continuous gradient
이 장에서 smooth function은 differentiable하고 gradient가
원자료 수식 · PDF 3쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Gradient Lipschitz ↔ Hessian spectral bound
같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
을 만족하는 함수다. 복소수 공간의 derivative는 더 미묘하므로 이 정의는 우선 실수공간에 둔다.
Least-squares 예제 의 gradient는 이며,
원자료 수식 · PDF 3쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Gradient Lipschitz ↔ Hessian spectral bound
같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
에서
원자료 수식 · PDF 3쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Gradient Lipschitz ↔ Hessian spectral bound
같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 표준편차 또는 시그모이드 표기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
을 얻는다.
두 번 미분 가능하고 Hessian spectral norm이
원자료 수식 · PDF 3쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Gradient Lipschitz ↔ Hessian spectral bound
같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
처럼 bounded이면 gradient Lipschitz의 충분조건이다. Taylor integral form
원자료 수식 · PDF 3쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Gradient Lipschitz ↔ Hessian spectral bound
같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
과 norm bound
원자료 수식 · PDF 3쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Gradient Lipschitz ↔ Hessian spectral bound
같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
가 proof를 이룬다. 자료는 이 조건이 sufficient이지만 necessary는 아니라고 명시한다.
Quadratic examples로 와 rank-one form , ,
원자료 수식 · PDF 3쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Gradient Lipschitz ↔ Hessian spectral bound
같은 quadratic Hessian에서 gradient-difference ratio와 λmax를 비교하고, PDF의 z=[1,2] rank-one Hessian 예제 ||2zzᵀ||₂=10을 직접 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
을 제시한다.
강의 주석 — PDF p.3. least-squares gradient, Hessian의 spectral norm, singular value와 eigenvalue 관계를 따라가는 필기가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#Fair potential과 edge-preserving regularizer
Fair potential은
원자료 수식 · PDF 4쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이며,
원자료 수식 · PDF 4쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
,
원자료 수식 · PDF 4쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
을 만족한다. 원점 근처에서는 roughly quadratic, 큰 |x|에서는 |x|처럼 증가하고, 두 번째 도함수가 nonnegative라 convex다.
자료는 potential 자체도 Lipschitz continuous인지 로 질문한다.
Regularizer gradient와 그 Lipschitz constant를 합성함수로 계산하는 exercise는
원자료 표기 확인 필요 · PDF 4쪽 · 식 (2)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 지정된 항을 모두 더하는 연산 | |
| 전체 클래스 수 또는 행렬—문맥 확인 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
에서 시작해 ,
원자료 표기 확인 필요 · PDF 4쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
,
원자료 표기 확인 필요 · PDF 4쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 지정된 항을 모두 더하는 연산 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
,
원자료 표기 확인 필요 · PDF 4쪽 · 식 (3)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
,
원자료 표기 확인 필요 · PDF 4쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 전체 클래스 수 또는 행렬—문맥 확인 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
의 빈칸을 남긴다.
강의 주석 — PDF p.4. Fair potential 그래프에는 quadratic regime와 edge-preserving 성질을 연결하는 메모가 있고, regularizer exercise 옆에는 chain rule 순서가 표시되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#4.2 Smooth convex 함수의 gradient descent
가정은 finite minimizer , Lipschitz gradient , 그리고 step size 이다. 이때 iteration은
원자료 수식 · PDF 5쪽 · 식 (4)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
GD step size, anisotropy, and corrected worst-case scaling
2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다.
자료가 열거하는 properties는 cost monotonicity , minimizer까지 거리의 monotonicity , minimizer convergence다. 에서는
원자료 표기 확인 필요 · PDF 5쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
GD step size, anisotropy, and corrected worst-case scaling
2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
을 제시하고, 같은 bound가 에도 성립할 것이라는 conjecture를 적는다.
Convergence rate는 objective gap , gradient norm , iterate error 를 global/local하게 본다. fixed step α=1/L인 GD의 tight worst-case objective bound는
원자료 표기 확인 필요 · PDF 5쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
GD step size, anisotropy, and corrected worst-case scaling
2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이고, Nesterov FGM은 rate를 갖는다.
느린 example은 least-squares에서 , 를 사용한다. optimal fixed step을 써도 길쭉한 level set 때문에 iteration이 zig-zag한다. 자료는 acceleration의 두 실무 방향으로 preconditioner와 line search를 제시한다.
강의 주석 — PDF p.5. O(1/k)와 O(1/k²) 비교, condition number가 큰 타원에서 zig-zag가 생긴다는 메모가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#4.3 Preconditioned steepest descent(PSD)와 PGD
PSD는 negative preconditioned gradient , one-dimensional line search , update
원자료 수식 · PDF 6쪽 · 식 (5)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
를 결합한다.
Quadratic case에는 analytic line search 가 가능하다. 이면 strict decrease가 필요한 경우 를 얻지만, nonquadratic objective에서는 매 iteration의 line search 비용이 생긴다.
Exact line search의 first-order condition은
원자료 수식 · PDF 6쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 | |
| 특정 변수에 대한 편미분 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이므로 다음 gradient와 현재 search direction이 orthogonal하다. inexact line search라면 approximate orthogonality만 기대한다.
Fixed-step PGD는
원자료 수식 · PDF 6쪽 · 식 (6)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
다. 와 coordinate change 를 쓰면 원문 문제를
원자료 수식 · PDF 6쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 사건의 확률 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 바꾼다.
강의 주석 — PDF p.6. line search 후 gradient와 search direction이 직교한다는 표시, FGM/OGM은 L을 알면 line search가 필요 없다는 메모가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
Chain rule을 적용한 transformed-coordinate GD는
원자료 수식 · PDF 7쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이며, T를 곱하면 PGD가 된다. 자료는 이 동일성을 로 비워 둔다.
Least-squares에서는 α=1과 을 택하면 이고, 따라서 를 ideal preconditioner로 해석한다. 좋은 preconditioner는 level set을 거의 spherical하게 만드는 좌표계를 뜻한다.
#Descent direction
Definition 4.5는 local decrease를
원자료 수식 · PDF 7쪽 · 식 (7)
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 정의하며 d=0도 degenerate descent direction이다. 실수공간에서 앞 절의 positive-definite P 조건 아래 nonzero
원자료 수식 · PDF 7쪽 · 식 (8)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
가 descent direction이고, proof sketch는
원자료 수식 · PDF 7쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다.
대표 선택은 positive diagonal 과
원자료 표기 확인 필요 · PDF 7쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. 후자는 circulant 구조일 때 FFT로 P-gradient product를 빠르게 계산할 수 있다고 설명한다.
강의 주석 — PDF p.7. elliptical level set을 circular하게 만드는 coordinate transform, ideal inverse-Hessian preconditioner, unitary diagonalization 표시가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#Descent direction: complex case
는 holomorphic하지 않지만, positive-definite P에 대해
원자료 수식 · PDF 8쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
가 descent direction이다. 자료는 complex case의 를 derivative라기보다 negative descent direction을 만드는 gradient-like quantity로 사용한다. 이어 stationary equation을 라고 인쇄한다.
#4.4 Complex edge-preserving regularizer의 descent direction
Complex regularizer는
원자료 수식 · PDF 8쪽 · 식 (9)
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 지정된 항을 모두 더하는 연산 | |
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
다. f는 real-valued, nondecreasing on nonnegative arguments, differentiable이고, 가 t=0에서도 well-defined이며 를 만족한다고 가정한다. Fair potential에는 가 된다.
Claim은
원자료 수식 · PDF 8쪽 · 식 (10)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
가 descent direction이라는 것이다. intuition은 이다.
한 row에 대한 proof는 , contraction
원자료 수식 · PDF 8쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
, step interval 을 사용한다. 마지막 비교는 원자료에 로 적혀 있다.
강의 주석 — PDF p.8. Wirtinger/complex derivative를 직접 쓰지 않고 negative descent direction으로 gradient notation을 재사용한다는 메모와 Hermitian transpose 표시가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#Complex descent field의 Lipschitz constant와 practical bound
자료는 를 로 분해한다. real argument에서 를 비우고, complex argument에는 numerical evidence에 기반한 conjecture , 를 제시한다. 이는 원자료의 연구 중 진술로 보존하며 정리로 격상하지 않는다.
1D finite difference가 periodic이면 circulant/normal이라 spectral radius
원자료 표기 확인 필요 · PDF 9쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
를 쓸 수 있다. nonperiodic boundary에는
원자료 수식 · PDF 9쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
과 convenient 1-norm bound
원자료 수식 · PDF 9쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
를 사용하여 practical choice 를 얻는다.
Preconditioned fixed step을 정하기 위해 transformed objective , gradient , Lipschitz bound
원자료 표기 확인 필요 · PDF 9쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
을 계산한다.
강의 주석 — PDF p.9. finite-difference matrix의 periodic/circulant 구조, spectral radius ≈2, matrix 1-norm으로 4를 얻는 계산이 손으로 보강되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
Transformed-coordinate GD를 x-space로 옮기면
원자료 수식 · PDF 10쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이며, valid fixed step은
원자료 표기 확인 필요 · PDF 10쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. 따라서 preconditioning을 써도 반드시 line search로 갈 필요는 없다.
#4.5 General inverse problems with efficient line search
대표 inverse problem은
원자료 수식 · PDF 10쪽 · 식 (11)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
General inverse problem: cached products make line search cheap
Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 지정된 항을 모두 더하는 연산 | |
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이고, 이를 포함하는 general form은 원자료에서
원자료 표기 확인 필요 · PDF 10쪽 · 식 (12)
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
General inverse problem: cached products make line search cheap
Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 비워 둔다. 각 B_i는 M_i×N, 각 f_i는 보통 convex다.
Special case mapping은
원자료 수식 · PDF 10쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
General inverse problem: cached products make line search cheap
Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이며, Fair potential일 때 f₂ gradient의 best constant를
원자료 표기 확인 필요 · PDF 10쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
General inverse problem: cached products make line search cheap
Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 전체 클래스 수 또는 행렬—문맥 확인 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 묻는다.
Naive line search 는 매 trial마다 B_i product를 반복한다. 미리 products를 계산하면
원자료 수식 · PDF 10쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
General inverse problem: cached products make line search cheap
Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 지정된 항을 모두 더하는 연산 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
가 되고, outer iteration의 update를 곱해
원자료 수식 · PDF 10쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
General inverse problem: cached products make line search cheap
Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 재사용한다. 이 simplification에서 line derivative의 Lipschitz constant는 B_i operator norm을 직접 필요로 하지 않는다.
강의 주석 — PDF p.10. B_i x와 B_i d를 line search 전에 cache하고 다음 iteration에서 recursive update하라는 계산 흐름이 표시되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#4.6 Convergence rates
Local strict convexity와 twice differentiability 아래에서 PGD·PSD·PCG의 asymptotic behavior를
원자료 수식 · PDF 11쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
, root convergence factor , preconditioned Hessian/condition number 로 정리한다.
자료는 이어 라고 서술하고, 위 ρ가 lower bound와 맞는다고 적는다.
강의 주석 — PDF p.11. κ=100에서 0.99·0.98·0.82를 비교하며 preconditioning과 PCG의 이점을 강조하는 표시가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#Generalized S-Lipschitz PGD analysis
Definition 4.7은
원자료 수식 · PDF 11쪽 · 식 (13)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
으로 anisotropic smoothness를 정의하고, 에서 classic condition을 회복한다. Theorem 4.8은 matrix condition
원자료 수식 · PDF 11쪽 · 식 (14)
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
아래의 PGD
원자료 수식 · PDF 11쪽 · 식 (15)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
에 대해 decrease
원자료 수식 · PDF 11쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
와 gradient norm convergence를 준다.
P가 SPD이면 condition은 이고 weighted distance 가 감소한다. 는 MM method와 같으며 classical bound
원자료 수식 · PDF 12쪽 · 식 (16)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
, 2014 tight bound
원자료 수식 · PDF 12쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
를 제시한다. Huber-like function이 tight example이다.
서로 다른 physical units를 가진 diagonal A example에서 scalar Lipschitz constant의 단위를
원자료 표기 확인 필요 · PDF 12쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 전체 클래스 수 또는 행렬—문맥 확인 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 묻는다.
#Generalized Nesterov fast gradient method(FGM)
Generalized FGM은 , , 를 결합한
원자료 수식 · PDF 12쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. 모든 t=1이면 ordinary GD가 되며, convex S-Lipschitz objective에서
원자료 수식 · PDF 12쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
의 O(1/k²) worst-case rate를 얻는다. quadratic in R^N에서는 CG가 exact arithmetic에서 N iterations 내 종료할 수 있어 worst-case bound가 개별 application을 과도하게 비관할 수 있다고 덧붙인다.
Second-order baseline으로 Newton update
원자료 수식 · PDF 12쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
을 제시하지만, large-scale problem에서는 Hessian formation/inversion이 impractical해 first-order methods에 초점을 둔다.
강의 주석 — PDF p.12. O(1/k)와 O(1/k²) bound, momentum, Newton의 Hessian inverse 비용을 비교하는 필기가 보인다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#4.7 Accelerated first-order methods
General first-order class는
원자료 수식 · PDF 13쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
, fixed-coefficient FO class는
원자료 수식 · PDF 13쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 지정된 항을 모두 더하는 연산 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
다. 어떤 algorithms가 FO인지
원자료 표기 확인 필요 · PDF 13쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 묻는다.
Barzilai–Borwein method은 , , 를 묶은
원자료 수식 · PDF 13쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. GFO에는 속하지만 coefficients가 trajectory에 의존하므로 fixed-step FO에는 속하지 않는다.
자료가 제시하는 research questions는 주어진 coefficients의 convergence rate 분석, coefficients 최적화, fast recursion, L에 독립적인 universal design, 그리고 GFO가 얼마나 더 나아질 수 있는지다.
#Nesterov FGM1의 recursive/FO 표현
Nesterov iteration은 usual GD step , momentum factor , update , 를 가진
원자료 수식 · PDF 13쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. Implementation은 recursive하지만 analysis에서는 FO coefficient form으로 펼칠 수 있다.
강의 주석 — PDF p.13. FO/GFO 포함관계, Barzilai–Borwein step이 과거 iterate와 gradient 차이를 이용한다는 표시가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
FGM1의 fixed-step coefficients는
원자료 표기 확인 필요 · PDF 14쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이며, 자료는 n=0…5에 대한 lower-triangular numerical coefficient matrix를 함께 보여 준다.
Primary sequence bound는
원자료 수식 · PDF 14쪽 · 식 (17)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
, Nesterov worst-function lower bound는
원자료 수식 · PDF 14쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
, secondary sequence bound는
원자료 수식 · PDF 14쪽 · 식 (18)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. 두 upper bounds는 asymptotically tight하지만 leading constant gap은 개선 여지를 남긴다.
ε-accuracy에 필요한 iteration complexity를
원자료 표기 확인 필요 · PDF 14쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 묻는다.
#Optimized gradient method(OGM)
D. Kim이 optimized coefficients
원자료 수식 · PDF 14쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
와 horizon-dependent θ recurrence
원자료 표기 확인 필요 · PDF 14쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
를 제시한다. Analytical bound
원자료 수식 · PDF 14쪽 · 식 (19)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
는 O(1/N²)이지만 FGM의 leading constant보다 factor 2 개선된다.
강의 주석 — PDF p.14. FGM coefficient matrix와 OGM의 새 final-horizon coefficient가 비교되어 있고, ε complexity 질문 옆에 square-root 표시가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
Efficient OGM recursion은 GD step , horizon-aware , two-momentum update
원자료 수식 · PDF 15쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. 마지막 새 momentum을 제거하면 Nesterov FGM으로 되돌아간다. 단점은 final bound를 위해 N을 미리 정해야 한다는 점이다.
Primary sequence는
원자료 수식 · PDF 15쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. newer OGM’은 standard recurrence 와 over-relaxed gradient + FGM momentum
원자료 수식 · PDF 15쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
를 사용해 N을 미리 정하지 않는다. 자료는 도 각주로 제시한다.
자료의 intuition은 over-relaxed gradient multiplier가 라는 것이다.
#OGM의 GFO worst-case optimality
OGM은 fixed-step class 에서 optimized h를 사용해
원자료 수식 · PDF 16쪽 · 식 (20)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
을 만족한다. Drori는 dimension d>N인 large-scale setting의 GFO class 전체에 대해 lower bound
원자료 수식 · PDF 16쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
를 보였다. 따라서 이 oracle model 안에서 OGM의 worst-case complexity가 optimal하다고 설명한다.
Huber-like worst case
Quadratic worst case
강의 주석 — PDF p.16. OGM이 fixed-step FO뿐 아니라 GFO oracle model에서도 worst-case optimal하다는 “optimal” 강조와 Huber/quadratic 두 worst-case 경로가 표시되어 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
두 worst-case families에는
원자료 수식 · PDF 17쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
가 성립한다. 하지만 일반적으로 FGM/OGM은
원자료 수식 · PDF 17쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이며, bound가 k에 따라 감소한다고 실제 iterate cost가 monotone인 것은 아니다.
#4.8 Machine learning: Binary classification with logistic regression
Feature vectors v_m∈R^N, labels y_m∈{±1}, regularization β>0에 대해
원자료 수식 · PDF 17쪽 · 식 (21)
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
Logistic regression: margin, surrogate curvature, gradient, L bound
2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 지정된 항을 모두 더하는 연산 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
를 최소화한다.
원하는 classifier margin은
원자료 수식 · PDF 17쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
Logistic regression: margin, surrogate curvature, gradient, L bound
2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이며, sign(⟨x,v_m⟩)을 class decision으로 사용한다.
Logistic surrogate는 , derivative , curvature
원자료 수식 · PDF 17쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
선형 점수를 확률처럼 해석 가능한 값으로 어떻게 바꾸는가?
한 줄 핵심
점수 z에 음수를 붙여 지수함수를 계산하고 1+e^{-z}의 역수를 취한다.
Formula-specific lesson
Logistic regression: margin, surrogate curvature, gradient, L bound
2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.
Calculation walkthrough
계산 과정
- 1
선형 점수 z를 계산한다
- 2
음의 지수값을 계산한다
- 3
1을 더한다
- 4
역수를 취한다
Worked example
숫자로 직접 계산 — z=2일 때
양의 점수가 어느 정도의 출력으로 변하는지 본다.
- 1
지수
- 2
분모
- 3
역수
결과: 출력은 약 0.881이다.
Sanity check
검산 포인트
- z=0이면 정확히 0.5다.
- 큰 양수에서는 1, 큰 음수에서는 0에 가까워진다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
라 gradient Lipschitz constant 계산이 가능하다.
Surrogate losses
Decision boundary update
General inverse form과의 대응은
원자료 표기 확인 필요 · PDF 17쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
선형 점수를 확률처럼 해석 가능한 값으로 어떻게 바꾸는가?
한 줄 핵심
점수 z에 음수를 붙여 지수함수를 계산하고 1+e^{-z}의 역수를 취한다.
Formula-specific lesson
Logistic regression: margin, surrogate curvature, gradient, L bound
2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.
Calculation walkthrough
계산 과정
- 1
선형 점수 z를 계산한다
- 2
음의 지수값을 계산한다
- 3
1을 더한다
- 4
역수를 취한다
Worked example
숫자로 직접 계산 — z=2일 때
양의 점수가 어느 정도의 출력으로 변하는지 본다.
- 1
지수
- 2
분모
- 3
역수
결과: 출력은 약 0.881이다.
Sanity check
검산 포인트
- z=0이면 정확히 0.5다.
- 큰 양수에서는 1, 큰 음수에서는 0에 가까워진다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
,
원자료 표기 확인 필요 · PDF 17쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
선형 점수를 확률처럼 해석 가능한 값으로 어떻게 바꾸는가?
한 줄 핵심
점수 z에 음수를 붙여 지수함수를 계산하고 1+e^{-z}의 역수를 취한다.
Formula-specific lesson
Logistic regression: margin, surrogate curvature, gradient, L bound
2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.
Calculation walkthrough
계산 과정
- 1
선형 점수 z를 계산한다
- 2
음의 지수값을 계산한다
- 3
1을 더한다
- 4
역수를 취한다
Worked example
숫자로 직접 계산 — z=2일 때
양의 점수가 어느 정도의 출력으로 변하는지 본다.
- 1
지수
- 2
분모
- 3
역수
결과: 출력은 약 0.881이다.
Sanity check
검산 포인트
- z=0이면 정확히 0.5다.
- 큰 양수에서는 1, 큰 음수에서는 0에 가까워진다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 비워 두고, 를 정의한다. Gradient와 practical constant는
원자료 수식 · PDF 17쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Logistic regression: margin, surrogate curvature, gradient, L bound
2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다.
Practical notes는 V columns를 unit norm으로 normalize해 exponent overflow를 줄이고, β를 cross-validation으로 tuning하며, convex smooth objective라 FGM/OGM에 적합하다는 것이다. N이 매우 크고 sparse classifier가 필요하면 ℓ₂ regularizer를 ℓ₁으로 바꾸고 FISTA 또는 POGM을 사용하라고 제안한다.
Sparse variant의 regularizer 교체는 이다.
Numerical result는 M=100, N=7 labeled training data에서 initial boundary, optimized final boundary, ideal boundary를 비교한다. 자료 스스로 ‘large scale?’라고 반문한다.
강의 주석 — PDF p.17. logistic·hinge·exponential·0–1 surrogate를 비교하고 V=[y₁v₁,…]로 데이터를 쌓는 메모가 있다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
강의 주석 — PDF p.18. column normalization, cross-validation, sparse ℓ₁ variant를 practical implementation 항목 옆에서 강조한다. 판독이 확정되지 않는 작은 글씨는 추측해 문장으로 만들지 않았다.
#4.9 Summary
이 장은 differentiable unconstrained objective를 위한 gradient-based algorithms를 정리한다. 매 iteration의 gradient computation이 흔히 가장 비싸다.
PSD와 PCG는 line search를 추가로 요구하며, line search 자체도 cost/gradient를 여러 번 평가하는 1D optimization이다. 그러나 equation (12) 구조에서는 §4.5의 cached products와 recursive update로 효율화할 수 있다.
마지막 question은 general form이 모든 Lipschitz-gradient objective의 strict subset인지
원자료 표기 확인 필요 · PDF 18쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 지정된 항을 모두 더하는 연산 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 묻는다.
#강의자료 참고문헌
- R. C. Fair, “On the robust estimation of econometric models,” Annals of Economic and Social Measurement, 1974.
- K. Lange, “Convergence of EM image reconstruction algorithms with Gibbs smoothing,” IEEE Transactions on Medical Imaging, 1990.
- X. Zheng et al., “Sparse-view X-ray CT reconstruction using ℓ1 prior with learned transform,” submitted 2019; arXiv:1711.00905.
- B. T. Polyak, Introduction to Optimization, 1987.
- Y. Drori and M. Teboulle, “Performance of first-order methods for smooth convex minimization: a novel approach,” Mathematical Programming, 2014.
- A. B. Taylor, J. M. Hendrickx, and F. Glineur, “Smooth strongly convex interpolation and exact worst-case performance of first-order methods,” Mathematical Programming, 2017.
- D. Kim and J. A. Fessler, “Optimized first-order methods for smooth convex minimization,” Mathematical Programming, 2016.
- Y. Nesterov, Lectures on Convex Optimization, 2018.
- I. Y. Chun and J. A. Fessler, “Convolutional analysis operator learning: Acceleration and convergence,” IEEE Transactions on Image Processing, 2020.
- J. Barzilai and J. M. Borwein, “Two-point step size gradient methods,” IMA Journal of Numerical Analysis, 1988.
- Y. Nesterov, “A method for unconstrained convex minimization problem with the rate of convergence O(1/k²),” 1983.
- Y. Nesterov, “Smooth minimization of non-smooth functions,” Mathematical Programming, 2005.
- O. Güler, “New proximal point algorithms for convex minimization,” SIAM Journal on Optimization, 1992.
- D. Kim and J. A. Fessler, “On the convergence analysis of the optimized gradient method,” Journal of Optimization Theory and Applications, 2017.
- Y. Drori, “The exact information-based complexity of smooth convex minimization,” Journal of Complexity, 2017.
- A. Beck and M. Teboulle, “A fast iterative shrinkage-thresholding algorithm for linear inverse problems,” SIAM Journal on Imaging Sciences, 2009.
- A. B. Taylor, J. M. Hendrickx, and F. Glineur, “Exact worst-case performance of first-order methods for composite convex optimization,” SIAM Journal on Optimization, 2017.
#편집·수학 검증(Editorial audit)
이 절은 PDF 원문을 덮어쓰지 않는다. 위 source-suspect/blank formula를 그대로 남겨 두고, 아래에서 corrects로 연결한 완성식 또는 교정식을 별도 record로 제공한다.
#Lipschitz 함수의 곱: 전역 명제는 거짓이고 boundedness는 충분조건
Counterexample는
수학적 교정식 · PDF 2쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
입력 x가 결정경계의 어느 쪽에 있는가?
한 줄 핵심
wᵀx+b를 계산해 양수면 한 클래스, 음수면 다른 클래스로 보낸다. 0이면 경계 위다.
Formula-specific lesson
Lipschitz 곱: 반례와 bounded-product bound
x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.
Calculation walkthrough
계산 과정
- 1
특징과 가중치를 같은 위치끼리 곱한다
- 2
모든 곱을 더하고 bias를 더한다
- 3
부호를 확인한다
- 4
필요하면 경계까지 거리를 구한다
Worked example
숫자로 직접 계산 — 한 점 분류하기
w=[1,-2], x=[3,1], b=0.5이다.
- 1
가중합
- 2
클래스
- 3
경계까지 거리
결과: 이 점은 양의 클래스 쪽에 있고 경계에서 약 0.67 떨어져 있다.
Sanity check
검산 포인트
- w와 x의 차원이 같아야 한다.
- 거리에는 |g(x)|가 필요하지만 signed distance는 부호를 유지할 수 있다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
다. |f|≤fmax, |g|≤gmax이면 decomposition
원자료 빈칸의 완성식 · PDF 2쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Lipschitz 곱: 반례와 bounded-product bound
x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
와 bound
원자료 빈칸의 완성식 · PDF 2쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Lipschitz 곱: 반례와 bounded-product bound
x² 반례와 bounded tanh factors를 같은 축에서 비교해 두 Lipschitz 함수의 곱이 항상 Lipschitz라는 명제가 왜 거짓인지, boundedness가 어떤 상수를 주는지 계산한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
가 성립한다. boundedness는 sufficient이지만 necessary는 아니다. 예를 들어 bounded factor 하나와 constant factor의 곱처럼 더 약한 조건에서도 Lipschitz가 될 수 있다.
#Fair potential과 real regularizer 빈칸 완성
Potential 자체의 constant는
원자료 빈칸의 완성식 · PDF 4쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. Real chain rule은
원자료 빈칸의 완성식 · PDF 4쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
; component constants와 vector bound는
원자료 빈칸의 완성식 · PDF 4쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 전체 클래스 수 또는 행렬—문맥 확인 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
,
원자료 빈칸의 완성식 · PDF 4쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
; 최종 regularizer-gradient constant는
원자료 빈칸의 완성식 · PDF 4쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Fair potential → chain rule → regularizer Lipschitz bound
δ를 바꾸며 ψδ, ψ̇δ, ψ̈δ를 같이 보고, first-difference C에서 Cᵀψ̇(Cx), ||C||₂², L∇R bound가 하나의 계산으로 연결되는지 검산한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 전체 클래스 수 또는 행렬—문맥 확인 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다. Ldotψ≤1일 때 source MCQ의 선택지는 C다.
#Preconditioning 빈칸 완성
Coordinate-change answer는
원자료 빈칸의 완성식 · PDF 7쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 사건의 확률 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
, unitary diagonalization은
원자료 빈칸의 완성식 · PDF 7쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Preconditioning and exact line-search orthogonality
ill-conditioned quadratic의 geometry를 P로 구형화하고, d=-P∇Ψ에서 exact line-search α와 다음 gradient의 d-직교성을 계산한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다.
#Complex notation의 transpose 및 proof-end 교정
Complex least-squares stationarity에는 transpose가 아니라 Hermitian transpose가 필요하므로
수학적 교정식 · PDF 8쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이 맞다. single-term proof 마지막은
수학적 교정식 · PDF 8쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 교정한다. real symmetric derivative의 빈칸은
원자료 빈칸의 완성식 · PDF 9쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다.
#General inverse form 및 line-search exercise 완성
Equation (12)의 blank는
원자료 빈칸의 완성식 · PDF 10쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
General inverse problem: cached products make line search cheap
Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 지정된 항을 모두 더하는 연산 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
, normalized Fair potential의 MCQ answer는
원자료 빈칸의 완성식 · PDF 10쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
General inverse problem: cached products make line search cheap
Bᵢx와 Bᵢd를 한 번 계산한 뒤 Bᵢ(x+αd)=zᵢ+αqᵢ로 trial product를 재사용하고 accepted step 뒤 cache update를 검증한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 B다.
#PCG의 “quadratic convergence” 문구 분리
원자료 문구는 generic numerical-analysis terminology의 quadratic convergence와 혼동될 수 있다. 안전한 교정은
수학적 교정식 · PDF 11쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
비선형 관계를 선형모델이 사용할 수 있는 유사도 점수로 어떻게 바꾸는가?
한 줄 핵심
두 입력의 거리 또는 특징공간 내적을 계산해 스칼라 유사도 κ(u,v)를 만든다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
두 입력의 차이를 구한다
- 2
거리 제곱을 계산한다
- 3
커널 폭으로 나눈다
- 4
음의 지수함수로 유사도를 만든다
Worked example
숫자로 직접 계산 — RBF 커널
u=[0,0], v=[1,1], σ=1이다.
- 1
거리 제곱
- 2
지수
결과: 두 점의 RBF 유사도는 약 0.368이다.
Sanity check
검산 포인트
- u=v이면 RBF 커널은 1이다.
- σ가 너무 작으면 거의 모든 다른 점이 0에 가깝고, 너무 크면 모두 비슷해진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 두 입력의 유사도를 반환하는 커널 | |
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다.
#객관식 및 OGM recurrence 교정
Heterogeneous units example의 answer는
원자료 빈칸의 완성식 · PDF 12쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
; fixed-coefficient FO answer는
원자료 빈칸의 완성식 · PDF 13쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
; ε complexity는
원자료 빈칸의 완성식 · PDF 14쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
; OGM final-horizon line의 인덱스는
수학적 교정식 · PDF 14쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
로 교정한다.
#Logistic regression mapping 완성
Equation (21)은 ; exact mapping은
원자료 빈칸의 완성식 · PDF 17쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
선형 점수를 확률처럼 해석 가능한 값으로 어떻게 바꾸는가?
한 줄 핵심
점수 z에 음수를 붙여 지수함수를 계산하고 1+e^{-z}의 역수를 취한다.
Formula-specific lesson
Logistic regression: margin, surrogate curvature, gradient, L bound
2D ±1 samples에서 margin, logistic loss, gradient와 σ(1-σ)≤1/4 curvature를 같은 weights로 계산해 practical Lipschitz bound까지 연결한다.
Calculation walkthrough
계산 과정
- 1
선형 점수 z를 계산한다
- 2
음의 지수값을 계산한다
- 3
1을 더한다
- 4
역수를 취한다
Worked example
숫자로 직접 계산 — z=2일 때
양의 점수가 어느 정도의 출력으로 변하는지 본다.
- 1
지수
- 2
분모
- 3
역수
결과: 출력은 약 0.881이다.
Sanity check
검산 포인트
- z=0이면 정확히 0.5다.
- 큰 양수에서는 1, 큰 음수에서는 0에 가까워진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 지정된 항을 모두 더하는 연산 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
이다.
#마지막 strict-subset 질문
허용되는 f_i가 임의의 Lipschitz-gradient function이면 I=1, B₁=I로 모든 Ψ를 표현할 수 있으므로
원자료 빈칸의 완성식 · PDF 18쪽
쉽게 설명 핵심 설명
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
다. 구조를 더 제한할 때에만 proper subset이 된다.
#2026-08-18 최신 연구 업데이트
아래는 2025 lecture source가 아니다. 강의자료의 GD–FGM–OGM 축을 2026-08-18까지의 peer-reviewed/official proceedings와 공개 preprint로 확장하며, source claim과 섞지 않는다.
#1. Worst-case analysis는 손계산에서 PEP/SDP 기반의 algorithm design으로 확장됐다
Drori–Teboulle의 Performance Estimation Problem(PEP)은 ‘주어진 oracle model에서 최악의 함수·iterate는 무엇인가’를 optimization problem으로 바꾼다. 원 논문은 smooth convex first-order methods의 tight analysis와 step-coefficient design을 제시했고, PEPit은 gradient/prox/projection oracle을 포함한 분석을 Python과 SDP로 자동화한다.
2025년 Numerical Design of Optimized First-Order Algorithms은 PEP를 사용해 memoryless/full-memory coefficients를 수치적으로 설계한다. 즉 Part IV의 OGM은 끝점이 아니라, function class·oracle·metric·horizon을 명시해 algorithm 자체를 최적화하는 연구 프로그램의 한 사례다.
반드시 구분할 것: PEP가 제공하는 것은 명시된 가정 아래의 worst-case certificate다. stochastic noise, mixed precision, finite batch, distributed communication을 추가하면 새로운 PEP 또는 별도의 stability model이 필요하다.
#2. Acceleration은 O(1/k²)만이 아니라 oscillation·restart·monotonicity를 함께 본다
FGM/OGM은 objective value가 매번 감소하지 않을 수 있다. Adaptive Restart for Accelerated Gradient Schemes는 function/gradient-based restart로 과도한 momentum의 oscillation을 감지한다. Restarts Subject to Approximate Sharpness는 2025년 공개된 parameter-free restart 분석으로 sharpness가 근사적으로만 알려진 상황까지 확장한다.
실무 gate는 단일 best theoretical rate가 아니라 objective spike, gradient norm, validation metric, restart count, wall-clock, numerical overflow를 함께 본다. accelerated method를 선택할 때 ‘몇 iteration인가’와 ‘한 iteration이 얼마나 비싸고 안정적인가’를 분리해야 한다.
#3. 대규모 모델 optimizer는 diagonal adaptivity, low-rank state, matrix geometry로 분화됐다
Adam 계열의 element-wise moment만이 유일한 선택은 아니다. ICLR 2025의 SPAM은 gradient spike를 감지해 momentum reset과 clipping을 결합하고, LDAdam은 low-dimensional gradient statistics와 projection-aware state transport로 optimizer-memory를 줄인다.
ICLR 2026의 Muon Outperforms Adam in Tail-End Associative Memory Learning은 Muon의 matrix update가 더 isotropic한 singular spectrum을 만들고 heavy-tailed associative-memory task의 tail class 학습에 유리하다는 분석을 보고한다. 이는 Part IV의 preconditioning 관점을 neural-network matrix geometry로 확장한 사례지만, 모든 architecture·dataset에서의 보편적 우월성을 뜻하지는 않는다.
#4. Nonconvex·distributed setting에서는 guarantee의 목표가 달라진다
Deep-network training은 일반적으로 convex minimizer guarantee가 아니라 stationarity, gradient norm, stochastic variance, communication complexity를 본다. BnB-PEP은 convex/nonconvex method design을 branch-and-bound로 다루고, ICLR 2026의 Error Feedback for Muon and Friends는 non-Euclidean matrix optimizer를 stochastic/distributed compression과 연결한다.
따라서 lecture의 0 < α < 2/L theorem을 그대로 LLM training에 이식하면 안 된다. objective class, norm geometry, stochastic oracle, optimizer state, distributed operator를 먼저 명시해야 한다.
#5. Second/high-order methods는 iteration 수와 per-step cost의 Pareto 문제다
ICLR 2025의 OPTAMI는 high-order convex methods의 global superlinear analysis와 PyTorch implementation을 제시한다. Hessian 또는 higher-order information은 iteration complexity를 줄일 수 있지만, derivative construction, linear solve, memory, accelerator mapping이 비싸다.
결론적으로 optimizer 선택은 GD·FGM·OGM·Adam·Muon·Newton 중 하나를 이름으로 고르는 문제가 아니다. curvature access, batch noise, matrix shape, memory budget, communication, horizon, target accuracy를 포함한 quality–cost–stability Pareto optimization이다.
#핵심 키워드
- L-smoothness — gradient 변화량을 input 변화량으로 제한하는 first-order regularity.
- Performance Estimation Problem(PEP) — algorithm의 worst-case performance를 SDP 등으로 계산·설계하는 framework.
- Restart — momentum을 reset해 accelerated method의 oscillation과 local mismatch를 줄이는 mechanism.
- Preconditioning — 좌표·norm geometry를 바꾸어 curvature anisotropy와 condition number를 줄이는 설계.
- Matrix optimizer — parameter matrix의 singular spectrum 또는 non-Euclidean norm을 직접 반영하는 update family.
- Optimizer-state efficiency — moment/preconditioner state의 memory와 communication을 줄이는 설계.
#연구 질문
- PEP로 설계한 finite-horizon optimizer가 stochastic mini-batch·mixed precision에서도 동일한 ranking을 유지하는가?
- Restart trigger를 objective/gradient/validation 신호 중 무엇으로 정의할 때 wall-clock과 final generalization이 가장 안정적인가?
- Diagonal Adam, low-rank adaptive method, Muon-style matrix geometry를 같은 compute·memory budget에서 어떻게 공정하게 비교할 것인가?
Adversarial review · source-preserving corrections
추가 적대적 검토 교정
아래 식은 PDF 원문을 덮어쓰지 않는다. 검토에서 수학적 문제가 확인된 원문 ID는
source-suspect 상태로 그대로 남기고, 각 교정식은 별도 ID와 corrects
링크를 가진다.
수학적 교정식 · PDF 5쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
GD step size, anisotropy, and corrected worst-case scaling
2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
수학적 교정식 · PDF 9쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
벡터·오차가 원점에서 얼마나 큰가?
한 줄 핵심
L2 노름은 성분을 제곱해 더한 뒤 제곱근을 취한다. 제곱 노름은 마지막 제곱근을 생략한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
각 성분을 제곱한다
음수와 양수를 모두 양의 기여도로 바꾼다.
- 2
제곱값을 모두 더한다
- 3
노름이면 제곱근을 취한다
- 4
제곱 노름인지 구분한다
Worked example
숫자로 직접 계산 — 3-4-5 벡터
가장 익숙한 피타고라스 예시다.
- 1
벡터
- 2
제곱합
- 3
제곱근
결과: 따라서 ||x||₂=5, ||x||₂²=25다.
Sanity check
검산 포인트
- 노름은 항상 0 이상이다.
- 제곱 노름과 노름을 혼동하면 단위와 미분계수가 달라진다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 전체 클래스 수 또는 행렬—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
수학적 교정식 · PDF 12쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
손실을 줄이기 위해 파라미터를 다음에 어디로 옮길 것인가?
한 줄 핵심
현재 파라미터에서 기울기를 계산하고 학습률을 곱한 값을 빼서 다음 파라미터를 만든다.
Formula-specific lesson
S-Lipschitz PGD: anisotropic norm, decrease, and rate
S와 P가 정의하는 geometry에서 generalized PGD를 실행해 objective decrease, weighted Fejér monotonicity, O(1/k)와 O(1/k²) guarantee scale을 비교한다.
Calculation walkthrough
계산 과정
- 1
현재 손실의 기울기를 계산한다
- 2
이동량을 정한다
- 3
증가 방향의 반대로 이동한다
- 4
새 손실을 확인하고 반복한다
학습률이 너무 크면 발산하고 너무 작으면 매우 느리다.
Worked example
숫자로 직접 계산 — 한 번의 업데이트
f(w)=(w-3)², 현재 w=5, 학습률 α=0.1이다.
- 1
기울기
- 2
이동량
- 3
업데이트
- 4
손실 비교
결과: 한 번 이동한 뒤 손실이 4에서 2.56으로 감소했다.
Sanity check
검산 포인트
- 마이너스 부호가 있는지 확인한다.
- 업데이트 전후 손실과 gradient norm을 함께 기록하면 발산을 빨리 발견할 수 있다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
수학적 교정식 · PDF 13쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
수학적 교정식 · PDF 14쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
수학적 교정식 · PDF 15쪽
쉽게 설명 핵심 설명 · 수식별 학습 장면
이 식이 답하는 질문
이 수식이 본문에서 정의하거나 연결하는 대상은 무엇인가?
한 줄 핵심
별도의 실제 계산이나 유도 과정이 없는 수식에는 범용 계산 절차를 덧붙이지 않고, 문맥과 기호만 간결하게 확인한다.
Formula-specific lesson
FGM → OGM: recurrence, momentum, and worst-case constants
같은 quadratic에서 FGM t-recurrence와 OGM extra momentum을 전개하고 β⁽⁰⁾=0, tₙ lower bound, O(1/k²) constant 차이를 확인한다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
수학적 교정식 · PDF 5쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
모델 예측이 정답에서 평균적으로 얼마나 멀리 벗어났는가?
한 줄 핵심
예측−정답 잔차를 구한 뒤 각 잔차를 제곱하고 샘플 수로 나눈다. 큰 오차가 더 강하게 벌점받는다.
Formula-specific lesson
GD step size, anisotropy, and corrected worst-case scaling
2D quadratic에서 αL을 직접 바꾸며 안정구간 0<α<2/L, objective 감소와 review-corrected bounds를 같은 trajectory로 비교한다.
Calculation walkthrough
계산 과정
- 1
예측값을 계산한다
선형회귀라면 Xw 또는 wᵀx로 예측을 만든다.
- 2
잔차를 계산한다
- 3
잔차를 제곱한다
부호를 없애고 큰 오차를 더 크게 반영한다.
- 4
모두 더해 샘플 수로 나눈다
Worked example
숫자로 직접 계산 — 두 샘플 MSE
정답과 예측을 직접 비교한다.
- 1
정답·예측
- 2
잔차
- 3
제곱
- 4
평균
결과: MSE는 5다. 두 번째 샘플의 오차 3이 전체 값을 크게 올린다.
Sanity check
검산 포인트
- 샘플 수로 나눴는지, 단순 제곱합인지 확인한다.
- MSE 단위는 원래 출력 단위의 제곱이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
수학적 교정식 · PDF 9쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up
같은 계산을 더 깊게 확인할 레퍼런스
수학적 교정식 · PDF 10쪽
쉽게 설명 + 계산 과정 4단계 계산 · 숫자 예제 · 검산 포함 · 수식별 학습 장면
이 식이 답하는 질문
각 파라미터를 늘리면 목표값이 얼마나 증가하거나 감소하는가?
한 줄 핵심
각 변수에 대한 편미분을 모아 벡터를 만들고, 최적화에서는 그 반대 방향으로 이동한다.
Formula-specific lesson
Complex descent, finite-difference spectrum, and safe fixed step
periodic first-difference spectrum을 계산하고 odd-N source 오류와 corrected 2cos(π/2N), transformed Lipschitz upper bound와 safe step을 연결한다.
Calculation walkthrough
계산 과정
- 1
미분할 변수를 정한다
다른 변수는 상수로 취급한다.
- 2
합·곱·연쇄법칙을 적용한다
복합함수라면 바깥 미분×안쪽 미분 순서로 계산한다.
- 3
각 편미분을 한 벡터로 모은다
- 4
현재 값에 대입한다
기울기의 숫자와 부호를 얻는다.
Worked example
숫자로 직접 계산 — 1차원 손실의 기울기
목표값 3에서 멀어진 정도를 제곱한 손실이다.
- 1
함수
- 2
미분
- 3
w=5 대입
결과: 양의 기울기 4이므로 w를 줄이는 방향이 손실을 낮춘다.
Sanity check
검산 포인트
- 기울기 벡터의 길이는 파라미터 벡터 길이와 같아야 한다.
- 상수항의 미분은 0이다.
Symbols
이 식에 실제로 나온 기호
| 기호 | 의미 |
|---|---|
| 학습률·혼합계수·쌍대계수 | |
| 각 변수 방향의 미분값을 모은 기울기 | |
| 샘플 수 또는 손실함수—문맥 확인 |
Reference-quality follow-up