해석 · 개념 허브깊이 읽기

신경망 보편 근사 정리

Universal Approximation Theorem

AD 198920세기 미국 (사이번코)

개념

적절한 활성화 함수를 쓴 충분히 넓은 단일 은닉층 신경망이 컴팩트 영역의 연속함수를 원하는 정확도로 근사할 수 있다는 존재 정리. 학습 가능성·필요한 폭·데이터 일반화까지 보장하지는 않는다.

한 호흡으로 이해하기

"단 한 층의 신경망도 어떤 연속함수든 임의 정밀도로 근사할 수 있다." 1989년 시벤코 정리. 딥러닝이 작동하는지에 대한 첫 수학적 보장. 충분히 크면 표현력은 무한 — 그러나 얼마나 커야 하는지 답은 아직 없다(딥러닝 이론의 미해결 문제).

한눈에 보기

-4-202400.20.40.60.81
σ(x) = 1/(1+e^(-x))σ(3x) — 더 가파른 단계x: 활성화 함수 시그모이드

핵심 식

fC([0,1]n),  ϕ(x)=iciσ(wix+bi):  fϕ<ε\forall f \in C([0,1]^n),\; \exists\, \phi(x) = \sum_i c_i \sigma(w_i \cdot x + b_i):\; \|f - \phi\|_\infty < \varepsilon

단층 신경망 = 만능 근사기

핵심 순간

AD 1989

사이번코 — 시그모이드 함수의 정리

조지 사이번코가 시그모이드 활성화 함수를 가진 단일 은닉층 신경망의 보편 근사성 증명.

AD 1991

호닉 — 더 넓은 활성화 함수 조건

비다항 활성화 등 더 일반적인 조건에서 조밀한 근사 결과를 정리해 정리의 적용 범위를 넓혔다.

AD 2017

깊이와 표현 효율 연구

특정 함수·구조에서는 깊은 네트워크가 얕은 네트워크보다 훨씬 적은 단위로 표현할 수 있다는 결과들이 나왔다. 모든 문제에서 깊이가 우월하다는 단일 정리는 아니다.

오늘날의 응용

신경망의 표현 능력을 이해하는 출발점이며 함수 근사·가치 함수·미분방정식 근사와 연결된다. 실제 딥러닝의 최적화와 일반화는 별도의 이론이 필요하다.

MathVoyage 너머로

불러오는 중…