혼합 소보레프 공간에서의 얕은 신경망 근사 연구
Shallow neural network approximation in mixed Sobolev spaces
arXiv본 연구는 얕은 신경망(shallow neural network)이 복잡한 함수 공간인 혼합 소보레프 공간의 함수를 얼마나 잘 근사하는지 이론적으로 분석했습니다.
- 활성화 함수와 무관하게, 전역적인 근사율은 목표 함수의 매끄러움($\alpha$)과 활성화 특성($\rho$) 중 작은 값으로 결정되는 원리를 확립했습니다.
- 이는 신경망 모델의 성능을 수학적으로 예측할 수 있는 이론적 기반을 제공하여, 복잡한 함수 근사가 필요한 분야 설계에 중요한 지침이 됩니다.
- 구체적으로 $\mathrm{ReLU}^k$는 최적 근사 지수가 $\min\{\alpha, k+1\}$로 결정되며, 모든 결과는 로그 인자(logarithmic factors)가 포함될 수 있습니다.
본 연구는 일반적인 활성화 함수를 사용하는 $n$개의 뉴런을 가진 얕은 신경망(shallow neural network)이 혼합 소보레프 공간(mixed Sobolev spaces)의 함수를 얼마나 잘 근사하는지, 특히 $L_2$ 근사 관점에서 조사했습니다. 연구진은 이 과정에서 활성화 함수의 특성과 목표 함수의 매끄러움 사이의 관계를 이론적으로 분석하였습니다.
활성화 함수에 독립적인 푸리에 블록 원리(Fourier-block principle)가 확립되었습니다. 이 원리에 따르면, 만약 특정 활성화 함수가 단변수 근사 차원 $\rho$를 가진다면, 전역적인 근사율은 목표 함수의 매끄러움($\alpha$)과 해당 활성화 특성($\rho$) 중 작은 값인 $\min\{\alpha,\rho\}$에 의해 결정됩니다. 이 결과는 명시적인 로그 인자(logarithmic factors)를 포함할 수 있습니다.
구체적인 활성화 함수에 대한 검증을 통해 여러 최적 근사 지수가 도출되었습니다. 예를 들어, $\mathrm{ReLU}^k$의 경우 모든 차원에서 최적 대수 근사 지수는 $\min\{\alpha, k+1\}$로 확인되었으며, 이는 카디널 B-스플라인 및 소프트-$\mathrm{ReLU}^k$에도 적용됩니다. 반면, ELU와 코사인 활성화 함수는 목표 함수의 전체 혼합 매끄러움 차원인 $\alpha$를 근사 지수로 제공하는 것으로 나타났습니다.