通用近似原理及证明-为什么神经网络可以拟合任意函数

​ 通用近似定理(Universal Approximation Theorem)表明:

​ 一个至少有一个隐藏层的神经网络【输入层-隐藏层-输出层】,同时要求激活函数有挤压性质,如 Sigmoid 函数、ReLU 函数,且输出层是线性的。这样的神经网络在隐藏层神经元足够多的情况下,能以任意的精度去近似任何连续函数。

证明:

Step1. 问题定义:设F是一个定义在n维单位立方体 0 , 1 n 0,1^n 0,1n上的连续函数族, C ( 0 , 1 n ) C(0,1^n) C(0,1n)表示上的连续函数空间,对于 f ∈ F f \in F f∈F,我们希望用一个神经网络来逼近这个函数。

Step2. 构造单层前馈神经网络:输入 x = ( x 1 , x 2 , ⋯   , x n ) ∈ 0 , 1 n x = (x_1, x_2, \cdots, x_n) \in 0, 1^n x=(x1,x2,⋯,xn)∈0,1n,输出为y,隐藏层有m个神经元,激活函数为 σ \sigma σ,输出层为线性函数y, w i w_i wi是输出权重, v i , j v_{i,j} vi,j是输入权重, b i b_i bi是偏置,则输出函数可表示为,其实 w i w_i wi是我们的要学习的参数
y = ∑ i = 1 m w i σ ( ∑ j = 1 n v i j x j + b i ) y = \sum_{i = 1}^{m} w_{i} \sigma \left( \sum_{j = 1}^{n} v_{ij} x_{j}+b_{i} \right) y=i=1∑mwiσ(j=1∑nvijxj+bi)

Step3. 构造损失函数:
E = ∫ 0 , 1 n ( y − f ( x ) ) 2 d x E = \int_{0,1^n} (y - f(x))^2 dx E=∫0,1n(y−f(x))2dx

Step4. Weierstrass 逼近定理表明对于任意给定的在闭区间上连续的函数,可以用 多项式函数 来逼近。由于激活函数 σ \sigma σ是连续的, ∀ ϵ > 0 , ∃ p ( x ) , s.t. ∣ σ ( x ) − p ( x ) ∣ < ϵ , ∀ x ∈ R \forall \epsilon > 0, \exists p(x) \text{ }, \text{ s.t. }|\sigma(x)-p(x)|<\epsilon, \forall x\in\mathbb{R} ∀ϵ>0,∃p(x) , s.t. ∣σ(x)−p(x)∣<ϵ,∀x∈R

​ 进而化简误差函数和目标函数:
y = ∑ i = 1 m w i p ( ∑ j = 1 n v i j x j + b i ) E = ∫ 0 , 1 n ( ∑ i = 1 m w i p ( ∑ j = 1 n v i j x j + b i ) − f ( x ) ) 2 d x y = \sum_{i = 1}^{m} w_{i}p(\sum_{j = 1}^{n} v_{ij}x_{j}+b_{i}) \\ E = \int_{0,1^n} \left( \sum_{i = 1}^{m} w_{i}p \left( \sum_{j = 1}^{n} v_{ij}x_{j}+b_{i} \right) - f(x) \right)^2 dx y=i=1∑mwip(j=1∑nvijxj+bi)E=∫0,1n(i=1∑mwip(j=1∑nvijxj+bi)−f(x))2dx

Step5. 由于 f f f是连续函数, p p p是多项式函数,所以函数 ∑ i = 1 m w i p ( ∑ j = 1 n v i j x j + b i ) − f ( x ) \sum_{i = 1}^{m} w_{i}p\left(\sum_{j = 1}^{n} v_{ij}x_{j}+b_{i}\right)-f(x) ∑i=1mwip(∑j=1nvijxj+bi)−f(x)是连续函数。根据连续函数在闭区间上的性质(Weierstrass逼近定理),对于任意的 ϵ > 0 \epsilon > 0 ϵ>0,存在一个正数 M M M,使得对于所有的 x ∈ 0 , 1 n x\in 0, 1^{n} x∈0,1n
∣ ∑ i = 1 m w i p ( ∑ j = 1 n v i j x j + b i ) − f ( x ) ∣ < ϵ 2 \left|\sum_{i = 1}^{m} w_{i}p\left(\sum_{j = 1}^{n} v_{ij}x_{j}+b_{i}\right)-f(x)\right| < \frac{\epsilon}{2} i=1∑mwip(j=1∑nvijxj+bi)−f(x) <2ϵ

​ 绝对值小于,则去绝对值号可得到 ∫ 0 , 1 n ( f ( x ) − f ( x ′ ) )   d x < ϵ 2 \int_{0,1^n} (f(x) - f(x')) \, dx < \frac{\epsilon}{2} ∫0,1n(f(x)−f(x′))dx<2ϵ 得证。其实本质就是根据微分法将定义域区间划分为若干的小立方体,那么在每个小立方体上都可以用一个多项式函数 p i p_i pi来逼近 f ( x ) f(x) f(x)在该小立方体的上取值,将这些多项式函数组合即可得到y。

Step6. 最终可以使得对于所有的 x ∈ 0 , 1 n x \in 0, 1^n x∈0,1n,有 ∣ y − f ( x ) ∣ < ϵ \vert y - f(x) \vert < \epsilon ∣y−f(x)∣<ϵ,其中 ϵ \epsilon ϵ是一个任意小的正数,表示逼近的精度。得证神经网络可以以任意精度逼近任意非线性函数。

相关推荐
武子康3 分钟前
Agent 的工具没变,SGLang 缓存为什么没命中?
人工智能·llm·agent
hyunbar7775 分钟前
LangChain 实战:Agent 4类结构化输出方式
人工智能
咖啡星人k8 分钟前
2026 可观测性实战:把观测契约写进SPEC,MonkeyCode 云端跑通
人工智能·机器学习
阿里云大数据AI技术9 分钟前
基于阿里云Milvus 知识库服务,快速搭建智能客服问答系统实践
人工智能·agent
RAOY的AI笔记11 分钟前
GPT-6 Astra开发指南:API调用、工具使用与AI Agent应用思路
大数据·人工智能·gpt
Code_Artist20 分钟前
从 Tool Calling 到能力编排:重新理解 Agent Skill 的运行机制——以 tRPC-Agent-Go 为例
人工智能·openai·agent
geneculture23 分钟前
融智学视域下的心灵哲学范式重审--行为主义、功能主义与中文屋论证的融智学对照分析 (高级科普 · 学术论文)
人工智能·信息科学·融智学的重要应用·哲学与科学统一性·融智时代(杂志)·心智哲学重审·中文屋论题
chuntian_tester26 分钟前
AI自动化第3步【用例设计】
人工智能·测试工具·ai·自动化
科技每日热闻29 分钟前
中国企业出海开展业务,如何挑选可安全合规使用国际大模型的云平台?Amazon Bedrock 在同一平台完成国际模型接入、区域选择与合规治理
大数据·人工智能·安全·ai
xiongmosy34 分钟前
从“移动的家”到“可居住的空间”:小米澎程正在重新定义“车”能做什么
人工智能