机器学习_感知机

模型函数

y=sign(wTx+b)={+1,wTx+b≥0−1,wTx+b<0 y = sign(w^{T}x+b) = \begin{cases} +1, \quad w^{T}x+b \geq 0 \\ -1, \quad w^{T}x+b < 0 \\ \end{cases} y=sign(wTx+b)={+1,wTx+b≥0−1,wTx+b<0

损失函数

任意样本点到分离超平面的距离可按如下方式计算

di=∣w1x1+w2x2+⋯+wnxn+b∣w12+w22+⋯+wn2=∣w1x1+w2x2+⋯+wnxn+b∣∣∣w∣∣=∣wTxi+b∣∣∣w∣∣ \begin{split} d_i &= \cfrac{|w_1x_1+w_2x_2+\cdots+w_nx_n+b|}{\sqrt{w_1^2+w_2^2+\cdots+w_n^2}} \\ &= \cfrac{|w_1x_1+w_2x_2+\cdots+w_nx_n+b|}{||w||} \\ &= \cfrac{|w^Tx_i+b|}{||w||} \\ \end{split} di=w12+w22+⋯+wn2 ∣w1x1+w2x2+⋯+wnxn+b∣=∣∣w∣∣∣w1x1+w2x2+⋯+wnxn+b∣=∣∣w∣∣∣wTxi+b∣

将所有被当前超平面误分类的样本点记为集合MMM,则这些点到超平面的距离总和为

L(w,b)=∑xi∈M∣wTxi+b∣∣∣w∣∣=1∣∣w∣∣∑xi∈M∣wTxi+b∣ L(w,b) = \sum_{x_i \in M} \cfrac{|w^Tx_i+b|}{||w||} = \cfrac{1}{||w||} \sum_{x_i \in M} |w^Tx_i+b| L(w,b)=xi∈M∑∣∣w∣∣∣wTxi+b∣=∣∣w∣∣1xi∈M∑∣wTxi+b∣

因为数据点误分类时,yi(wTxi+b)<0y_i(w^Tx_i+b)<0yi(wTxi+b)<0,所以可以简化损失函数L(w,b)L(w,b)L(w,b)如下

L(w,b)=1∣∣w∣∣∑xi∈M−yi(wTxi+b)=∑xi∈M−yi(wTxi+b) L(w,b) = \cfrac{1}{||w||} \sum_{x_i \in M} -y_i(w^Tx_i+b) = \sum_{x_i \in M} -y_i(w^Tx_i+b) L(w,b)=∣∣w∣∣1xi∈M∑−yi(wTxi+b)=xi∈M∑−yi(wTxi+b)

目标函数

定义感知机模型目标函数,即当L(w)L(w)L(w)取最小值时www是多少

w∗,b∗=arg⁡min⁡w,bL(w,b)=arg⁡min⁡w,b∑xi∈M−yi(wTxi+b) w^{*},b^{*} = \mathop{\arg\min}\limits_{w,b} L(w,b) = \mathop{\arg\min}\limits_{w,b} \sum_{x_i \in M} -y_i(w^Tx_i+b) w∗,b∗=w,bargminL(w,b)=w,bargminxi∈M∑−yi(wTxi+b)

权重更新表达式

损失函数对www求导得出www的梯度向量

∇wL(w,b)=∂∂wL(w,b)=∂∂w∑xi∈M−yi(wTxi+b)=∑xi∈M∂∂w−yi(wTxi+b)=∑xi∈M−yixi \begin{split} \nabla_w L(w,b) &= \cfrac{\partial}{\partial w} L(w,b) \\ &= \cfrac{\partial}{\partial w} \sum_{x_i \in M} -y_i(w^Tx_i+b) \\ &= \sum_{x_i \in M}\cfrac{\partial}{\partial w} -y_i(w^Tx_i+b) \\ &= \sum_{x_i \in M} -y_ix_i \\ \end{split} ∇wL(w,b)=∂w∂L(w,b)=∂w∂xi∈M∑−yi(wTxi+b)=xi∈M∑∂w∂−yi(wTxi+b)=xi∈M∑−yixi

损失函数对bbb求导得出bbb的梯度向量

∇bL(w,b)=∂∂bL(w,b)=∂∂b∑xi∈M−yi(wTxi+b)=∑xi∈M∂∂b−yi(wTxi+b)=∑xi∈M−yi \begin{split} \nabla_b L(w,b) &= \cfrac{\partial}{\partial b} L(w,b)\\ &= \cfrac{\partial}{\partial b} \sum_{x_i \in M} -y_i(w^Tx_i+b)\\ &= \sum_{x_i \in M}\cfrac{\partial}{\partial b} -y_i(w^Tx_i+b)\\ &= \sum_{x_i \in M} -y_i\\ \end{split} ∇bL(w,b)=∂b∂L(w,b)=∂b∂xi∈M∑−yi(wTxi+b)=xi∈M∑∂b∂−yi(wTxi+b)=xi∈M∑−yi

使用小批量梯度下降法求解www

w:=w−η∇wL(w,b):=w−η∑xi∈M−yixi:=w+η∑xi∈Myixi \begin{split} w :&= w - \eta \nabla_w L(w,b) \\ :&= w - \eta \sum_{x_i \in M} -y_ix_i \\ :&= w + \eta \sum_{x_i \in M} y_ix_i \\ \end{split} w:::=w−η∇wL(w,b)=w−ηxi∈M∑−yixi=w+ηxi∈M∑yixi

使用小批量梯度下降法求解bbb

b:=b−η∇bL(w,b):=b−η∑xi∈M−yi:=b+η∑xi∈Myi \begin{split} b :&= b - \eta \nabla_b L(w,b) \\ :&= b - \eta \sum_{x_i \in M} -y_i \\ :&= b + \eta \sum_{x_i \in M} y_i \\ \end{split} b:::=b−η∇bL(w,b)=b−ηxi∈M∑−yi=b+ηxi∈M∑yi

使用随机梯度下降法求解www

w:=w−η∇wL(w,b):=w−η(−yixi):=w+ηyixi \begin{split} w :&= w - \eta \nabla_w L(w,b) \\ :&= w - \eta(-y_ix_i) \\ :&= w + \eta y_ix_i \\ \end{split} w:::=w−η∇wL(w,b)=w−η(−yixi)=w+ηyixi

使用随机梯度下降法求解bbb

b:=b−η∇bL(w,b):=b−η(−yi):=b+ηyi \begin{split} b :&= b - \eta \nabla_b L(w,b) \\ :&= b - \eta(-y_i) \\ :&= b + \eta y_i \\ \end{split} b:::=b−η∇bL(w,b)=b−η(−yi)=b+ηyi

相关推荐
罗西的思考6 小时前
机器人模型(WM / WAM / VLA)综合分析与对比:从「看」到「想」再到「做」
人工智能·算法·机器学习
猎头南楼8 小时前
大模型后训练与 Agent 自迭代:两类工程能力的观察
人工智能·深度学习·机器学习
Zzj_tju10 小时前
VLM 读图评测:先审计评分器,再判断读错还是算错
人工智能·深度学习·机器学习·语言模型
七灵微12 小时前
【AI】代码实战- 基于时间序列的轴承检测1
人工智能·机器学习·ai·pandas·matplotlib
Jared_devin13 小时前
单头、多头 Self-Attention可视化
人工智能·pytorch·深度学习·算法·机器学习·pycharm
天国梦13 小时前
同步课本单词APP怎么选?实测3款才知道真实差距
人工智能·机器学习
来让爷抱一个13 小时前
2026 CFG引导实战:八帧跳跃不许跑偏,百智云精灵图把条件契约写进素材包
人工智能·机器学习
pen-ai14 小时前
【优化方法】最小二乘:从误差平方到线性与非线性拟合
人工智能·算法·机器学习
YOLO数据集集合14 小时前
洪水场景建筑与植被检测数据集 | 洪水检测 建筑识别 植被监测 灾情评估 目标检测9073期
人工智能·目标检测·机器学习·计算机视觉·目标跟踪·无人机视角·灾害救援
Q264336502314 小时前
【有源码】基于机器学习的电信网络诈骗话术语义识别与可视化分析系统 XGBoost算法+Hadoop+Spark
大数据·hadoop·算法·机器学习·spark·毕业设计·课程设计