机器学习_感知机

模型函数

y=sign(wTx+b)={+1,wTx+b≥0−1,wTx+b<0 y = sign(w^{T}x+b) = \begin{cases} +1, \quad w^{T}x+b \geq 0 \\ -1, \quad w^{T}x+b < 0 \\ \end{cases} y=sign(wTx+b)={+1,wTx+b≥0−1,wTx+b<0

损失函数

任意样本点到分离超平面的距离可按如下方式计算

di=∣w1x1+w2x2+⋯+wnxn+b∣w12+w22+⋯+wn2=∣w1x1+w2x2+⋯+wnxn+b∣∣∣w∣∣=∣wTxi+b∣∣∣w∣∣ \begin{split} d_i &= \cfrac{|w_1x_1+w_2x_2+\cdots+w_nx_n+b|}{\sqrt{w_1^2+w_2^2+\cdots+w_n^2}} \\ &= \cfrac{|w_1x_1+w_2x_2+\cdots+w_nx_n+b|}{||w||} \\ &= \cfrac{|w^Tx_i+b|}{||w||} \\ \end{split} di=w12+w22+⋯+wn2 ∣w1x1+w2x2+⋯+wnxn+b∣=∣∣w∣∣∣w1x1+w2x2+⋯+wnxn+b∣=∣∣w∣∣∣wTxi+b∣

将所有被当前超平面误分类的样本点记为集合MMM,则这些点到超平面的距离总和为

L(w,b)=∑xi∈M∣wTxi+b∣∣∣w∣∣=1∣∣w∣∣∑xi∈M∣wTxi+b∣ L(w,b) = \sum_{x_i \in M} \cfrac{|w^Tx_i+b|}{||w||} = \cfrac{1}{||w||} \sum_{x_i \in M} |w^Tx_i+b| L(w,b)=xi∈M∑∣∣w∣∣∣wTxi+b∣=∣∣w∣∣1xi∈M∑∣wTxi+b∣

因为数据点误分类时,yi(wTxi+b)<0y_i(w^Tx_i+b)<0yi(wTxi+b)<0,所以可以简化损失函数L(w,b)L(w,b)L(w,b)如下

L(w,b)=1∣∣w∣∣∑xi∈M−yi(wTxi+b)=∑xi∈M−yi(wTxi+b) L(w,b) = \cfrac{1}{||w||} \sum_{x_i \in M} -y_i(w^Tx_i+b) = \sum_{x_i \in M} -y_i(w^Tx_i+b) L(w,b)=∣∣w∣∣1xi∈M∑−yi(wTxi+b)=xi∈M∑−yi(wTxi+b)

目标函数

定义感知机模型目标函数,即当L(w)L(w)L(w)取最小值时www是多少

w∗,b∗=arg⁡min⁡w,bL(w,b)=arg⁡min⁡w,b∑xi∈M−yi(wTxi+b) w^{*},b^{*} = \mathop{\arg\min}\limits_{w,b} L(w,b) = \mathop{\arg\min}\limits_{w,b} \sum_{x_i \in M} -y_i(w^Tx_i+b) w∗,b∗=w,bargminL(w,b)=w,bargminxi∈M∑−yi(wTxi+b)

权重更新表达式

损失函数对www求导得出www的梯度向量

∇wL(w,b)=∂∂wL(w,b)=∂∂w∑xi∈M−yi(wTxi+b)=∑xi∈M∂∂w−yi(wTxi+b)=∑xi∈M−yixi \begin{split} \nabla_w L(w,b) &= \cfrac{\partial}{\partial w} L(w,b) \\ &= \cfrac{\partial}{\partial w} \sum_{x_i \in M} -y_i(w^Tx_i+b) \\ &= \sum_{x_i \in M}\cfrac{\partial}{\partial w} -y_i(w^Tx_i+b) \\ &= \sum_{x_i \in M} -y_ix_i \\ \end{split} ∇wL(w,b)=∂w∂L(w,b)=∂w∂xi∈M∑−yi(wTxi+b)=xi∈M∑∂w∂−yi(wTxi+b)=xi∈M∑−yixi

损失函数对bbb求导得出bbb的梯度向量

∇bL(w,b)=∂∂bL(w,b)=∂∂b∑xi∈M−yi(wTxi+b)=∑xi∈M∂∂b−yi(wTxi+b)=∑xi∈M−yi \begin{split} \nabla_b L(w,b) &= \cfrac{\partial}{\partial b} L(w,b)\\ &= \cfrac{\partial}{\partial b} \sum_{x_i \in M} -y_i(w^Tx_i+b)\\ &= \sum_{x_i \in M}\cfrac{\partial}{\partial b} -y_i(w^Tx_i+b)\\ &= \sum_{x_i \in M} -y_i\\ \end{split} ∇bL(w,b)=∂b∂L(w,b)=∂b∂xi∈M∑−yi(wTxi+b)=xi∈M∑∂b∂−yi(wTxi+b)=xi∈M∑−yi

使用小批量梯度下降法求解www

w:=w−η∇wL(w,b):=w−η∑xi∈M−yixi:=w+η∑xi∈Myixi \begin{split} w :&= w - \eta \nabla_w L(w,b) \\ :&= w - \eta \sum_{x_i \in M} -y_ix_i \\ :&= w + \eta \sum_{x_i \in M} y_ix_i \\ \end{split} w:::=w−η∇wL(w,b)=w−ηxi∈M∑−yixi=w+ηxi∈M∑yixi

使用小批量梯度下降法求解bbb

b:=b−η∇bL(w,b):=b−η∑xi∈M−yi:=b+η∑xi∈Myi \begin{split} b :&= b - \eta \nabla_b L(w,b) \\ :&= b - \eta \sum_{x_i \in M} -y_i \\ :&= b + \eta \sum_{x_i \in M} y_i \\ \end{split} b:::=b−η∇bL(w,b)=b−ηxi∈M∑−yi=b+ηxi∈M∑yi

使用随机梯度下降法求解www

w:=w−η∇wL(w,b):=w−η(−yixi):=w+ηyixi \begin{split} w :&= w - \eta \nabla_w L(w,b) \\ :&= w - \eta(-y_ix_i) \\ :&= w + \eta y_ix_i \\ \end{split} w:::=w−η∇wL(w,b)=w−η(−yixi)=w+ηyixi

使用随机梯度下降法求解bbb

b:=b−η∇bL(w,b):=b−η(−yi):=b+ηyi \begin{split} b :&= b - \eta \nabla_b L(w,b) \\ :&= b - \eta(-y_i) \\ :&= b + \eta y_i \\ \end{split} b:::=b−η∇bL(w,b)=b−η(−yi)=b+ηyi

相关推荐
ShallWeL12 小时前
【机器学习】(31)—— 如何得到 Embedding
人工智能·机器学习·embedding
世人万千丶12 小时前
鸿蒙Crash高级捕获与异常监控:全局异常兜底/崩溃栈解析/符号表还原/智能聚类/闭环修复
学习·机器学习·华为·数据挖掘·harmonyos·鸿蒙·聚类
lancyu13 小时前
零基础AI应用编程开发入门 | 吴恩达Prompt工程极简通关指南:新手从零学会工业级提示词开发(可直接复用代码)
人工智能·深度学习·机器学习
大龄码农有梦想14 小时前
AI Agent 目前最大的瓶颈是什么?
人工智能·机器学习·ai agent·智能体·ai工作流·智能体平台
SomeB1oody14 小时前
【RustyML入门】2.0. 经典机器学习
开发语言·后端·机器学习·rust·教程
天辛大师14 小时前
天心大师:不确定中锚定自我,AI生活的哲学命题
人工智能·算法·决策树·机器学习·生活·启发式算法
databook15 小时前
用统计检验来确定“重要特征”
python·机器学习·scikit-learn
湘美书院--湘美谈教育17 小时前
AI时代的奥德赛:算法星空,寻找精神归航
大数据·人工智能·深度学习·机器学习·生活
倒流时光三十年18 小时前
第五阶段 41 · 相关性调优(boosting、function_score、filter vs query 上下文)
机器学习·集成学习·boosting