机器学习开发的迭代循环

开发机器学习的过程,有助于在机器学习开发的过程中做出正确决策。

首要要确定系统的整体架构,这意味选择机器学习模型,以及什么数据,可能还需要选择超参数,

然后根据这些决策,会实现并训练一个模型,

然后事实活产看一下诊断,例如产看算法的偏差或者方差,以及在下一个章节要看到的错误分析,根据诊断的见解,做出决策

例如是否让神经网络更强大,或者改变正则化参数,或者可能添加更多的数据,或者添加更多的特征,或者减少特征,

最后再次围绕这个循环进行,选择新的架构,通常需要多次迭代才能达到想要的性能,

看一个电子邮件垃圾邮件分类器

如何区分一个邮件是垃圾邮件还是真正的有限呢?

一种方法是训练一个监督学习算法,其中输入特征X是电子邮件邮件的特征,输出标签Y 1或0用来 取决于他是垃圾邮件还是非垃圾邮件,因此这是一个文本分类的应用

一种构建分类特征方法的是说,取英语语言或某些其他字典前100000的单词并使用他们来定义特征,X1,X2X....X10000

统计这些词是否出现出现为1没出现为0构建成一个列表向量,

另一种方法是不让这些数字是0和1,而是实际单词在邮件中出现的次数,

比如buy出现了两次就变成2

有了这些特征就可以训练一个分类算法,例如逻辑回归模型,或者是神经网络,用来预测这些给定特征X的Y,

在训练模型之处如果他变现的不如你希望的那样好,你可能会想到很多种改进学习算法性能的想法,例如收集更多的数据总是很诱人,但是会有创建了大量的虚假电子邮件地址,并故意让这些地址落入垃圾邮件发送者手中,以便当他们向这些虚假邮件发送垃圾邮件时,这些邮件是垃圾邮件,因此这是一种获取大量垃圾邮件数据的方法,

或者你可能会基于邮寄路由开发更复杂的特征

邮件路由指的是,电子邮件在到达你手中之前,所经过的一系列计算服务器,有时遍布全球,而电子邮件实际上有,所谓的邮件头信息,这些信息记录了电子邮件如何穿越不同的服务器,不同的网络,最终找到你,有时电子邮件的路径可以帮到你,判断他是否由垃圾邮件发送的,

或者从邮件正文中开发开发更复杂的特征,即邮件的文本,所以之前提到的特征中,discounting,discount,可能被视为不同的词,但他们也许被视为相同的词,或者你可能会决定开发算法拼写错误或故意的拼写错误,如w4tches,med1cine,m0rtgage,这也可以判断一个邮件是否为垃圾邮件,

相关推荐
智体工坊1 小时前
从零搭建 AI 模型中转网关:部署、渠道、定价、装修全记录
运维·服务器·人工智能·搜索引擎·自动化
gnsnswa1 小时前
解读6大AI人工智能认证证书
人工智能·信息可视化·职场和发展·数据分析·aigc·学习方法·信息与通信
明如正午1 小时前
codebuddy-ignore-详解
人工智能·codebuddy
Canace1 小时前
GPT-5.6 到底怎么选?一文搞懂 Sol、Terra、Luna 和 Ultra
前端·人工智能·chatgpt
anxiao_m1 小时前
2026教学AI云桌面横向测评!五大主流品牌实景能力对比
大数据·人工智能·机器学习
IT_陈寒1 小时前
小心!Java里的这个空指针问题绝对坑过你
前端·人工智能·后端
小白学大数据1 小时前
基于Python的抖音网页版视频点赞数增长趋势追踪系统设计与实现
开发语言·爬虫·python·搜索引擎·音视频
Canace1 小时前
AI 都能操作浏览器了,却读不了微信公众号文章
前端·人工智能·产品
计算机魔术师1 小时前
工信部发布首部L3/L4自动驾驶系统安全要求强制性国标,2027年7月实施
人工智能·后端·自动驾驶·系统安全