项目实战-神经网络预测

一、环境配置与工具导入,

配置中文显示,固定随机种子,生成固定的随机数(,为了让代码每次运行的结果都一样,因为模型初始化权重初始化时随机的,如果不固定种子,同一份代码跑两次,会出现两个精度不一样的模型,调参的时候就不知道数据的变动是因为参数的改变还是因为模型的随机,导致归因困难,固定了随机种子,就相当于与有了一个对照组,排除了随机因素的干扰,确定模型的结果变动是因为参数的变动,最终的目的是让模型的结果跟随参数的变动而变动,而不是跟着模型的初始化随机权重变动而变动)

二、数据加载与初步观察,

1.读取数据,按照业务需求进行筛选

2.查看数据类型,缺失值,查看平均数,最大数,最小数,四分位数,快速了解数据是问么分布的,有没有极端值,整体的是销量水平怎么样,对数据有一个初步的认识

三、数据清洗与数据预处理

1.查看维度

2.类型转换

提取年,月,日,星期几,是否周末,因为销量往往与时间归路有关

3.筛选数据

4.筛选特征

5.缺失值处理(平均值填充,众数填充)

6.查看最终清晰的数据查看维度

7.根据业务需求进行变化

四、时序数据构造,构造14天的时间窗口把过去14天的特征作为输出x第十五条作为输出Y,生成模型能生成的时序训练数据

五、数据标准化与拆分

把特征缩放到统一范围,避免特征过大影响模型学习

初始化标准化器scaler = StandardScaler() #这个就是标准化把数据在-3到3之间等到当特征数据的范围差异很大时,损失函数的等高线会像一个极扁的椭圆。梯度下降时,参数更新容易在椭圆上 "之" 字形来回震荡,走很多弯路才能收敛。

标准化后,所有特征的尺度一致,损失函数的等高线会更接近圆形。梯度下降就能更直接地朝着最小值的方向走,收敛速度更快,模型也更容易训练到最优状态。

把数据按照时序窗口拆分成样本对。

拆分测试集与训练集,时序序列不能随机拆分

六、transformer搭建与训练

通过函数单间模型结构,用多头注意力捕获时间依赖,然后开始训练,加入了早停和学习率衰减防止过拟合

七、模型评估与未来预测,用测试机计算 SMSE,MAE,R**2来评估模型的好坏,最后用predict_future函数基于最后的14天真实数据滚动预测未来14天的销量

相关推荐
xwz小王子24 分钟前
拒绝视频生成,深度跃迁提出具身基座模型全新路线
人工智能·深度学习·机器学习
奈斯先生Vector24 分钟前
AIGC 视频生成实战:用 Kling Video 拆解文生视频、图生视频与完整工作流
开发语言·人工智能·windows·python·aigc·音视频
m0_7393128730 分钟前
【自动驾驶/机器人控制】之坐标系&运动学仿真代码工程分析(一)
人工智能·机器人·自动驾驶
桃西西呀32 分钟前
用 AI 写得更快,上线却容易炸?拆解 AI 编码生产力悖论的 5 个机制,附 9 个坑的自检清单
人工智能·llm·ai编程
derekwang8534 分钟前
驾驭 AI · AI Harness Engineering · 契约层设计
人工智能·ai编程
月华路34 分钟前
《模型不玄学》第14章 标签、损失与样本权重
人工智能·算法·机器学习
DPS普轩·真空灌胶机专家43 分钟前
普轩科技亮相第四届西安军工展 | 真空灌胶专家,展位 2-003
大数据·人工智能·科技·机器人·pcb工艺
台风护盾43 分钟前
视频怎么自动翻译成中文字幕?AI 视频翻译的三道坎和一条捷径
人工智能·机器翻译·音频处理·ai工具·视频翻译
@嵌入式扫地僧44 分钟前
嵌入式环境下麦克风阵列远场语音降噪的快速实现
人工智能·语音识别·嵌入式语音降噪·麦克风阵列·ai 降噪轻量化
行者全栈架构师1 小时前
WorkBuddy 实战:把一份 200 页年报变成可上台的投资分析 PPT
人工智能·算法·全栈