网络流数据集处理(深度学习数据处理基础)

一、数据集处理

处理数据集是一个文件夹 一个文件夹处理的,将原网络流数据集 放入一个文件夹 处理转换成 Json文件。(数据预处理)然后将这些文件处理成目标文件格式 再分割成训练集和测试集。每次运行只会处理一个文件夹。

  • 运行train.py 导入训练集训练模型,训练完之后进行保存模型参数。
  • 运行test.py 导入测试集测试模型,因此我们需要使用模型参数保存代码。

如果我们需要将数据集4倍交叉验证分为4个部分,3个训练集,一个测试集。那就相当于运行三次train.py分别运行导入不同的三个训练集即可。如果每个部分都需要当做一次测试集,那就重复4次就行。

二、后门攻击训练

为了进行有监督训练,我们需要带有标签的数据集。

我们认为数据集是带有标签的,

训练这里分为几个步骤:

将训练集每64个网络流当做一个批次。

(1)选择一个投毒目标yt,在当前训练集批次中随机选择20%个投毒目标,进行以下处理:

  • 上一次网络流+当前网络流生成 触发器掩码m
  • 当前网络流 与 掩码的m[n+1,2n]相加,训练模型分类为目标类别yt

(2)对于不投毒的训练集,用正常标签训练。

相关推荐
Lx352几秒前
📝 智能体市场探秘:如何挑选你的AI同事
人工智能
PingCAP20 分钟前
Dify 基于 TiDB 的数据架构重构实践
数据库·人工智能·tidb
梦道长生25 分钟前
GPT-SoVITS Windows 配置与推理笔记(自用)
人工智能·windows·笔记·gpt
uncle_ll32 分钟前
达摩院Paraformer-ONNX模型:一站式高精度中文语音识别工业级解决方案
人工智能·nlp·语音识别·asr
阿里云大数据AI技术32 分钟前
阿里云 AI 搜索开放平台:从算法到业务——AI 搜索驱动企业智能化升级
大数据·人工智能·算法
MervynZ36 分钟前
Agent to Agent(A2A)一文全了解
人工智能·google·开源
灵均66644 分钟前
机器学习-线性回归模型
人工智能·机器学习·线性回归·numpy·pandas·scikit-learn·matplotlib
Se7en2581 小时前
为 Kubernetes 提供智能的 LLM 推理路由:Gateway API Inference Extension 深度解析
人工智能
数据饕餮1 小时前
大模型推理引擎选型与应用场景分析:SGLang、Ollama、VLLM 和 LLaMA.cpp
人工智能·语言模型
Likeadust1 小时前
依靠视频设备轨迹回放平台EasyCVR构建视频监控,为幼教连锁园区安全护航
大数据·网络·人工智能·音视频·实时音视频