【昇思初学入门】第三天打卡

数据集Dataset

心得体会

  1. 昇思提供了丰富的数据集,文本、图像、音频等都有内置
  2. MindSpore的Pipeline设计和并行处理能力使得数据预处理更加高效
  3. 可通过GeneratorDataset接口实现自定义方式的数据集加载
  4. 可迭代的数据集,可以通过迭代的方式逐步获取数据样本,生成器generator也属于可迭代的数据集类型

笔记

  1. 数据获取
python 复制代码
import numpy as np
from mindspore.dataset import vision
from mindspore.dataset import MnistDataset, GeneratorDataset
import matplotlib.pyplot as plt
# Download data from open datasets
from download import download

url = "https://mindspore-website.obs.cn-north-4.myhuaweicloud.com/" \
      "notebook/datasets/MNIST_Data.zip"
path = download(url, "./", kind="zip", replace=True)

这里找数据集:https://www.mindspore.cn/docs/zh-CN/r2.3.0rc2/api_python/mindspore.dataset.html

2.数据迭代

python 复制代码
# shuffle 消除数据排列造成的分布不均问题,及打乱数据顺序
train_dataset = MnistDataset("MNIST_Data/train", shuffle=True)
def visualize(dataset):
    figure = plt.figure(figsize=(4, 4))
    cols, rows = 3, 3

    plt.subplots_adjust(wspace=0.5, hspace=0.5)

    for idx, (image, label) in enumerate(dataset.create_tuple_iterator()):
        figure.add_subplot(rows, cols, idx + 1)
        plt.title(int(label))
        plt.axis("off")
        plt.imshow(image.asnumpy().squeeze(), cmap="gray")
        if idx == cols * rows - 1:
            break
    plt.show()
  1. 数据预处理
python 复制代码
#图像统一除以255,数据类型由uint8转为了float32
train_dataset = train_dataset.map(vision.Rescale(1.0 / 255.0, 0), input_columns='image')
相关推荐
李帅朋8 小时前
微分基本定义笔记
人工智能·笔记·深度学习·神经网络
ai小陈10 小时前
LoRA微调显存怎么估?32GB GPU训练配置与常见问题排查
人工智能·深度学习·机器学习·ai·gpu算力
2601_9622974810 小时前
AI 自动编码将上线,谷歌 Colab 推出 Github Copilot 竞品
深度学习·代码生成·githubcopilot·ai编码·谷歌colab
SuperHeroWu710 小时前
【HarmonyOS AI】 通用文字识别详解
人工智能·pytorch·深度学习·通用文字识别
deepdata_cn13 小时前
元学习、迁移学习、小样本学习的区别
深度学习·迁移学习
千里码aicood14 小时前
Flask-基于图神经网络的谣言检测研究
人工智能·神经网络·flask
知识分享小能手15 小时前
深度学习学习教程,从入门到精通,深度模型中的优化 — 完整知识点与代码案例(8)
人工智能·深度学习·学习
疯神NB15 小时前
循环神经网络RNN
人工智能·rnn·深度学习
月华路15 小时前
《模型不玄学》第24章 第二个标签怎么造:层级标签
人工智能·深度学习·机器学习
jianpeng的工程笔记16 小时前
Colab Kaggle 防断开脚本
javascript·深度学习·kaggle·colab