昇思25天学习打卡营第8天|模型权重保存与加载

打卡

目录

打卡

模型的两种保存形式

Checkpoint

中间表示IR

模型保存与加载

模型权重保存-例1

模型权重加载-例1

模型权重保存-例2

模型权重加载-例2

模型权重文件的空间占用计算-例


模型的两种保存形式

Checkpoint

权重参数文件

中间表示IR

中间表示(Intermediate Representation,IR)是程序编译过程中介于源语言和目标语言之间的程序表示。MindIR是一种基于图表示的函数式IR,其最核心的目的是服务于自动微分变换

在图模式set_context(mode=GRAPH_MODE)下运行用MindSpore编写的模型时,若配置中设置了set_context(save_graphs=1),运行时会输出一些图编译过程中生成的一些中间文件,我们称为IR文件。

  • ir后缀结尾的IR文件:一种比较直观易懂的以文本格式描述模型结构的文件,可以直接用文本编辑软件查看。

  • dot后缀结尾的IR文件:描述了不同节点间的拓扑关系,可以用graphviz将此文件作为输入生成图片,方便用户直观地查看模型结构。对于算子比较多的模型,推荐使用可视化组件MindSpore Insight对计算图进行可视化。

模型保存与加载

保存流程:

  • 定义模型网络
  • 选择损失函数、优化器等
  • 训练模型、更新模型权重参数
  • 选择1:保存模型权重参数Checkpoint到本地
  • 选择2:保存中间表示IR到本地

加载流程:

  • 定义模型网络
  • 选择1:从本地加载模型权重参数Checkpoint
  • 选择2:保存中间表示IR到本地

模型权重保存-例1

python 复制代码
model = network()
mindspore.save_checkpoint( 
       model,         ## 待保存的对象。数据类型可为 mindspore.nn.Cell 、list或dict。
       "model.ckpt"   ## 模型权重保存路径
     )

模型权重加载-例1

python 复制代码
model = network()
param_dict = mindspore.load_checkpoint("model.ckpt")
param_not_load, _ = mindspore.load_param_into_net(
                                    model, 
                                    param_dict
                                  )
print(param_not_load)  ## param_not_load是未被加载的参数列表,为空时代表所有参数均加载成功。

模型权重保存-例2

MindIR同时保存了Checkpoint和模型结构,因此需要定义输入Tensor来获取输入shape。

python 复制代码
model = network()
inputs = Tensor(np.ones([1, 1, 28, 28]).astype(np.float32))
mindspore.export(model, 
                inputs, 
                file_name="model", 
                file_format="MINDIR"
                )

模型权重加载-例2

python 复制代码
mindspore.set_context(mode=mindspore.GRAPH_MODE)

graph = mindspore.load("model.mindir")
model = nn.GraphCell(graph)
outputs = model(inputs)
print(outputs.shape)

模型权重文件的空间占用计算-例

  • 计算方式:计算模型参数个数;按照每个参数占用的字节数计算所有参数的字节占用;转换字节占用单位为MB或GB等。
  • 对比:查看实际保存的大小,与计算预期占用字节数做对比。

例子如下:可以看到,计算与预期基本一致。MindIR同时保存了Checkpoint和模型结构,参数文件会更大一些。

相关推荐
七宝大爷2 分钟前
NVIDIA Blackwell Ultra GB300深度解析:AI芯片性能的新巅峰
人工智能·gpu·gb300
鲸鱼在dn2 分钟前
大语言模型的后训练与“灾难性遗忘”问题——李宏毅2025大模型第六讲笔记
人工智能·笔记·语言模型
a20063801216 分钟前
ply(python版本的flex/bison or Lex/Yacc)
python
wokaoyan198122 分钟前
逻辑推演题——谁是骗子
python
九年义务漏网鲨鱼23 分钟前
利用AI大模型重构陈旧代码库 (Refactoring Legacy Codebase with AI)
python
滑水滑成滑头35 分钟前
**标题:发散创新:智能交通系统的深度探究与实现**摘要:本文将详细
java·人工智能·python
闭着眼睛学算法1 小时前
【双机位A卷】华为OD笔试之【哈希表】双机位A-跳房子I【Py/Java/C++/C/JS/Go六种语言】【欧弟算法】全网注释最详细分类最全的华子OD真题题解
java·c语言·c++·python·算法·华为od·散列表
海云安1 小时前
海云安入选安全牛《企业级AI大模型落地实战技术应用指南(2025版)》优秀案例
人工智能·安全
周杰伦_Jay1 小时前
【PaddleOCR深度解析与DeepSeek-OCR对比】开源OCR工具库的技术路线与场景适配
人工智能·机器学习·云原生·架构·开源·ocr
无限码力1 小时前
华为OD技术面真题 - Python开发 - 2
python·华为od·华为od技术面真题·华为od技术面八股·华为od技术面python八股·华为od面试python真题·华为odpython八股