【pytorch】深度学习准备:基本配置

深度学习中常用包

python 复制代码
import os 
import numpy as np 
import torch
import torch.nn as nn
from torch.utils.data import Dataset, DataLoader
import torch.optim as optimizer

超参数设置

2种设置方式:将超参数直接设置在训练的代码中;用yaml、json,dict等文件来存储超参数

python 复制代码
# 批次的大小
batch_size = 16
# 优化器的学习率
lr = 1e-4
# 训练次数
max_epochs = 100

GPU设置

python 复制代码
# 方案一:使用os.environ,这种情况如果使用GPU不需要设置
import os
os.environ['CUDA_VISIBLE_DEVICES'] = '0,1' # 指明调用的GPU为0,1号

# 方案二:使用"device",后续对要使用GPU的变量用.to(device)即可
device = torch.device("cuda:1" if torch.cuda.is_available() else "cpu") # 指明调用的GPU为1号

使用argparse和yaml文件

  1. argparse的使用:
python 复制代码
import argparse
"""
	argparse.ArgumentParser()创建了一个对象
	add_argument()添加参数
	parse_args()将参数封装在opt内,各个参数通过.运算符调用
"""

def main(opt):
    print(opt.num_batches)

if __name__ == '__main__':

    parse = argparse.ArgumentParser()
    parse.add_argument('--num_batches', type=int, default=50, help='the num of batch')
    parse.add_argument('--num_window', type=int, default=5, help='the num of window')
    parse.add_argument('--weight', type=str, default= '../pretrain.pth', help='the path of pretrained model')

    opt = parse.parse_args()
    main(opt)
  1. yaml文件的使用
    下面是一个yaml文件的例子,参数呈现层级结构
yaml 复制代码
device: 'cpu'

data:
    train_path: 'data/train'
    test_path: 'test/train'
    num: 1000

读取yaml文件

python 复制代码
def read_yaml(path):
"""
	read()读入yaml文件中的内容
	safe_load()加载yaml格式的内容并转换为字典
"""
    file = open(path, 'r', encoding='utf-8')
    string = file.read()
    file.close()
    dict = yaml.safe_load(string)

    return dict

path = 'config.yaml'
Dict = read_yaml(path)
device = Dict['device']
print(device)
train_path = Dict['data']['train_path']
print(train_path)
  1. 使用方法
    在yaml文件中给全部参数设置默认值,使用argparse库设置待调参数的值

参考资料

  1. 深度学习代码中的argparse以及yaml文件的使用
  2. datawhale的thorough-pytorch repo
相关推荐
Carl_奕然3 分钟前
【智能体】Loop 的四种设计模式之:Hill Climbing Loop(2026 最新版)
人工智能·python·设计模式
Rocky Ding*5 分钟前
深度解析LlamaGen核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·llamagen
欣欣之王来了5 分钟前
5G网络基础:5G的核心特性,eMBB、uRLLC、mMTC的应用场景
网络·学习·计算机网络·安全·教程
hai3152475438 分钟前
语言学矩阵原理
人工智能·机器学习·矩阵
Omics Pro8 分钟前
~30,000+引用!理论2005,R包2008,多组学集成AI增强
开发语言·数据库·人工智能·算法·机器学习·自然语言处理·r语言
ZzT11 分钟前
拆开 Claude Code、Codex 等 11 个 coding agent:没有一个用 LangChain,也没有一个用向量检索代码
人工智能·ai编程·claude
Kstheme13 分钟前
受 Karpathy ASD-STE100的启发,我把论文讲解做成了一个开源 Skill
人工智能
EatFan13 分钟前
MCP 从概念到落地:Java(Spring AI Alibaba)与 .NET 双栈接入实操对比
java·人工智能·后端·spring·.net·java后端·mcp
Xudde.16 分钟前
CVE-2026-24061漏洞复现
学习·安全
传奇开心果编程19 分钟前
【Compose Multiplatform 跨端开发学与练】第4课 导航与路由
android·windows·学习·ui·ios·kotlin·composer