droppath

DropPath 是一种用于正则化深度学习模型的技术,它在训练过程中随机丢弃路径(或者说随机让某些部分的输出变为零),从而增强模型的鲁棒性和泛化能力。

代码解释:

import torch

import torch.nn as nn

定义 DropPath 类

class DropPath(nn.Module):

def init(self, drop_prob=None):

super().init()

self.drop_prob = drop_prob

def forward(self, x):

return drop_path(x, self.drop_prob, self.training)

def drop_path(x, drop_prob: float = 0., training: bool = False):

#drop_path(输入,将drop_prob初始化为0., 判断是否为训练模式)

if drop_prob == 0. or not training:

return x

#如果drop_prob等于0或者不是训练模式直接将输入输出

keep_prob = 1 - drop_prob

#保留的概率

shape = (x.shape0,) + (1,) * (x.ndim - 1)

形状:(batch_size, 1, 1, ...)

x.shape0获取xshape的第一维也就是batch_size

(1,) * (x.ndim - 1) 将shape用1填充和x的形状一样

random_tensor = keep_prob + torch.rand(shape, dtype=x.dtype, device=x.device)

torch.rand(shape, dtype=x.dtype, device=x.device)生成随机数(生成均值为0,标准差为1的正态# 分布随机数)形状和shape一致的也就是和x一致,数据类型,设备都和x一致

将随机数和keep_prob相加得到随机数(范围keep_prob,1+keep_prob

random_tensor.floor_()

二值化,生成 0 或 1 的 mask

也就是将随机数向下取整

output = x.div(keep_prob) * random_tensor

#x.div(keep_prob)将输入张量x的所有值除以keep_prob,目的是放大保留下来的部分

#* random_tensor根据0 或 1 的 mask决定哪些路径会被保留(1)或丢弃(0)

return output

为什么要放大保留下来的部分:

  • 丢弃路径会导致部分值被置为零,模型整体输出的总期望值会下降。
  • 为了补偿这种下降,需要对保留下来的部分放大,使得丢弃路径后的总期望值和丢弃前一致。

因为只是补偿所以并不一定等与原期望

数学解释:

假设输入张量是 ,其中每个元素 xi表示特征。

期望:

丢弃之后:

放大之后:

实例:

python 复制代码
import torch
import torch.nn as nn

# 定义 DropPath 类
class DropPath(nn.Module):
    def __init__(self, drop_prob=None):
        super().__init__()
        self.drop_prob = drop_prob

    def forward(self, x):
        return drop_path(x, self.drop_prob, self.training)

def drop_path(x, drop_prob: float = 0., training: bool = False):
    if drop_prob == 0. or not training:
        return x
    keep_prob = 1 - drop_prob
    shape = (x.shape[0],) + (1,) * (x.ndim - 1)  # 形状:(batch_size, 1, 1, ...)
    random_tensor = keep_prob + torch.rand(shape, dtype=x.dtype, device=x.device)
    random_tensor.floor_()  # 二值化,生成 0 或 1 的 mask
    print(f'mask: {random_tensor}')
    output = x.div(keep_prob) * random_tensor
    return output

# 定义简单模型
class SimpleModel(nn.Module):
    def __init__(self, drop_prob):
        super().__init__()
        self.linear = nn.Linear(4, 4)  # 简单的线性层
        self.drop_path = DropPath(drop_prob)  # 使用 DropPath
        self.activation = nn.ReLU()  # ReLU 激活

    def forward(self, x):
        print("输入数据:")
        print(x)

        x = self.linear(x)  # 线性层
        print("线性层输出:")
        print(x)

        x = self.activation(x)  # ReLU 激活
        print("激活后输出:")
        print(x)

        x = self.drop_path(x)  # DropPath
        print("DropPath 后输出:")
        print(x)

        return x

# 创建模型
model = SimpleModel(drop_prob=0.5)
model.train()  # 设置为训练模式以启用 DropPath

# 输入数据
input_data = torch.tensor([[1.0, 2.0, 3.0, 4.0],
                           [5.0, 6.0, 7.0, 8.0]], dtype=torch.float32)

# 运行模型
output = model(input_data)

输出: 简单理解就是根据mask的1,0值对每个样本进行保留或置零

输入数据:

tensor(\[1., 2., 3., 4.,

5., 6., 7., 8.])

线性层输出:

tensor(\[ 1.2836, -1.4602, 2.2660, -1.7250,

1.3035, -4.1391, 4.5453, -2.5738], grad_fn=<AddmmBackward0>)

激活后输出:

tensor(\[1.2836, 0.0000, 2.2660, 0.0000,

1.3035, 0.0000, 4.5453, 0.0000], grad_fn=<ReluBackward0>)

mask: tensor(\[1.,

0.])

DropPath 后输出:

tensor(\[2.5672, 0.0000, 4.5321, 0.0000,

0.0000, 0.0000, 0.0000, 0.0000], grad_fn=<MulBackward0>)

复制代码
复制代码
相关推荐
醍醐实验室几秒前
长文本外推中的 RoPE Base 调优:从 10,000 到 500,000 的数学底数奥秘
人工智能
搞科研的小刘选手13 分钟前
【香港中文大学(深圳)、IEEE主办 | 深圳举办】第六届IEEE能源工程与电力系统国际学术会议(EEPS 2026)
人工智能·电力系统·能源工程·香港中文大学(深圳)·会议推荐
weixin_4462608518 分钟前
面向编码智能体的「先学测试,再用测试提升修复能力」框架
人工智能
2401_8653825021 分钟前
政务信息化项目审价的现实意义
大数据·人工智能·政务
lvts_cs24 分钟前
汽车零部件产业发展趋势,对地方招商工作带来的影响
大数据·人工智能·汽车
AI云海24 分钟前
计算机视觉之YOLO11整体架构、多任务能力
人工智能·计算机视觉·架构
Axis tech26 分钟前
基于Ego-Pi框架与Manus手套的仿人机器人灵巧操作研究
人工智能·机器学习·机器人
我有满天星辰33 分钟前
《从 0 打造我的本地 AI 知识库:Obsidian + Ollama + Milvus + RAG + MCP + Agent》第 01 篇
人工智能·milvus
您^_^34 分钟前
DeepSeek-Harness v0.1.5-alpha.1更新后旧会话打不开?5 步抢救 8MB 会话照抄
人工智能·windows·个人开发·deepseek v4 pro·deepseekharness
倔强的石头10634 分钟前
【深度学习】神经网络前向传播与反向传播推导
人工智能·深度学习·神经网络