书接上回(Convolution)

#灵感be like 酒品见人品 还得看特殊时刻的状态

一、Convolution卷积

1.官网

主要关注二维2d的 Conv2d --- PyTorch 2.13 documentation

class torch.nn.Conv2d(in_channels , out_channels , kernel_size , stride=1 , padding=0 , dilation=1 , groups=1 , bias=True , padding_mode='zeros' , device=None , dtype=None)

主要参数到dilation为止

2.两篇文献解释卷积2d

灰度图像只有一个通道

卷积核kernel

卷积操作:卷积核和图像像素进行对应位相乘后 再相加

卷积核一点点移动

卷积操作之后的结果

input channel和output channel

(1)1个输入通道 想得到4个输出通道的

需要4个卷积核来操作

(2)3个通道输入,想得到4个通道输出

需要3*4=12个卷积核来操作(4组 每组3个 卷积核)

R通道和卷积核A进行卷积操作+GB+BC 相加之后得到最后的

Kernel size卷积核大小

通常3*3 ,这个是5*2

Strides步长

比如S(1,3)先纵向

Padding填充

通常是0的黑色

比如下图

原本图像H*W=7*7,现在Padding填充是1×1,则图像变成H*W=9*9

输入通道2,输出通道1,卷积核Kernel是3×3,Padding填充是1×1,步长S纵向横向都是1,膨胀dilation也就是像素间隔也是1×1

Dilation空洞卷积

dilation(膨胀率)就是卷积核内部各个像素点之间的"间隔距离"。

  • 默认 dilation=1 :表示像素点之间没有间隔(紧挨着),就是最普通的卷积。

比如下图D(4,2)就是H高度方向间隙为4,W宽度方向间隙为2

最后输出特征图

有计算公式的

卷积核一般是奇数,

1*1是改变通道数目,3*3和5*5是提取特征的

验证一下-可视化

相关推荐
7177772 小时前
中小团队 DevOps 平台选哪家:2026 年主流平台对比与 Gitee 本土化方案解析
人工智能·gitee
武子康3 小时前
小智断网后还能做什么?沿一次唤醒看清设备与服务端的分工
人工智能·llm·agent
西安栈上月明软件科技3 小时前
从 Linux 0.01 到 AI 开源:星图邻的开源实践
人工智能·自然语言处理·架构·开源·fastapi
麻雀飞吧3 小时前
先判断工具用来学习、开发还是执行
人工智能·python
甲维斯3 小时前
ZCode:快来领“免费”3亿tokens和“Git打包服务”
人工智能
揽秀亭长3 小时前
视频转文字有哪些方法?在线AI、剪辑软件、本地对比
人工智能·音视频
RoboWizard4 小时前
三星和金士顿内存条哪个更适合游戏超频
大数据·人工智能
深圳市恒星物联科技有限公司4 小时前
轻量MCU设备通过OpenHarmony兼容性测评的全流程关键要点与实战踩坑经验
大数据·人工智能·物联网·鸿蒙
AI闲人4 小时前
企业 AI 最大的问题,不是数据不足,而是数据没有业务语义
人工智能·数字化·企业ai落地
米小虾5 小时前
一周 AI 观察(9.14–9.18):Anthropic 自曝"AI 写了我四分之一的研发",于是这一周所有人都在买同一样东西
人工智能