书接上回(Convolution)

#灵感be like 酒品见人品 还得看特殊时刻的状态

一、Convolution卷积

1.官网

主要关注二维2d的 Conv2d --- PyTorch 2.13 documentation

class torch.nn.Conv2d(in_channels , out_channels , kernel_size , stride=1 , padding=0 , dilation=1 , groups=1 , bias=True , padding_mode='zeros' , device=None , dtype=None)

主要参数到dilation为止

2.两篇文献解释卷积2d

灰度图像只有一个通道

卷积核kernel

卷积操作:卷积核和图像像素进行对应位相乘后 再相加

卷积核一点点移动

卷积操作之后的结果

input channel和output channel

(1)1个输入通道 想得到4个输出通道的

需要4个卷积核来操作

(2)3个通道输入,想得到4个通道输出

需要3*4=12个卷积核来操作(4组 每组3个 卷积核)

R通道和卷积核A进行卷积操作+GB+BC 相加之后得到最后的

Kernel size卷积核大小

通常3*3 ,这个是5*2

Strides步长

比如S(1,3)先纵向

Padding填充

通常是0的黑色

比如下图

原本图像H*W=7*7,现在Padding填充是1×1,则图像变成H*W=9*9

输入通道2,输出通道1,卷积核Kernel是3×3,Padding填充是1×1,步长S纵向横向都是1,膨胀dilation也就是像素间隔也是1×1

Dilation空洞卷积

dilation(膨胀率)就是卷积核内部各个像素点之间的"间隔距离"。

  • 默认 dilation=1 :表示像素点之间没有间隔(紧挨着),就是最普通的卷积。

比如下图D(4,2)就是H高度方向间隙为4,W宽度方向间隙为2

最后输出特征图

有计算公式的

卷积核一般是奇数,

1*1是改变通道数目,3*3和5*5是提取特征的

验证一下-可视化

相关推荐
海盗123416 分钟前
AI新闻日报_2026-08-26——Vera Rubin 实测 30 倍吞吐跃升、Ilya SSI 持续学习模型或本周亮相、开源模型调用首超闭源
人工智能
裕晟资质规划18 分钟前
西安政务信息化项目涉密系统集成资质准入解析:甲级/乙级承接边界、等保差异与合规承接路径
大数据·运维·数据库·人工智能·安全·政务
HyperAI超神经20 分钟前
MiniMax H3 突破视频生成边界,音画内容一体生成;Ornith-1.5-35B-A3B 探索推理模型自进化训练新模式
人工智能·深度学习·学习·音视频·多模态·视频生成·推理模型
神奇霸王龙21 分钟前
Codex MCP GA 实测:Qwen / GLM / Kimi / DeepSeek / MiniMax 调度 Codex 沙箱的真实成本
人工智能·ai·agent·ai编程·原型模式·mcp
gt202622 分钟前
机器翻译是怎么工作的:从规则、统计到神经网络的三次演进
人工智能·神经网络·机器翻译
赛博三把手23 分钟前
DeepSeek Harness (dsh) 国内网络接入第三方大模型聚合平台 API:以 Claude Opus 5 /Fable 5为例
人工智能·架构·开源
我是浮华31 分钟前
团队ai工具栈
人工智能·个人ai学习
平原201833 分钟前
AI岗位需求增长244%背后:从任务重组到可验证学习闭环
大数据·人工智能·学习
tqs_1234534 分钟前
AI Agent FunctionCall全链路解析:从LLM输出到Skill执行的完整流程
人工智能