论文阅读FCN-Transformer Feature Fusion for PolypSegmentation

本文提出了一种名为Fully Convolutional Branch-TransFormer (FCBFormer)的图像分割框架。该架构旨在结合Transformer和全卷积网络(FCN)的优势,以提高结肠镜图像中息肉的检测和分类准确性。

1,框架结构:

模型采用双分支结构,两个并行分支:一个全卷积分支(FCB)和一个Transformer分支(TB)。FCB返回全尺寸(h×w)特征图,而TB返回降尺寸(h/4 × w/4)的特征图。TB的输出张量经过上采样并与FCB的输出张量在通道维度上进行拼接,然后通过预测头(PH)处理,生成输入图像的全尺寸分割图。

2,TB分支的结构

TB使用ImageNet预训练的金字塔视觉Transformer V2(PVTv2)作为图像编码器,该编码器返回一个具有4个级别的特征金字塔,这个金字塔随后被用作渐进式局部解码器(PLD)的输入。

在PLD中,金字塔的每个级别首先通过一个局部强调(LE)模块进行处理,以解决基于Transformer的模型在特征表示中表示局部特征的不足,然后通过逐步特征聚合(SFA)融合经过局部强调的金字塔特征。最后,融合的多尺度特征用于预测输入图像的分割图。

3,LE模块的结构

LE模块,即局部强调(Local Emphasis)模块,是SSFormer架构中用于增强Transformer编码器提取的特征的局部特征表示的组件。在FCBFormer的TB(Transformer Branch)中,LE模块的目的是通过强调图像的局部区域来改善Transformer模型在处理细节时的性能。

LE模块的具体由卷积层、激活函数、残差连接、组归一化、通道数调整等部分组成。

LE模块的设计旨在通过突出局部特征来弥补Transformer在处理精细细节时的不足,从而在分割任务中提供更准确的局部边界信息。

4,FCB分支的结构

如上图C所示,是由残差模块组成的U型结构。

5,实验结果

相关推荐
Jack_pirate13 分钟前
深度学习中的特征到底是什么?
人工智能·深度学习
微凉的衣柜27 分钟前
微软在AI时代的战略布局和挑战
人工智能·深度学习·microsoft
哦哦~9211 小时前
深度学习驱动的油气开发技术与应用
大数据·人工智能·深度学习·学习
程序员一诺6 小时前
【深度学习】嘿马深度学习笔记第10篇:卷积神经网络,学习目标【附代码文档】
人工智能·python·深度学习·算法
MUTA️6 小时前
RT-DETR学习笔记(2)
人工智能·笔记·深度学习·学习·机器学习·计算机视觉
学术头条9 小时前
清华、智谱团队:探索 RLHF 的 scaling laws
人工智能·深度学习·算法·机器学习·语言模型·计算语言学
18号房客9 小时前
一个简单的机器学习实战例程,使用Scikit-Learn库来完成一个常见的分类任务——**鸢尾花数据集(Iris Dataset)**的分类
人工智能·深度学习·神经网络·机器学习·语言模型·自然语言处理·sklearn
Ven%9 小时前
如何在防火墙上指定ip访问服务器上任何端口呢
linux·服务器·网络·深度学习·tcp/ip
IT猿手10 小时前
最新高性能多目标优化算法:多目标麋鹿优化算法(MOEHO)求解TP1-TP10及工程应用---盘式制动器设计,提供完整MATLAB代码
开发语言·深度学习·算法·机器学习·matlab·多目标算法
强哥之神10 小时前
Nexa AI发布OmniAudio-2.6B:一款快速的音频语言模型,专为边缘部署设计
人工智能·深度学习·机器学习·语言模型·自然语言处理·音视频·openai