CUDA C | 第一章 基于CUDA的异构并行计算

目录

1.1并行计算

[1.1.1 串行编程和并行编程](#1.1.1 串行编程和并行编程)

[1.1.2 并行性](#1.1.2 并行性)

[1.1.3 计算机架构](#1.1.3 计算机架构)


1.1并行计算

并行计算通常涉及两 个不同的计算技术领域。

·计算机架构(硬件方面)

·并行程序设计(软件方面)

计算机架构 关注的是在结构级别上支持并行性,而并行编程设计关注的是充分使用计算机架构的计算能力来并发地解决问题。为了在软件中实现并行执行,硬件必须提供一个支持并行执行多进程或多线程的平台。

1.1.1 串行编程和并行编程

1.1.2 并行性

在应用程序中有两种基本的并行类型

·任务并行

·数据并行

当许多任务或函数可以独立地、大规模地并行执行时,这就是任务并行。任务并行的重点在于利用多核系统对任务进行分配。

当可以同时处理许多数据时,这就是数据并行。数据并行的重点在于利用多核系统对数据进行分配。

通常来说,有两种方法可以对数据进行划分:块划分(block partitioning)和周期划分 (cyclic partitioning)。

在块划分中,一组连续的数据被分到一个块内。每个数据块以任意次序被安排给一个线程,线程通常在同一时间只处理一个数据块。

在周期划分中,更少的数据被分到一个块内。相邻的线程处理相邻的数据块,每个线程可以处理多个数据块。 为一个待处理的线程选择一个新的块,就意味着要跳过和现有线程一样多的数据块。

程序性能通常对块的大小比较敏感。块划分与周期划分中划分方式的选择与计算机架 构有密切关系。

1.1.3 计算机架构

根据指令和数据进入CPU的方式,将计算机架构分为4种不同 的类型

·单指令单数据(SISD) ·单指令多数据(SIMD) ·多指令单数据(MISD) ·多指令多数据(MIMD)

延迟是一个操作从开始到完成所需要的时间,常用微秒来表示。

带宽是单位时间内可处理的数据量,通常表示为MB/s或GB/s。

吞吐量是单位时间内成功处理的运算数量,通 常表示为gflops(即每秒十亿次的浮点运算数量),特别是在重点使用浮点计算的科学计算领域经常用到。

延迟用来衡量完成一次操作的时间,而吞吐量用来衡量在给定的单位时间内处理的操作量。

计算机架构也能根据内存组织方式进行进一步划分,一般可以分成下面两种类型。

·分布式内存的多节点系统

·共享内存的多处理器系统

GPU核心和CPU核心:

CPU核心比较重,用来处理非常复杂的控制逻辑,以优化串行程序执行。

GPU核心较轻,用于优化具有简单控制逻辑的数据并行任务,注重并行程序的吞吐量。

相关推荐
IT_陈寒3 分钟前
SpringBoot性能飞跃:5个关键优化让你的应用吞吐量提升300%
前端·人工智能·后端
柳鲲鹏1 小时前
交叉编译:strip: Unable to recognise the format of the input file xx.c.o
linux·运维·服务器
六六六六六66661 小时前
Ubuntu22.04安装Ibus的中文输入法
linux
kunge1v51 小时前
学习爬虫第三天:数据提取
前端·爬虫·python·学习
爱学习的小鱼gogo1 小时前
python 矩阵中寻找就接近的目标值 (矩阵-中等)含源码(八)
开发语言·经验分享·python·算法·职场和发展·矩阵
聚客AI1 小时前
系统提示的“消亡”?上下文工程正在重新定义人机交互规则
图像处理·人工智能·pytorch·语言模型·自然语言处理·chatgpt·gpt-3
Hello.Reader1 小时前
Flink 状态模式演进(State Schema Evolution)从原理到落地的一站式指南
python·flink·状态模式
红纸2811 小时前
Subword算法之WordPiece、Unigram与SentencePiece
人工智能·python·深度学习·神经网络·算法·机器学习·自然语言处理
golang学习记1 小时前
Crush:新一代基于Go语言构建的开源 AI 编程CLI工具
人工智能
一车小面包1 小时前
Subword-Based Tokenization策略之BPE与BBPE
人工智能·自然语言处理