【系统面试篇】进程和线程类（1）（笔记）——区别、通讯方式、同步、互斥、死锁

下述为五个基本状态：

运行状态（Running）：该时刻进程占用 CPU；

就绪状态（Ready）：可运行，由于其他进程处于运行状态而暂时停止运行；

阻塞状态（Blocked）：该进程正在等待某一事件发生（如等待输入/输出操作的完成）而暂时停止运行，这时，即使给它 CPU 控制权，它也无法运行；

创建状态（new）：进程正在被创建时的状态；

结束状态（Exit）：讲程正在从系统中消失时的状态；

再来详细说明一下进程的状态变迁：

NULL -> 创建状态：一个新进程被创建时的第一个状态；
创建状态 -> 就绪状态：当进程被创建完成并初始化后，一切就绪准备运行时，变为就绪状态，这个过程是很快的；
就绪态 -> 运行状态：处于就绪状态的进程被操作系统的进程调度器选中后，就分配给 CPU 正式运行该进程；
运行状态 ->结束状态：当进程已经运行完成或出错时，会被操作系统作结束状态处理；
运行状态 -> 就绪状态：处于运行状态的进程在运行过程中，由于分配给它的运行时间片用完，操作系统会把该进程变为就绪态，接着从就绪态选中另外一个进程运行；
运行状态 -> 阻塞状态：当进程请求某个事件且必须等待时，例如请求 I/O 事件；
阻塞状态 -> 就绪状态：当进程要等待的事件完成时，它从阻塞状态变到就绪状态；

如果有大量处于阻塞状态的进程，进程可能会占用着物理内存空间，显然不是我们所希望的，毕竟物理内存空间是有限的，被阻塞状态的进程占用着物理内存就一种浪费物理内存的行为。所以，在虚拟内存管理的操作系统中，通常会把阻塞状态的进程的物理内存空间换出到硬盘，等需要再次运行的时候，再从硬盘换入到物理内存。

那么，就需要一个新的状态，来 描述进程没有占用实际的物理内存空间的情况 ，这个状态就是 挂起状态 。++这跟阻塞状态是不一样，阻塞状态是等待某个事件的返回++。

挂起状态可以分为两种：

阻塞挂起状态：进程在外存（硬盘）并等待某个事件的出现；

就绪挂起状态：进程在外存（硬盘），但只要进入内存，即刻立刻运行；

这两种挂起状态加上前面的五种状态，就变成了 七种状态变迁，见如下图：

3. 进程之间的通信方式?

每个进程的用户地址空间都是独立的，一般而言是不能互相访问的，但内核空间是每个进程都共享的，所以 进程之间要通信必须通过内核。

（1）管道

所谓的管道，就是 内核里面的一串缓存 。从管道的一段写入的数据，实际上是缓存在内核中的，另一端读取，也就是从内核中读取这段数据。另外，管道传输的数据是无格式的流且大小受限。

这两个描述符都是在一个进程里面，并没有起到进程间通信的作用，怎么样才能使得管道是跨过两个进程的呢？

我们可以 使用 fork 创建子进程，创建的子进程会复制父进程的文件描述符 ，这样就做到了两个进程各有两个「fd[0] 与 fd[1]」，两个进程就可以通过各自的 fd 写入和读取同一个管道文件实现跨进程通信了。

管道只能一端写入，另一端读出，所以上面这种模式容易造成混乱，因为父进程和子进程都可以同时写入，也都可以读出。为了避免这种情况，通常的做法是：

父进程关闭读取的 fd[0]，只保留写入的 fd[1]；
子进程关闭写入的 fd[1]，只保留读取的 fd[0]；

所以说如果需要双向通信，则应该创建两个管道。

（2）消息队列

管道的通信方式是效率低的，因此管道不适合进程间频繁地交换数据。对于这个问题，消息队列的通信模式就可以解决。

比如，A 进程要给 B 进程发送消息，A 进程把数据放在对应的消息队列后就可以正常返回了，B 进程需要的时候再去读取数据就可以了。同理，B 进程要给 A 进程发送消息也是如此。

再来，消息队列是保存在 内核中的消息链表 ，在发送数据时，会分成一个一个独立的数据单元，也就是 消息体（数据块） ，消息体是用户自定义的数据类型，消息的发送方和接收方要约定好消息体的数据类型，所以 ++每个消息体都是固定大小的存储块++，不像管道是无格式的字节流数据。

如果进程从消息队列中读取了消息体，内核就会把这个消息体删除。消息队列生命周期随内核，如果没有释放消息队列或者没有关闭操作系统，消息队列会一直存在。

消息这种模型，两个进程之间的通信就像平时发邮件一样，你来一封，我回一封，可以频繁沟通了。但邮件的通信方式存在不足的地方有两点，一是通信不及时，二是附件也有大小限制，这同样也是 消息队列通信不足的点。

消息队列不适合比较大数据的传输，因为在内核中每个消息体都有一个最大长度的限制，同时所有队列所包含的全部消息体的总长度也是有上限。

在 Linux 内核中，会有 两个宏定义 MSGMAX 和 MSGMNB ，它们以字节为单位，分别定义了一条消息的最大长度和一个队列的最大长度。消息队列通信过程中，存在用户态与内核态之间的数据拷贝开销，因为 ++进程写入数据到内核中的消息队列时，会发生从用户态拷贝数据到内核态的过程，同理另一进程读取内核中的消息数据时，会发生从内核态拷贝数据到用户态的过程。++

（3）共享内存

消息队列的读取和写入的过程，都会有发生用户态与内核态之间的消息拷贝过程。那共享内存的方式，就很好的解决了这一问题。

现代操作系统，对于内存管理，采用的是 虚拟内存技术，也就是每**个进程都有自己独立的虚拟内存空间，不同进程的虚拟内存映射到不同的物理内存中。**所以，即使进程 A 和进程 B 的虚拟地址是一样的，其实访问的是不同的物理内存地址，对于数据的增删查改互不影响。

共享内存的机制，就是拿出一块虚拟地址空间来，映射到相同的物理内存中。这样这个进程写入的东西，另外一个进程马上就能看到了，都不需要拷贝来拷贝去，传来传去，大大提高了进程间通信的速度。

（4）信号量

用了共享内存通信方式，带来新的问题，那就是如果多个进程同时修改同一个共享内存，很有可能就冲突了。例如两个进程都同时写一个地址，那先写的那个进程会发现内容被别人覆盖了。为了防止多进程竞争共享资源，而造成的数据错乱，所以 ++需要保护机制，使得共享的资源，在任意时刻只能被一个进程访问。++ 正好，信号量就实现了这一保护机制。

信号量其实是一个整型的计数器，主要 ++用于实现进程间的互斥与同步，而不是用于缓存进程间通信的数据。++ 信号量表示资源的数量，控制信号量的方式有两种原子操作：

一个是 P 操作，这个操作会 把信号量减去 1 ，相減后 如果信号量＜0，则表明资源已被占用 ，进程需阻塞等待；相減后如果信号量 >=0，则表明 还有资源可使用，进程可正常继续执行。
另一个是 V 操作，这个操作会 把信号量加上 1 ，相加后 如果信号量＜=0，则表明当前有阻塞中的进程，于是会将该进程唤醒运行 ；相加后 如果信号量＞0，则表明当前没有阻塞中的进程；

P 操作是用在进入共享资源之前，V 操作是用在离开共享资源之后，这两个操作是必须成对出现的。

接下来，举个例子，如果要使得两个进程互斥访问共享内存，我们可以初始化信号量为 1。

具体的过程如下：

进程 A 在访问共享内存前，先执行了 P 操作，由于信号量的初始值为 1，故在进程 A 执行 P 操作后 信号量变为 0，表示共享资源可用，于是进程 A 就可以访问共享内存。
若此时，进程 B 也想访问共享内存，执行了 P 操作，结果信号量变为了 -1，这就意味着临界资源已被占用，因此进程 B 被阻塞。
直到进程 A 访问完共享内存，才会执行 V 操作，使得信号量恢复为 0，接着就会唤醒阻塞中的进程 B，使得进程 B 可以访问共享内存，最后完成共享内存的访问后，执行 V 操作，使信号量恢复到初始值 1。

可以发现，信号初始化为 1，就代表着是互斥信号量，它可以保证共享内存在任何时刻只有一个进程在访问，这就很好的保护了共享内存。

另外，在多进程里，每个进程并不一定是顺序执行的，它们基本是以各自独立的、不可预知的速度向前推进，但有时候我们又希望多个进程能密切合作，以实现一个共同的任务。

例如，进程 A 是负责生产数据，而进程 B 是负责读取数据，这两个进程是相互合作、相互依赖的，++进程 A 必须先生产了数据，进程 B 才能读取到数据，所以执行是有前后顺序的++ 。那么这时候，就可以 用信号量来实现多进程同步的方式，我们可以初始化信号量为 0。

具体过程：

如果进程 B 比进程 A 先执行了，那么执行到 P 操作时，由于信号量初始值为 0，故信号量会变为 -1，表示进程 A 还没生产数据，于是进程 B 就 阻塞等待；
接着，当进程 A 生产完数据后，执行了 V 操作，就会使得信号量变 0，于是就会唤醒阻塞在 P 操作的进程 B；
最后，进程 B 被唤醒后，意味着进程 A 已经生产了数据，于是进程 B 就可以正常读取数据了。

可以发现，信号初始化为 0，就代表着是同步信号量，它可以保证进程 A 应在进程 B 之前执行。

（5）信号

上述进程间通信，都是常规状态下的工作模式。对于异常情况下的工作模式，就需要用「信号」的方式来通知进程。

信号用于通知接收进程某个事件已经发生，从而迫使进程执行信号处理程序。

运行在 shell 终端的进程，我们可以通过键盘输入某些组合键的时候，给进程发送信号。例如：

Ctrl+C 产生 SIGINT 信号，表示终止该进程；
Ctrl+Z 产生 SIGTSTP 信号，表示停止该进程，但还未结束；
如果进程在后台运行，且知道进程 PID 号，可以通过 kill 命令的方式给进程发送信号：kill-91050，表示给 PID 为 1050 的进程发送 SIGKILL 信号，用来立即结束该进程；

所以，信号事件的来源主要有 硬件来源（如键盘 Cltr+C）和软件来源（如 kill 命令）。

（6）Socket

上述管道、消息队列、共享内存、信号量和信号都是在同一台主机上进行进程间通信，那 要想跨网络与不同主机上的进程之间通信，就需要 Socket 通信。

4. 解释一下进程同步和互斥，以及解决这些问题的方法？

（1）互斥的概念

假设同一个进程中的线程 1 和线程 2 同时执行对变量 i 的加 1 操作，每个线程执行 10000 次，那么它对应的汇编指令执行过程是这样的：

但由于时钟中断发生造成上下文切换，使得最后的结果不等于 20000，针对上面线程 1 和线程 2 的执行过程，产生这种情况的流程图如下：

上面展示的情况称为 竞争条件（race condition） ，当多线程相互竞争操作共享变量时，由于运气不好，即在执行过程中发生了上下文切换，我们得到了错误的结果，事实上，每次运行都可能得到不同的结果，因此输出的结果存在 不确定性（indeterminate）。

由于多线程执行操作共享变量的这段代码可能会导致 竞争状态 ，因此我们将此段代码称为临界区（criticalsection），++它是访问共享资源的代码片段，一定不能给多线程同时执行。++ 我们希望这段代码是 互斥（mutualexclusion） 的，也就说++保证一个线程在临界区执行时，其他线程应该被阻止进入临界区++，说白了，就是这段代码执行过程中，最多只能出现一个线程。

（2）同步的概念

互斥解决了并发进程/线程对临界区的使用问题。这种基于临界区控制的交互作用是比较简单的，++只要一个进程/线程进入了临界区，其他试图想进入临界区的进程/线程都会被阻塞着，直到第一个进程/线程离开了临界区++。在多线程里，每个线程并不一定是顺序执行的，它们基本是以各自独立的、不可预知的速度向前推进，但有时候我们又希望多个线程能密切合作，以实现一个共同的任务。

例如，线程 1 是负责读入数据的，而线程 2 是负责处理数据的，这两个线程是相互合作、相互依赖的。线程 2 在没有收到线程 1 的唤醒通知时，就会一直阻塞等待，当线程 1 读完数据需要把数据传给线程 2 时，线程 1 会唤醒线程 2，并把数据交给线程 2 处理。

进程同步是指多个并发执行的进程之间协调和管理它们的执行顺序，以确保它们按照一定的顺序或时间间隔执行。

同步就好比：「操作 A 应在操作 B 之前执行」，「操作 C 必须在操作 A 和操作 B 都完成之后才能执行」等；

互斥就好比：「操作 A 和操作 B 不能在同一时刻执行」；

（3）锁

使用加锁操作和解锁操作 可以解决并发线程/进程的互斥问题。任何想进入临界区的线程，必须先执行加锁操作。若加锁操作顺利通过，则线程可进入 临界区；在完成对临界资源的访问后再执行解锁操作，以释放该临界资源。

（4）信号量

信号量是操作系统提供的一种协调共享资源访问的方法。通常 信号量表示资源的数量 ，对应的变量是一个整型（sem）变量。另外，还有 两个原子操作的系统调用函数 来控制信号量的，分别是：

P 操作：将 sem 减1，相減后，如果 sem<0，则进程/线程进入阻塞等待，否则继续，表明 P 操作可能会阻塞；
V 操作：将 sem 加1，相加后，如果 sem<=0，唤醒一个等待中的进程/线程，表明 V 操作不会阻塞；

原子操作就是要么全部执行，要么都不执行，不能出现执行到一半的中间状态。

**++P 操作是用在进入临界区之前，V 操作是用在离开临界区之后，这两个操作是必须成对出现的。++**举个类比，2 个资源的信号量，相当于 2 条火车轨道，PV 操作如下图过程：

PV 操作的函数是由操作系统管理和实现的，所以操作系统已经使得执行 PV 函数时是具有原子性的。

（5）使用信号量和 PV 操作

为每类共享资源设置一个信号量 s，其初值为 1，表示该临界资源未被占用。只要把进入临界区的操作置于 P（s）和 V（s）之间，即可实现进程/线程互斥：

++此时，任何想进入临界区的线程，必先在互斥信号量上执行 P 操作，在完成对临界资源的访问后再执行 V 操作++。

由于互斥信号量的初始值为 1，故在第一个线程执行 P 操作后 s 值变为 0，表示临界资源为空闲 ，可分配给该线程，使之进入临界区。若此时又有第二个线程想进入临界区，也应 先执行 P 操作，结果使 s 变为负值，这就意味着临界资源已被占用，因此，第二个线程被阻塞。

并且，直到第一个线程执行 V 操作，释放临界资源而恢复 s 值为 0 后，才唤醒第二个线程 ，使之进入临界区，待它完成临界资源的访问后，又执行 V 操作，使 s 恢复到初始值 1。对于两个并发线程，++互斥信号量的值仅取 1、0 和 -1 三个值++，分别表示：

如果互斥信号量为 1，表示没有线程进入临界区。
如果互斥信号量为 0，表示有一个线程进入临界区。
如果互斥信号量为 -1，表示一个线程进入临界区，另一个线程等待进入。

通过互斥信号量的方式，就能保证临界区任何时刻只有一个线程在执行，就达到了互斥的效果。

5. 什么是死锁？如何避免死锁？

在多线程编程中，为了防止多线程竞争共享资源而导致数据错乱，都会在操作共享资源之前加上互斥锁，只有成功获得到锁的线程，才能操作共享资源，获取不到锁的线程就只能等待，直到锁被释放。

那么，当两个线程为了保护两个不同的共享资源而使用了两个互斥锁，那么 ++这两个互斥锁应用不当的时候，可能会造成两个线程都在等待对方释放锁，在没有外力的作用下，这些线程会一直相互等待，就没办法继续运行，这种情况就是发生了死锁。++

死锁只有同时满足以下四个条件才会发生：

互斥条件

持有并等待条件

不可剥夺条件

环路等待条件

（1）互斥条件

**互斥条件是指多个线程不能同时使用同一个资源。**比如下图，如果线程 A 已经持有的资源，不能再同时被线程 B 持有，如果线程 B 请求获取线程 A 已经占用的资源，那线程 B 只能等待，直到线程 A 释放了资源。

（2）持有并等待条件

持有并等待条件是指，当线程 A 已经持有了资源 1，又想申请资源 2，而资源 2 已经被线程 C 持有了，所以线程 A 就会处于等待状态，但是线程 A 在等待资源 2 的同时并不会释放自己已经持有的资源 1。

（3）不可剥夺条件

不可剥夺条件是指，当线程已经持有了资源，在自己使用完之前不能被其他线程获取，线程 B 如果也想使用此资源，则只能在线程 A 使用完并释放后才能获取。

（4）环路等待条件

环路等待条件指的是，在死锁发生的时候，两个线程获取资源的顺序构成了环形链。比如，线程 A 已经持有资源 2，而想请求资源 1，线程 B 已经获取了资源 1，而想请求资源 2，这就形成资源请求等待的环形图。

（5）方法

只需要破坏上面一个条件就可以破坏死锁：

破坏持有并等待条件：一次性申请所有的资源。
破坏不可剥夺条件：占用部分资源的线程进一步申请其他资源时，如果申请不到，可以主动释放它占有的资源。
破坏环路等待条件：靠按序申请资源来预防。让所有进程按照相同的顺序请求资源，释放资源则反序释放。

破坏环路等待条件下：

线程 A 和线程 B 获取资源的顺序要一样，当线程 A 是先尝试获取资源 A，然后尝试获取资源 B 的时候，线程 B 同样也是先尝试获取资源 A，然后尝试获取资源 B。也就是说，线程 A 和线程 B 总是以相同的顺序申请自己想要的资源。